El juicio no se delega · 2 de 12
Un trabajo bien presentado, con su bibliografía ordenada, sus años, sus volúmenes y su DOI. El docente comprueba la primera referencia y no la encuentra. Comprueba la segunda y tampoco. A la cuarta ya sabe lo que va a encontrar en las demás. Lo que descoloca en esa escena no es el error, que los alumnos cometen desde que existe la escuela, sino el acabado, porque nadie inventa una cita y se toma la molestia de ponerle un identificador digital creíble. La máquina sí. Y no lo hace para engañar a nadie.
Suele decirse que estas herramientas se equivocan y que los ingenieros irán puliendo el fallo versión tras versión. Es una idea razonable, pues es lo que hemos visto ocurrir con casi todas las tecnologías que han entrado en la escuela. Con esta no funciona así. Lo que llamamos alucinación no es una avería que pueda separarse del resto: es el mismo mecanismo que hace que la herramienta cumpla su función.

Lo que no está escrito en ninguna parte
En el artículo anterior vimos que un modelo de lenguaje calcula qué palabra es más probable a continuación y repite el cálculo hasta terminar la frase. De ahí se deriva una consecuencia que conviene analizar despacio: un sistema así producirá una continuación aunque no haya nada que continuar. José Antonio Bowen y C. Edward Watson lo explican con precisión en Teaching with AI: “como estos modelos generan ordenando probabilidades sobre la palabra o el píxel siguiente, tienden a generar datos falsos y a fabricar referencias inexistentes, y esa posibilidad está incorporada en la parte generativa del sistema, igual que el sesgo lo está en su entrenamiento”.
Los dos problemas se pueden reducir, advierten los mismos autores, pero serán difíciles de eliminar, porque son consecuencia directa de la forma en que estos sistemas aprenden. No estamos ante un descuido de programación que alguien no ha tenido tiempo de corregir.
¿Y por qué inventa más sobre unas cosas que sobre otras? Marc Alier, profesor e investigador de la Universitat Politècnica de Catalunya, lo formula en el Informe ODITE 2026 de la manera más útil para un claustro: la calidad de las respuestas es inconstante, y lo es de forma especial en los ámbitos donde los datos de entrenamiento son limitados o incompletos. Sobre lo que la humanidad ha escrito mil veces, el terreno está abonado. Sobre lo que casi nadie ha escrito, el modelo sigue teniendo que decir algo, y lo dice.
Y aquí está precisamente el problema. Un coche avisa cuando falla algo, con una luz en el salpicadero. En un modelo de lenguaje no hay ninguna luz de aviso: ningún indicador interno se enciende cuando el sistema pasa de recuperar un patrón bien asentado a rellenar un hueco. Las dos operaciones son la misma operación. Ray Gallon, escritor y educador, presidente y cofundador de The Transformation Society, lo resume en su entrevista del mismo informe recordando que la máquina predice el siguiente grupo de letras y que por eso comete errores, «alucinaciones, que no lo son, en un sentido psicológico». La palabra que se ha elegido para nombrar este fenómeno sugiere una percepción alterada, algo que le pasa a una mente sana en un mal día. Pero en realidad no tiene nada que ver con eso.
Ningún indicador interno avisa cuando la máquina pasa de evocar datos firmes a inventar contenido.

El tono no es un dato
Si el aviso no llega de dentro, tendrá que llegar de fuera. Y ahí aparece la segunda dificultad, que es nuestra y no de la máquina.
Cuando leemos, usamos la forma como pista del fondo. Un texto ordenado, sin titubeos, con vocabulario preciso y estructura clara, nos parece más fiable que uno vacilante, y en el trato entre personas esa pista funciona razonablemente bien, porque quien duda suele dudar en voz alta. Alejandro Espeso-García, autor de una revisión sobre potenciación y externalización cognitiva publicada en Cultura, Ciencia y Deporte, recoge que la fluidez y el tono seguro de estas respuestas inducen a aceptarlas bajo la premisa de que, si se lee bien, debe de ser verdad. La pista sigue ahí, pero ha dejado de informar de nada. Bowen y Watson lo dicen en una línea: “un texto con tono autorizado puede seguir siendo un sinsentido”.
Parece un aviso para despistados, ¿verdad?, pues resulta que funciona al revés. Los mismos autores recogen la experiencia de un instituto alemán documentada por Haverkamp en 2022, donde se enseñaron al alumnado los fallos de la herramienta y después se le permitió usarla en los exámenes. Ningún estudiante se apoyó solo en ella, y varios buscaron información adicional por su cuenta. Sin embargo, los estudiantes con menos seguridad en el contenido de la materia o en su propio razonamiento obtuvieron peores resultados, por adoptar el texto generado sin someterlo a crítica.
Ese resultado merece detenerse. Quien más necesita la ayuda es quien menos preparado está para juzgarla, porque para detectar que una afirmación es falsa hay que saber algo sobre el asunto. Verificar exige saber.
También lo descubre el alumnado cuando se le da ocasión. Miquel Àngel Fuentes Arjona, docente de secundaria en un centro público de Cataluña y formador en competencia digital docente, documenta en el Informe ODITE 2026 una experiencia de doce sesiones en 1.º de Bachillerato en la que sus alumnos reconstruyeron por escrito qué pensaban antes y qué piensan ahora. Sobre las alucinaciones, partían de que era «un problema del programa» y de que la herramienta «siempre decía la verdad». Al final hablan de «respuestas creíbles, pero erróneas» y constatan que el sistema «no es capaz de verificar la información». Conviene tomar estos datos por lo que son: trece alumnos, un solo trimestre, y una recogida retrospectiva que el propio autor advierte que no es un diseño de test previo y posterior. No es una medida de eficacia. Es algo más modesto y más interesante: la voz de quienes han cambiado de criterio explicando por qué.

El alumnado descubre en el aula que las respuestas verosímiles a menudo esconden afirmaciones completamente erróneas.
El mismo gesto que inventa es el que crea
Llegados aquí, la pregunta del claustro suele ser cuándo estará resuelto. Y la respuesta incómoda es que resolverlo del todo tendría un precio que quizá no queramos pagar.
Bowen y Watson dedican un capítulo entero de su libro a la creatividad, y el argumento es este: la capacidad de combinar ideas y palabras como ningún humano las habría combinado es la misma capacidad que produce las referencias inventadas. Las alucinaciones pueden ser peligrosas, escriben, «pero son también un rasgo de la creatividad». Cuando a un modelo se le añaden inhibiciones para que afirme menos cosas sin comprobar, señalan a propósito de una herramienta concreta, disminuyen las invenciones y disminuye también su interés creativo. Ese es el intercambio real, y no lo decide la escuela.
Lo que sí decide la escuela es qué hace mientras tanto. Si la invención no se va a eliminar, la verificación deja de ser una precaución que se añade al final y pasa a ser la mitad del trabajo. Así lo plantea la revisión sistemática de Iliana Guaranda-Arias y sus colegas de la Universidad Estatal de Milagro, en Ecuador, que analiza cincuenta y dos estudios y sitúa la verificación de fuentes, la autoría y la integridad académica dentro de lo que llaman alfabetización ética en inteligencia artificial, junto a la formación del profesorado en el análisis de casos. Los propios autores advierten que predominan los diseños documentales y transversales y que no puede establecerse causalidad. Es un mapa de qué enseñar, no una prueba de que enseñarlo funcione.
Y hay una última vuelta, la más difícil de ver desde fuera. Espeso-García observa que el riesgo mayor no es que la herramienta invente hechos, sino que produzca en quien la usa una alucinación de competencia: la persona confunde haber obtenido una respuesta coherente con haber entendido el asunto. La máquina no tiene luz de aviso. Nosotros tampoco.
El principal riesgo educativo es confundir la coherencia del texto generado con la comprensión real.

Qué hacer con esto
En el aula. Cristian Ruiz Reinales, director de Tecnología y profesor de Informática en el Colegio Juan de Lanuza de Zaragoza, documenta en el Informe ODITE 2026 una actividad de 6º de Primaria llamada «Detectives de citas»: el alumnado comprueba si una cita atribuida a alguien aparece en fuentes fiables o solo en páginas sin autoría, y termina formulando sus propias reglas del tipo «si no hay fuente, entonces no la doy por válida». En el mismo proyecto funciona una rutina transversal que puede adoptarse mañana en cualquier materia, «IA dice / Fuente dice / Yo concluyo», que obliga a separar por escrito lo que propone la herramienta, lo que puede comprobarse y lo que el alumno concluye con su criterio.
Para secundaria y bachillerato, Bowen y Watson proponen una tarea más exigente: encargar un trabajo con apoyo de la herramienta y pedir después que se verifiquen todas las citas, que deben existir y decir lo que la herramienta dice que dicen, entregando juntas las referencias originales y las corregidas. El trabajo de verificación se convierte así en el objeto de evaluación, no en un requisito previo que nadie mira.
Para el equipo directivo. La plantilla de política de centro de Bowen y Watson incluye dos puntos que suelen faltar en las normas de uso que se están aprobando: una advertencia explícita sobre los límites de la herramienta y una regla clara sobre la responsabilidad última del alumno respecto de lo que entrega. Los mismos autores avisan de que una norma construida solo con prohibiciones desmotiva, pierde oportunidades y puede aumentar la desigualdad, porque quien ya sabe usar la herramienta la usará igual. La diferencia entre prohibir citar sin verificar y enseñar a verificar parece pequeña sobre el papel. En la práctica es la diferencia entre una norma y una competencia. Pau García-Milà, empresario y divulgador, lo formula en su entrevista del informe con una fórmula que sirve de brújula: «que aprendan a desconfiar bien».

Encadenar pasos lógicos emula el razonamiento, pero no disipa la opacidad de su mecanismo interno.
Para terminar
La escuela lleva décadas enseñando a evaluar fuentes, y esa competencia no ha caducado. Lo que ha cambiado es que antes el texto poco fiable solía parecerlo, y ahora no lo parece nunca. La verificación no es un trámite añadido al uso de estas herramientas. Es la mitad del uso.
Para seguir pensando. De las tareas que hemos puesto este curso, ¿cuántas se pueden aprobar sin haber comprobado ni una sola afirmación? Y una segunda, para la reunión de equipo: cuando un alumno entrega una cita inventada, ¿qué estamos evaluando exactamente, su honestidad o su capacidad de comprobar?
Verificar fuentes deja de ser un trámite añadido para convertirse en el eje central de la evaluación.












