Lesson 16 of 22· Límites y riesgos
Imagina que le pides a un asistente de IA:
«Dame la referencia académica que demuestra que beber café mejora la memoria a largo plazo.»
Y responde, con total soltura:
«Según el estudio de Martínez y Kowalski (2019), "Caffeine and Long-Term Memory Consolidation", publicado en el Journal of Cognitive Neuroscience, vol. 31, pp. 412–428, el consumo moderado de café mejora la retención en un 23 %.»
Suena impecable: autores, año, título, revista, volumen, páginas y hasta un porcentaje. El problema es que ese estudio no existe. Ni los autores, ni el volumen, ni el 23 %. El modelo no mintió a propósito ni consultó una base de datos y se equivocó: fabricó una referencia que parece real porque así es como se ve una cita académica de verdad.
Esto es una alucinación, y en esta lección vas a entender por qué no es un bug accidental, sino una consecuencia directa de cómo funciona un LLM. Al terminar sabrás reconocerlas y tendrás estrategias concretas para reducir el daño que causan.
Una alucinación es una afirmación que el modelo genera con fluidez y confianza pero que es falsa, inventada o no verificable: un dato equivocado, una cita inexistente, una función de una librería que nunca se programó, una fecha imaginaria, una biografía mezclada.
El detalle clave —y el más incómodo— es el tono. El modelo no dice «creo que…» ni «no estoy seguro». Presenta lo inventado con la misma seguridad con la que presenta lo correcto. Para el modelo, un hecho verdadero y uno fabricado se ven exactamente igual: ambos son secuencias de tokens plausibles.
Regla mental: un LLM no distingue entre «lo que es verdad» y «lo que suena a verdad». Solo conoce lo segundo.
Recuerda lo que viste antes en el curso: un LLM es, en el fondo, una máquina de predecir el siguiente token. En cada paso elige la continuación estadísticamente más probable dado todo el texto anterior, según los patrones que aprendió durante el entrenamiento.
Ese objetivo —"¿qué token viene después?"— optimiza la plausibilidad del texto, no su veracidad. En ningún momento del entrenamiento el modelo tuvo un botón que dijera «esto es cierto» frente a «esto es falso». Aprendió cómo suena el lenguaje humano cuando afirma cosas, no cuáles de esas cosas son reales.
Por eso, cuando le pides una cita que no está fuertemente memorizada, el modelo hace lo único que sabe hacer: genera algo que tenga la forma correcta. Una cita académica plausible tiene autores con apellidos creíbles, un año reciente, una revista del área y unos números de página. El modelo rellena esa plantilla con tokens probables… y el resultado es una referencia perfecta en forma y falsa en contenido.
La alucinación no es un fallo del sistema: es el sistema funcionando exactamente como fue diseñado, aplicado a una pregunta cuya respuesta verdadera no está bien representada en sus pesos.
Las alucinaciones se agravan por dos límites que viste en lecciones anteriores:
Predicción de tokens sobre plausibilidad. Como acabamos de ver, el objetivo del modelo es que el texto fluya, no que sea cierto. Cuanto más específico y "de nicho" es un dato (un número exacto, una cita concreta, una fecha puntual), menos probable es que esté memorizado con precisión y más fácil es que el modelo lo rellene con algo verosímil.
Conocimiento congelado (corte de conocimiento). El modelo aprendió de un conjunto de texto hasta cierta fecha y no se actualiza solo. Si le preguntas por algo posterior a su corte —o por un detalle que simplemente no estaba en sus datos— no tiene forma de decir «no lo sé de primera mano». Su instinto estadístico es producir una respuesta con forma de respuesta.
Juntando ambos: el modelo tiene más probabilidad de alucinar cuanto más preciso, reciente o poco frecuente sea el dato que le pides.
Estos son los tipos de alucinación con los que te toparás más a menudo. Reconocerlos por adelantado es media batalla ganada.
| Tipo | Ejemplo típico | Por qué pasa |
|---|---|---|
| Citas y fuentes inventadas | Un paper, libro o URL con formato perfecto que no existe | La forma de una cita es muy predecible; el contenido concreto, no |
| Datos y cifras falsas | «La población de esa ciudad es de 847.000 habitantes» (inventado) | Un número específico suena preciso aunque no esté memorizado |
| Funciones/métodos inexistentes | pandas.read_excel_fast() — una función que nunca existió | El modelo compone un nombre plausible siguiendo el patrón de la librería |
| Atribuciones erróneas | Poner una frase célebre en boca de la persona equivocada | Mezcla patrones de contextos parecidos |
| Confusión de entidades | Fundir dos personas o productos con nombres similares en uno solo | Sus representaciones internas están "cerca" y se solapan |
Fíjate en el patrón común: la estructura siempre es correcta. Una función mal inventada respeta las convenciones de nombres de la librería; una cita falsa respeta el formato bibliográfico. Eso es justo lo que las hace peligrosas: parecen confiables precisamente porque el modelo es excelente imitando formas.
Las alucinaciones no se eliminan por completo —son inherentes a la tecnología—, pero puedes reducir mucho su impacto con hábitos sencillos:
Idea central: no confíes en que el modelo sepa; ayúdalo a no tener que adivinar.
Ahora comprueba que puedes reconocer y mitigar una alucinación en la práctica.
Free