Por qué alucinan los modelos de Inteligencia Artificial
Las alucinaciones tienen fama de fallo misterioso. No lo son. Qué las causa y qué significa realmente la cifra que te muestra un proveedor.
Las alucinaciones tienen fama de fallo misterioso. No lo son. Hoy se sabe bastante de por qué ocurren y hay formas concretas de medirlas.
Un grupo de investigadores le pidió a un chatbot el título de la tesis doctoral de uno de los autores del estudio. Respondió con tres títulos distintos y total seguridad. Ninguno era correcto. Con la fecha de nacimiento pasó lo mismo: tres fechas y las tres falsas (OpenAI, 2025).
Si compras o evalúas IA, esto te toca de cerca. La cifra de alucinación que aparece en una propuesta puede significar cosas muy distintas según cómo se midió. Aquí explicamos de dónde sale el problema y cómo leer esas cifras.
Qué es una alucinación
Es texto fluido y convincente que no es fiel a la fuente o a los hechos. Una revisión publicada en ACM Computing Surveys separa dos tipos (Ji et al., 2023).
La intrínseca contradice el material de origen. El documento dice que una vacuna se aprobó en 2019 y el resumen dice 2021. La extrínseca agrega algo que el material no permite comprobar. Puede ser cierto o no, pero con lo que el modelo tenía delante no hay forma de saberlo.
La diferencia pesa al comprar. Un asistente que resume los informes de tu empresa puede contradecirlos. Uno que responde de memoria puede inventar lo que ningún documento respalda. Los investigadores también separan la fidelidad, que es la coherencia con la fuente entregada, de la factualidad, que es la coherencia con el mundo. Se miden con pruebas distintas.
Por qué ocurre
No hay una sola causa. Hay varias y se suman.
1. El modelo aprende a predecir, no a verificar
En la primera etapa, los modelos practican un ejercicio: adivinar la palabra que sigue en cantidades enormes de texto. Ese texto no trae etiquetas de verdadero o falso. El modelo solo ve ejemplos de lenguaje fluido (OpenAI, 2025).
Los investigadores de OpenAI lo explican con una analogía. Si a millones de fotos de mascotas les pones la etiqueta "perro" o "gato", un algoritmo aprende a clasificarlas bien. Si la etiqueta es el cumpleaños de cada mascota, ningún algoritmo acierta, porque esa fecha no se deduce de ningún patrón. Los errores de ortografía desaparecen con la escala porque la ortografía sigue patrones. Los datos arbitrarios y poco frecuentes no los siguen, y ahí nacen las alucinaciones. El artículo técnico lo resume así: son errores de clasificación que aparecen cuando el modelo no distingue un enunciado falso de un hecho (Kalai et al., 2025).
2. Los datos traen errores humanos
TruthfulQA es una prueba de 817 preguntas en 38 categorías. Están diseñadas para que algunas personas respondan mal por una creencia equivocada. En su versión original de 2021, el mejor modelo fue veraz en 58% de las preguntas. Las personas, en 94%. Los modelos más grandes resultaron en general los menos veraces, porque imitaban mejor las ideas erróneas del texto de internet (Lin, Hilton y Evans, 2022).
Esos modelos eran de la generación de GPT-3. Lo que aporta el estudio es el mecanismo: un error popular puede aparecer en las respuestas justamente porque aparece mucho en los datos.
3. Las pruebas premian adivinar
Piensa en un examen de opción múltiple. Si dejas una pregunta en blanco, obtienes cero. Si adivinas, quizá aciertas. Un modelo evaluado solo por su porcentaje de aciertos aprende a adivinar.
OpenAI publicó una comparación en SimpleQA, una prueba de preguntas con una única respuesta correcta:
| gpt-5-thinking-mini | o4-mini | |
|---|---|---|
| Se abstiene | 52% | 1% |
| Acierta | 22% | 24% |
| Se equivoca | 26% | 75% |
El modelo más antiguo acierta un poco más. También se equivoca casi tres veces más seguido. Si el ranking solo mira aciertos, gana el que adivina (OpenAI, 2025). Los autores proponen penalizar más los errores seguros que la incertidumbre y dar crédito parcial a quien expresa duda. Piden además reformar las pruebas que dominan los rankings en vez de sumar una prueba más de alucinación (Kalai et al., 2025).
4. El modelo prefiere lo que recuerda
Según la revisión de Ji y colegas, las estrategias de generación que aumentan la diversidad del texto, como el muestreo top-k, se asocian con más alucinación. Los modelos grandes también tienden a darle más peso al conocimiento guardado en sus parámetros que al texto que se les entrega (Ji et al., 2023). Un modelo con un documento delante puede responder con lo que "recuerda" y no con lo que le diste.
Qué reduce el problema y qué no
Darle al modelo los documentos relevantes ayuda. Los estudios de diálogo que revisan Ji y colegas encontraron que la recuperación de información mejora el desempeño y reduce la alucinación sin sacrificar la conversación. No la elimina, como muestra el trabajo de Vectara.
Tampoco la precisión llegará nunca a 100%, porque hay preguntas cuya respuesta no se puede determinar. Según los autores de OpenAI, eso no hace inevitable la alucinación. Un modelo puede abstenerse cuando no sabe (OpenAI, 2025).
Cómo leer una cifra de alucinación
Antes de comparar dos proveedores, hazte estas cinco preguntas:
- ¿Qué tarea mide? Resumir un documento y responder de memoria son problemas distintos. Una tasa baja en resúmenes no dice nada sobre preguntas abiertas.
- ¿Separa errores de abstenciones? Una cifra de aciertos sin tasa de error esconde al modelo que adivina.
- ¿Quién la midió? Pide una medición independiente o hazla con tus propios casos.
- ¿Con qué datos y en qué idioma? El detector HHEM de Vectara se anunció en su versión 2.0, en 2024, con soporte para inglés, francés y alemán. El español no estaba incluido (Vectara, 2024). Pregunta dónde se validó la prueba.
- ¿De qué fecha y versión? Los rankings se actualizan y los modelos cambian con cada lanzamiento.
En resumen
Piensa en un estudiante en un examen oral. No sabe la respuesta, pero dejarla en blanco le da cero y adivinar quizá le da un punto. Responde y se equivoca.
Eso es una alucinación: una respuesta falsa entregada con la misma seguridad que una correcta. El modelo no miente. Aprendió a producir la palabra más probable, no a comprobar si lo que dice es verdad. Además, las pruebas con las que se le evalúa premian el acierto y no castigan el error seguro, así que adivinar le conviene (OpenAI, 2025).
Por eso, al evaluar un sistema, pregunta qué hace cuando no sabe.
Por dónde empezar
Depende de dónde estés hoy.
Si ya usas un asistente con tus documentos, pídele que cite de donde saco cada dato y revisa diez respuestas.
Cada semana publicamos análisis de Inteligencia Artificial y negocios para América Latina. Suscríbete al boletín para recibirlos.
FUENTES
- Kalai, A. T., Nachum, O., Vempala, S. S. y Zhang, E. (2025). Why Language Models Hallucinate. arXiv:2509.04664. https://arxiv.org/abs/2509.04664
- OpenAI (5 de septiembre de 2025). Why language models hallucinate. https://openai.com/index/why-language-models-hallucinate/
- Ji, Z. et al. (2023). Survey of Hallucination in Natural Language Generation. ACM Computing Surveys, 55(12). https://arxiv.org/abs/2202.03629
- Lin, S., Hilton, J. y Evans, O. (2022). TruthfulQA: Measuring How Models Mimic Human Falsehoods. ACL 2022. https://arxiv.org/abs/2109.07958
- Anthropic (27 de marzo de 2025). Tracing the thoughts of a large language model. https://www.anthropic.com/research/tracing-thoughts-language-model
- Vectara. Introducing the Next Generation of Vectara's Hallucination Leaderboard. https://vectara.com/blog/introducing-the-next-generation-of-vectaras-hallucination-leaderboard
- Vectara. hallucination-leaderboard (repositorio). https://github.com/vectara/hallucination-leaderboard
- Vectara. HHEM 2.1: A Better Hallucination Detection Model and a New Leaderboard. https://www.vectara.com/blog/hhem-2-1-a-better-hallucination-detection-model/
- Tamber, M. S. et al. (2025). Benchmarking LLM Faithfulness in RAG with Evolving Leaderboards. arXiv:2505.04847. https://arxiv.org/abs/2505.04847
- Min, S. et al. (2023). FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation. EMNLP 2023. https://arxiv.org/abs/2305.14251
- Farquhar, S., Kossen, J., Kuhn, L. y Gal, Y. (2024). Detecting hallucinations in large language models using semantic entropy. Nature, 630, 625-630. https://doi.org/10.1038/s41586-024-07421-0