← Últimos artículos
💬 NLP

From Architecture to Output: Structural Origins of Hallucination in Large Language Models and the Amplifying Role of Data

Este artículo sostiene que las alucinaciones en los modelos de lenguaje de gran tamaño son consecuencias estructurales de tres decisiones arquitectónicas fundamentales —la autoatención, la estimación de máxima verosimilitud y la decodificación autorregresiva— que crean un sistema de falla compuesto que las patologías de los conjuntos de datos amplifican en lugar de originar, lo que requiere un cambio de la clasificación basada en la salida hacia estrategias de diagnóstico y mitigación específicas del mecanismo.

Autores originales: Md. Rejaul Korim Sadi, Toufiqur Rahman Tasin, Golam Mostofa Naeem

Publicado 2026-06-09
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Md. Rejaul Korim Sadi, Toufiqur Rahman Tasin, Golam Mostofa Naeem

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La gran idea: No es el dato, es la máquina

Imagina que tienes un robot que escribe historias. A veces, este robot escribe una historia que suena perfecta, fluye maravillosamente y suena muy segura de sí misma, pero es completamente inventada. Llamamos a esto "alucinación".

La mayoría de la gente piensa que el robot miente porque fue alimentado con libros malos o datos malos de internet. Este artículo argumenta que esto es erróneo. El artículo afirma que incluso si le dieras al robot la biblioteca perfecta del mundo, seguiría mintiendo.

¿Por qué? Porque la estructura cerebral del robot (su arquitectura) está construida de una manera que hace que mentir sea inevitable. Los autores identifican tres "fallos de diseño" específicos en cómo se construyen estos modelos de IA que trabajan juntos para crear estas mentiras convincentes.


Los tres "fallos de diseño" (El sistema de fallo compuesto)

El artículo dice que el robot tiene tres hábitos específicos que causan que alucine. Piensa en ellos como tres engranajes en una máquina que, al girar juntos, producen una historia falsa.

1. El "buscador de patrones" (Autoatención / Self-Attention)

El fallo: El robot no entiende realmente el significado; solo entiende la frecuencia.
La analogía: Imagina a una persona que ha leído millones de libros pero nunca ha salido de su casa. Sabe que "Sylhet" y "Té" aparecen junto a ellos en casi todas las frases que ha leído.

  • Cómo funciona: Si le preguntas "¿Por qué es famoso Sylhet?", el robot ve el patrón fuerte: Sylhet + Té. Dice con confianza: "Sylhet es famoso por el té".
  • La alucinación: Pero, ¿qué pasa si preguntas "¿Cuál es la capital de Bangladesh?"? El robot podría seguir agarrando el patrón de "Sylhet" porque esas palabras suelen aparecer juntas en sus datos de entrenamiento, incluso si no tienen sentido en este nuevo contexto.
  • La afirmación del artículo: El robot confunde la proximidad estadística (palabras que pasan tiempo juntas) con la verdad semántica (lo que es realmente real). No comprueba hechos; solo comprueba si las palabras suelen ir juntas.

2. El "concurso de popularidad" (Estimación de Máxima Verosimilitud / Maximum Likelihood Estimation)

El fallo: El robot está entrenado para adivinar la siguiente palabra más probable, no la siguiente palabra más verdadera.
La analogía: Imagina un concurso donde el presentador hace una pregunta y el premio se lo lleva quien adivine la respuesta que aparece con más frecuencia en la mente de la audiencia, independientemente de si es cierta o no.

  • Cómo funciona: Si el 90% de internet dice que "los rayos nunca caen dos veces en el mismo lugar" (un mito), y solo el 10% dice que sí, el robot aprende que el mito es la respuesta "correcta" porque es más popular.
  • La alucinación: El robot no intenta ser veraz; intenta ser fluido. Se recompensa al robot por sonar como el texto promedio de un humano, incluso si ese texto está lleno de mentiras. El artículo señala que los modelos más grandes en realidad se vuelven peores diciendo la verdad porque se vuelven mejores memorizando las mentiras que encuentran en los datos.

3. La "calle de un solo sentido" (Decodificación Autoregresiva / Autoregressive Decoding)

El fallo: Una vez que el robot escribe una palabra, nunca puede retractarse.
La analogía: Imagina un tren que construye sus propias vías a medida que avanza. Si el ingeniero comete un pequeño error y coloca la vía ligeramente hacia la izquierda, el tren tiene que seguir hacia la izquierda. No puede saltar atrás para corregir el primer error.

  • Cómo funciona: El robot escribe una palabra a la vez. Si comete un pequeño error en la primera palabra (debido al Fallo #1 o #2), esa palabra incorrecta se convierte en la "verdad" para la siguiente palabra.
  • La alucinación: El robot no se da cuenta de que ha cometido un error. Simplemente construye el resto de la frase basándose en ese punto de partida erróneo. El resultado es una historia que suena perfectamente lógica y fluye con suavidad, pero que está construida sobre una base de mentiras. Esto se llama un "fallo en cascada".

El papel de los malos datos (El amplificador)

El artículo admite que los malos datos (como los hechos de "cola larga" que son raros, o el contenido sesgado de internet) empeoran las cosas. Pero argumenta que los malos datos son solo un amplificador, no la causa.

  • La analogía: Piensa en los tres fallos de diseño como un bosque seco. Los malos datos son solo una chispa.
    • Si el bosque está húmedo (datos perfectos), una chispa podría no iniciar un incendio.
    • Pero si el bosque está seco (fallos arquitectónicos), incluso una pequeña chispa (un pequeño error de datos) causará un incendio masivo (una alucinación).
  • El punto del artículo: No puedes arreglar el incendio simplemente eliminando la chispa. Tienes que arreglar la sequedad del bosque (la arquitectura). Los datos no crean la alucinación; el diseño de la máquina los explota para crearla.

Por qué fallan las listas de verificación actuales

El artículo critica las formas actuales de estudiar las alucinaciones. Los investigadores suelen categorizar las mentiras por qué aspecto tiene la mentira (por ejemplo, "contradijo la entrada" o "se inventó un hecho").

La crítica del artículo: Esto es como un médico que dice: "El paciente tiene fiebre", sin comprobar si la fiebre es causada por la gripe, una infección o un termostato roto.

  • La solución: Los autores proponen una nueva forma de clasificar las alucinaciones. En lugar de mirar solo el resultado, debemos mirar el mecanismo.
    • ¿Mintió el robot porque confundió patrones de palabras? (Autoatención)
    • ¿Mintió porque siguió un mito popular? (Objetivo MLE)
    • ¿Mintió porque no pudo corregir un pequeño error temprano? (Cascada Autoregresiva)

Resumen

Este artículo argumenta que los Modelos de Lenguaje Extensos (LLM) alucinan no porque sean "estúpidos" o tengan "malos datos", sino porque están construidos sobre tres decisiones arquitectónicas específicas:

  1. Aprenden patrones, no verdades.
  2. Son recompensados por la popularidad, no por la precisión.
  3. Están atrapados en un camino de un solo sentido donde no pueden corregir sus propios errores.

Hasta que no se arreglen estos tres engranjes estructurales, los robots seguirán escribiendo historias fluidas, convincentes y fácticamente erróneas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →