Hallucination as Commitment Failure: Larger LLMs Misfire Despite Knowing the Answer
Este artículo desafía la visión de que las alucinaciones provienen únicamente de la falta de conocimiento, revelando que los LLMs más grandes ajustados mediante instrucciones a menudo alucinan porque no logran comprometerse con un concepto correcto ya presente en su distribución de probabilidad, dispersando en cambio la masa de probabilidad entre alternativas debido a un mecanismo de afilado dependiente de la escala que impulsa tanto la utilidad como los errores confiables.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
La Gran Idea: No Se Trata de "No Saber"
La mayoría de la gente piensa que las alucinaciones de la IA (cuando una IA inventa cosas) ocurren porque la IA simplemente no sabe la respuesta. La idea es: Si la IA conoce el hecho, dice la verdad. Si no lo conoce, adivina.
Este artículo argumenta que eso es incorrecto.
Los investigadores descubrieron que, a menudo, la IA sí sabe la respuesta. Tiene la información correcta "en su cabeza" en el mismo momento en que comienza a hablar. Sin embargo, aún elige decir algo incorrecto. Ellos llaman a esto un "Fallo de Compromiso".
La Analogía: El Chef Nervioso
Imagina a un chef muy talentoso (la IA) al que le preguntan: "¿Cuál es la capital de Francia?"
- La Teoría Antigua: Si el chef no sabe la respuesta, adivina "Londres". Si la sabe, dice "París".
- La Nueva Teoría (Este Artículo): El chef sabe que la respuesta es París. De hecho, está pensando en "París" con tanta intensidad que su cerebro zumba con la palabra. Pero, como está pensando en "París" de muchas maneras diferentes a la vez (por ejemplo, "París", "paris", "la ciudad de la luz", "la capital de Francia"), su cerebro se confunde.
- Tiene una fuerte sensación hacia "París", pero está dispersa a través de todas esas diferentes frases.
- Al mismo tiempo, tiene un pensamiento muy agudo y enfocado sobre "Londres" (quizás porque vio una imagen del Big Ben antes).
- Aunque la sensación de "París" es más fuerte en general, el pensamiento de "Londres" es tan agudo y concentrado que gana la carrera hacia su boca. Exclama "Londres" con confianza, incluso aunque sabía que era París.
Cómo Lo Descubrieron
Los investigadores observaron cómo los modelos de IA "piensan" antes de hablar. Se centraron en la primera palabra que genera la IA (el "paso de compromiso").
Introdujeron una nueva forma de medir lo que la IA sabe, llamada Masa de Probabilidad Semántica.
- Forma Antigua: ¿Elegió la IA la palabra exacta correcta? (¿Dijo "París"?)
- Nueva Forma: ¿Tuvo la IA una fuerte sensación sobre el concepto de París, incluso si estaba dividida entre "París", "paris" y "la ciudad de la luz"?
Los Hallazgos:
- Probaron muchos modelos de IA (desde pequeños hasta enormes).
- Descubrieron que entre el 16% y el 47% de las veces que la IA cometía un error, en realidad tenía una fuerte "sensación" por la respuesta correcta.
- El Giro: Cuanto más grande era el modelo de IA, más a menudo ocurría esto. Los modelos más grandes no solo sabían más; cometían más de estos tipos específicos de errores donde sabían la respuesta pero aún así la equivocaron.
¿Por Qué Ocurre Esto? (El Efecto de "Agudización")
El artículo sugiere que el Ajuste por Instrucciones (entrenar a la IA para ser útil y seguir reglas) cambia cómo piensa la IA.
Imagina que el cerebro de la IA es un paisaje de colinas y valles.
- Antes del Entrenamiento: Las colinas son planas y borrosas. La IA está insegura.
- Después del Entrenamiento: La IA se vuelve muy decidida. Convierte sus pensamientos en picos agudos y altos.
- Cuando la IA tiene razón, el pico de la respuesta correcta es tan alto y agudo que gana fácilmente.
- Pero, a veces la IA se confunde. La respuesta "correcta" se divide en muchas colinas pequeñas y planas (porque está pensando en "París", "paris", "Francia", etc.). Mientras tanto, la respuesta "incorrecta" es un solo pico increíblemente agudo y alto.
- El proceso de toma de decisiones de la IA es como una bola rodando por una colina. Siempre rueda hacia el punto más agudo. Incluso si el lado "correcto" tiene más "área de colina" en total, el lado "incorrecto" tiene el pico más agudo, por lo que la bola rueda hacia allí.
Los Dos Tipos de Errores
Los investigadores encontraron dos formas en que ocurre este "Fallo de Compromiso":
- La Primera Palabra Incorrecta: La IA comienza la frase con la palabra incorrecta inmediatamente (por ejemplo, diciendo "Moscú" en lugar de "París"), aunque tenía una fuerte sensación por París.
- El Camino Incorrecto: La IA comienza con la palabra correcta (por ejemplo, "París") pero luego se desvía inmediatamente en las siguientes palabras, convirtiendo "París" en una historia sobre una ciudad diferente.
El "Impuesto de Alineación"
El artículo concluye que esto es un efecto secundario de hacer que los modelos de IA sean "útiles".
- Para hacer que una IA sea confiada y rápida, la entrenamos para que sea muy decidida (picos agudos).
- Esto funciona muy bien cuando la IA tiene razón.
- Pero cuando la IA está ligeramente confundida, esa misma "decisión" la hace equivocarse con confianza. No duda al elegir la respuesta incorrecta porque su cerebro es muy bueno al elegir la opción "más aguda", incluso si esa opción es incorrecta.
Resumen
- Las alucinaciones no son siempre ignorancia. A veces la IA sabe la respuesta pero falla al "comprometerse" con ella.
- Los modelos más grandes no son perfectos. A medida que los modelos crecen, se vuelven mejores siendo decisivos, lo que irónicamente los hace más propensos a equivocarse con confianza.
- El problema es la distribución. La IA dispersa su "conocimiento" de la respuesta correcta demasiado delgada a través de muchas variaciones, mientras que la respuesta incorrecta recibe todo el enfoque en un solo punto agudo. La IA elige el punto agudo, no la respuesta correcta.
El artículo sugiere que para solucionar esto, podríamos necesitar enseñar a la IA a mirar el "concepto completo" (todas las formas de decir "París") en lugar de simplemente elegir la única palabra más aguda.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.