← Últimos artículos
💬 NLP

Unconditional Truthfulness: Learning Unconditional Uncertainty of Large Language Models

Este trabajo propone un método novedoso para cuantificar la incertidumbre de los Grandes Modelos de Lenguaje mediante el entrenamiento de un modelo de regresión sobre mapas de atención, probabilidades de tokens y puntuaciones de incertidumbre calculadas recurrentemente para detectar eficazmente alucinaciones y mejorar la generación selectiva en múltiples conjuntos de datos y modelos.

Autores originales: Artem Vazhentsev, Ekaterina Fadeeva, Rui Xing, Gleb Kuzmin, Ivan Lazichny, Alexander Panchenko, Preslav Nakov, Timothy Baldwin, Maxim Panov, Artem Shelmanov

Publicado 2026-04-29
📖 4 min de lectura☕ Lectura para el café

Autores originales: Artem Vazhentsev, Ekaterina Fadeeva, Rui Xing, Gleb Kuzmin, Ivan Lazichny, Alexander Panchenko, Preslav Nakov, Timothy Baldwin, Maxim Panov, Artem Shelmanov

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás escuchando a un robot muy inteligente y que habla muy rápido contarte una historia. El robot es excelente inventando oraciones, pero a veces se muestra seguro de cosas que en realidad son incorrectas (a esto se le llama "alucinaciones").

El problema es que el robot no sabe que está mintiendo. Simplemente sigue hablando, y si comete un error al principio, se vuelve aún más seguro a medida que construye el resto de la historia sobre ese error. Es como un juego de "teléfono" donde la primera persona susurra un hecho incorrecto, y todos los demás lo repiten con una confianza creciente.

El Problema: El Punto Ciego del Robot
Las formas actuales de verificar si el robot está mintiendo suelen examinar la "puntuación de confianza" del robot para cada palabra que dice. Pero esto es complicado. Si el robot dice: "El cielo es verde", podría sentirse muy seguro sobre la siguiente palabra, "pasto", porque simplemente está siguiendo su propia lógica. No se da cuenta de que toda la oración se basa en una mentira.

Los autores de este artículo llaman a esto el problema de la "dependencia condicional". La confianza del robot para la siguiente palabra depende enteramente de la palabra anterior, incluso si esa palabra anterior fue un error.

La Solución: TAD (Dependencia Basada en Atención Entrenable)
Los investigadores crearon una nueva herramienta llamada TAD. Imagina TAD como un editor superinteligente sentado junto al robot, observándolo escribir una palabra a la vez.

Así es como funciona el editor, usando algunas analogías simples:

  1. La "Mirada" (Atención): Cuando el robot habla, "mira" las palabras anteriores para decidir qué decir a continuación. Los investigadores se dieron cuenta de que, cuando el robot dice la verdad, su "mirada" (atención) es estable y enfocada. Pero cuando empieza a alucinar, su mirada se vuelve inestable o confusa. TAD observa esta mirada de cerca.
  2. La "Reacción en Cadena" (Recurrencia): El editor no solo mira la palabra actual. Recuerda la incertidumbre de las palabras anteriores. Si el robot tropezó con la palabra #1, el editor marca la palabra #2, #3 y #4 como sospechosas, incluso si el robot suena seguro sobre ellas. Es como un profesor que sabe que si un estudiante se equivoca en el primer paso de un problema de matemáticas, la respuesta final probablemente también sea incorrecta, independientemente de lo ordenadamente que el estudiante la haya escrito.
  3. El "Entrenamiento en Dos Etapas": Para enseñar a este editor, los investigadores utilizaron un proceso de dos pasos.
    • Paso 1: Enseñaron al editor a detectar errores usando solo la confianza cruda del robot.
    • Paso 2: Permitieron que el editor usara su propia "intuición" del Paso 1 para aprender aún mejor. Es como practicar un deporte: primero aprendes los movimientos básicos, luego practicas jugar un partido completo donde debes reaccionar a tus propios movimientos anteriores.

Cómo lo Probaron
Probaron este editor en diez tipos diferentes de tareas, desde resumir artículos de noticias hasta responder preguntas de cultura general complicadas, utilizando tres versiones diferentes del robot (LLaMA, Gemma y Qwen).

  • El Resultado: TAD fue mucho mejor detectando las mentiras del robot que cualquier otro método que probaron. Fue especialmente bueno detectando cuándo una historia larga se salió de los cauces.
  • La Eficiencia: A diferencia de otros métodos que requieren que el robot "piense" la respuesta cinco veces diferentes (lo cual es lento y costoso), TAD es muy rápido. Solo añade aproximadamente un 5% de tiempo extra al proceso de pensamiento del robot. Es como echar un segundo vistazo rápido en lugar de pedirle al robot que reescriba toda la historia.

La Conclusión
El artículo afirma que, al enseñar a un modelo informático a prestar atención a cómo el robot mira sus propias palabras anteriores, y al recordar los errores cometidos al principio de la oración, podemos construir un "detector de mentiras" mucho mejor para la IA. Esto hace que la IA sea más segura y fiable, especialmente para respuestas largas, sin ralentizar demasiado las cosas.

Lo que el Artículo NO Afirma

  • No afirma que esto funcione para cada tipo de IA en cada situación (se probó en modelos y tareas específicos).
  • No afirma que esto sea una herramienta médica o un juez legal.
  • No afirma que la IA nunca volverá a cometer errores; solo afirma que esta herramienta es mejor para detectar los errores para que puedan ser filtrados.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →