← Últimos artículos
🤖 AI

Entropy Distribution as a Fingerprint for Hallucinations in Generative Models

Este artículo presenta la Puntuación de Entropía Calibrada (CES), un método ligero de caja negra en un solo paso que aprovecha las distribuciones de entropía a nivel de token para detectar alucinaciones en los LLM con garantías formales de error y un rendimiento comparable al de los enfoques multies muestra computacionalmente costosos.

Autores originales: Mattia J. Villani, Pranav Deshpande, Akshay Seshadri, Romina Yalovetzky, Niraj Kumar

Publicado 2026-05-28
📖 4 min de lectura☕ Lectura para el café

Autores originales: Mattia J. Villani, Pranav Deshpande, Akshay Seshadri, Romina Yalovetzky, Niraj Kumar

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás escuchando a un narrador de historias. A veces, cuenta una historia que es perfectamente veraz y fluye con naturalidad. Otras veces, empieza a "alucinar": inventa hechos, se confunde o divaga de un modo que carece de sentido.

Durante mucho tiempo, los ordenadores que intentaban detectar estas mentiras tenían que hacer una de dos cosas: o bien pedirle al narrador que repitiera la historia cinco o seis veces para ver si los detalles coincidían (lo cual es lento y costoso), o bien espiar dentro del cerebro del narrador para ver sus notas secretas (lo cual a menudo es imposible con sistemas cerrados).

Este artículo presenta una nueva y astuta forma de detectar a un mentiroso que solo requiere escuchar la historia una vez. Se llama Puntuación de Entropía Calibrada (CES).

Así es como funciona, utilizando analogías sencillas:

1. El "Medidor de Confianza" (Entropía)

Cada vez que un Modelo de Lenguaje Grande (LLM) escribe una palabra, tiene un "medidor de confianza" sobre lo que viene a continuación.

  • Alta Confianza: El modelo sabe exactamente qué decir. Es como un chef que conoce la receta a la perfección. La "entropía" (una medida de la incertidumbre) es baja.
  • Baja Confianza: El modelo está adivinando. Es como el chef mirando a una nevera vacía, inseguro de qué cocinar. La "entropía" es alta.

2. La Vieja Forma vs. La Nueva Forma

La Vieja Forma (Perplejidad):
Los métodos anteriores observaban la confianza promedio de toda la historia.

  • Analogía: Imagina a un estudiante que hace un examen. El método antiguo solo mira su nota promedio. Si el promedio es del 70%, podría aprobar. Pero esto oculta la verdad: ¿Obtuvo una nota del 70% en todas las preguntas? ¿O respondió 10 preguntas perfectamente (100%) y 10 preguntas completamente mal (0%)? El promedio es el mismo, pero el segundo estudiante es mucho más inestable.

La Nueva Forma (CES):
Los autores se dieron cuenta de que la forma del medidor de confianza importa más que el promedio.

  • Analogía: Cuando un modelo cuenta la verdad, su medidor de confianza es estable y predecible. Cuando empieza a alucinar, el medidor se vuelve loco. Puede estar tranquilo durante un tiempo, luego subir repentinamente a una confusión total, y luego subir de nuevo.
  • El artículo afirma que este "patrón salvaje" es una huella dactilar de una mentira. Incluso si la confianza promedio parece normal, los picos (la incertidumbre máxima) y la forma general de la curva la delatan.

3. Cómo Funciona el CES (La Verificación de la "Huella Dactilar")

El método funciona en dos pasos:

  1. Aprendiendo el Patrón de la "Verdad": Primero, el sistema escucha muchas historias que se sabe que son verdaderas. Construye un "mapa de referencia" (una curva estadística) de cómo se ve el medidor de confianza de una historia veraz. Anota: "Bien, las historias verdaderas suelen tener pequeños bultos aquí, pero rara vez picos enormes allí".
  2. La Prueba de Una Sola Vez: Cuando llega una nueva historia, el sistema la escucha solo una vez. No pide una segunda opinión. Compara el medidor de confianza de la historia con el "Mapa de la Verdad".
    • Si la historia tiene un pico extraño o una forma que no encaja en el mapa, el sistema la marca: "¡Esto parece una alucinación!"

4. Por Qué Esto es Algo Importante

  • Velocidad: Solo necesita un solo pase a través del texto. Es como atrapar a un mentiroso escuchándolo hablar una vez, en lugar de hacerle repetir la historia cinco veces.
  • Amigable con la Caja Negra: No necesitas ver el código interno del modelo ni sus pensamientos ocultos. Solo necesitas los "logits" (los números de confianza crudos que el modelo genera antes de elegir una palabra), que la mayoría de las APIs proporcionan.
  • Prueba Estadística: Los autores no solo supusieron que esto funcionaba. Utilizaron matemáticas para demostrar que, a medida que la historia se hace más larga, la probabilidad de pasar por alto una mentira cae a casi cero, y la probabilidad de acusar falsamente a una historia veraz también cae a casi cero.

Resumen

Piensa en el CES como un detector de mentiras que no necesita un polígrafo ni una segunda entrevista. Solo escucha el ritmo de la incertidumbre en el texto. Si el ritmo es estable, es probable que sea verdad. Si el ritmo tiene saltos erráticos y salvajes (incluso si el promedio parece bien), es probable que sea una alucinación.

El artículo probó esto en 10 modelos de IA diferentes y 8 tipos de preguntas distintas (desde matemáticas hasta cultura general) y descubrió que este método de "un solo pase" detecta mentiras tan bien como los métodos costosos de múltiples pases, pero mucho más rápido y barato.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →