← Últimos artículos
💬 NLP

D-Score: A Spectral Hidden-State Signal for Hallucination Detection in Large Language Models

Este artículo presenta D-Score, un método de detección de alucinaciones para Modelos de Lenguaje Extensos que analiza la geometría espectral de las activaciones de los estados ocultos durante una única pasada hacia adelante para identificar inconsistencias entre el texto generado y el conocimiento interno del modelo, eliminando la necesidad de verificadores externos o de múltiples generaciones.

Autores originales: Bianca Raimondi, Davide Evangelista, Maurizio Gabbrielli, Elena Loli Piccolomini

Publicado 2026-07-28
📖 4 min de lectura☕ Lectura para el café

Autores originales: Bianca Raimondi, Davide Evangelista, Maurizio Gabbrielli, Elena Loli Piccolomini

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que entras en una biblioteca donde los libros han sido escritos por un robot muy talentoso, pero ocasionalmente travieso. Este robot, conocido como un Modelo de Lenguaje Extenso (LLM), puede escribir historias, responder preguntas y charlar contigo de una manera que suena perfectamente humana. Pero aquí está el truco: a veces, el robot inventa cosas. Podría decirte que la luna está hecha de queso verde o que un evento histórico famoso ocurrió en el día equivocado. Esto no es porque el robot esté mintiendo a propósito; es simplemente que tiene confianza en sus propios hechos inventados. A esto lo llamamos "alucinación".

Durante mucho tiempo, la única forma de atrapar estas mentiras era enviar la respuesta del robot a un segundo robot o a un bibliotecario humano para contrastarla con una base de datos de hechos reales. Era como pedirle a un estudiante que escribiera un ensayo y luego contratar a un profesor diferente para calificarlo. Pero, ¿y si el propio cerebro del estudiante nos diera una pista? ¿Y si, en el momento en que el robot empezara a inventar algo, su "proceso de pensamiento" interno cambiara de una manera que pudiéramos ver, incluso antes de que terminara la frase? Esta es la pregunta que los científicos se están haciendo: ¿Podemos echar un vistazo al interior de la mente del robot para detectar una mentira mientras ocurre, sin necesidad de una segunda opinión?

Esto es exactamente lo que los investigadores de este artículo se propusieron hacer. Introdujeron una nueva y astuta herramienta llamada D-Score. Piensa en la mente del robot como una gigantesca pista de baile multidimensional. Cada vez que el robot procesa una palabra, envía una señal a través de esta pista. Cuando el robot habla de algo que conoce bien y de lo que está seguro, los bailarines (las señales) se mueven en una línea organizada y sincronizada. Todos marchan en la misma dirección, como un desfile bien ensayado. Esto crea un camino "coherente".

Sin embargo, cuando el robot intenta hablar de algo que no sabe o que está inventando, la pista de baile se vuelve caótica. El robot intenta decir una cosa (el hecho inventado), pero su memoria interna le susurra: "Espera, eso no suena bien" o "No estoy seguro de esto". Este conflicto hace que los bailarines se dispersen. En lugar de marchar en una sola línea apretada, comienzan a esparcirse en muchas direcciones diferentes a la vez. Algunos bailarines están confundidos, otros intentan corregir el error y otros simplemente no están seguros.

El D-Score es un truco matemático simple que cuenta en cuántas direcciones diferentes se mueven estos bailarines. Si los bailarines marchan todos en una línea recta, la puntuación es baja. Pero si se dispersan en una multitud desordenada, la puntuación sube. Los investigadores descubrieron que cuando el D-Score es alto, es una señal fuerte de que el robot está alucinando.

El equipo probó esta idea en tres cerebros de robot diferentes (llamados Llama-2, Llama-3 y Vicuna) utilizando dos conjuntos de preguntas capciosas. Descubrieron que el D-Score era mucho mejor detectando mentiras que otros métodos que solo observaban qué tan "sorprendido" estaba el robot o cuántas veces repetía la respuesta. De hecho, en algunas pruebas, el D-Score fue casi 10 puntos porcentuales mejor que el método anterior más eficaz para detectar alucinaciones.

Lo que hace que esto sea tan emocionante es lo sencillo que es. El D-Score no necesita consultar una base de datos, no necesita pedirle al robot que responda a la misma pregunta cinco veces y no necesita a un segundo robot que ayude. Solo necesita observar las señales internas del robot durante una sola conversación. Los investigadores sugieren que esto funciona porque la propia "incertidumbre" o el "conflicto" interno del robot deja una huella visible en su proceso de pensamiento.

Por supuesto, el artículo es cuidadoso al decir que esto no es una varita mágica que atrapa cada una de las mentiras. Si el robot está inventando un hecho sobre el cual no tiene ningún recuerdo interno en absoluto, la pista de baile podría no volverse caótica y el D-Score podría mantenerse bajo. Pero para las mentiras que el robot percibe internamente, esta nueva señal "espectral" es una forma poderosa de atraparlas en el acto, todo ello escuchando el propio ritmo interno del robot.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →