← Últimos artículos
💬 NLP

CORTEX: Token-Level Hallucination Detection in RAG via Comparative Internal Representations

El artículo propone CORTEX, un método de detección de alucinaciones a nivel de token para la Generación Aumentada por Recuperación que identifica contenido no fundamentado comparando las representaciones internas de un modelo con y sin los documentos recuperados, mientras aprovecha la propagación de información y el suavizado consistente en fragmentos para lograr una localización de grano fino de las alucinaciones.

Autores originales: Kazuaki Furumai, Shuichiro Haruta, Kazunori Matsumoto, Daisuke Kamisaka

Publicado 2026-07-01
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Kazuaki Furumai, Shuichiro Haruta, Kazunori Matsumoto, Daisuke Kamisaka

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente muy inteligente y culto (la IA) que intenta responder a una pregunta para ti. Para asegurar que la respuesta sea precisa, le entregas una pila de libros de referencia (los documentos recuperados) para que los consulte mientras escribe.

A veces, el asistente hace un gran trabajo, ciñéndose estrictamente a los libros. Otras veces, podría inventar accidentalmente un hecho o confundir un detalle, a pesar de que los libros están ahí mismo sobre el escritorio. Esto se llama "alucinación".

El problema es que, en una respuesta larga y detallada, la IA podría acertar en el 90% de los hechos de los libros, pero fallar en solo una o dos frases. Las herramientas actuales son como un guardia de seguridad que solo revisa el informe completo al final. Si el informe es mayormente bueno, el guardia podría decir: "¡Parece estar bien!", y así pasar por alto la pequeña mentira escondida en medio.

Este artículo presenta CORTEX, una nueva herramienta diseñada para ser un "microscopio" que revisa la respuesta palabra por palabra (o token por token) para detectar exactamente dónde está inventando cosas la IA.

Así es como funciona CORTROX, utilizando tres analogías sencillas:

1. La prueba de "Con y Sin" (Representaciones Internas Comparativas)

Imagina que estás tratando de averiguar si un estudiante realmente está leyendo un libro de texto o si solo está adivinando.

  • La forma antigua: Miras la respuesta del estudiante e intentas adivinar si leyó el libro.
  • La forma de CORTEX: Le pides al estudiante que responda la misma pregunta dos veces.
    1. Primera vez: Le das el libro de texto para que lo lea.
    2. Segunda vez: Le quitas el libro de texto y le pides que responda de memoria.

CORTEX compara la "actividad cerebral" (pensamientos internos) de la IA durante estos dos escenarios.

  • Si la IA está hablando de un hecho encontrado en el libro, su "cerebro" cambia significativamente cuando el libro está presente. Es como si los ojos del estudiante se iluminaran porque encontró la respuesta en el texto.
  • Si la IA está inventando algo (alucinando), su "cerebro" se ve casi igual tanto si el libro está ahí como si no, porque solo está extrayendo información de su propia memoria.

Al comparar estos dos estados, CORTEX puede detectar exactamente qué palabras cambiaron debido al libro (bueno) y cuáles se mantuvieron iguales debido a que fueron inventadas (malo).

2. El detective del "Cadena de Pensamiento" (Residuo Contextual)

A veces, una IA es lo suficientemente inteligente como para leer un hecho de un libro al principio de la respuesta, y luego usar ese hecho para construir el resto de la oración más adelante.

  • El problema: Si solo miras la oración posterior, podría parecer que la IA ya no está usando el libro, porque el libro no se menciona justo ahí. Esto podría engañar a un detector haciéndole creer que la oración posterior es una mentira, aunque esté basada en un hecho verdadero encontrado anteriormente.
  • La solución de CORTEX: CORTEX actúa como un detective que sigue el rastro. Se da cuenta de: "Oye, esta oración depende de un hecho que la IA acaba de leer dos oraciones atrás". Resta esa "influencia indirecta" para no confundirse. Esto evita que la herramienta acuse falsamente a la IA de mentir cuando en realidad solo está continuando una historia verdadera.

3. El "Filtro de Ruido" (Suavizado de Persistencia de Etiquetas)

Imagina que estás escuchando una estación de radio que tiene mucha estática. A veces, la estática hace que una sola palabra suene como una mentira, incluso si toda la oración es verdadera.

  • El problema: Las herramientas de detección puras pueden ser erráticas. Podrían marcar una palabra como mentira, luego la siguiente como verdad, y la siguiente como mentira, creando un patrón desordenado y disperso. Pero en realidad, si una IA miente, suele mentir durante toda una frase u oración, no solo por una palabra aislada.
  • La solución de CÓRTEX: CORTEX aplica un filtro de "suavizado". Asume que si una palabra es una mentira, las palabras inmediatamente contiguas probablemente sean parte de la misma mentira. Conecta los puntos, convirtiendo un desorden disperso de "posibles mentiras" en un bloque claro y sólido de "mentiras definitivas". Esto hace que el resultado final sea mucho más fácil de leer y entender para un humano.

Los Resultados

Los autores probaron CORTEX en dos conjuntos diferentes de preguntas y tres modelos de IA distintos. Descubrieron que:

  • CORTEX es mucho mejor encontrando las palabras exactas que se inventan en comparación con otros métodos.
  • Funciona incluso cuando la IA es un modelo de "API" (una caja negra en cuyo interior no puedes mirar) utilizando otro modelo de IA abierto para realizar el trabajo de detective entre bastidores.
  • Cada parte del sistema (la comparación, la verificación de la cadena de pensamiento y el suavizado) ayudó a que la detección fuera más precisa.

En resumen, CORTEX es una herramienta que nos ayuda a confiar más en las respuestas de la IA al señalar exactamente dónde la IA está inventando cosas, en lugar de simplemente adivinar si toda la respuesta es buena o mala.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →