Beyond Document Grounding: Span-Level Hallucination Detection over Code, Tool Output, and Documents
Este artículo introduce un benchmark unificado para la detección de alucinaciones a nivel de segmento a través de diversos tipos de entradas estructuradas como código y salidas de herramientas, demostrando que un modelo Qwen3.5-2B ajustado supera significamente a los detectores existentes y a los jueces zero-shot en estos dominios complejos, manteniendo al mismo tiempo la competitividad en benchmarks de RAG de lenguaje natural.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás contratando a un asistente muy inteligente y de habla rápida para que te escriba un informe. Le das una pila de libros de referencia (el "contexto") y una pregunta específica. Ellos rápidamente redactan una respuesta.
¿El problema? A veces, incluso los asistentes más inteligentes pueden volverse un poco creativos. Pueden inventar un dato, mezclar un número o citar una página que no existe en tus libros. Esto se llama una alucinación.
Durante mucho tiempo, los investigadores han construido "verificadores de hechos" para detectar estos errores, pero la mayoría solo funcionaban cuando el asistente escribía sobre temas normales como historia o ciencia utilizando texto plano.
Este artículo presenta un verificador de hechos nuevo y mucho más difícil, diseñado para el mundo moderno, donde los asistentes también están escribiendo código de computadora, resumiendo registros (logs) de herramientas de software y leyendo documentos estructurados como tablas y manuales.
Aquí hay un desglose de lo que hicieron, utilizando algunas analogías cotidianas:
1. El Problema: El punto ciego del "Código" y el "Log"
Imagina que tu asistente es un mecánico.
- Los Verificadores de Hechos Antiguos: Eran excelentes para comprobar si el mecánico decía "El coche es rojo" cuando el coche es en realidad azul.
- La Nueva Realidad: El mecánico ahora está escribiendo un complejo manual de reparación (código) o leyendo una pantalla de diagnóstico digital (salida de la herramienta). Si el mecánico escribe un comando incorrecto como
apagar_motoren lugar deencender_motor, todo el coche podría romperse. O si enumera un número de pieza que no existe, el pedido falla. - La Brecha: Los verificadores de hechos existentes eran como un humano leyendo una novela; no sabían cómo detectar una sola línea errónea en un programa informático o un error específico en un registro de software. No podían distinguir entre un término técnico real y uno inventado.
2. La Solución: Un juego de "Encuentra las Diferencias"
Los autores construyeron un nuevo campo de entrenamiento masivo (un benchmark) para enseñar a las computadoras cómo ser estos verificadores de hechos especializados.
- Cómo crearon los datos: Comenzaron con respuestas perfectas y correctas (como un manual de reparación perfecto). Luego, utilizaron un "inyector de alucinaciones" (piensa en él como un editor travieso) para introducir mentiras diminutas y localizadas.
- Ejemplo: Cambiaron un nombre de función real
establecer_dispositivopor uno falsoestablecer_dispositivo_activo. - No se limitaron a decir "Esta respuesta es incorrecta". Marcaron los caracteres exactos donde ocurrió la mentira.
- Ejemplo: Cambiaron un nombre de función real
- La Variedad: Crearon más de 74,000 ejemplos que cubren:
- Código: Correcciones de software reales de GitHub.
- Salida de Herramientas (Tool Output): Registros de herramientas de software (como mensajes de error o resultados de búsqueda).
- Documentos Estructurados: Artículos de investigación, archivos README y páginas de Wikipedia con tablas y listas.
- Texto Normal: Preguntas y respuestas estándar (para asegurar que no olvidaran cómo verificar el texto normal).
3. El Nuevo Detective: "LettuceDetect"
Entrenaron un nuevo modelo de IA (una versión de 2 mil millones de parámetros de un modelo llamado Qwen) para actuar como el detective.
- El Trabajo: El detective observa la Petición (Request), los Libros de Referencia y la Respuesta del Asistente. Debe señalar la mentira exacta y decir: "Esta palabra específica es inventada" o "Este número es incorrecto".
- Los Resultados:
- En Código y Herramientas: El nuevo detective es un superhéroe. Detectó el 60% de las mentiras en código y registros de herramientas.
- La Competencia: Los antiguos verificadores de hechos "estándar" (como LettuceDetect-large) e incluso los gigantes y brillantes jueces de IA (LLMs Zero-shot) solo detectaron entre un 17% y un 22% de las mentiras en código. Eran esencialmente ciegos ante los errores técnicos.
- En Texto Normal: El nuevo detective sigue siendo muy bueno verificando texto normal (obteniendo puntuaciones similares a los mejores sistemas existentes), demostrando que no perdió su conocimiento general mientras aprendía a leer código.
4. Por qué importa el "Nivel de Segmento" (Span-Level)
El artículo enfatiza que no solo dicen "Rechaza esta respuesta". Realizan una Detección a Nivel de Segmento (Span-Level Detection).
- Analogía: Imagina que un estudiante escribe un ensayo de 10 páginas. Una oración es una mentira.
- Forma Antigua: "Reprueba todo el ensayo". (Demasiado severo, las otras 9 páginas podrían ser perfectas).
- Nueva Forma: "Resalta la oración que es una mentira". (Preciso y útil).
- En el código, esto es crítico. Si un programa tiene 100 líneas y solo una línea está mal, no quieres desechar todo el programa; solo quieres arreglar esa línea específica.
Resumen
Este artículo presenta un nuevo "detector de verdad" unificado que puede manejar la realidad técnica y desordenada de los asistentes de IA modernos. Va más allá de simplemente verificar texto simple para detectar errores diminutos y peligrosos en código, registros de software y documentos estructurados.
Su nuevo modelo, LettuceDetect-Qwen-2B, es significativamente mejor encontrando estas mentiras técnicas que las herramientas anteriores, especialmente cuando el asistente está escribiendo código o leyendo registros de software, manteniendo al mismo tiempo un nivel de primer nivel para la verificación de lenguaje normal. Han publicado todos sus datos y modelos para que otros puedan usar este juego de "encuentra las diferencias" para construir sistemas de IA más fiables y mejores.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.