Delulu: A Verified Multi-Lingual Benchmark for Code Hallucination Detection in Fill-in-the-Middle Tasks
Este artículo presenta Delulu, un benchmark multilingüe rigurosamente verificado que consta de 1.951 muestras curadas de forma adversaria y que pone de manifiesto la vulnerabilidad persistente de los modelos de generación de código más avanzados a producir alucinaciones plausibles pero incorrectas en tareas de relleno en medio.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás contratando a un programador junior muy inteligente, pero ligeramente demasiado seguro de sí mismo, para que te ayude a escribir código. Este programador es excelente adivinando qué viene a continuación en una oración, pero a veces, cuando no sabe la respuesta, simplemente inventa algo que suena perfecto.
Este artículo presenta un nuevo "examen" llamado DELULU, diseñado para detectar estas respuestas inventadas, conocidas como alucinaciones, específicamente cuando el programador está rellenando la parte media de un fragmento de código (una tarea llamada "Rellenar en el Medio").
Aquí tienes el desglose del artículo utilizando analogías simples:
1. El Problema: El "Mentiroso Seguro"
En el mundo de la IA para codificación, a menudo se prueban los modelos para ver si pueden escribir una función completa desde cero. Pero en el mundo real, los asistentes de IA (como GitHub Copilot) funcionan principalmente observando el código antes y después de un hueco y rellenando la parte media.
El problema es que estas IAs son como mentirosos seguros. Podrían inventar una biblioteca que no existe, llamar a una función que no es real, o usar un nombre de variable que no ha sido definido.
- La Trampa: El código parece perfecto a simple vista (es gramaticalmente correcto). Se lee como una oración normal. Pero cuando intentas ejecutarlo, se bloquea porque la IA inventó un hecho.
- El Objetivo: Los autores querían saber: ¿Pueden los modelos de IA actuales evitar de manera fiable cometer estas mentiras? Y si mienten, ¿pueden otros modelos de IA detectar la mentira?
2. La Solución: El Examen "DELULU"
Los autores construyeron un punto de referencia (un conjunto de pruebas) llamado DELULU. El nombre es un juego de palabras con la jerga de internet para "delirante", porque estas alucinaciones de la IA suelen ser muy convincentes.
Piensa en DELULU como una trampa gigante y automatizada tendida para los modelos de IA.
- La Configuración: Tomaron código real de internet y crearon 1.951 "trampas".
- Las Trampas: Para cada pieza correcta de código (la respuesta "Dorada"), utilizaron una IA superinteligente para crear una versión "Alucinada". Esta versión falsa cambiaba solo una cosa minúscula para hacerla incorrecta, pero la mantenía con apariencia plausible.
- Ejemplo: Cambiar una importación real
from pandas import read_csvpor una falsafrom pandas import read_csvs.
- Ejemplo: Cambiar una importación real
- Los 4 Tipos de Mentiras: El examen se centra en cuatro formas específicas en las que la IA se equivoca:
- Método: Inventar un nombre de función (por ejemplo,
df.remove_nulls()cuando esa función no existe). - Parámetro: Añadir una configuración que no existe (por ejemplo,
print(text, color="blue")cuando la función no acepta colores). - Variable No Definida: Usar un nombre que nunca fue creado.
- Importación: Intentar cargar un paquete de software que no existe.
- Método: Inventar un nombre de función (por ejemplo,
3. Cómo Construyeron el Examen (El "Pipeline Adversarial")
No solo adivinaron las preguntas; construyeron una fábrica rigurosa para asegurar que las preguntas fueran difíciles y las respuestas reales.
- Generación: Una IA creó el código falso y mentiroso.
- El Panel de "Jueces": Cuatro super-IA diferentes actuaron como profesores para calificar el código falso. Si un profesor no podía distinguir la mentira de la verdad, la pregunta se conservaba. Si el profesor la detectaba fácilmente, la pregunta se descartaba.
- La "Verificación de la Realidad" (Docker): Esta es la parte más importante. No solo confiaron en los profesores. Pusieron cada fragmento de código individual en una caja de arena virtual (un contenedor Docker) e intentaron ejecutarlo.
- Si el código "Dorado" se ejecutaba con éxito, se conservaba.
- Si el código "Alucinado" se bloqueaba con el error exacto que el examen buscaba (como "Archivo no encontrado" o "Variable no definida"), se conservaba.
- Si el código falso no se bloqueaba realmente, se descartaba.
- Revisión Humana: Finalmente, expertos humanos revisaron las preguntas restantes para asegurarse de que no fueran demasiado fáciles o sesgadas.
4. Los Resultados: La IA Sigue Luchando
Los autores probaron 11 modelos de IA diferentes (desde pequeños hasta muy grandes) en este examen.
- La Puntuación: Incluso el mejor modelo de IA solo acertó aproximadamente el 84.5% de las respuestas. Eso significa que aún cayó en la trampa en aproximadamente 1 de cada 6 preguntas.
- La Trampa Más Difícil: Las mentiras de "Importación" (inventar paquetes de software falsos) fueron las más difíciles de evitar para las IAs. Es como pedirles que memoricen una guía telefónica de todas las bibliotecas de software existentes; siguen adivinando nombres que suenan reales pero no lo son.
- El Problema de Detección: También preguntaron: "¿Puede una IA actuar como revisor de código y detectar estas mentiras?". Incluso los revisores de IA más inteligentes solo detectaron las mentiras aproximadamente el 92% de las veces. Esto significa que aún existe una brecha por la que una mentira puede colarse.
5. Por Qué Esto Importa
El artículo concluye que este es un problema fundamental, no solo un error en un modelo de IA específico.
- No se trata solo del tamaño: Hacer la IA más grande ayuda, pero no resuelve el problema completamente.
- No se trata solo del entrenamiento: Diferentes familias de modelos de IA tuvieron dificultades con los mismos tipos de mentiras.
- La Conclusión: No podemos confiar en que la IA escriba código sin verificarlo, porque incluso las mejores IAs son lo suficientemente "delirantes" como para inventar hechos que bloquean tu programa.
En resumen: DELULU es una prueba rigurosa y multilingüe que demuestra que los asistentes de código actuales de IA aún son propensos a inventar hechos que parecen reales pero fallan cuando intentas ejecutarlos. El artículo proporciona las herramientas (la prueba y los contenedores de "caja de arena") para que los desarrolladores midan y mejoren esta debilidad específica.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.