How Reliable Are Bengali LLM Benchmarks? A Cross-Lingual Contamination and Robustness Audit of Open-Weight Language Models
Este artículo introduce y valida un marco sistemático para auditar la fiabilidad de los benchmarks de LLM en bengalí mediante la detección de la contaminación de datos translingüísticos y la medición de la robustez frente a perturbaciones, revelando que los resultados piloto iniciales muestran un rendimiento apenas por encima de los niveles de azar.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás tratando de juzgar qué tan bueno es un nuevo estudiante resolviendo problemas matemáticos. Le das un examen, obtiene una puntuación alta y lo declaras un genio. Pero, ¿qué pasaría si, antes del examen, hubiera memorizado secretamente la clave de respuestas? O ¿qué pasaría si hubiera visto los mismos problemas en un idioma diferente y simplemente hubiera adivinado las respuestas basándose en eso? Este es el complicado mundo de las pruebas de Inteligencia Artificial (IA). Los científicos construyen "Modelos de Lenguaje Extensos" (LLM, por sus siglas en inglés)—programas informáticos superinteligentes que pueden leer, escribir y chatear en muchos idiomas. Para ver si estos programas son realmente inteligentes o solo buenos memorizando, los investigadores les aplican pruebas estandarizadas llamadas "benchmarks".
Sin embargo, existe un problema escurridizo llamado "contaminación". Es como si un profesor accidentalmente hubiera dejado la clave de respuestas sobre su escritorio y el estudiante la encontrara antes del examen. El estudiante obtiene una puntuación perfecta, pero no aprendió el material; simplemente memorizó las respuestas. Esto es algo muy importante porque si las pruebas están "contaminadas", no podemos confiar en las puntuaciones. Podríamos pensar que una IA es excelente en un idioma como el bengalí (hablado por cientos de millones de personas) cuando en realidad solo ha visto la versión en inglés de la prueba anteriormente.
Ahora, veamos un nuevo estudio que actúa como un detective, investigando si estas pruebas de IA para el idioma bengalí son justas o si están llenas de filtraciones ocultas.
El trabajo de detective: Auditoría de las pruebas de IA en bengalí
Los investigadores en este artículo se están haciendo una pregunta muy importante: ¿Son las puntuaciones que vemos para los modelos de IA en las pruebas de bengalí reales, o están infladas debido a la exposición previa?
Se centraron en el bengalí porque es un idioma masivo que apenas ha comenzado a tener sus propias pruebas de IA. Muchas de estas pruebas son traducciones directas de famosos exámenes en inglés. El equipo temía que, si un modelo de IA había visto la versión en inglés de una pregunta durante su entrenamiento, podría ser capaz de adivinar la respuesta en bengalí sin entender realmente el bengalí. Esto se llama "contaminación translingüística".
Para resolver este misterio, los investigadores construyeron un "marco de auditoría" especial—un conjunto de herramientas para verificar la exposición previa. Utilizaron tres métodos principales:
- La verificación de "verosimilitud": Observaron qué tan sorprendida estaba la IA por las preguntas del examen. Si la IA había visto la pregunta antes, no se sorprendería; sería muy segura. Si la veía por primera vez, sería más vacilante.
- La prueba de "completar el espacio en blanco": Intentaron engañar a la IA ocultando una de las respuestas incorrectas en una pregunta de opción múltiple y le pidieron que adivinara cuál era la palabra faltante. Si la IA podía adivinar la palabra exacta que faltaba, es probable que tuviera todo el examen memorizado.
- La búsqueda de la "verdad fundamental" (Ground Truth): Para algunos modelos que son completamente abiertos (donde podemos ver exactamente con qué datos fueron entrenados), buscaron literalmente en los datos de entrenamiento para ver si las preguntas del examen estaban allí.
También probaron la robustez. Esto es como cambiar ligeramente la redacción de una pregunta—cambiando un número o añadiendo una frase tonta e irrelevante—para ver si la IA sigue acertando. Si la puntuación de la IA cae drásticamente cuando cambias la pregunta ligeramente, sugiere que la IA no estaba realmente "pensando"; solo estaba memorizando el patrón exacto.
Lo que encontraron (hasta ahora)
Los investigadores no se limitaron a hablar de la teoría; de hecho, realizaron una pequeña prueba "piloto" para ver si sus herramientas de detective funcionaban. Utilizaron un modelo de IA más pequeño (llamado Qwen2.5-1.5B) y lo probaron con 500 preguntas de un examen de comprensión lectora en bengalí llamado BoolQ-bn.
Esto es lo que reveló el piloto:
- La puntuación fue apenas mejor que el azar: El modelo obtuvo una precisión de 0.568. Dado que este es un examen de preguntas de sí/no, un intento al azar obtendría un 0.50. El modelo solo hizo unos 7 puntos más que el puro azar. Esto sugiere que, a este tamaño, el modelo aún no tiene un conocimiento sólido de la comprensión lectora en bengalí.
- La prueba de "exposición previa" fue inconclusa: Intentaron ver si el modelo había memorizado las respuestas utilizando sus herramientas de verosimilitud, pero necesitaban un conjunto de "control" de preguntas (preguntas que el modelo definitivamente no había visto) para comparar. Esa parte todavía se está terminando.
- La prueba de "distracción": Añadieron una frase distractora a las preguntas para ver si la IA se confundía. La puntuación del modelo bajó ligeramente a 0.558, pero la diferencia no fue estadísticamente significativa (las matemáticas dicen que podría ser simplemente ruido aleatorio). Esto significa que el piloto fue demasiado pequeño para decir con certeza si el modelo era frágil o no.
El panorama general
La principal conclusión de este artículo no es un veredicto final sobre si la IA en bengalí presenta exposición previa o no. En cambio, este artículo es un plan maestro sobre cómo averiguarlo.
Los investigadores han construido un conjunto de herramientas completo y de código abierto que cualquiera puede usar para auditar estas pruebas. Han enumerado todos los benchmarks disponibles en bengalí, crearon un protocolo para verificar la contaminación y demostraron que es posible realizar estas costosas pruebas con recursos informáticos gratuitos (como Google Colab).
Actualmente están realizando la auditoría completa en muchos más modelos y benchmarks. El piloto demostró que el sistema funciona, pero los resultados completos aún se están calculando. El artículo argumenta que, hasta que realicemos estas auditorías, no podemos estar seguros de si las altas puntuaciones que vemos para la IA en bengalí son inteligencia real o simplemente el resultado de que los modelos hayan visto las respuestas en inglés antes.
En resumen, este artículo es un llamado a la acción: "Dejemos de adivinar si la IA es inteligente en bengalí y empecemos a usar estas herramientas de detective para demostrarlo". Se están asegurando de que, cuando digamos que una IA es buena en un idioma, sea porque realmente entiende el idioma, no porque memorizó el examen.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.