Memory or Generalization? Temporal Probing of Data Contamination in Bengali LLM Benchmarks
Este artículo introduce el "sondeo temporal", una prueba de validez directa que utiliza ítems de dificultad equiparada y posteriores a la fecha de corte para medir la contaminación de datos en los benchmarks de LLM en bengalí, encontrando que los modelos actuales en el conjunto de datos BoolQ-bn no muestran una inflación significativa por memorización a pesar de la prevalencia de conjuntos de prueba estáticos y traducidos.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
En el mundo de la inteligencia artificial, los investigadores dependen de pruebas para medir qué tan inteligente es un programa informático. Estas pruebas, llamadas evaluaciones de referencia (benchmarks), son como exámenes estandarizados para las máquinas. Durante mucho tiempo, estos exámenes fueron escritos en inglés. A medida que la tecnología ha crecido, los desarrolladores han traducido estos exámenes del inglés a otros idiomas para ver qué tan bien sus programas comprenden las muchas lenguas del mundo. Uno de los idiomas más importantes para probar es el bengalí, hablado por aproximadamente un cuarto de mil de millones de personas. Sin embargo, una sombra se cierne sobre estas pruebas traducidas. Debido a que internet es tan vasto, el texto de estos exámenes a menudo termina dentro de las masivas bibliotecas de datos que enseñan a estos programas cómo hablar. Si un programa ya ha leído las preguntas del examen durante su entrenamiento, no está demostrando realmente su inteligencia al responderlas correctamente; simplemente está recordando las respuestas que vio antes. Este problema, conocido como contaminación de datos, hace que sea difícil saber si una puntuación alta significa que el programa es realmente capaz o si solo tiene una buena memoria.
Un investigador llamado Md Fahim Faisal Tanha se propuso resolver este misterio para los modelos de lenguaje en lengua bengalí. En lugar de intentar adivinar si un modelo había visto una pregunta, utilizó el tiempo como una herramienta para encontrar la verdad. Se dio cuenta de que si un modelo fue entrenado con datos hasta una cierta fecha, no podría saber de ninguna manera nada publicado después de esa fecha. Para probar esto, tomó las viejas y existentes preguntas de exámenes en bengalí y creó preguntas nuevas y difíciles de emparejar utilizando artículos de noticias y exámenes de prueba publicados en 2025 y 2026. Estas nuevas preguntas fueron cuidadosamente elaboradas para ser tan difíciles como las antiguas, pero se garantizaba que no habían sido vistas por los modelos porque fueron escritas después de que los modelos terminaran de aprender. Al comparar qué tan bien les fue en las preguntas viejas frente a las nuevas, podía ver si las puntuaciones antiguas estaban infladas por la memoria.
El estudio se centró en siete modelos de lenguaje de código abierto diferentes, que variaban desde tamaños pequeños hasta medianos, y los probó en ochenta y cuatro pares de preguntas. Los resultados fueron sorprendentemente tranquilizadores para la comunidad. Para la mayoría de los modelos, las puntuaciones en las preguntas viejas fueron casi exactamente iguales a las puntuaciones en las nuevas preguntas no vistas. Esto sugiere que los modelos no estaban memorizando los exámenes antiguos; en realidad, estaban usando su comprensión del lenguaje para resolver los problemas. La mayor diferencia encontrada fue una pequeña brecha de aproximadamente ocho puntos porcentuales, la cual el análisis estadístico mostró que probablemente era solo ruido aleatorio en lugar de una señal de contaminación de datos. En otras palabras, las puntuaciones actuales para estos modelos de bengalí parecen ser confiables.
Hubo una excepción interesante que enseñó a los investigadores una lección valiosa sobre cómo diseñar estas pruebas. Un modelo, una versión grande de la familia Qwen, en realidad funcionó significativamente mejor en las preguntas nuevas que en las viejas. Al principio, esto parecía extraño, pero los investigadores se dieron cuenta de que no era una señal de contaminación. En cambio, significaba que las nuevas preguntas eran simplemente más fáciles de responder para ese modelo específico que las viejas preguntas traducidas. Las preguntas viejas requerían un razonamiento complejo con el que el modelo tenía dificultades, mientras que las nuevas preguntas eran hechos más directos. Esta brecha se redujo a medida que los investigadores refinaron su proceso de emparejamiento, demostrando que la diferencia inicial era un fallo en el diseño de la prueba, no un fallo en el rendimiento del modelo. Este hallazgo destaca que el nuevo método de usar el tiempo para verificar la contaminación de datos es lo suficientemente poderoso como para detectar no solo la memoria, sino también desajustes sutiles en la dificultad.
En última instancia, este trabajo proporciona una forma práctica para que la comunidad de inteligencia artificial bengalí verifique sus resultados sin necesidad de herramientas costosas o juegos de adivinanzas complejos. Al utilizar un método simple y gratuito que compara preguntas viejas con nuevas, los investigadores pueden ahora estar más seguros de que sus altas puntuaciones reflejan una inteligencia genuina. El estudio concluye que, para los modelos probados, las evaluaciones de referencia son válidas y las puntuaciones son reales. A medida que lleguen modelos más nuevos y potentes en el futuro, este mismo enfoque puede utilizarse para asegurar que el progreso reportado se base en una capacidad real, manteniendo el campo honesto y avanzando sobre terreno sólido.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.