Memory or Generalization? Temporal Probing of Data Contamination in Bengali LLM Benchmarks
Cet article introduit le « sondage temporel », un test de validité directe utilisant des éléments d'une difficulté équivalente et postérieurs à la date de coupure pour mesurer la contamination des données dans les benchmarks de LLM en bengali, constatant que les modèles actuels sur l'ensemble de données BoolQ-bn ne présentent aucune inflation significative due à la mémorisation malgré la prévalence de jeux de tests statiques et traduits.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le monde de l'intelligence artificielle, les chercheurs s'appuient sur des tests pour mesurer l'intelligence d'un programme informatique. Ces tests, appelés benchmarks, sont comme des examens standardisés pour les machines. Pendant longtemps, ces examens ont été rédigés en anglais. À mesure que la technologie a progressé, les développeurs ont traduit ces tests anglais dans d'autres langues pour voir si leurs programmes comprennent les nombreuses langues du monde. L'une des langues les plus importantes à tester est le bengali, parlé par environ un quart de milliard de personnes. Cependant, une ombre plane sur ces tests traduits. Parce que l'internet est si vaste, le texte de ces examens se retrouve souvent à l'intérieur des bibliothèques massives de données qui enseignent à ces programmes comment parler. Si un programme a déjà lu les questions de l'examen lors de son entraînement, il ne fait pas réellement preuve de son intelligence lorsqu'il y répond correctement ; il se contente de se souvenir des réponses qu'il a vues auparavant. Ce problème, connu sous le nom de contamination des données, rend difficile de savoir si un score élevé signifie que le programme est réellement capable ou s'il possède simplement une bonne mémoire.
Un chercheur nommé Md Fahim Faisal Tanha s'est donné pour mission de résoudre ce mystère pour les modèles de langue bengalis. Au lieu d'essayer de deviner si un modèle avait vu une question, il a utilisé le temps comme un outil pour trouver la vérité. Il a réalisé que si un modèle était entraîné sur des données allant jusqu'à une certaine date, il ne pouvait pas nécessairement connaître quoi que ce soit publié après cette date. Pour tester cela, il a pris les anciennes questions d'examen bengalis existantes et a créé de toutes nouvelles questions, difficiles à faire correspondre, en utilisant des articles de presse et des sujets d'examen publiés en 2025 et 2026. Ces nouvelles questions ont été soigneusement élaborées pour être aussi difficiles que les anciennes, mais elles étaient garanties invisibles pour les modèles car elles ont été écrites après que les modèles ont cessé d'apprendre. En comparant les performances des modèles sur les anciennes questions par rapport aux nouvelles questions, il a pu voir si les anciens scores étaient gonflés par la mémoire.
L'étude s'est concentrée sur sept modèles de langue open-source différents, allant de petites à moyennes tailles, et les a testés sur quatre-vingt-quatre paires de questions. Les résultats ont été étonnamment rassurants pour la communauté. Pour la plupart des modèles, les scores sur les anciennes questions étaient presque exactement les mêmes que les scores sur les nouvelles questions, inédites. Cela suggère que les modèles n'étaient pas en train de mémoriser les anciens examens ; ils utilisaient réellement leur compréhension de la langue pour résoudre les problèmes. La plus grande différence trouvée était un minuscule écart d'environ huit points de pourcentage, qui l'analyse statistique a montré comme étant probablement un simple bruit aléatoire plutôt qu'un signe de contamination des données. En d'autres termes, les scores actuels pour ces modèles bengalis semblent être dignes de confiance.
Il y avait une exception intéressante qui a enseigné aux chercheurs une leçon précieuse sur la manière de concevoir ces tests. Un modèle, une grande version de la famille Qwen, a en fait obtenu des résultats nettement meilleurs sur les nouvelles questions que sur les anciennes. Au premier abord, cela semblait étrange, mais les chercheurs ont réalisé qu'il ne s'agissait pas d'un signe de contamination. Au contraire, cela signifiait que les nouvelles questions étaient simplement plus faciles à répondre pour ce modèle spécifique que les anciennes questions traduites. Les anciennes questions nécessitaient un raisonnement complexe avec lequel le modèle éprouvait des difficultés, tandis que les nouvelles questions concernaient des faits plus directs. Cet écart s'est réduit à mesure que les chercheurs affinaient leur processus de correspondance, prouvant que la différence initiale était un défaut de conception du test, et non un défaut de performance du modèle. Cette découverte souligne que la nouvelle méthode consistant à utiliser le temps pour vérifier la contamination des données est assez puissante pour détecter non seulement la mémoire, mais aussi les décalages subtils de difficulté.
Enfin, ce travail fournit un moyen pratique à la communauté de l'intelligence artificielle bengalie pour vérifier ses résultats sans avoir besoin d'outils coûteux ou de jeux de devinettes complexes. En utilisant une méthode simple et gratuite qui compare les anciennes questions aux nouvelles, les chercheurs peuvent désormais être plus confiants dans le fait que leurs scores élevés reflètent une intelligence réelle. L'étude conclut que pour les modèles testés, les benchmarks sont valides et les scores sont réels. À mesure que de nouveaux modèles plus puissants arriveront à l'avenir, cette même approche pourra être utilisée pour s'assurer que les progrès rapportés sont basés sur une capacité réelle, maintenant ainsi le domaine honnête et progressant sur des bases solides.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.