Quantifying the Impact of Translation Errors on Multilingual LLM Evaluation
Ce papier examine la fiabilité des évaluations de modèles de langage multilingues en démontrant que les erreurs de traduction dans les benchmarks traduits par machine contribuent de manière significative aux baisses de précision et que les méthodes de détection automatique d'erreurs montrent un accord non négligeable avec les annotations humaines.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous soyez un enseignant tentant de noter une classe d'élèves parlant différentes langues. Vous possédez un test célèbre rédigé en anglais (la « Référence Or »). Pour évaluer la maîtrise de l'espagnol, du français ou de l'allemand par vos élèves, vous prenez ce test en anglais, le faites passer par une machine de traduction, et distribuez les versions traduites à vos élèves.
La grande question que pose cet article est : Que se passe-t-il si la machine de traduction commet des erreurs ?
Les auteurs, une équipe de chercheurs, ont découvert que ces erreurs de traduction ne sont pas de simples coquilles ; elles sont comme des nids-de-poule sur la route qui peuvent faire chuter même les élèves les plus brillants, même s'ils connaissaient parfaitement la réponse en anglais.
Voici une analyse de leurs résultats utilisant des analogies simples :
1. Le « Correcteur Robot » contre l'Expert Humain
Les chercheurs voulaient savoir : pouvons-nous faire confiance à d'autres modèles d'IA pour repérer ces nids-de-poule de traduction, ou avons-nous besoin d'un expert humain ?
- L'Expérience : Ils ont pris un ensemble de questions de test traduites et ont demandé à quatre « Correcteurs Robots » différents (des modèles d'IA comme GPT-5.2, Mistral, etc.) de souligner exactement où la traduction était erronée. Ils ont comparé le travail des robots à une « Référence Or » créée par des linguistes humains professionnels.
- Le Résultat : Les robots étaient corrects, mais pas parfaits. Un robot, GPT-5.2, était le meilleur pour trouver les nids-de-poule, s'accordant avec les experts humains environ la moitié du temps. Les autres robots étaient beaucoup moins précis.
- La Contrainte : Les robots étaient souvent confus quant à où l'erreur commençait et se terminait. C'est comme deux personnes essayant de dessiner un cercle autour d'une tache sur une chemise ; elles peuvent s'accorder sur l'existence d'une tache, mais l'une dessine un tout petit cercle autour du centre, tandis que l'autre dessine un énorme cercle englobant toute la manche.
2. La « Source du Problème » (Qui est à blâmer ?)
Parfois, la question du test en anglais elle-même est étrange ou confuse. Parfois, la traduction l'aggrave. Les chercheurs voulaient savoir : L'élève échoue-t-il parce que la question en anglais était mauvaise, ou parce que la traduction l'a gâchée ?
- L'Analogie : Imaginez un problème de mathématiques qui dit « Si une voiture parcourt 50 miles en 2 heures... »
- Problème Source : La question en anglais est brisée et dit « Si une voiture parcourt 50 miles en 2 pommes... » (L'original est absurde).
- Problème de Traduction : L'anglais est correct, mais le traducteur remplace « miles » par « kilomètres » et « heures » par « minutes », rendant les mathématiques impossibles à résoudre.
- La Découverte : Les chercheurs ont constaté que les erreurs de traduction sont les véritables fauteurs de trouble. Même lorsque la question en anglais était parfaite et résoluble, la version traduite faisait que les élèves IA donnaient la mauvaise réponse environ 6 à 11 points de pourcentage de plus simplement à cause des erreurs de traduction.
3. La « Chute de Score » contre le « Classement »
C'est la partie la plus surprenante. Les chercheurs ont demandé : Si nous réparions magiquement toutes les erreurs de traduction, le classement des modèles d'IA changerait-il ?
- L'Analogie : Imaginez une course où chaque coureur démarre 10 mètres derrière la ligne de départ à cause d'une erreur de traduction.
- Le Résultat : Si vous faites avancer tout le monde de 10 mètres (en réparant la traduction), tout le monde va plus vite. Le coureur qui était en 1re place reste en 1re place. Le coureur en 10e place reste en 10e place. L'ordre des gagnants ne change pas.
- Le Problème : Cependant, les temps sont tous faux. Vous pensez que le gagnant a couru une course de 10 secondes, mais il a en réalité couru une course de 9 secondes. Vous sous-estimez la véritable capacité de chacun.
- La Conclusion : Les erreurs de traduction agissent comme un poids uniforme attaché à chaque modèle d'IA. Elles tirent le score de tout le monde vers le bas de manière égale. Ainsi, bien que le « Classement » (qui est n°1) reste le même, les scores réels sont biaisés et trop bas. Nous disons au monde : « Cette IA n'est intelligente qu'à 80 % », alors qu'elle pourrait en réalité être intelligente à 85 %, simplement parce que le test a été mal traduit.
Résumé de la Conclusion
L'article conclut que l'utilisation de benchmarks traduits par machine pour tester l'IA est risquée.
- Les robots ne sont pas encore parfaits pour repérer les erreurs de traduction.
- Les erreurs de traduction provoquent de véritables baisses mesurables de performance (environ 6 à 11 points de précision en moins).
- Les classements des modèles d'IA sont stables (le gagnant reste le gagnant), mais les scores sont injustement bas.
C'est comme juger un concours de cuisine où les ingrédients auraient été traduits depuis une autre langue. Le meilleur chef pourrait toujours gagner, mais les juges pourraient penser que la nourriture a un goût pire qu'elle ne l'est réellement, car la recette a été légèrement déformée par la traduction.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.