← Derniers articles
💬 NLP

Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents

Cet article introduit un cadre rigoureux pour mesurer la rétention de politique translingue chez les agents utilisant des outils en corrigeant cinq biais critiques, révélant que les modèles de pointe conservent structurellement 71 à 73 % de leurs politiques d'action à travers les langues en acheminant les tâches non anglaises via l'anglais, tandis que les modèles plus petits présentent des ruptures et que les échecs observés peuvent être artificiellement fabriqués par des expressions régulières d'extraction de traces plutôt que par des limitations du modèle.

Auteurs originaux : Sourabrata Mukherjee, Kalika Bali, Sunayana Sitaram

Publié 2026-08-12
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Sourabrata Mukherjee, Kalika Bali, Sunayana Sitaram

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le voyage invisible d'un assistant numérique

Imaginez que vous avez un assistant numérique super intelligent, comme un robot personnel mais vivant à l'intérieur d'un ordinateur. Son travail consiste à résoudre des problèmes en suivant une série d'étapes : il peut chercher des informations, faire des calculs ou traduire une phrase, avant de vous donner une réponse finale. C'est ainsi que fonctionnent les « agents IA » modernes ; ils ne se contentent pas de deviner la réponse, ils construisent un chemin pour y parvenir.

Pendant longtemps, les scientifiques ont testé ces assistants en leur posant la même question dans différentes langues, comme l'anglais et le hindi. Si l'assistant donnait la bonne réponse dans les deux langues, tout le monde était satisfait. C'était comme noter un élève uniquement sur le fait qu'il obtienne le bon chiffre lors d'un test de mathématiques, sans regarder comment il a résolu le problème. Mais que se passerait-il si l'élève résolvait le problème en anglais en dessinant un tableau, mais résolvait le problème en hindi en écrivant une longue dissertation ? Ils recevraient la même note, mais ils auraient utilisé des méthodes complètement différentes.

Ce document pose une question cruciale : lorsqu'un agent d'IA change de langue, change-t-il son « itinéraire » ou les étapes qu'il suit pour obtenir la réponse ? Il s'avère que les étapes comptent énormément. L'itinéraire détermine combien d'argent l'ordinateur dépense, sa vitesse de fonctionnement et ce qui se passe s'il commet une erreur. Si l'IA prend un chemin différent en hindi qu'en anglais, cela peut coûter plus cher ou échouer d'une manière que les règles de sécurité n'auraient pas détectée. Ainsi, les chercheurs ont décidé de ne plus seulement regarder la réponse finale, mais de commencer à observer le voyage lui-même.

Le grand détour linguistique

Les chercheurs ont entrepris de voir si ces agents d'IA étaient véritablement bilingues ou s'ils faisaient simplement semblant. Ils ont pris huit modèles d'IA différents et leur ont donné les mêmes tâches dans 41 langues différentes. Au lieu de simplement vérifier le résultat final, ils ont enregistré chaque étape franchie par l'IA — la « trace » — comme un GPS traquant le trajet d'une voiture. Ils voulaient savoir : si je demande à l'IA de « trouver la météo puis de calculer le coût » en anglais, et que je lui demande exactement la même chose en hindi, suivra-t-elle exactement les mêmes étapes ?

La réponse fut un « non » retentissant, mais pas de la manière dont on pourrait l'imaginer. L'IA ne prenait pas seulement un chemin légèrement différent ; elle faisait un détour massif. Les chercheurs ont découvert que lorsque la langue changeait, le comportement de l'IA changeait de manière significative. En fait, lorsqu'ils ont examiné les modèles les plus avancés, ils ne conservaient qu'environ 71 % à 73 % de leur plan initial étape par étape lors du changement de langue. Cela signifie que, pendant environ 27 % à 29 % du temps, l'IA faisait quelque chose de complètement différent simplement parce que les mots étaient dans une autre langue.

Le secret du « Pivot Anglais »

Pourquoi cela se produisait-il ? L'équipe a découvert une habitude cachée que les agents d'IA avaient développée. Il s'avère que même lorsque vous posez une question à l'IA en hindi, en tamoul ou dans toute autre langue, elle traduit souvent secrètement l'ensemble en anglais dans son « esprit » d'abord. Elle résout ensuite le problème en anglais et traduit la réponse en retour.

Les chercheurs ont appelé cela le « pivot anglais ». Pour prouver cela, ils ont essayé de forcer l'IA à arrêter de le faire. Ils ont dit à l'IA : « S'il te plaît, pense dans la langue que tu parles, ne traduis pas en anglais ! » Mais l'IA n'a pas obéi. Dans les deux modèles testés, l'IA a suivi l'instruction de penser dans la langue de la tâche moins d'1 % du temps. Comme l'IA n'a presque jamais fait ce qu'on lui avait ordonné, les chercheurs n'ont pas pu tester si le fait de penser dans une autre langue changerait ses étapes. Cependant, le résultat a établi quelque chose d'encore plus fort : le « pivot anglais » n'est pas seulement une préférence que l'on peut désactiver avec une simple consigne ; c'est un comportement profondément ancré que les modèles ignorent de fait lorsqu'ils reçoivent un ordre direct. C'était comme un voyageur qui, peu importe le pays qu'il visite, insiste pour ne parler qu'à un traducteur avant de parler à quiconque, peu importe ce que le guide lui dit. Cette habitude était si forte qu'elle était la raison principale pour laquelle les étapes de l'IA changeaient lorsque la langue changeait.

Le piège des raccourcis

Le document a également mis au jour une erreur amusante qui a failli tromper tout le monde. Lors de la mesure de l'efficacité de ces agents d'IA, certains chercheurs utilisaient un programme informatique simple pour lire les étapes de l'IA. L'un de ces programmes était si strict que si l'IA écrivait une phrase telle que « Je vais utiliser la calculatrice », au lieu d'un format de code spécifique, le programme considérait que l'IA avait échoué.

À cause de cela, un modèle d'IA très capable semblait échouer 76 % du temps. Mais lorsque les chercheurs ont corrigé le programme informatique pour le rendre un peu plus flexible, le « taux de réussite » de l'IA a bondi de 26 fois ! Cela a appris aux chercheurs que parfois, ce qui ressemble à un problème de langue est en réalité un problème de lecture de l'écriture de l'IA.

La règle de la taille

Enfin, l'équipe a examiné si les modèles d'IA plus grands étaient meilleurs pour cela. Ils ont découvert une règle étrange : les modèles les plus grands et les plus puissants étaient tous très similaires, restant fidèles à cette cohérence de 71–73 %. Mais les petits modèles étaient un désordre. Certains petits modèles semblaient excellents, mais il s'est avéré qu'ils avaient simplement eu de la chance car ils empruntaient des chemins très courts et simples, faciles à faire correspondre par hasard. Une fois que les chercheurs ont corrigé ce facteur de chance, les petits modèles n'étaient plus aussi impressionnants. Il semble que seuls les modèles très larges et puissants se soient installés dans une manière de comportement cohérente, tandis que les plus petits sont encore en train de chercher leur voie.

Pourquoi cela importe

Cette étude change la façon dont nous devrions tester l'IA. Elle montre qu'obtenir la bonne réponse ne suffit pas. Si une IA prend un chemin différent, plus coûteux ou plus risqué simplement parce que vous avez parlé une autre langue, c'est un problème. Les chercheurs ont montré que ces agents ne sont pas véritablement fluides dans leurs actions ; ils s'appuient toujours sur une béquille anglaise cachée. Tant que nous ne réglerons pas cela, une IA pourrait être digne de confiance en anglais mais peu fiable dans d'autres langues, non pas parce qu'elle est « stupide », mais parce qu'elle emprunte une route différente et non surveillée pour atteindre la même destination.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →