← Derniers articles
💬 NLP

Divergent large language model predictions from convergent representations in ambiguous word pairs

Cette étude révèle que les transformeurs de type « decoder-only » résolvent l'ambiguïté lexicale en faisant diverger initialement leurs représentations internes pour ensuite les faire reconverger partiellement dans les couches tardives, créant un décalage où les distinctions sémantiques persistent pour conduire des prédictions distinctes malgré le fait qu'elles deviennent invisibles pour les mesures de similitude d'embeddings standards.

Auteurs originaux : K. Jack Scott, Narun Pat, Veronica Liesaputra

Publié 2026-08-04
📖 8 min de lecture🧠 Analyse approfondie

Auteurs originaux : K. Jack Scott, Narun Pat, Veronica Liesaputra

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de comprendre comment un cerveau géant et numérique apprend à lire. Ce cerveau est appelé un Grand Modèle de Langage (LLM), ce qui est la technologie derrière les chatbots et les assistants intelligents que nous utilisons chaque jour. Pour donner du sens au monde, ces modèles ne se contentent pas de mémoriser des mots ; ils transforment chaque mot en une « empreinte digitale » mathématique appelée embedding. Considérez cette empreinte comme une coordonnée dans une carte massive et multidimensionnelle. Si deux mots ont des sens similaires, leurs coordonnées sont censées être proches, comme des voisins dans une ville. S'ils ont des sens différents, ils devraient être éloignés.

Pendant des années, les scientifiques ont fait confiance à cette carte. Ils croyaient que si l'on examinait l'empreinte finale créée par un modèle pour un mot, on pouvait déterminer exactement ce que le modèle pensait que ce mot signifiait. Cette idée est le pilier de nombreux outils que nous utilisons aujourd'hui, comme les moteurs de recherche qui trouvent des documents ou les applications qui regroupent des idées similaires. Mais il y a un piège : le langage est complexe. Certains mots, comme « banque », peuvent signifier un lieu où l'on garde de l'argent ou le bord d'une rivière. Ce sont des mots ambigus. La grande question que les chercheurs se posent est la suivante : l'empreine digitale finale produite par le modèle montre-t-elle réellement la différence entre ces deux sens, ou la carte devient-elle floue et confuse juste à la fin ?

Ce document plonge dans ce mystère en observant comment trois modèles d'IA différents — un petit, un moyen et un très grand — traitent des mots ambigus couche par couche. Les chercheurs ont découvert quelque chose de surprenant et de contre-intuitif. À mesure que les modèles traitent un mot comme « banque », la distance mathématique entre le sens « rivière » et le sens « argent » s'élargit en réalité au milieu du réseau, pour ensuite se resserrer à nouveau dans les dernières couches. C'est comme si le modèle séparait temporairement les deux sens dans sa carte interne, puis décidait de les remettre dans le même quartier juste avant de parler.

Cependant, voici le rebondissement : même si les empreintes finales semblent très similaires (presque comme si elles étaient de retour dans le même quartier), les prédictions du modèle sont complètement différentes. Lorsqu'on demande au modèle de deviner le mot suivant, il sait exactement de quelle « banque » il est question. L'étude montre que la dernière couche détient le secret du sens, mais elle le cache d'une manière que les outils de mesure standards (comme les simples vérifications de distance) ne peuvent pas voir. Le modèle n'est pas confus ; il utilise simplement un code secret dans sa dernière couche qui ressemble à une similitude mais agit comme une différence. Cela suggère que se fier uniquement à l'« empreinte » finale pour comprendre ce qu'une IA pense pourrait être trompeur, car les distinctions les plus importantes se produisent d'une manière qui donne l'impression qu'elles ont disparu, même si elles dirigent toujours le comportement du modèle.

L'histoire de la carte changeante

Pour comprendre comment cela fonctionne, imaginez le modèle d'IA comme une équipe de 64 détectives (pour le plus grand modèle, Qwen2.5) se passant une note secrète le long d'une longue ligne. Chaque détective représente une « couche » du modèle. Quand la note dit « banque », les premiers détectives regardent simplement la forme du mot. Ils ne savent pas encore s'il s'agit d'une rivière ou d'une banque, donc leurs notes se ressemblent presque toutes.

À mesure que la note passe aux détectives du milieu, quelque chose de magique se produit. Ces détectives commencent à prêter attention au contexte — les mots qui précèdent et suivent « banque ». Un détective voit « rivière » à proximité et marque la note d'un gros point rouge. Un autre voit « argent » et marque la note d'une étoile bleue. À ce stade intermédiaire, les notes pour les deux sens sont aussi différentes que le jour et la nuit. Si vous mesuriez la distance entre elles ici, elles seraient très éloignées.

Mais ensuite, la note atteint les derniers détectives. C'est ici que l'intrigue s'épaissit. Les derniers détectives prennent ces points rouges et ces étoiles bleues distincts et les replient en une note qui semble très similaire. Si vous mesuriez la distance entre les notes finales pour la « banque de rivière » et la « banque d'argent », elles sembleraient presque identiques à nouveau. C'est comme si les détectives avaient décidé : « Faisons en sorte que notre rapport final se ressemble pour ne pas confondre le patron. »

Cependant, le patron (la sortie du modèle) n'est pas dupe. Même si les notes finales se ressemblent, les détectives ont secrètement encodé la différence de manière à changer la réponse finale. Lorsque le modèle prédit le mot suivant, il ne dit pas « rivière » pour le contexte de l'argent, même si la note finale semble appartenir à la rivière.

Les chercheurs ont prouvé cela en jouant au jeu du « changement de rôle ». Ils ont pris la note finale du contexte « rivière » et l'ont échangée dans le contexte « argent ». Lorsqu'ils l'ont fait, le modèle a complètement changé d'avis et a commencé à prédire des mots liés à la rivière. Cela a prouvé que la dernière couche détient bien la différence, même si elle donne l'impression que les deux sens ont fusionné à nouveau. La différence est toujours là, mais elle est cachée dans les instructions pour l'étape suivante, et non dans la forme de la note elle-même.

Pourquoi la carte est trompeuse

Cette découverte ressemble à un tour de magie. Si vous ne regardez que les mains du magicien à la fin du tour, elles semblent vides et identiques. Mais si vous aviez regardé toute la performance, vous auriez vu que le magicien jonglait avec deux balles différentes tout au long du processus. Les chercheurs ont découvert que pour les mots ambigus, le « jonglage » se produit dans les couches intermédiaires, où les sens sont clairement séparés. Mais au moment où le tour est terminé, les balles sont cachées à nouveau, et les mains semblent identiques.

L'article a testé cela sur trois modèles différents : un petit appelé GPT-2 (117 millions de paramètres), un moyen appelé Llama-3.2 (3 milliards de paramètres) et un grand appelé Qwen2.5 (32 milliards de paramètres). Malgré leurs tailles et architectures différentes, ils ont tous fait la même chose. Ils ont séparé les sens au milieu, puis les ont ramenés ensemble à la fin, tout en sachant exactement quel sens utiliser.

Les chercheurs ont également vérifié s'il ne s'agissait pas simplement d'un coup de chance causé par la position des mots dans la phrase. Ils ont inversé l'ordre des mots dans les phrases (comme changer « Le chat a chassé la souris » en « La souris a chassé le chat ») et ont constaté que le comportement du modèle était toujours dicté par le sens, et non par l'ordre des mots. Cela a confirmé que le modèle comprenait véritablement l'ambiguïté.

Ce que cela signifie pour l'avenir

La grande conclusion est que nous avons peut-être regardé la mauvaise partie de la carte. Pendant longtemps, les gens ont supposé que si deux choses semblent similaires dans la couche finale d'une IA, elles signifient la même chose. Ce document suggère que ce n'est pas toujours le cas. La dernière couche peut ressembler à une pièce bondée où tout le monde se tient serré, mais si vous écoutez ce qu'ils disent (leurs prédictions), vous réaliserez qu'ils débattent en réalité de sujets complètement différents.

Cela ne signifie pas que l'IA est défectueuse. Cela signifie simplement que la façon dont elle stocke l'information est plus complexe qu'un simple tableau de distances. Les chercheurs suggèrent que si nous voulons construire de meilleurs outils pour la recherche ou l'organisation de l'information, nous devrons peut-être regarder les couches intermédiaires où les sens sont clairement séparés, ou nous devrons écouter ce que le modèle prédit plutôt que de simplement mesurer la proximité de ses empreintes digitales.

L'étude n'a pas trouvé de solution miracle ou une nouvelle façon de construire des modèles, mais elle a résolu un puzzle sur la façon dont ces modèles pensent. Elle a montré que la « magie » de la levée d'ambiguïté n'est pas perdue dans la dernière couche ; elle est juste cachée à la vue de tous, attendant que nous regardions les bons indices. Les chercheurs sont confiants dans ces résultats car ils ont utilisé plusieurs modèles et différents types de mots ambigus, et le schéma s'est vérifié à chaque fois. C'est un rappel que dans le monde de l'IA, les choses ne sont pas toujours ce qu'elles semblent être, et que parfois, les différences les plus importantes sont celles que l'on ne peut pas voir avec une règle.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →