← Derniers articles
💬 NLP

Localizing Anchoring Pathways in Language Models

Cet article étudie les mécanismes internes des effets d'ancrage dans les modèles Qwen et Llama de 7B–8B, révélant que les méthodes d'attribution au niveau des arêtes localisent plus précisément les signaux de décision pertinents que les méthodes au niveau des nœuds et que, bien que ces voies soient cohérentes entre les directions d'ancrage au sein d'un même modèle, elles changent considérablement entre les variantes de base et les variantes ajustées par instructions.

Auteurs originaux : Hillary N. Owusu, Sarah Wiegreffe, Naomi H. Feldman

Publié 2026-06-12
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hillary N. Owusu, Sarah Wiegreffe, Naomi H. Feldman

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un grand modèle de langage (LLM) comme un détective super intelligent, mais légèrement crédule. Vous lui posez une énigme à résoudre, mais vous glissez aussi un nombre aléatoire et non pertinent dans la conversation — comme si vous disiez au détective : « Au fait, le ticket de loterie s'est arrêté sur 15 », avant de demander : « Combien de jours faut-il à la Lune pour orbiter autour de la Terre ? »

Même si le détective connaît la réponse (27 jours), ce « 15 » aléatoire pourrait l'amener à trop pencher vers le 15. C'est ce qu'on appelle l'ancrage. Il s'agit d'un biais cognitif où un nombre non pertinent influence votre jugement et l'attire vers lui.

Ce document est comme une équipe d'ingénieurs en mécanique qui démonterait ce détective pour voir exactement où, dans son cerveau, se produit cette « crédulité ». Ils veulent savoir : Quels fils et quels interrupteurs spécifiques à l'intérieur de l'ordinateur transportent le signal qui dit : « Hé, ce nombre aléatoire est important ! »

Voici comment ils ont procédé et ce qu'ils ont trouvé, expliqué simplement :

1. La mise en place : Un jeu contrôlé

Au lieu de laisser le détective rédiger une longue dissertation, les chercheurs ont transformé le test en un jeu à choix multiples.

  • La question : « Quelle est la durée d'une orbite lunaire ? » (Réponse correcte : 27 jours).
  • Le piège : Ils ont ajouté une phrase contenant un nombre aléatoire, soit un « Ancre Basse » (15), soit une « Ancre Haute » (49).
  • L'objectif : Ils ont mesuré à quel point la confiance du modèle basculait vers la mauvaise réponse (15 ou 49) simplement parce que ce nombre avait été mentionné.

Ils ont confirmé que les modèles se faisaient effectivement piéger, tout comme les humains.

2. La méthode : Tracer les fils

Pour trouver les « circuits de la crédulité », les chercheurs ont utilisé une technique appelée Localisation de Circuit.

  • L'analogie : Imaginez que le modèle est une immense ville avec des millions de routes (arêtes/edges) reliant des quartiers (nœuds/nodes).
  • L'ancienne méthode : Les chercheurs regardaient auparavant des quartiers entiers (nœuds) pour voir où le trafic était dense.
  • La nouvelle méthode : Ce document a démontré que regarder les routes individuelles (arêtes) est bien plus efficace. C'est comme réaliser que le problème ne vient pas de tout le quartier du « Centre-ville », mais spécifiquement d'un seul pont reliant le Centre-ville à la banlieue.

Ils ont découvert que les méthodes au niveau des arêtes (en regardant les connexions) étaient bien plus précises pour identifier le biais que les méthodes au niveau des nœuds (en regardant les composants seuls). La « crédulité » n'est pas bloquée dans une partie spécifique du cerveau ; elle réside dans la trajectoire que prend l'information.

3. Les résultats : Ce que la carte a révélé

A. Les ancres « Basses » et « Hautes » utilisent les mêmes routes

Que le modèle ait été trompé par un nombre bas (15) ou un nombre haut (49), le trafic a circulé à travers presque exactement le même ensemble de routes.

  • La métaphore : C'est comme une rivière. Que l'eau coule vite (ancre haute) ou lentement (ancre basse), elle utilise toujours le même lit de rivière. Le modèle possède une « trajectoire de susceptibilité » partagée pour être influencé par les nombres, peu importe si le nombre est grand ou petit.

B. Les modèles « de base » vs « ajustés par instructions »

Les chercheurs ont testé deux versions du même modèle :

  1. Modèle de base : Le détective brut, non entraîné.
  2. Modèle ajusté par instructions (Instruction-Tuned) : Le détective qui a été entraîné à suivre des règles et à répondre aux questions poliment.

La surprise : Bien qu'ils utilisent le même « lit de rivière » général (les mêmes couches du réseau), les routes spécifiques les plus importantes ont changé après l'entraînement.

  • La métaphore : Imaginez que vous appreniez un nouvel itinéraire à un conducteur. Il traverse toujours la même ville, mais les rues spécifiques qu'il emprunte pour atteindre sa destination ont changé. L'« ajustement par instructions » (l'entraînement) a recâblé les connexions les plus importantes. Un circuit qui fonctionnait parfaitement sur le modèle brut ne fonctionnait pas toujours sur le modèle entraîné.

4. La vue d'ensemble

Ce document prouve que l'ancrage n'est pas seulement un « bug » dans les connaissances du modèle. C'est un processus mécanique spécifique où des nombres non pertinents détournent les trajectoires de prise de décision du modèle.

  • Point clé à retenir : Le biais circule à travers les connexions (arêtes), et pas seulement à travers des parties isolées.
  • Point clé à retenir : Les ancres basses et hautes partagent la même « autoroute », mais l'enseignement de nouvelles règles au modèle (ajustement par instructions) modifie les sorties les plus importantes sur cette autoroute.

En résumé, les chercheurs ont cartographié la « crédulité » à l'intérieur de l'IA, montrant précisément quels fils transportent le signal lorsque le modèle est distrait par un nombre aléatoire. Cela nous aide à comprendre que le modèle n'est pas simplement « faux » ; il suit une trajectoire spécifique et prévisible qui l'égare.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →