← Derniers articles
🤖 AI

Decomposing how prompting steers behavior

Cet article introduit un cadre de décomposition géométrique imbriqué qui révèle comment le prompting oriente les grands modèles de langage et de vision-langage en transformant leurs représentations internes, démontrant que les transformations affines — spécifiquement le mélange linéaire transdimensionnel — sont le mécanisme clé pour réorganiser les représentations afin de correspondre aux structures de tâches instruites et de récupérer les comportements cibles.

Auteurs originaux : Fan L. Cheng, Nikolaus Kriegeskorte

Publié 2026-06-03
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Fan L. Cheng, Nikolaus Kriegeskorte

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un grand modèle de langage (LLM) ou un modèle de vision-langage (VLM) comme une usine géante et complexe. À l'intérieur de cette usine, des matières premières (comme la photo d'un chat ou une phrase racontant une histoire triste) circulent sur une série de tapis roulants (les couches du modèle). Au fur et à mesure de leur progression, les matériaux sont transformés, remodelés et organisés.

Habituellement, pour changer ce que l'usine produit, il faut reconstruire les machines (réentraîner le modèle). Mais le prompting (l'art de formuler des instructions) est comme un directeur qui entre dans l'usine et crie une nouvelle instruction : "Arrêtez de trier par couleur, triez maintenant par taille !" Les machines ne changent pas, mais le résultat change soudainement.

Cette étude pose une question simple mais profonde : Comment un cri du directeur parvient-il réellement à réorganiser les articles sur le tapis roulant pour qu'ils se trient différemment ?

Voici la décomposition de leur découverte, en utilisant des analogies de la vie quotidienne :

1. L'expérience : La « Carte Magique »

Les chercheurs ont pris un ensemble d'éléments (comme 1 000 images différentes) et les ont présentés au modèle avec deux instructions différentes :

  • Prompt A : « Y a-t-il des personnes sur cette image ? » (Réponse Oui/Non).
  • Prompt B : « Combien de personnes y a-t-il sur cette image ? » (Réponse numérique).

Ils ont observé l'« état interne » du modèle (la disposition des articles sur le tapis roulant) à différentes profondeurs. Ils ont constaté que les articles avaient une forme différente pour le Prompt A que pour le Prompt B.

Ils ont ensuite posé la question suivante : « Pouvons-nous dessiner une carte simple qui transforme l'arrangement "Oui/Non" en l'arrangement "Compter" ? »

2. Les cinq niveaux de « Cartes » (La décomposition imbriquée)

Pour trouver la réponse, ils ont essayé cinq types différents de « cartes » mathématiques (transformations), en partant du plus simple pour aller vers le plus complexe. Considérez cela comme différentes manières de réorganiser une pile de livres :

  1. Translation (Le Glissement) : Juste faire glisser toute la pile de livres vers un nouvel endroit sur la table sans toucher aux livres eux-mêmes.
  2. Rigide + Mise à l'échelle uniforme (Le Mouvement Rigide) : Déplacer la pile et peut-être la rendre légèrement plus grande ou plus petite, mais en conservant exactement la même forme relative entre les livres.
  3. Rigide + Mise à l'échelle axiale (L'Étirement) : Déplacer la pile et l'étirer dans des directions spécifiques (comme tirer une feuille de caoutchouc horizontalement mais pas verticalement).
  4. Affine (Le Mélange) : Déplacer, étirer et mélanger les livres. C'est comme prendre le livre du « haut » et le fusionner avec celui du « côté » pour créer une nouvelle position.
  5. Non linéaire (La Déformation) : Tordre la table elle-même, tordre les livres de manières complexes et imprévisibles.

3. La grande découverte : C'est principalement un « Mélange »

Les chercheurs ont découvert que :

  • Le « Glissement » (Translation) fait une grande partie du travail de base. Le simple fait de déplacer l'état interne vers un nouvel endroit explique une énorme partie du changement.
  • Mais le « Mélange » (Affine) est la recette secrète. Bien que le glissement aide, le modèle doit réellement mélanger ses caractéristiques internes (mélange linéaire interdimensionnel) pour comprendre pleinement la nouvelle tâche.
  • La « Déformation » (Non linéaire) n'est pas nécessaire. Étonnamment, ils n'ont pas eu besoin de mathématiques complexes et torsadées pour expliquer le changement. Une fois qu'ils ont ajouté le « Mélange » (Affine), le comportement du modèle était presque parfaitement récupéré. Les éléments complexes et non linéaires n'apportaient pas beaucoup de valeur.

L'analogie : Imaginez que vous avez une boîte de LEGO construite en forme de château (Prompt A). Vous voulez la transformer en vaisseau spatial (Prompt B).

  • Vous n'avez pas besoin de faire fondre le plastique (Non linéaire).
  • Vous n'avez pas seulement besoin de faire glisser la boîte à travers la pièce (Translation).
  • Vous devez démonter le château, étirer certaines pièces, et réorganiser/mélanger les briques pour créer une nouvelle structure. L'étude a montré que ce « réarrangement et mélange » est le mécanisme central de fonctionnement des prompts.

4. Le test « Causal » : La carte fonctionne-t-elle vraiment ?

Pour prouver qu'il ne s'agissait pas d'une simple coïncidence, ils ont pratiqué une « chirurgie » sur le modèle :

  1. Ils ont soumis une image au modèle avec le prompt « Oui/Non ».
  2. À une couche spécifique, ils ont arrêté le processus.
  3. Ils ont pris l'état interne et lui ont appliqué leur « Carte de Mélange ».
  4. Ils ont laissé le modèle terminer son traitement.

Le Résultat : Le modèle a soudainement commencé à donner des réponses de type « Compter », même s'il était techniquement toujours en train de répondre à la question « Oui/Non » ! Cela a prouvé que la transformation géométrique (la carte) cause le changement de comportement.

5. Différents modèles, différentes stratégies

Tout comme différentes usines ont différents directeurs, différents modèles d'IA utilisent différentes stratégies :

  • OPT-2.7B semble reposer fortement sur l'« étirement » et le « mélange » (transformations complexes) au début.
  • Llama3 et Qwen3 semblent reposer davantage sur un simple « glissement » (translation) au début, utilisant peut-être un « code d'instruction » spécifique qui déplace simplement les données au bon endroit.

Résumé

L'étude conclut que lorsque vous donnez une nouvelle instruction à une IA, elle n'a pas besoin de réécrire fondamentalement son cerveau ou d'effectuer des calculs complexes et torsadés. Au lieu de cela, elle fait glisser son compréhension interne vers un nouvel emplacement et mélange ses caractéristiques de manière linéaire (transformation affine) pour s'adapter à la nouvelle tâche.

Cela donne une image géométrique claire de la façon dont les modèles d'IA « écoutent » les instructions : ils effectuent essentiellement un réarrangement sophistiqué et multi-étapes de leurs données internes, et nous pouvons maintenant mesurer précisément quelle part de ce réarrangement est un simple glissement par rapport à un mélange complexe.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →