← Derniers articles
🤖 machine learning

What's the plan? Metrics for implicit planning in LLMs and their application to rhyme generation and question answering

Ce papier introduit des techniques simples et évolutives pour démontrer que la planification implicite — un mécanisme par lequel les modèles de langage orientent les tokens intermédiaires vers des objectifs futurs tels que des rimes ou des réponses — est une capacité universelle présente même dans des modèles aussi petits que 1 milliard de paramètres, offrant ainsi de nouvelles perspectives pour la sécurité et le contrôle de l'IA.

Auteurs originaux : Jim Maar, Denis Paperno, Callum Stuart McDougall, Neel Nanda

Publié 2026-05-12
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jim Maar, Denis Paperno, Callum Stuart McDougall, Neel Nanda

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous regardiez un magicien sortir un lapin d'un chapeau. Vous pourriez vous demander : Le magicien avait-il vraiment prévu de sortir un lapin avant même d'avoir commencé l'illusion, ou a-t-il simplement décidé par magie de sortir un lapin au moment où il a plongé la main dans le chapeau ?

Pendant longtemps, les scientifiques ont pensé que les grands modèles de langage (LLM) — les cerveaux de l'IA derrière des outils comme les chatbots — étaient tout simplement comme des magiciens qui ne prévoyaient rien à l'avance. Ils croyaient que l'IA prédisait simplement le mot suivant en se basant sur le précédent, comme un perroquet répétant des sons, sans aucune idée de la direction que prendrait la phrase.

Ce papier, intitulé "What's the Plan?" (Quel est le plan ?), soutient que l'IA est en réalité un architecte stratégique, et non pas simplement un perroquet. Il montre que ces modèles planifient secrètement leurs mouvements futurs pendant qu'ils parlent encore.

Voici comment les auteurs l'ont prouvé, en utilisant des analogies simples :

1. Les deux types de planification

Les auteurs définissent la planification en deux parties, comme un écrivain composant un poème :

  • Planification vers l'avant (Le plan directeur) : Avant d'écrire la deuxième moitié d'une phrase, l'IA crée un « plan directeur » caché dans son cerveau. Elle sait : « Je dois terminer cette ligne par un mot qui rime avec 'chat'. »
  • Planification vers l'arrière (La construction) : Alors qu'elle écrit les mots du milieu de la phrase, elle les façonne subtilement pour s'assurer qu'elle peut atteindre cette fin « chat » en douceur. C'est comme un conducteur qui voit un virage arriver dans 100 mètres et commence à ralentir et à changer de file maintenant, même s'il n'a pas encore atteint le virage.

2. L'expérience : Rimes et questions

Pour le prouver, les chercheurs n'ont pas demandé à l'IA d'écrire un essai complexe. Ils lui ont donné deux tâches simples :

  • Rimes : Ils ont donné à l'IA la première ligne d'un poème et lui ont demandé de terminer la deuxième ligne par une rime spécifique (par exemple, si la première ligne se termine par « brique », la deuxième doit se terminer par « stick », « trick » ou « sick »).
  • Réponses à des questions : Ils ont posé des questions où la réponse nécessitait une règle grammaticale spécifique, comme choisir entre « a » et « an » (par exemple, « a whale » vs « an eye »).

3. L'astuce de la « télécommande »

C'est la partie la plus cool du papier. Les chercheurs n'ont pas seulement observé l'IA ; ils ont piraté son cerveau en plein milieu d'une phrase.

Imaginez que l'IA écrit un poème. Juste au moment où elle termine la première ligne, les chercheurs utilisent une « télécommande » (un vecteur mathématique) pour pousser le cerveau de l'IA.

  • Le coup de pouce : Ils ont dit au cerveau de l'IA : « Oublie la rime à laquelle tu pensais. Maintenant, planifie la rime '-ight' (comme light ou night). »
  • Le résultat : L'IA n'a pas seulement changé le tout dernier mot. Elle a réécrit le milieu de la phrase.
    • Sans le coup de pouce : « Soaring above where true joy will sing » (Planant au-dessus de là où la vraie joie va chanter).
    • Avec le coup de pouce : « Soaring above bathed in a golden light » (Planant au-dessus, baigné dans une lumière dorée).

L'IA a changé des mots comme « where true joy will » en « bathed in a golden » parce qu'elle devait construire un pont vers la nouvelle destination (« light »). Cela prouve que l'IA gardait un plan dans sa tête tout au long du processus et a ajusté sa trajectoire pour correspondre au nouveau plan.

4. La découverte des « petits cerveaux »

Une grande surprise dans le papier est que même les petits modèles d'IA le font.
Auparavant, les scientifiques pensaient que seuls les modèles massifs et super-complexes pouvaient planifier à l'avance. Les auteurs ont découvert que même des modèles avec seulement 1 milliard de paramètres (ce qui est relativement petit dans le monde de l'IA) effectuent cette planification. Ce n'est pas seulement une caractéristique des modèles « super-intelligents » ; c'est une habitude de base de la façon dont ces modèles fonctionnent.

5. Le test de l'« article »

Ils ont également testé cela avec des questions comme « Qu'utilisez-vous pour voir ? » (Réponse : an eye).
Quand ils ont poussé l'IA à penser à « heart » (qui nécessite « a »), l'IA a immédiatement commencé à utiliser « a » au lieu de « an » avant même d'avoir écrit le mot « heart ».
C'est comme une personne disant : « Je veux acheter un... » puis s'arrêtant pour réfléchir à un mot commençant par une consonne, plutôt que de dire « Je veux acheter une... » puis réalisant qu'elle a fait une erreur. L'IA connaissait la destination avant même d'avoir commencé le voyage.

Résumé

Le papier affirme que :

  1. L'IA planifie à l'avance : Elle crée une carte cachée de l'endroit où elle veut aller avant d'y arriver.
  2. Elle ajuste le chemin : Si vous changez la destination en cours de route, l'IA modifie les étapes qu'elle prend pour y arriver, et pas seulement l'étape finale.
  3. C'est omniprésent : Cela se produit dans les petits modèles et les grands modèles, dans la poésie et dans les questions simples.

Les auteurs n'ont pas utilisé cela pour créer de nouvelles applications ou résoudre des problèmes de sécurité dans ce papier spécifique ; ils voulaient simplement prouver que la « magie » de l'IA n'est pas simplement une devinette aléatoire — c'est une forme de planification cachée et implicite.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →