← Derniers articles
💬 NLP

Interpreting and Controlling Model Behavior via Constitutions for Atomic Concept Edits

Cet article introduit un cadre d'interprétabilité boîte noire qui apprend des « constitutions » en langage naturel vérifiables en appliquant systématiquement des éditions de concepts atomiques aux invites, permettant ainsi une compréhension profonde et un contrôle efficace des comportements des modèles à travers des tâches telles que la génération de texte en image et le raisonnement mathématique.

Auteurs originaux : Neha Kalibhat, Zi Wang, Prasoon Bajpai, Drew Proud, Wenjun Zeng, Been Kim, Mani Malek

Publié 2026-02-03
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Neha Kalibhat, Zi Wang, Prasoon Bajpai, Drew Proud, Wenjun Zeng, Been Kim, Mani Malek

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un artiste robot ou une calculatrice super intelligente, très puissante mais quelque peu mystérieuse. Vous lui donnez une consigne (un ensemble d'instructions), et elle vous donne une réponse ou une image. Parfois, vous voulez savoir : « Pourquoi s'est-elle trompée ? » ou « Comment puis-je la piéger pour qu'elle réussisse ? »

Ce document présente une nouvelle façon de parler à ces modèles de type « boîte noire » sans avoir besoin de voir leur code interne. Ils appellent cette méthode les Éditions de Concepts Atomiques guidées par une Constitution (ACEs).

Voici la décomposition en utilisant des analogies simples :

1. Le Problème : Le mystère de la « Boîte Noire »

Imaginez que vous essayez de réparer une voiture, mais que le moteur est caché à l'intérieur d'un bloc d'acier solide. Vous ne pouvez pas voir les engrenages. Vous pouvez seulement tourner la clé (la consigne) et voir si la voiture démarre (le résultat).

  • Le Défi : Si la voiture ne démarre pas, comment savoir s'il s'agit du carburant, des bougies d'allumage ou de la batterie ? En IA, si un modèle donne une mauvaise réponse, il est difficile de savoir quel mot spécifique dans votre consigne a causé l'échec.

2. L'Outil : Les « Éditions de Concepts Atomiques » (ACEs)

Les chercheurs traitent la consigne comme une structure en LEGO.

  • Concept Atomique : Une seule brique distincte (par exemple, le mot « chat », la couleur « rouge » ou l'action « courir »).
  • L'Édition (ACE) : Au lieu de reconstruire toute la voiture, vous remplacez simplement une seule brique.
    • Retirer : On retire la brique « chat ».
    • Ajouter : On ajoute une brique « chien ».
    • Remplacer : On échange « rouge » par « bleu ».

Ils testent systématiquement le remplacement de ces briques uniques pour voir ce qui se passe. Est-ce que la voiture démarre maintenant ? L'image a-t-elle changé ? Cela les aide à cartographier exactement quels « blocs » contrôlent quels comportements.

3. La Solution : La « Constitution »

Après avoir testé des milliers de ces remplacements de briques uniques, les chercheurs ne se contentent pas de conserver les données ; ils rédigent un Code de règles (ou une « Constitution »).

Voyez cette Constitution comme la Recette Secrète d'un Chef pour changer la saveur d'un plat.

  • Sans Constitution : Vous devinez au hasard. « Peut-être si j'ajoute du sel ? Peut-être si je retire le poivre ? » Cela prend beaucoup de temps pour découvrir ce qui fonctionne.
  • Avec une Constitution : Vous avez un guide écrit qui dit : « Pour rendre cette soupe épicée, ajoutez toujours des piments. Pour la rendre fade, retirez le sel. N'ajoutez jamais de sucre. »

Cette « Constitution » est une liste de Bonnes Stratégies et de Mauvaises Stratégies rédigée en langage clair. Elle résume les schémas que les chercheurs ont découverts.

  • Exemple : « Si vous voulez que l'image soit incorrecte, ajoutez un "environnement conflictuel" (comme mettre un poisson dans un désert). »
  • Exemple : « Si vous voulez que la réponse mathématique soit fausse, ajoutez une "variable de distraction" (un nombre qui semble important mais ne l'est pas). »

4. Comment cela fonctionne en pratique

Les chercheurs ont testé cela sur trois différents « jeux » :

  • Jeu 1 : Le défi du décompte de mots

    • Objectif : Faire en sorte que l'IA écrive une réponse très courte (moins de 50 mots).
    • L'enseignement de la Constitution : L'IA ignore les mots vagues comme « soyez bref ». Elle n'écoute que les nombres stricts (ex. : « Écrivez exactement 10 mots ») ou les limites structurelles (ex. : « Écrivez une seule phrase »).
    • Résultat : En utilisant la Constitution, l'IA a bien mieux respecté les règles de décompte de mots qu'en l'absence de celle-ci.
  • Jeu 2 : Le piège mathématique

    • Objectif : Faire échouer l'IA sur un problème de mathématiques simple.
    • L'enseignement de la Constitution : Certains modèles d'IA (comme GPT-5) sont confus si vous ajoutez une « variable de distraction » (un faux nombre qui semble appartenir au problème). D'autres modèles (comme Gemini) sont assez intelligents pour ignorer le faux nombre et donner la bonne réponse.
    • Résultat : La Constitution a révélé que différents modèles ont différents « angles morts ».
  • Jeu 3 : Le décalage d'image

    • Objectif : Faire en sorte que l'IA dessine une image qui ne correspond pas à la description.
    • L'enseignement de la Constitution :
      • Un modèle (GPT-Image) se brise si vous supprimez la relation entre les objets (par exemple, dire « un homme et son fils » mais retirer « fils »). Il repose sur une grammaire stricte.
      • Un autre modèle (Imagen) se brise si vous ajoutez un décor conflictuel (par exemple, un « parc » avec des « déchets industriels »). Il accorde plus d'importance à l'« ambiance » ou à l'atmosphère générale.

5. Le Grand Succès

L'article affirme qu'en utilisant cette Constitution pour guider les Éditions Atomiques (les remplacements de briques uniques), ils peuvent contrôler le comportement de l'IA 1,86 fois mieux qu'en devinant simplement au hasard.

En résumé :
Au lieu de deviner aveuglément comment changer l'avis d'une IA, cette méthode vous permet de démonter les instructions de l'IA mot par mot, d'apprendre les règles qui régissent son fonctionnement, et de rédiger une simple « Constitution » qui vous indique exactement comment la diriger vers votre objectif. Cela transforme une mystérieuse boîte noire en une machine dotée d'un manuel d'instructions clair et compréhensible.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →