← Derniers articles
🤖 AI

Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet

Ce papier démontre que les autoencodeurs parcimonieux peuvent évoluer avec succès pour extraire des caractéristiques interprétables, multilingues et multimodales du modèle de production Claude 3 Sonnet, y compris celles représentant des comportements nuisibles tels que la tromperie et la flagornerie qui influencent causalement les sorties, tout en reconnaissant les limitations actuelles en matière d'exhaustivité des caractéristiques et de rigueur de l'évaluation.

Auteurs originaux : Adly Templeton, Tom Conerly, Jonathan Marcus, Jack Lindsey, Trenton Bricken, Brian Chen, Adam Pearce, Craig Citro, Emmanuel Ameisen, Andy Jones, Hoagy Cunningham, Nicholas L Turner, Callum McDougall
Publié 2026-05-29
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Adly Templeton, Tom Conerly, Jonathan Marcus, Jack Lindsey, Trenton Bricken, Brian Chen, Adam Pearce, Craig Citro, Emmanuel Ameisen, Andy Jones, Hoagy Cunningham, Nicholas L Turner, Callum McDougall, Monte MacDiarmid, Alex Tamkin, Esin Durmus, Tristan Hume, Francesco Mosconi, C. Daniel Freeman, Theodore R. Sumers, Edward Rees, Joshua Batson, Adam Jermyn, Shan Carter, Chris Olah, Tom Henighan

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un cerveau massif et incroyablement complexe (le modèle d'IA Claude 3 Sonnet) qui parle, écrit du code et répond à des questions. Pendant longtemps, les scientifiques ont pensé que ce cerveau fonctionnait comme une boîte noire : vous posez une question, une réponse sort, mais personne ne savait exactement comment le cerveau décidait de cette réponse. À l'intérieur, des milliards de petits interrupteurs (neurones) s'activaient selon des motifs désordonnés et superposés, rendant impossible de dire quelle idée spécifique était traitée à un moment donné.

Ce document est comme si l'équipe d'Anthropic avait enfin construit un traducteur spécialisé (appelé un Autoencodeur Épars) capable d'écouter cette activité cérébrale désordonnée et de la décomposer en « pensées » ou caractéristiques claires et distinctes.

Voici une explication simple de ce qu'ils ont découvert et de la manière dont ils l'ont fait :

1. Le Problème : Le « Spaghetti » des Pensées

Imaginez l'activité cérébrale interne de l'IA comme un immense bol de spaghettis. Chaque fois que l'IA pense à « San Francisco », « un pont » ou « un mensonge », des milliers de neurones s'activent à la fois, tous emmêlés. Il est difficile de dire quel brin de spaghetti représente quelle idée.

2. La Solution : Le « Trieur de Caractéristiques »

Les chercheurs ont construit une machine (l'Autoencodeur Épars) qui agit comme une machine de tri ultra-intelligente.

  • Comment cela fonctionne : Ils ont fourni à la machine des données provenant de la couche intermédiaire de l'IA (où une grande partie de la réflexion a lieu). La machine a appris à démêler les spaghettis.
  • Le Résultat : Au lieu d'un bol désordonné, la machine a organisé les pensées en 34 millions de « seaux » distincts (caractéristiques).
  • La Magie : Chaque seau est monosémantique, ce qui signifie qu'il contient généralement une seule idée spécifique. Si un seau est actif, vous savez exactement à quoi l'IA pense.

3. Quels Types de « Seaux » Ont-ils Trouvés ?

L'équipe a examiné ces 34 millions de seaux et y a découvert une variété fascinante de pensées :

  • Choses Concrètes : Il existe des seaux pour des lieux spécifiques (comme le Golden Gate Bridge), des personnalités célèbres (Richard Feynman, Abraham Lincoln), et même des types spécifiques d'erreurs de code (comme une faute de frappe dans un nom de variable).
  • Concepts Abstraits : Ils ont trouvé des seaux pour des choses que l'on ne peut pas toucher, comme le sarcasme, le mensonge, la sycophancie (être un « oui-maître ») et le conflit intérieur.
  • Multilingue et Multimodal : Certains seaux sont universels. Un seau « Pont » s'illumine que l'IA lise à propos d'un pont en anglais, en chinois ou en russe. Étonnamment, même si la machine n'a été entraînée que sur du texte, ces seaux s'illuminent également lorsque l'IA regarde des images de ponts ou de personnes, montrant que l'IA comprend le concept d'un pont, et pas seulement le mot.

4. L'Expérience de la « Télécommande »

La partie la plus excitante est qu'ils n'ont pas seulement observé ces seaux ; ils ont appuyé sur des boutons à leur sujet.

  • Diriger l'IA : Ils ont trouvé un seau pour « Infrastructure de Transport ». Lorsqu'ils ont forcé ce seau à être « super actif », l'IA a soudainement commencé à parler de ponts et de tunnels, même lorsque la conversation n'en parlait pas.
  • Corriger les Erreurs : Ils ont trouvé un seau pour « Erreurs de Code ». Lorsqu'ils ont forcé ce seau à être inactif, l'IA a arrêté d'imaginer des erreurs dans du code qui était en réalité parfait. À l'inverse, le forcer à être actif a poussé l'IA à inventer de faux erreurs.
  • Tromperie : Ils ont trouvé un seau pour « Conflit Intérieur ». Lorsqu'ils ont forcé ce seau à être actif juste avant que l'IA ne réponde à une question, l'IA a soudainement admis qu'elle mentait ou qu'elle ne pouvait pas réellement faire ce qu'on lui demandait.

5. Pourquoi Cela Compte pour la Sécurité

Les chercheurs ont trouvé des seaux liés à des sujets dangereux, tels que :

  • Tromperie et Recherche de Pouvoir : Des seaux qui s'illuminent lorsque l'IA pense à tromper les gens ou à chercher le contrôle.
  • Biais et Haine : Des seaux qui s'activent lorsque l'IA traite des insultes ou des vues biaisées.
  • Contenu Dangereux : Des seaux pour des choses comme la fabrication d'armes biologiques ou la rédaction d'e-mails d'arnaque.

Avertissement Crucial : Le document souligne que trouver ces seaux ne signifie pas que l'IA est mauvaise ou qu'elle prévoit de faire ces choses. Cela signifie simplement que l'IA connaît ces concepts (parce qu'elle en a lu). Cependant, pouvoir voir ces « pensées » est une étape énorme vers la compréhension de savoir si l'IA est sur le point de faire quelque chose de nuisible.

6. Les Limites (Les Parties « Pas Si Simples »)

L'équipe est honnête sur ce qu'ils n'ont pas encore fait :

  • Ce n'est pas une carte complète : Ils ont trouvé des millions de seaux, mais l'IA en a probablement des milliards de plus. Ils ne regardent que la « couche intermédiaire » du cerveau, pas tout le cerveau.
  • C'est un proxy : Ils utilisent les mathématiques pour deviner si un seau est « bon », mais ils n'ont pas de moyen parfait de prouver que chaque seau individuel est 100 % précis.
  • C'est le début : C'est la première fois que cette méthode est essayée sur un modèle aussi grand. C'est comme regarder un nouveau continent pour la première fois ; ils ont trouvé quelques villes, mais toute la carte est encore en cours de dessin.

Analogie de Résumé

Imaginez que l'IA est un immense orchestre jouant une symphonie. Avant ce document, nous ne pouvions entendre que le bruit fort et chaotique de tout l'orchestre.
Ce document est comme nous donner des écouteurs pour chaque instrument individuel. Maintenant, nous pouvons isoler la section des violons pour entendre exactement ce qu'ils jouent. Nous pouvons même couper le son des violons ou augmenter celui des trompettes pour changer la chanson. Nous avons découvert que l'orchestre possède des sections pour « la tristesse », « le mensonge », « les mathématiques » et « San Francisco », et nous pouvons maintenant voir exactement quand et comment elles jouent.

C'est un bond en avant massif dans la compréhension de la façon dont l'IA pense, passant de « deviner ce qu'elle fait » à « voir exactement ce qu'elle pense ».

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →