CircuitSteer: Geometrically Aligned Multi-Layer Steering via Sparse Autoencoder Circuits
CircuitSteer est un nouveau cadre qui exploite les autoencodeurs creux pour identifier et manipuler des circuits sémantiques multicouches géométriquement alignés, permettant un contrôle comportemental robuste et préservant la fluidité dans les grands modèles de langage, ce qui surpasse les méthodes de pilotage à couche unique existantes.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Résumé Technique : CircuitSteer
Énoncé du Problème
Le contrôle du comportement des grands modèles de langage (LLM) via le pilotage au moment de l'inférence reste un défi critique pour l'alignement de l'IA. Les méthodes existantes, telles que l'ajout d'activation contrastive (CAA) et l'ingénierie de la représentation (RepE), reposent généralement sur des interventions à couche unique fixes dérivées de différences d'activations agrégées. Ces approches font face à deux limitations principales :
- Conflation Sémantique : Elles appliquent un vecteur d'intervention unique à des entrées sémantiquement diverses, échouant souvent à capturer la nature distribuée des concepts de haut niveau.
- Désalignement Géométrique : Les concepts sémantiques de haut niveau sont distribués sur plusieurs couches et évoluent progressivement à travers le réseau. Les interventions multi-couches sans considération géométrique échouent car les caractéristiques (features) codant le même concept à différentes profondeurs ont souvent des directions de décodeur qui sont géométriquement désalignées. Combiner ces éléments sans alignement entraîne une interférence destructrice, provoquant un effondrement de la fluidité (dégradation de la qualité du texte) ou des changements de comportement instables.
Les méthodes actuelles basées sur les auto-encodeurs parcimonieux (SAE) améliorent l'interprétabilité en décomposant les activations en caractéristiques monosémantiques, mais supposent souvent qu'une intervention à couche unique est suffisante, ignorant la propagation trans-couches des signaux sémantiques.
Méthodologie : CircuitSteer
CircuitSteer est un cadre de travail sans entraînement (training-free) qui exploite les SAE pour identifier et manipuler des circuits sémantiques cohérents distribués sur plusieurs couches. Au lieu de sélectionner des caractéristiques indépendamment à chaque couche, il construit un circuit de flux de caractéristiques basé sur deux critères conjoints :
- Co-activation des Caractéristiques : Identifier les paires de caractéristiques et qui sont simultanément actives sur les mêmes entrées, approximant ainsi l'influence causale.
- Alignement Géométrique : Garantir que les directions de décodeur de ces caractéristiques sont compatibles (similitude cosinus élevée). Cela empêche l'interférence destructrice lorsque les interventions sont appliquées à travers les couches.
La méthode procède en trois étapes :
- Découverte de Circuit : En utilisant une analyse contrastive entre les prompts cibles () et les prompts bénins (), la méthode calcule un score de spécificité contrastive pour les arêtes du graphe de flux de caractéristiques. Les arêtes ayant des scores de spécificité élevés sont conservées pour isoler le sous-circuit responsable du comportement cible.
- Synthèse de Vecteur : Pour chaque couche impliquée dans le sous-circuit isolé, un vecteur de pilotage dense est synthétisé en moyennant les directions de décodeur de toutes les caractéristiques participant aux arêtes du circuit. Cela découple l'amplitude de l'intervention de la taille du circuit.
- Intervention Multi-points : Lors de l'inférence, ces vecteurs synthétisés sont appliqués simultanément à toutes les couches pertinentes avec un coefficient scalaire . L'alignement géométrique garantit que les interventions renforcent un changement directionnel cohérent à travers la profondeur plutôt que de permettre aux couches ultérieures de compenser les perturbations antérieures.
Le cadre ne nécessite aucune mise à jour de poids ou optimisation basée sur le gradient ; il utilise des SAE pré-entraînés (ex: Gemma-Scope, Llama-Scope) et effectue des opérations algébriques sur les activations de la passe avant.
Contributions Clés
- Cadre CircuitSteer : Une nouvelle méthode de pilotage multi-couches sans entraînement qui identifie des circuits de caractéristiques spécifiques au comportement via la co-activation des caractéristiques et l'alignement géométrique des directions de décodeur.
- Nécessité de l'Alignement Géométrique : Démonstration empirique que l'alignement géométrique des directions de décodeur est un prérequis pour un pilotage multi-couches stable. Les caractéristiques non alignées provoquent un effondrement de la fluidité, tandis que les caractéristiques alignées permettent une réduction comportementale constante avec une perplexité proche de la ligne de base.
- Évaluation Exhaustive : Évaluation par rapport à huit bases de comparaison (incluant CAA, RepE, ITI, LoReFT et des méthodes basées sur les SAE) à travers quatre ensembles de données comportementales (Toxicité, Émotion, Sycophance, Refus) et deux familles de modèles (Gemma-2-2B et Llama-3.1-8B-Instruct).
Résultats
Sur tous les modèles et jeux de données, CircuitSteer est la seule méthode à produire systématiquement des interventions préservant la fluidité :
- Préservation de la Fluidité : Les méthodes concurrentes sacrifient soit la qualité du texte (perplexité élevée), soit échouent à obtenir une réduction comportementale suffisante. CircuitSteer maintient une perplexité normalisée proche de 1,0 tout en atteignant une réduction comportementale significative.
- Comportements Complexes : Sur des tâches difficiles comme la sycophance et le refus, les méthodes à couche unique (ex: CAA) échouent souvent totalement ou produisent des changements négligeables. CircuitSteer réduit avec succès la sycophance sur Gemma-2-2B (là où les autres méthodes échouent) et réduit les taux de refus de 89 % à 0 % sur Llama-3.1-8B-Instruct.
- Robustesse : La méthode passe efficacement à l'échelle vers des modèles plus grands (Qwen3.5-27B) et différentes familles de SAE sans réajustement des hyperparamètres.
- Préservation des Capacités : Un pilotage fort n'entraîne pas de dégradation significative des capacités fondamentales ; la précision sur MMLU et GSM8K reste largement intacte.
Signification et Revendications
L'article affirme que CircuitSteer démontre que le pilotage de circuit multi-couches, rendu possible par l'imposition de l'alignement géométrique parmi les caractéristiques sélectionnées, produit un contrôle comportemental strictement plus robuste et efficace que les interventions statiques à point unique.
Les auteurs positionnent ce travail comme une étape fondamentale vers un déploiement plus sûr des modèles de langage en :
- Passant d'interventions opaques sur le flux résiduel à un contrôle transparent au niveau des caractéristiques, où le sous-circuit spécifique à un comportement peut être inspecté et ajusté.
- Adressant les modes de défaillance fondamentaux du pilotage multi-couches sans considération géométrique (interférence destructrice et effondrement de la fluidité).
- Fournissant un mécanisme scalable et sans entraînement pour le contrôle comportemental qui respecte la structure de calcul distribuée des LLM.
L'article conclut que l'alignement des interventions avec la propre géométrie des caractéristiques du modèle est essentiel pour atteindre à la fois la robustesse et la transparence dans l'alignement de l'IA.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.