CircuitSteer: Geometrically Aligned Multi-Layer Steering via Sparse Autoencoder Circuits
CircuitSteer is een nieuw framework dat Sparse Autoencoders benut om geometrisch uitgelijnde, meerlaagse semantische circuits te identificeren en te manipuleren, wat robuuste en vloeiendheid-behoudende gedragscontrole in grote taalmodellen mogelijk maakt die bestaande single-layer sturingsmethoden overtreft.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Technische Samenvatting: CircuitSteer
Probleemstelling
Het controleren van het gedrag van Large Language Models (LLM's) via sturing tijdens de inferentie (inference-time steering) blijft een kritieke uitdaging voor AI-alignment. Bestaande methoden, zoals Contrastive Activation Addition (CAA) en Representation Engineering (RepE), vertrouwen doorgaans op vaste, single-layer interventies afgeleid van geaggregeerde activatieverschillen. Deze benaderingen kampen met twee primaire beperkingen:
- Semantische Conflatie: Ze passen een enkele interventievector toe op semantisch diverse inputs, waardoor ze er vaak niet in slagen de gedistribueerde aard van hoogwaardige concepten te vatten.
- Geometrische Misalignement: Hoogwaardige semantische concepten zijn verdeeld over meerdere lagen en evolueren progressief door het netwerk. Multi-layer interventies zonder geometrische overweging falen omdat features die hetzelfde concept coderen op verschillende dieptes vaak decoderrichtingen hebben die geometrisch misaligned zijn. Het combineren hiervan zonder alignment leidt tot destructieve interferentie, wat resulteert in fluency collapse (degradatie van tekstkwaliteit) of instabiele gedragsveranderingen.
Huidige methoden gebaseerd op Sparse Autoencoders (SAE's) verbeteren interpreteerbaarheid door activaties te deconstrueren in monosemantische features, maar gaan vaak nog steeds uit van de aanname dat single-layer interventie voldoende is, waarbij de cross-layer propagatie van semantische signalen wordt genegeerd.
Methodologie: CircuitSteer
CircuitSteer is een training-vrij framework dat SAE's gebruikt om coherente semantische circuits te identificeren en te manipuleren die over meerdere lagen verdeeld zijn. In plaats van features onafhankelijk per laag te selecteren, construeert het een feature flow circuit op basis van twee gezamenlijke criteria:
- Feature Co-activatie: Het identificeren van paren features en die simultaan actief zijn op dezelfde inputs, wat een benadering vormt van causale invloed.
- Geometrische Alignment: Ervoor zorgen dat de decoderrichtingen van deze features compatibel zijn (hoge cosinus-gelijkenis). Dit voorkomt destructieve interferentie wanneer interventies over lagen worden toegepast.
De methode verloopt in drie stadia:
- Circuit Discovery: Middels contrastieve analyse tussen doelgerichte prompts () en neutrale prompts (), berekent de methode een contrastive specificity score voor de randen in de feature flow graph. Randen met hoge specificiteitsscores worden behouden om het subcircuit te isoleren dat verantwoordelijk is voor het doelgedrag.
- Vector Synthese: Voor elke laag die betrokken is bij het geïsoleerde subcircuit, wordt een dichte sturende vector gesynthetiseerd door de decoderrichtingen van alle features die deelnemen aan de circuit-randen te middelen. Dit ontkoppelt de interventie-amplitude van de circuitgrootte.
- Multi-Point Interventie: Tijdens de inferentie worden deze gesynthetiseerde vectoren simultaan toegepast op alle relevante lagen met een scalaire coëfficiënt . De geometrische alignment zorgt ervoor dat interventies een consistente directionele verschuiving over de diepte versterken, in plaats van dat latere lagen eerdere perturbaties compenseren.
Het framework vereist geen weight updates of gradiënt-gebaseerde optimalisatie; het maakt gebruik van pre-trained SAE's (bijv. Gemma-Scope, Llama-Scope) en voert algebraïsche operaties uit op forward-pass activaties.
Belangrijkste Bijdragen
- CircuitSteer Framework: Een nieuw, training-vrij multi-layer sturingsmechanisme dat gedragsspecifieke SAE-circuits identificeert via feature co-activatie en geometrische alignment van decoderrichtingen.
- Noodzaak van Geometrische Alignment: Empirische demonstratie dat geometrische alignment van decoderrichtingen een vereiste is voor stabiele multi-layer sturing. Niet-uitgelijnde features veroorzaken fluency collapse, terwijl uitgelijnde features een consistente gedragsreductie bereiken met een perplexiteit die nabij de baseline ligt.
- Uitgebreide Benchmarking: Evaluatie tegen acht baselines (inclusief CAA, RepE, ITI, LoReFT en SAE-gebaseerde methoden) over vier gedragsdatasets (Toxicity, Emotion, Sycophancy, Refusal) en twee modelfamilies (Gemma-2-2B en Llama-3.1-8B-Instruct).
Resultaten
Over alle modellen en datasets heen is CircuitSteer de enige methode die consistent fluency-preserverende interventies produceert:
- Fluency Preservation: Concurrerende methoden offeren ofwel tekstkwaliteit op (hoge perplexiteit) of falen in het bereiken van voldoende gedragsreductie. CircuitSteer houdt de genormaliseerde perplexiteit nabij 1.0 terwijl het een significante gedragsreductie bereikt.
- Complexe Gedragingen: Bij moeilijke taken zoals sycophancy en refusal falen single-layer methoden (zoals CAA) vaak volledig of produceren ze verwaarloosbare veranderingen. CircuitSteer reduceert sycophancy succesvol op Gemma-2-2B (waar andere methoden falen) en vermindert de refusal rate van 89% naar 0% op Llama-3.1-8B-Instruct.
- Robuustheid: De methode schaalt effectief naar grotere modellen (Qwen3.5-27B) en verschillende SAE-families zonder hyperparameter-retuning.
- Behoud van Capaciteiten: Sterke sturing degradeert de kerncapaciteiten niet significant; de nauwkeurigheid op MMLU en GSM8K blijft grotendeels intact.
Betekenis en Claims
Het artikel claimt dat CircuitSteer aantoont dat multi-layer circuit steering, mogelijk gemaakt door het afdwingen van geometrische alignment tussen geselecteerde features, strikt robuustere en effectievere gedragscontrole oplevert dan statische single-point interventies.
De auteurs positioneren dit werk als een fundamentele stap naar veiligere inzet van taalmodellen door:
- Van ondoorzichtige residual-stream interventies over te stappen naar transparante, feature-level controle waarbij het specifieke subcircuit voor een gedrag kan worden geïnspecteerd en afgesteld.
- De fundamentele faalmodi van multi-layer sturing zonder geometrische overweging (destructieve interferentie en fluency collapse) aan te pakken.
- Een schaalbaar, training-vrij mechanisme voor gedragscontrole te bieden dat de gedistribueerde computationele structuur van LLM's respecteert.
Het artikel concludeert dat het afstemmen van interventies op de eigen feature-geometrie van het model essentieel is voor zowel robuustheid als transparantie in AI-alignment.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.