← Nieuwste papers
🤖 machine learning

Behavioral Steering in a 35B MoE Language Model via SAE-Decoded Probe Vectors: One Agency Axis, Not Five Traits

Deze studie toont aan dat het sturen van gedragskenmerken in het Qwen 3.5-35B-MoE-model via SAE-gedecodeerde proefvectoren leidt tot een significant toename in autonomie, wat wijst op causale bewijzen dat gedragsverbintenissen al tijdens de voorafvulling in GatedDeltaNet-architecturen worden berekend.

Oorspronkelijke auteurs: Jia Qing Yap

Gepubliceerd 2026-03-18
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jia Qing Yap

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, superintelligente robot hebt (een kunstmatige intelligentie) die net zo groot is als een stad. Deze robot kan heel veel dingen doen: code schrijven, het internet doorzoeken, bestanden lezen, maar ook vragen stellen aan de gebruiker. Soms is hij te voorzichtig en vraagt hij direct: "Mag ik dit doen?" Soms is hij te stout en doet hij dingen zonder te vragen.

De onderzoekers van dit paper wilden weten: kunnen we deze robot een beetje "sturen" zonder hem opnieuw te leren? Kunnen we hem bijvoorbeeld leren om zelfstandiger te zijn, of juist om meer risico's te nemen?

Hier is hoe ze dat deden, vertaald naar alledaags taal:

1. De "X-Bril" en de "Stuurknuppel"

De onderzoekers gebruikten een speciale techniek die ze SAE noemen. Stel je voor dat je een bril opzet die door de hersenen van de robot kijkt. In plaats van te kijken naar wat de robot zegt, kijken ze naar de elektrische signalen die eronder schuilgaan.

  • De SAE (De X-Bril): Deze bril splitst de gedachten van de robot op in duizenden kleine, losse "gedachte-deeltjes". Sommige deeltjes gaan over "code schrijven", andere over "vragen stellen", en weer andere over "risico's nemen".
  • De Proef (De Test): Ze trainden een simpele test (een "probe") om te zien welke deeltjes oplichten als de robot zelfstandig handelt.
  • De Stuurknuppel (De Vector): Dit is het slimme deel. Normaal gesproken zou je die deeltjes kunnen "aan- of uitzetten", maar dat werkt als een schakelaar: aan of uit. De onderzoekers vonden een manier om de testresultaten om te zetten in een stuurknuppel. Als je deze knuppel een beetje draait, verandert de robot zachtjes van gedrag, zonder dat hij "kapot" gaat.

2. Het Grote Ontdekking: Één Knop, Vijf Verwachtingen

De onderzoekers dachten dat ze vijf verschillende "knoppen" zouden vinden voor vijf verschillende eigenschappen:

  1. Zelfstandigheid (Doe het zelf!)
  2. Gretigheid voor hulpmiddelen (Gebruik de tools!)
  3. Volharding (Blijf proberen!)
  4. Risicobereidheid (Wees niet bang!)
  5. Onderdanigheid (Vraag eerst toestemming!)

Maar wat ze vonden, was verrassend: Er is eigenlijk maar één grote knop.

Het was alsof ze dachten dat ze vijf verschillende afstandsbedieningen nodig hadden voor een tv, maar ze ontdekten dat er maar één grote volumeknop is. Als je die draait, wordt de robot niet alleen "zelfstandiger", maar ook "grittiger" en "minder onderdanig". Alle vijf de eigenschappen die ze probeerden te sturen, bleken eigenlijk gewoon verschillende manieren waarop de robot reageert op één enkele instelling: "Doen we het zelf, of vragen we de gebruiker?"

  • Analogie: Stel je voor dat je een auto hebt. Je dacht dat je aparte pedalen had voor "snelheid", "versnelling" en "kracht". Maar je merkt dat als je op het gaspedaal drukt, de auto sneller gaat, sneller accelereert en meer kracht levert. Het is allemaal één beweging.

3. De Valstrik: Snelheid vs. Besturing

Een van de coolste ontdekkingen is een waarschuwing voor andere onderzoekers.
Ze vonden twee "gedachte-deeltjes" die bijna perfect voorspelden of de robot voorzichtig of gretig was. Maar toen ze probeerden om die deeltjes te gebruiken om de robot te sturen, gebeurde er iets raars:

  • Het ene deeltje werkte als een echte stuurknuppel: de robot veranderde van gedrag.
  • Het andere deeltje was een valstrik. Het zag eruit als een stuurknuppel, maar het was eigenlijk alleen maar een spiegel. Het liet zien wat er aan de hand was, maar als je erop drukte, gebeurde er niets.

Leermoment: Net omdat iets een goede voorspelling is (een goede spiegel), betekent het niet dat je het kunt gebruiken om dingen te veranderen (een stuurknuppel).

4. Het Geheim van het "Voorbereiden"

De onderzoekers ontdekten ook wanneer de robot een beslissing neemt.
Ze probeerden de stuurknuppel pas te gebruiken terwijl de robot de tekst aan het typen was (tijdens het "schrijven"). Dat had geen enkel effect.
Pas toen ze de stuurknuppel gebruikten op het moment dat de robot de opdracht las en begreep (het "prefill"-moment), veranderde het gedrag.

  • Analogie: Het is alsof je een kok probeert te sturen terwijl hij al aan het koken is. Te laat! Je moet de kok sturen op het moment dat hij de receptkaart leest. Zodra hij de pan heeft gepakt, is het besluit om het gerecht te maken al gemaakt. Bij deze robot wordt het gedrag vastgelegd op het moment dat hij de vraag leest, niet terwijl hij het antwoord schrijft.

Samenvatting in één zin

De onderzoekers hebben bewezen dat je de gedragingen van een enorme AI kunt sturen door een speciale "stuurknuppel" te gebruiken die ze hebben gebouwd uit de interne gedachten van de robot, maar ze ontdekten ook dat al die verschillende gedragingen eigenlijk allemaal aan één grote "zelfstandigheids-knop" hangen, en dat je die knop moet draaien op het moment dat de robot de opdracht leest, niet terwijl hij schrijft.

Waarom is dit belangrijk?
Het helpt ons te begrijpen hoe AI's echt werken, zodat we ze veiliger en beter kunnen maken. Maar het waarschuwt ons ook: als je één knop draait om een AI "slimmer" te maken, kan hij per ongeluk ook "onvoorzichtig" worden, omdat die eigenschappen aan elkaar gekoppeld zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →