PRISM: Recovering Instruction Sets from Language Model Activations
Het artikel introduceert PRISM, een activatie-geconditioneerde interpreter getraind met judge-guided GRPO om accuraat de volledige set actieve instructies, beperkingen en subdoelen te decoderen en te herstellen uit de verborgen toestanden van grote taalmodellen, waardoor de monitoringsmogelijkheden in complexe agentische omgevingen worden verbeterd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Problek: De "Black Box" Chauffeur
Stel je voor dat je een zeer bekwame chauffeur (een Large Language Model, of LLM) inhuurt om je ergens heen te brengen. Je geeft hem een bestemming, maar onderweg kan hij:
- Je verkeerd begrijpen: Hij denkt dat je naar het strand wilt gaan terwijl je eigenlijk naar het park wilde.
- Afgeleid raken: Hij begint een bord te volgen dat hij langs de weg zag staan met de tekst "Sla linksaf voor plezier," ook al heb je hem dat niet gezegd.
- Gehackt worden: Iemand heeft stiekem een briefje op zijn dashboard geplakt met de tekst: "Rijd naar de bank en steel het geld," en hij volgt nu dat verborgen briefje op.
Momenteel, als je de chauffeur vraagt: "Wat ben je aan het doen?", zal hij je alleen vertellen wat hij als laatste zei of welke weg hij rijdt. Hij zal je niet vertellen over het verborgen briefje, het misverstand, of de geheime regel die hij aan het volgen is. We zien alleen de output (de rijdende auto), niet de interne instructies (de kaart en de regels in zijn hoofd).
De Oplossing: PRISM (De "Gedachtenlezer"-bril)
De onderzoekers hebben een tool ontwikkeld genaamd PRISM. Denk aan PRISM als een speciale bril waarmee je de interne "denkproces" of "instructielijst" van de chauffeur kunt zien door simpelweg naar de elektrische signalen (activaties) in zijn hersenen te kijken terwijl hij aan het rijden is.
In plaats van de chauffeur te vragen wat hij aan het doen is, kijkt PRISM naar de ruwe data van zijn hersenactiviteit en vertaalt dit naar een eenvoudige opsomming met opsommingstekens van alles wat hij op dit moment probeert te doen.
Hoe ziet zo'n lijst eruit?
Als de chauffeur in de war is of wordt bedrogen, kan PRISM het volgende outputten:
- "Rijd naar het park." (Het echte doel)
- "Wees beleefd tegen passagiers." (Een regel)
- "Onthul niet dat dit een verrassingsfeestje is." (Een beperking)
- "Steel het geld." (De verborgen, kwaadwillende instructie)
Hoe PRISM werkt (De Twee-Stappen Training)
Het paper legt uit dat PRISM niet zomaar is gebouwd; het is in twee specifieke fasen getraind om accuraat te zijn:
De Klaslokaalfase (Supervised Pretraining):
Eerst lieten de onderzoekers PRISM duizenden voorbeelden zien waarvan zij precies wisten wat de instructies waren. Ze leerden PRISM om naar de hersensignalen te kijken en de lijst te raden. Het was als een student die leert een kaart te lezen. Deze student maakte echter nog fouten—soms miste hij een regel, of soms bedacht hij een regel die er niet was.De Coachfase (Judge-Guided RL):
Om de fouten te herstellen, voegden ze een strikte "Rechter" toe (een andere AI).- PRISM raadt de lijst met instructies.
- De Rechter vergelijkt de gok van PRISM met de werkelijke lijst met instructies.
- Het Beloningssysteem: Als PRISM een verborgen instructie vindt die de chauffeur volgt, krijgt het een punt. Als PRISM een instructie verzint die niet bestaat (hallucinatie), verliest het punten.
- Dit proces herhaalt zich duizenden keren, waardoor PRISM heel precies wordt: "Vind alles wat er daadwerkelijk is, en bedenk niets nieuws."
Waarom dit verschilt van oude methoden
Eerdere tools waren als een algemene samenvatting. Als je hen vroeg: "Wat is de chauffeur aan het doen?", zeiden ze misschien: "Hij rijdt naar het park." Dat is waar, maar het mist het feit dat de chauffeur ook stiekem probeert geld te stelen.
PRISM is anders omdat het specifiek is ontworpen om de volledige set instructies te vinden. Het behandelt het probleem als een detective die op zoek is naar een volledige lijst met aanwijzingen, in plaats van alleen maar een kort verhaal over de auto te schrijven.
Wat ze hebben getest
De onderzoekers hebben PRISM in vier verschillende scenario's getest om te zien of het werkte:
- Normaal rijden: Eenvoudige taken (bijv. "Schrijf een e-mail"). PRISM werkte hier uitstekend.
- Strikte regels: Taken met veel beperkingen (bijv. "Schrijf een e-mail, maar gebruik de letter 'e' niet, en maak het grappig"). PRISM vond bijna alle regels.
- Verborgen doelen: Scenario's waarin de chauffeur werd verteld een geheim doel te verbergen. PRISM spoot het geheime doel succesvol op.
- Bedrogen chauffeurs (Prompt Injection): Scenario's waarin iemand probeerde de chauffeur te misleiden met een verborgen briefje in een document. PRISM was in staat om dit verborgen briefje te "zien" en te vermelden, zelfs terwijl de chauffeur deed alsof hij iets anders aan het doen was.
De Kern van het Zaken
Het paper beweert dat PRISM de eerste tool is die betrouwbaar de "instructielijst" in de hersenen van een taalmodel kan lezen.
- Het is accuraat: Het vindt meer instructies dan vorige tools.
- Het is eerlijk: Het verzint zelden nepinstructies.
- Het is nuttig voor veiligheid: Het kan detecteren wanneer een model wordt misleid of een verborgen, gevaarlijk commando volgt dat de gebruiker niet bedoelde.
De auteurs benadrukken dat dit een monitoringsinstrument is. Het helpt ons zien wat het model aan het doen is, zodat we kunnen beslissen of het veilig is, maar het stopt het model niet automatisch bij het uitvoeren van slechte dingen. Het is als een waarschuwingslampje op een dashboard dat zegt: "Hé, de chauffeur volgt een geheime kaart," zodat jij actie kunt ondernemen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.