← Nieuwste papers
💬 NLP

REAL: Reading Out Transformer Activations for Precise Localization in Language Model Steering

Het artikel introduceert REAL, een framework dat gedrag-relevante Transformer-modules identificeert door vector-gekwantiseerde autoencoders te trainen op verborgen activaties om onderscheid te maken tussen gealigneerde en schendende responsen, waardoor nauwkeurigere en effectievere sturing tijdens de inferentie mogelijk wordt over diverse grote taalmodellen en taken heen.

Oorspronkelijke auteurs: Li-Ming Zhan, Bo Liu, Chengqiang Xie, Jiannong Cao, Xiao-Ming Wu

Gepubliceerd 2026-07-14
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Li-Ming Zhan, Bo Liu, Chengqiang Xie, Jiannong Cao, Xiao-Ming Wu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een gigantische, superintelligente robothersenen voor (een Large Language Model) die is getraind om verhalen te schrijven, vragen te beantwoorden en met je te chatten. Soms wil je deze robot een duwtje geven om eerlijker te zijn of om te voorkomen dat hij dingen verzint, maar je wilt de hersenen van de robot niet opnieuw opbouwen of de bedrading veranderen. Dat wordt "inference-time steering" genoemd—het sturen van het schip terwijl het al vaart.

Het probleem? De oude manieren van sturen waren een beetje alsof je moest raden welke knop je moest indrukken. Onderzoekers gebruikten eenvoudige aanwijzingen of willekeurige gissingen om de juiste onderdelen van de hersenen te vinden om aan te passen, wat er vaak toe leidde dat de robot in de war raakte of vreemd gedrag vertoonde.

Maak kennis met REAL (Reading Out Transformer Activations for Precise Localization). Denk aan REAL als een hoogtechnologische detective die niet gokt; het luistert daadwerkelijk naar de interne gedachten van de robot om precies de tandwielen te vinden die verantwoordelijk zijn voor specifieke gedragingen.

Zo werkt de detective:
Voor elk klein tandwiel in de hersenen van de robot (een "attention head" of "layer" genoemd), stelt REAL een speciale vertaler op. Deze vertaler gebruikt een "vector-quantized autoencoder" (een chique term voor een slimme sorteerder) om de gedachten van de robot in twee stapels te organiseren: "Goede, eerlijke gedachten" en "Slechte, leugenachtige gedachten." Het gebruikt een gedeeld woordenboek (een codebook) om deze gedachten te sorteren.

REAL stelt vervolgens een simpele vraag: "Hoe goed kan dit specifieke tandwiel het verschil zien tussen een waarheidsgetrouw antwoord en een nepantwoord?" Als een tandwiel heel goed is in het herkennen van het verschil, geeft REAL het een hoge score. Als het tandwiel in de war is, is de score laag. Deze score vertelt de onderzoekers precies welke tandwielen ze moeten aanpassen en hoe hard ze moeten duwen.

De onderzoekers testten deze detective op acht verschillende robotbreinen (uit de Llama- en Qwen-families) en negen verschillende uitdagende parcoursen, variërend van het dwingen van de robot om de waarheid te spreken tot het afhandelen van lastige vragen waarbij feiten met elkaar botsen.

De resultaten? REAL was een gamechanger. Bij het proberen de robots eerlijker te maken, verbeterde REAL hun prestaties met gemiddeld 20% vergeleken met de vorige beste methode (genaamd ITI), waarbij sommige tests een enorme sprong lieten zien van wel 81,5%. Bovendien waren de tandwielen die REAL koos zo goed in het herkennen van de waarheid, dat ze ook goed werkten in nieuwe situaties die de robots nog niet hadden gezien, zonder dat er extra training nodig was.

Kortom, in plaats van blind te gokken welk deel van de robothersenen aangepast moet worden, luistert REAL naar de interne gesprekken, sorteert de goede gedachten van de slechte, en wijst direct naar de schakelaar die omgezet moet worden. Het is een slimmere, preciezere manier om deze krachtige AI-geesten te begeleiden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →