Building Better Activation Oracles
Dit artikel verbetert Activation Oracles (AOs) door vier trainingsverbeteringen te introduceren om hallucinaties en vaagheid aan te pakken, terwijl het AObench vrijgeeft, de eerste uitgebreide evaluatiesuite, om schaalbare, end-to-end interpreteerbaarheid te bevorderen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een superintelligente robot hebt (een Large Language Model) die verhalen schrijft, wiskundige problemen oplost of vragen beantwoordt. Maar in de "hersenen" van deze robot vuren miljarden kleine elektrische signalen af in een taal die geen mens kan begrijpen. Deze signalen worden activaties genoemd.
Lange tijd wilden we in die hersenen kunnen kijken om te zien waarom de robot een bepaalde beslissing nam. Hier komt de Activation Oracle (AO) in beeld. Zie een AO als een "vertaler" of een "biograaf" voor de robot. Je laat de vertaler de elektrische signalen van de robot zien en vraagt: "Wat was hier precies je gedachte?" en de vertaler probeert dit in begrijpelijk Nederlands uit te leggen.
De oorspronkelijke vertalers hadden echter grote problemen:
- Ze waren vaag: In plaats van te zeggen "Ik dacht aan het woord 'appel'", zeiden ze: "Ik dacht aan het concept van de zin." (Niet erg nuttig!)
- Ze hallucineerden: Ze verzon details die helemaal niet in de signalen aanwezig waren.
- Ze waren "valsspelers": Soms lazen ze de signalen helemaal niet; ze keken alleen naar de woorden vóór en ná het signaal en raadden het antwoord op basis van die woorden. Dit wordt "text inversion" genoemd.
De auteurs van dit paper wilden een betere vertaler boulen. Ze hebben niet alleen de code aangepast; ze hebben het trainingsproces op vier specifieke manieren herbouwd. Hier is hoe ze dat deden, met behulp van alledaagse analogieën:
1. Het Betere Handboek (De Conversationele Dataset)
Het Probleem: De oude vertaler werd getraind op een handboek (genaamd LatentQA) dat lastige vragen stelde over complexe prompts. De antwoorden waren vaak onmogelijk te vinden door enkel naar de signalen te kijken, waardoor de vertaler begon te gokken of vage antwoorden gaf.
De Oplossing: De auteurs creëerden een nieuw handboek. Ze namen het eigen "denkproces" (de interne redenering) van de robot, sneden het doormidden, en vroegen een andere AI om een vraag te schrijven over de tweede helft die alleen beantwoord kon worden door naar de signalen van de eerste helft te kijken.
De Analogie: Stel je voor dat je een student leert om een kaart te lezen. De oude methode gaf de student een kaart en vroeg: "Waar is de schat?", zonder de legenda van de kaart te tonen. De nieuwe methode toont een specifiek herkenningspunt op de kaart en vraagt: "Wat is het terrein precies hier?" Dit dwingt de vertaler om daadwerkelijk naar de signalen te kijken, in plaats van te gokken op basis van de context.
Resultaat: Dit was de grootste verbetering. De nieuwe vertaler werd veel specifieker en stopte met zo vaag te zijn.
2. Naar Meer Lagen Kijken (De Multi-Layer Feed)
Het Probleem: De oude vertaler keek slechts naar één specifieke "verdieping" van de hersenen van de robot (rond de 25% of 50% diepte). Maar de "gedachten" van de robot zijn verspreid over vele verdiepingen.
De Oplossing: De auteurs realiseerden zich dat de meest interessante "gedachten" rond de 60-80% mark plaatsvinden. Dus in plaats van naar slechts één verdieping te kijken, voedden ze de vertaler tegelijkertijd de signalen van vijf opeenvolgende verdiepingen.
De Analogie: Als je een film wilt begrijpen, zegt het kijken naar slechts één frame (één laag) heel weinig. Het kijken naar een korte clip van vijf frames (vijf lagen) geeft je de beweging en de context die nodig zijn om te begrijpen wat er gebeurt.
Resultaat: Dit hielp de vertaler om de "film" van het denken van de robot beter te begrijpen, vooral bij het vergelijken van verschillende modellen.
3. Trainen op "Live" Data (On-Policy Rollouts)
Het Probleem: De oude vertaler werd getraind op oude, statische data (zoals een bibliotheek met boeken die geschreven zijn voordat de robot bestond). Het was alsoals een chauffeur trainen met een kaart van een stad die al 50 jaar niet meer is veranderd.
De Oplossing: Ze begonnen de vertaler te trainen op data die door de robot werd gegenereerd terwijl deze daadwerkelijk aan het denken was.
De Analogie: In plaats van een vertaler te onderwijzen met een script van een toneelstuk dat jaren geleden is afgelopen, plaatsten ze de vertaler in het publiek terwijl het toneelstuk live wordt opgevoerd. Dit zorgt ervoor dat de vertaler leert hoe de robot nu denkt, en niet hoe hij in het verleden dacht.
Resultaat: Dit hielp een beetje, maar het was niet de wondermiddel. Het maakte de vertaler iets beter in het begrijpen van de huidige staat van de robot.
4. Het Volume Omhoog Draaien (Injectiekracht)
Het Probleem: Wanneer de signalen aan de vertaler werden getoond, stond het "volume" (of de sterkte) van het signaal te zacht. De vertaler probeerde een fluistering te horen in een lawaaierige kamer.
De Oplossing: Ze draaiden het "volume" van de signalen die ze in de vertaler voerden omhoog.
De Analogie: Stel je voor dat je probeد een vriend te horen tijdens een luid concert. Als je hem alleen een briefje overhandigt, hoort hij het misschien niet. Als je de boodschap hardop roept (de sterkte verhoogt), is de kans veel groter dat hij het correct hoort.
Resultaat: Dit veranderde de algemene score niet veel, maar verminderde de hallucinaties aanzienlijk. De vertaler was minder geneigd om dingen te verzinnen omdat het echte signaal luider en duidelijker was.
Het Eindresultaat: AObench
Om te bewijzen dat hun nieuwe vertaler beter was, bouwden de auteurs een nieuwe test genaamd AObench. Zie dit als een "rijbewijstest" specifiek voor deze vertalers. Het controleert:
- Vaagheid: Geeft de vertaler een concreet antwoord of een vrijblijvend antwoord?
- Hallucinatie: Verzin de vertaler feiten?
Het Oordeel:
Door alle vier de verbeteringen te combineren, is de nieuwe vertaler veel beter dan de oude.
- Hij is minder vaag (hij geeft specifieke antwoorden).
- Hij hallucineert minder (hij vertelt vaker de waarheid).
- Hij volgt instructies beter op.
De auteurs geven toe dat de vertaler nog steeds niet perfect is, maar dat ze een solide fundament hebben gelegd. Ze hebben laten zien dat als je de vertaler betere trainingsdata geeft, meer van de hersenactiviteit laat zien en het volume omhoog draait, het een veel betrouwbaarder venster wordt naar hoe AI-modellen denken.
Kortom: Ze namen een vertaler die aan het gokken en vaag was, en veranderden die in een vertaler die daadwerkelijk luistert, het hele plaatje ziet en de waarheid spreekt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.