← Nieuwste papers
🤖 machine learning

Retrieval is Enough: Training-Free Interpretability with a Tool-Using Agent

Het artikel introduceert HARP, een training-vrije, tool-gebruikende agent die gebruikmaakt van retrieval uit activatiedatabases om hypothesen te genereren en te valideren, waarmee wordt aangetoond dat het dure, op training gebaseerde interpreteerbaarheidsmethoden kan overtreffen in conceptontdekking, detectie, sturing en geheime elicitatie.

Oorspronkelijke auteurs: Sriram Balasubramanian, Soheil Feizi

Gepubliceerd 2026-07-21
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Sriram Balasubramanian, Soheil Feizi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert te begrijpen hoe het brein van een reusachtige, superintelligente robot werkt. Dit brein, een neuraal netwerk genoemd, denkt niet in woorden zoals wij dat doen; het denkt in onzichtbare wolken van getallen die "activaties" worden genoemd. Lange tijd hebben wetenschappers geprobeerd om in deze wolken te gluren om te zien waar de robot werkelijk over nadenkt. Sommige onderzoekers probeerden een enorme, dure bibliotheek van deze getallenwolken te bouwen, waarbij ze een nieuwe, gespecialiseerde robot trainden om ze te memoriseren en uit te leggen. Anderen probeerden simpelere trucjes, zoals het gebruik van een vergrootglas om patronen te vinden zonder enige training. De grote vraag die iedereen stelt is: Hebben we echt die dure, getrainde bibliotheken nodig om het brein te begrijpen? Of is het mogelijk dat de "slimme" getrainde robots gewoon heel goed zijn in het opzoeken van antwoorden in een boek dat ze al uit hun hoofd hebben geleerd, in plaats van daadwerkelijk iets nieuws te ontdekken?

Dit artikel, getiteld "Retrieval is Enough", stelt een slimme nieuwe manier voor om in het brein van de robot te gluren zonder dure bibliotheken te bouwen. De auteurs creëerden een hulpmiddel genaamd HARP (Hypothesis-driven Agentic Retrieval and Probing). Zie HARP niet als een student die jarenlang moet studeren om de stof te leren, maar als een superintelligente detective met een magische telefoonbundel. Deze telefoonbundel bevat miljoens voorbeelden van de gedachten van de robot, gekoppeld aan de zinnen die deze gedachten veroorzaakten. Wanneer HARP wil weten wat een specifieke gedachte betekent, raadt het niet; het zoekt naar vergelijkbare gedachten in de telefoonbundel, leest de omliggende zinnen en ontdekt het patroon. Vervolgens gebruikt het eenvoudige wiskundige instrumenten om dat patroon van de gedachte af te "aftrekken" om te zien wat er overblijft, een proces dat het herhaalt totdat het elke laag van betekenis heeft afgepeld.

Het artikel stelt vast dat deze "detective met een telefoonbundel" verrassend krachtig is. Sterker nog, HARP doet het vaak beter dan de dure, getrainde robots bij het ontdekken van welke concepten verborgen zitten in de activaties van het neurale netwerk. Of de taak nu is om de hoofdonderwerpen in een paragraaf te achterhalen, een specifiek verborgen idee op te sporen, of zelfs een model te misleiden om een geheim woord te onthullen dat het getraind was om te verbergen, HARP presteert net zo goed, of soms zelfs beter, dan de zware, getrainde methoden. De auteurs suggereren dat veel van de "inzichten" waarvan we dachten dat we ze kregen door dure training, misschien slechts het resultaat zijn van het systeem dat patronen ophaalt en combineert die het tijdens de training zag, in plaats van het ontsluiten van diepe, nieuwe geheimen. Door aan te tonen dat een eenvoudig, zonder training werkend systeem het werk kan doen, beargumenteert het artikel dat we misschien niet zoveel tijd en geld nodig hebben aan het trainen van complexe interpreteerders als we simpelweg de antwoorden kunnen opzoeken in een goed georganiseerde database met voorbeelden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →