Query Circuits: Explaining How Language Models Answer User Prompts
Dit artikel introduceert "query circuits", een methode voor het traceren van input-specifieke informatiestromen binnen taalmodellen om getrouwe, ijle en computationeel toegankelijke verklaringen voor individuele outputs te bieden, gevalideerd door een nieuwe metriek genaamd Normalized Deviation Faithfulness (NDF) en gedemonstreerd over meerdere benchmarks.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een Large Language Model (LLM) voor als een enorme, bruisende stad met miljoenen wegen, kruispunten en verkeerslichten. Wanneer je het model een vraag stelt (een "prompt"), is dat alsof je een bezorgwagen door deze stad stuurt om een antwoord af te leveren.
Lange tijd hebben onderzoekers geprobeerd te begrijpen hoe deze stad werkt door algemene verkeerspatronen in kaart te brengen. Ze weten bijvoorbeeld dat "Route A" altijd wordt gebruikt wanneer de stad een verborgen object moet vinden, of dat "Route B" wordt gebruikt voor wiskundige problemen. Dit worden capability circuits genoemd.
Het kennen van de algemene route legt echter niet uit waarom de vrachtwagen vandaag voor jouw specifieke levering een specifieke weg heeft gekozen. Misschien was er een wegwerkzaamheid, een plotselinge omleiding of een uniek verkeerslicht dat er alleen voor deze ene rit toe deed.
Dit artikel introduceert een nieuwe manier om naar de stad te kijken: Query Circuits. In plaats van naar de algemene kaart te kijken, willen de auteurs het exacte, kleine pad volgen dat de vrachtwagen voor jouw specische vraag heeft afgelegd.
Hier is een overzicht van hun ontdekking met behulp van eenvoudige analogieën:
1. Het probleem: De "Surrogaat"-kaart klopte niet
Voorheen probeerden onderzoekers, om een specifieke rit te begrijpen, een klein, vereenvoudigd model van de stad (een "surrogaat") te bouwen en daar het pad te traceren.
- De analogie: Stel je voor dat je een complexe verkeersopstopping in New York wilt begrijpen door een speelgoedmodel van de stad te bouwen van LEGO-steentjes. Je traceert het pad op de LEGO-steentjes, in de hoop dat dit overeenkomt met de echte stad.
- Het probleem: Het artikel stelt dat deze LEGO-modellen vaak niet perfect overeenkomen met de echte stad. Ze missen details, en het bouwen ervan is traag en duur. De auteurs wilden het pad direct op de echte stad (het eigenlijke model) traceren zonder een speelgoedversie nodig te hebben.
2. De oplossing: De "Best-of-N" loterij
De auteurs ontdekten dat het verrassend moeilijk is om het exacte pad voor één specifieke vraag te vinden. Als je alleen naar de verkeerslichten voor één vraag kijkt, zijn de gegevens vaak "ruizig" (zoals statische ruis op een radio), wat het moeilijk maakt om het ware pad te zien.
- De analogie: Stel je voor dat je probeert een winnende loterijkaart te vinden, maar de loterijnummers zijn enigszins wazig. Als je probeert de winnaar te kiezen op basis van slechts één kaart, kies je misschien de verkeerde.
- De oplossing: De auteurs stellen een methode voor genaamd Best-of-N (BoN).
- Neem je oorspronkelijke vraag.
- Stel het model dezelfde vraag, maar formuleer hem op 9 verschillende manieren (parafraseren). Het is alsoal vragen: "Welke kleur heeft de lucht?" versus "Beschrijf de kleur van de lucht op een heldere dag."
- Traceer het pad voor alle 10 de versies.
- Kies de winnaar: Kies het pad dat het beste werkte.
- Het resultaat: Zelfs al was de oorspronkelijke vraag "wazig", was een van de geherformuleerde versies duidelijk genoeg om het ware, verborgen pad te onthullen. Door meerdere versies te controleren, vonden ze een "winnende kaart" die accuraat uitlegt hoe de AI antwoord gaf.
3. De nieuwe scorekaart: NDF
Om te weten of ze het juiste pad hadden gevonden, hadden ze een manier nodig om succes te meten. De oude scorekaart (genaamd NFS) was kapot voor complexe vragen; deze gaf scores zoals "200%" of "-50%", wat nergens op sloeg.
- De analogie: Het is als een snelheidsmeter die soms zegt dat je met 100 mph achteruit rijdt of met 500 mph vooruit, terwijl je in werkelijkheid met 60 mph rijdt.
- De oplossing: Ze hebben een nieuwe score uitgevonden genaamd NDF (Normalized Deviation Faithfulness). Dit is een betrouwbare snelheidsmeter die altijd tussen 0 en 1 blijft.
- 1.0 betekent dat het pad dat ze hebben gevonden perfect is (het verklaart het antwoord van het model exact).
- 0.0 betekent dat het pad nutteloos is.
- Deze nieuwe scorekaart stelt hen in staat om hun bevindingen te vertrouwen, zelfs bij moeilijke onderwerpen zoals medische examens of astronomie.
4. De grote verrassing: De stad is grotendeels leeg
De meest opwindende ontdekking is dat het model voor een enkele vraag niet de hele stad gebruikt. Het gebruikt slechts een klein, specifiek buurtje.
- De analogie: Je zou kunnen denken dat een bezorgwagen 50% van de wegen in de stad moet gebruiken om van punt A naar punt B te komen. Maar de auteurs ontdekten dat de vrachtwagen voor een specifieke vraag slechts ongeveer 1,3% van de wegen gebruikt.
- Het bewijs: Ze lieten zien dat als ze 98,7% van de stad zouden blokkeren en de vrachtwagen alleen dat kleine pad van 1,3% zouden laten gebruiken, hij nog steeds ongeveer 60% van de tijd de vraag correct kan beantwoorden. Dit bewijst dat het "brein" van het model voor individuele taken ongelooflijk schaars en efficiënt is.
Samenvatting
Het artikel introduceert een nieuwe tool om precies uit te leggen hoe een AI een specifieke vraag beantwoordt.
- Ze stopten met het gebruik van "speelgoedmodellen" en keken direct in de echte AI.
- Ze realiseerden zich dat het op verschillende manieren stellen van dezelfde vraag helpt om de verborgen "waarheid" van hoe de AI denkt te onthullen.
- Ze creëerden een betere manier om te meten of hun uitleg correct is.
- Ze bewezen dat voor elke enkele vraag, de AI slechts een minuscuul, specifiek deel van zijn enorme brein gebruikt om de klus te klaren.
Dit brengt ons van weten "hoe de AI in het algemeen wiskunde doet" naar begrijpen "hoe de AI dit specifieke wiskundeprobleem heeft opgelost."
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.