Slot Machines: How LLMs Keep Track of Multiple Entities
Dit onderzoek toont aan dat taalmodellen informatie over meerdere entiteiten in gescheiden 'huidige' en 'vorige' slots in hun residual stream bewaren, waarbij de huidige slot wordt gebruikt voor feitelijke vragen terwijl de vorige slot voornamelijk dient voor relationele inferenties, wat een kloof onthult tussen beschikbare informatie en wat het model daadwerkelijk gebruikt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
🎰 De "Slotmachines" van Taalmodellen: Hoe AI onthoudt wie wie is
Stel je voor dat een Taalmodel (zoals een geavanceerde chatbot) een enorme slotmachine is. Maar in plaats van fruit of zevenen, draait deze machine met personages en hun eigenschappen.
De onderzoekers van Anthropic wilden weten: Hoe onthoudt een computer precies wie "Alice" is en wat ze doet, terwijl er ook een "Bob" in de kamer staat? En kan de computer beide tegelijk onthouden op één enkel moment?
Hier is wat ze ontdekten, vertaald naar alledaagse taal:
1. De "Huidige" en "Vorige" Stoelen
Stel je een rij met stoelen voor in een bioscoopzaal.
- De Huidige Stoel (Current-Entity Slot): Dit is de stoel waar het personage nu zit. Als Alice op het scherm staat, zit haar informatie op deze stoel.
- De Vorige Stoel (Prior-Entity Slot): Als Alice de zaal verlaat en Bob binnenkomt, gaat Alice niet helemaal weg. Ze gaat op de stoel voor Bob zitten.
Het onderzoek toont aan dat het model op het moment dat Bob wordt beschreven, twee dingen tegelijk weet:
- Wie Bob is (op zijn eigen stoel).
- Wie Alice was (op de stoel ervoor).
Deze twee stukjes informatie zitten in twee verschillende "vakjes" (slots) in het brein van de AI. Ze raken elkaar niet; ze zijn als twee verschillende talen die naast elkaar worden gesproken zonder te verwarren.
2. Wat kan het model met deze informatie? (De Kracht van Relaties)
Het model gebruikt deze twee vakjes slim voor bepaalde taken:
- De "Wie kwam er na?"-vraag: Als je vraagt: "Wie kwam er na Alice?", kijkt het model naar Bobs stoel. Daar ziet het: "Ah, op de stoel ervoor zit Alice." Het kan de volgorde dus perfect volgen.
- Het "Klopt dit?"-testje: Als Alice "dapper" is en Bob "laf", kan het model op Bobs stoel zien: "Wacht, de vorige persoon was dapper, en ik ben laf. Dat is een conflict!" Het model kan dus zien of eigenschappen van twee opeenvolgende personages botsen.
3. Waar faalt het model? (De Blinde Vlek)
Hier wordt het interessant. Hoewel de informatie over Alice aanwezig is op Bobs stoel, gebruikt het model die informatie niet voor alles.
Stel je voor dat je een vraag stelt: "Is er iemand in de kamer die lang is?"
- Als Alice lang is, kijkt het model alleen naar Alice' eigen stoel.
- Het kijkt niet naar de stoel van Bob, ook al staat daar de informatie over Alice (de "vorige persoon") gewoon op!
Het is alsof je een boek leest en de informatie over hoofdstuk 1 in je hoofd hebt, maar als je wordt gevraagd: "Wie was de held in hoofdstuk 1?", dan slaat je het boek open bij hoofdstuk 1 in plaats van te kijken naar de samenvatting die je in je hoofd had. Het model "weet" het, maar het gebruikt het niet voor simpele zoekvragen.
4. De Grote Uitdaging: Twee dingen op één plek
De onderzoekers probeerden het model te dwingen om twee dingen tegelijk op één woord te onthouden.
- Voorbeeldzin: "Alice bereidt eten voor, en Bob consumeert voedsel."
- Het woord "voedsel" moet hier twee dingen onthouden: wat Alice doet én wat Bob doet.
De meeste slimme modellen (zoals de huidige open-source versies) struikelen hierover. Ze raken in de war, alsof ze twee verschillende recepten op één vel papier proberen te schrijven. Ze kunnen niet goed onderscheiden wie wat doet.
Maar... de allernieuwste, meest geavanceerde modellen (de "frontier" modellen) kunnen dit wel. Ze hebben blijkbaar een nieuwe truc bedacht om meerdere informatieblokken op één plek te stapelen zonder in de war te raken.
5. Waarom is dit belangrijk? (Leugenen en Sycofantisme)
Waarom maakt dit uit?
Stel je voor dat een AI probeert je te overtuigen of te liegen.
- Het model moet weten: "Wat is de waarheid?" (Eén vakje).
- En: "Wat gelooft de gebruiker?" (Een ander vakje).
- En: "Wat wil ik dat de gebruiker gelooft?" (Nog een vakje).
Als het model deze verschillende perspectieven niet goed kan scheiden en tegelijkertijd vasthouden, kan het gaan liegen of te veel meegeven (sycofantisme) zonder dat het zelf doorheeft dat het liegt. Het heeft dan een soort "blindziendheid": het reageert op informatie die er is, maar kan het niet bewust benoemen.
Samenvatting in één zin
Taalmodellen hebben een slim systeem om twee personages tegelijk te onthouden (de huidige en de vorige), maar ze gebruiken die herinnering alleen voor het vergelijken van de twee, en niet om simpele vragen over de vorige persoon te beantwoorden – tenzij ze de allernieuwste technologie hebben, die dit probleem dan weer oplost.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.