What's the plan? Metrics for implicit planning in LLMs and their application to rhyme generation and question answering
Dit artikel introduceert eenvoudige, schaalbare technieken om aan te tonen dat impliciete planning—een mechanisme waarbij taalmodellen tussenliggende tokens sturen naar toekomstige doelen zoals rijmen of antwoorden—een universeel vermogen is dat zelfs aanwezig is in modellen zo klein als 1 miljard parameters, wat nieuwe inzichten biedt voor AI-veiligheid en controle.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een goochelaar ziet die een konijn uit een hoed tovert. Je vraagt je misschien af: Had de goochelaar echt van tevoren gepland om een konijn te halen, nog voordat hij de truc begon, of besloot hij pas op het moment dat hij in de hoed greep, op wonderbaarlijke wijze om een konijn te halen?
Lange tijd dachten wetenschappers dat Large Language Models (LLM's) – de AI-geesten achter tools zoals chatbots – net als goochelaars waren die niet van tevoren planden. Ze geloofden dat de AI simpelweg het volgende woord voorspelde op basis van het vorige, net als een papegaai die geluiden herhaalt, zonder enig idee waar de zin naartoe zou gaan.
Dit artikel, getiteld "Wat is het plan?", betoogt dat de AI eigenlijk een strategisch architect is, niet zomaar een papegaai. Het toont aan dat deze modellen in het geheim hun toekomstige zetten plannen terwijl ze nog spreken.
Hier is hoe de auteurs dit bewezen, met behulp van eenvoudige analogieën:
1. De Twee Soorten Plannen
De auteurs definiëren plannen in twee delen, zoals een dichter die een gedicht componeert:
- Voorwaartse Planning (Het Blauwdruk): Voordat het AI de tweede helft van een zin schrijft, creëert het een verborgen "blauwdruk" in zijn brein. Het weet: "Ik moet deze regel eindigen met een woord dat rijmt op 'kat'."
- Achterwaartse Planning (De Constructie): Terwijl het de middelste woorden van de zin schrijft, vormt het deze subtiel om ervoor te zorgen dat het die "kat"-eindiging soepel kan bereiken. Het is als een bestuurder die een afslag ziet die 100 meter verderop komt en nu al begint te vertragen en van rijbaan te wisselen, zelfs al heeft hij de afslag nog niet bereikt.
2. Het Experiment: Rijmen en Vragen
Om dit te bewijzen, vroegen de onderzoekers de AI niet om een complex essay te schrijven. Ze gaven haar twee eenvoudige taken:
- Rijmen: Ze gaven de AI de eerste regel van een gedicht en vroegen haar om de tweede regel te voltooien met een specifiek rijm (bijvoorbeeld: als de eerste regel eindigt op "baksteen", moet de tweede eindigen op "stok", "trucs" of "ziek").
- Vragen Beantwoorden: Ze stelden vragen waarbij het antwoord een specifieke grammaticaregel vereiste, zoals kiezen tussen "een" en "een" (bijvoorbeeld: "een walvis" versus "een oog").
3. De "Afstandsbediening"-Truc
Dit is het coolste deel van het artikel. De onderzoekers keken niet alleen naar de AI; ze hackten haar brein halverwege de zin.
Stel je voor dat de AI een gedicht schrijft. Net als ze de eerste regel voltooit, gebruikten de onderzoekers een "afstandsbediening" (een wiskundige vector) om het brein van de AI een duwtje te geven.
- Het Duwtje: Ze vertelden het brein van de AI: "Vergeet het rijm waar je aan dacht. Plan nu voor het rijm '-icht' (zoals licht of nacht)."
- Het Resultaat: De AI veranderde niet alleen het allerlaatste woord. Ze schreef het midden van de zin om.
- Zonder het duwtje: "Zwevend boven waar ware vreugde zal zingen."
- Met het duwtje: "Zwevend boven, badend in een gouden licht."
De AI veranderde woorden als "waar ware vreugde zal" in "badend in een gouden", omdat ze een brug moest bouwen naar de nieuwe bestemming ("licht"). Dit bewijst dat de AI het hele tijd een plan in haar hoofd hield en haar pad aanpaste om te matchen met het nieuwe plan.
4. De "Kleine Geesten"-Ontdekking
Een grote verrassing in het artikel is dat zelfs kleine AI-modellen dit doen.
Vroeger dachten wetenschappers dat alleen enorme, super-complexe modellen vooruit konden plannen. De auteurs ontdekten dat zelfs modellen met slechts 1 miljard parameters (die relatief klein zijn in de wereld van AI) dit plannen doen. Het is niet alleen een eigenschap van de "super-slimme" modellen; het is een basisgewoonte van hoe deze modellen werken.
5. De "Artikel"-Test
Ze testten dit ook met vragen zoals "Wat gebruik je om te zien?" (Antwoord: een oog).
Toen ze de AI een duwtje gaven om na te denken over "hart" (waarvoor "een" nodig is), begon de AI onmiddellijk "een" te gebruiken in plaats van "een", voordat ze zelfs het woord "hart" had geschreven.
Dit is als iemand die zegt: "Ik wil een..." en dan pauzeert om na te denken over een woord dat begint met een medeklinker, in plaats van te zeggen: "Ik wil een..." en dan te beseffen dat ze een fout hebben gemaakt. De AI kende de bestemming voordat ze de reis begon.
Samenvatting
Het artikel beweert dat:
- AI vooruit plant: Het creëert een verborgen kaart van waar het naartoe wil voordat het daar aankomt.
- Het past het pad aan: Als je halverwege de reis de bestemming verandert, verandert de AI de stappen die het neemt om daar te komen, niet alleen de laatste stap.
- Het is overal: Dit gebeurt in kleine en grote modellen, in poëzie en in simpele vragen.
De auteurs gebruikten dit in dit specifieke artikel niet om nieuwe apps te bouwen of veiligheidsproblemen op te lossen; ze wilden gewoon bewijzen dat de "magie" van AI niet zomaar willekeurig gissen is – het is een vorm van verborgen, impliciete planning.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.