← Nieuwste papers
🤖 AI

Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning

Dit artikel stelt een verenigd driestaps trainingsparadigma voor dat toekomstbewuste planning internaliseert in LLM-agenten door eerst latente predictieve capaciteiten te injecteren, deze vervolgens te structureren door middel van format-eliciterend toezicht, en tot slot hun kalibratie te verfijnen via foresight-geconditioneerd reinforcement learning, waardoor de beperkingen van reactieve agenten worden overwonnen en gegrond, langetermijn besluitvorming wordt bereikt.

Oorspronkelijke auteurs: Xuan Zhang, Zhijian Zhou, Lingfeng Qiao, Yulei Qin, Ke Li, Xing Sun, Xiaoyu Tan, Chao Qu, Yuan Qi

Gepubliceerd 2026-06-29
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xuan Zhang, Zhijian Zhou, Lingfeng Qiao, Yulei Qin, Ke Li, Xing Sun, Xiaoyu Tan, Chao Qu, Yuan Qi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme robot leert om complexe puzzels op te lossen, zoals het vinden van een specifiek feit op het internet of het oplossen van een lastig wiskundig probleem.

Momenteel werken de meeste van deze robots als een reactieve bestuurder. Ze zien een verkeerslicht op rood springen, dus trappen ze op de rem. Ze zien een vraag, dus typen ze direct een antwoord. Ze zijn snel, maar ze "denken niet vooruit". Als ze een verkeerde afslag nemen, merken ze dat vaak pas op als ze al een ongeluk hebben veroorzaakt.

De onderzoekers in dit artikel wilden deze robots leren om meer te zijn als menselijke bestuurders. Mensen reageren niet alleen; wij draaien een "mentale simulatie". Voordat we het stuur omdraaien, vragen we onszelf af: "Als ik hier links af sla, rijd ik dan tegen die vrachtwagen aan? Als ik rechtdoor ga, kom ik dan in de file terecht?" We proberen verschillende paden in ons hoofd uit voordat we daadwerkelijk in beweging komen.

Het artikel stelt dat huidige AI-agenten dit gebrek aan "mentale simulatie" of intern wereldmodel hebben. Ze kunnen zich de toekomstige gevolgen van hun acties niet echt voorstellen.

Het Probleem: De "Fake It Till You Make It" Valstrik

De onderzoekers probeerden eerst een eenvoudige oplossing: ze zeiden simpelweg tegen de AI: "Schrijf voordat je antwoord geeft een plan voor wat je denkt dat er hierna zal gebeuren."

Ze stuitten op een probleem dat ze de "Format-Capability Gap" noemen.

Denk eraan als het leren van een student om een filmscript te schrijven. Als je hen alleen vertelt: "Schrijf een script met een held, een schurk en een plotwending," dan schrijven ze misschien een script dat op papier perfect lijkt. Maar als je hen vraagt om de scène daadwerkelijk uit te spelen, kunnen ze struikelen omdat ze niet echt begrijpen hoe de personages bewegen of spreken. Ze imiteren slechts het formaat van een plan zonder de werkelijke capaciteit te hebben om de toekomst te voorspellen.

In het geval van de AI begon de AI "plannen" te schrijven die er goed uitzagen, maar die vol stonden met onzin (hallucinaties). De AI zei bijvoorbeeld: "Ik zal zoeken naar X, en dan Y vinden," maar de AI wist eigenlijk niet of zoeken naar X wel tot Y zou leiden. Het was gewoon aan het gokken.

De Oplossing: Een Trainingskamp van Drie Fasen

Om dit op te lossen, creëerden de onderzoekers een speciaal driestappenprogramma om de AI te leren hoe ze echt "vooruit moet denken" en vervolgens kan handelen op basis van die gedachte. Ze noemen dit World Model Agentic Training.

Fase 1: De "Mentale Gym" (World Model Agentic Mid-Training)

Voordat de AI leert om over haar plannen te praten, moet ze eerst leren om plannen te hebben.

  • De Analogie: Stel je een piloot voor die traint in een vluchtsimulator. Ze lezen niet alleen het handboek; ze brengen duizenden uren door in virtuele vliegtuigen, waarbij ze zien wat er gebeurt als ze de hendel te ver naar achteren trekken of in een storm vliegen.
  • Wat de onderzoekers deden: Ze voerden de AI enorme hoeveelheden data waarin de "toekomst" al bekend was. Ze dwongen de AI om naar een huidige situatie te kijken en een samenvatting te schrijven van wat er daarna in de echte wereld daadwerkelijk gebeurde, samen met een betrouwbaarheidsscore (bijv. "Ik ben 85% zeker dat deze zoekopdracht het antwoord zal vinden").
  • Het Resultaat: De AI stopte met simpelweg gokken en begon een echt, intern begrip van oorzaak en gevolg op te bouwen. Het leerde de "physics" van de taak.

Fase 2: De "Scriptschrijver" (Format-Eliciting SFT)

Nu de AI de capaciteit heeft om de toekomst te voorspellen, moet ze leren hoe ze dat moet tonen.

  • De Analogie: De piloot weet nu hoe hij moet vliegen, maar moet nu leren hoe hij een vluchtplan in het juiste formaat indient, zodat de luchtverkeersleiding hem kan begrijpen.
  • Wat de onderzoekers deden: Ze leerden de AI een specifieke structuur te volgen. Voordat de AI een actie onderneemt, moet ze een "World Model Block" genereren die zegt: "Dit is mijn voorspelde pad, dit zijn de zoekwoorden waar ik naar zoek, en dit is mijn betrouwbaarheidsniveau."
  • Het Resultaat: De AI leerde haar interne gedachten duidelijk te verwoorden, waarbij de "verbeelding" werd gescheiden van de "actie".

Fase 3: De "Coach met een Stopwatch" (Foresight-Conditioned RL)

Ten slotte moesten ze ervoor zorgen dat de voorspellingen van de AI eerlijk en nuttig waren.

  • De Analogie: Stel je een coach voor die de piloot observeert. Als de piloot zegt: "Ik ben 100% zeker dat ik kan landen in een orkaan," maar hij crasht, dan krijgt de coach de piloot een strafpunten. Als de piloot zegt: "Ik ben 50% zeker, maar ik ga het proberen," en hij landt veilig, dan krijgt hij een beloning.
  • Wat de onderzoekers deden: Ze gebruikten een beloningssysteem dat twee dingen controleerde:
    1. Grounding (Verankering): Zijn de dingen die de AI voorspelde ook daadwerkelijk gebeurd? (Als de AI een specifieke naam voorspelde, is die naam dan ook echt gevonden?)
    2. Calibration (Kalibratie): Was de betrouwbaarheidsscore van de AI accuraat? (Als de AI zei "90% zeker" en het was fout, kreeg het een straf. Als de AI zei "50% zeker" en het was juist, kreeg het een beloning.)
  • Het Resultal: De AI leerde bescheiden te zijn wanneer ze onzeker was en zelfverzekerd wanneer ze het bij het rechte eind was. Ze stopte met het maken van wilde gokken.

De Resultaten: Slimere, Veiligere Agenten

De onderzoekers testten deze nieuwe trainingsmethode op twee soorten taken:

  1. Zoeken: Het vinden van antwoorden op complexe vragen die vereisen dat er op meerdere stukken informatie wordt gezocht.
  2. Wiskunde: Het oplossen van moeilijke wiskundige problemen.

De bevindingen waren duidelijk:

  • De AI die getraind was met deze driefasenmethode was aanzienlijk beter in het oplossen van deze problemen dan AI die met standaardmethoden is getraind.
  • Het was vooral goed in multi-step reasoning (taken die veel stappen vereisen). Het raakte niet verdwaald in het midden van het proces.
  • Het belangrijkste was dat de betrouwbaarheidsscores van de AI betrouwbaar werden. Wanneer de AI zei: "Ik ben 90% zeker," was het meestal ook echt zo. Wanneer de AI zei: "Ik ben slechts 10% zeker," dan was de AI meestal aan het worstelen of stond het op het punt een fout te maken.

Samenvatting

Het artikel laat zien dat je een AI niet simpelweg kunt vertellen om "vooruit te denken" en verwachten dat het werkt. Je moet de AI eerst leren hoe ze de toekomst kan simuleren (Fase 1), haar vervolgens leren hoe ze die gedachten kan opschrijven (Fase 2), en haar tot slot trainen om eerlijk te zijn over hoe zeker ze is (Fase 3). Door dit te doen, creëerden ze een AI-agent die niet alleen reageert op de wereld, maar er ook een plan voor maakt, precies zoals een mens dat doet.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →