← Nieuwste papers
💬 NLP

Pause or Fabricate? Training Language Models for Grounded Reasoning

Dit paper introduceert GRIL, een interactief versterkingsleerframework dat taalmodellen leert om bij onvolledige informatie proactief te pauzeren en verduidelijking te vragen in plaats van te hallucineren, wat leidt tot aanzienlijk betere prestaties en kortere antwoorden.

Oorspronkelijke auteurs: Yiwen Qiu, Linjuan Wu, Yizhou Liu, Yuchen Yan, Jin Ma, Xu Tan, Yao Hu, Daoxin Zhang, Wenqi Zhang, Weiming Lu, Jun Xiao, Yongliang Shen

Gepubliceerd 2026-04-22
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yiwen Qiu, Linjuan Wu, Yizhou Liu, Yuchen Yan, Jin Ma, Xu Tan, Yao Hu, Daoxin Zhang, Wenqi Zhang, Weiming Lu, Jun Xiao, Yongliang Shen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stop of Verzinnen? Hoe AI leert om eerlijk te zijn als het niet genoeg weet

Stel je voor dat je een detective bent die een mysterie moet oplossen. Je krijgt een dossier van je chef, maar er ontbreekt een cruciaal stukje informatie: je weet niet hoe oud de verdachte was op het moment van de misdaad.

Een gewone, ongetrainde AI (zoals de oude versies van grote taalmodellen) zou in deze situatie waarschijnlijk doen alsof het een genie is. Het zou denken: "Oké, ik heb geen leeftijd, maar ik ga gewoon een getal verzinnen, bijvoorbeeld 30. Dan ga ik mijn hele redenering opbouwen rond die 30, en ik zal het antwoord heel zelfverzekerd geven."

Dit noemen de auteurs van dit paper "ongegrond redeneren". Het is alsof je een huis bouwt op een fundering die je hebt verzonnen. Het ziet er misschien mooi uit, maar het staat op instorten zodra je de echte waarheid kent. Het probleem is niet dat de AI niet slim genoeg is om te rekenen; het probleem is dat het niet weet wanneer het moet stoppen en moet zeggen: "Hé, ik heb meer info nodig!"

De Oplossing: GRIL (De Slimme Detective)

De onderzoekers van de Universiteit van Zhejiang en Tencent hebben een nieuwe methode bedacht, genaamd GRIL. Ze hebben de AI getraind om te leren tussen twee opties te kiezen:

  1. Doorgaan met redeneren (als je alle stukjes van de puzzel hebt).
  2. Stoppen en vragen stellen (als je merkt dat er stukjes ontbreken).

Ze hebben dit gedaan met een soort "virtuele trainingsomgeving" die werkt als een spelletje:

  • De "Stop en Vraag" fase: Als de AI een vraag krijgt met ontbrekende info, krijgt ze een beloning als ze snel stopt en vraagt: "Ik heb meer info nodig." Als ze toch doorgaat en iets verzint, krijgt ze een straf.
  • De "Oplossing" fase: Pas als de AI de ontbrekende info heeft gekregen (bijvoorbeeld van de "trainer"), mag ze het probleem oplossen. Als het antwoord dan klopt, krijgt ze een grote beloning.

Waarom is dit zo slim? (De Analogie van de Bakker)

Stel je voor dat je een bakker bent die een taart moet maken.

  • De oude AI: Je vraagt: "Hoeveel suiker moet ik doen?" De AI zegt: "Geen idee, maar ik ga 500 gram doen en dan bak ik de taart." De taart is een ramp, maar de AI zegt: "Kijk, ik heb een taart gemaakt!"
  • De nieuwe AI (met GRIL): Je vraagt: "Hoeveel suiker moet ik doen?" De AI zegt: "Wacht even, in het recept staat dat niet. Ik kan geen taart bakken zonder dat ik weet hoeveel suiker er in moet. Kunnen we dat eerst checken?"

Zodra je zegt: "Ah, het zijn 200 gram!", zegt de AI: "Oké, nu weet ik het. Ik ga de taart bakken." En deze taart is perfect.

Wat levert dit op?

De resultaten van het paper zijn indrukwekkend:

  1. Minder verzinnen: De AI leert dat het beter is om te zeggen "Ik weet het niet" dan om een onzinverhaal te vertellen. Ze worden veel beter in het detecteren van ontbrekende info (soms wel tot 90% beter!).
  2. Sneller en korter: Omdat ze niet meer urenlang (of in dit geval: duizenden woorden) doorgaan met het verzinnen van een oplossing die onmogelijk is, worden hun antwoorden korter en efficiënter. Ze verspillen geen tijd aan "hallucinaties".
  3. Beter op de echte wereld: In het echte leven krijgen we vaak onvolledige vragen. Mensen zeggen dingen als "Ik wil een auto kopen, maar ik heb geen budget." Een oude AI zou zeggen: "Koop dan een Ferrari!" (verzonnen budget). Een GRIL-AI zegt: "Wat is je budget?"

Conclusie

Dit paper laat zien dat het grootste probleem van AI niet altijd is dat ze "dom" zijn, maar dat ze te zelfverzekerd zijn. Ze willen graag een antwoord geven, zelfs als ze niet genoeg informatie hebben.

GRIL leert de AI de kunst van het nederig zijn. Het leert ze dat het slimste wat je kunt doen, soms niet het antwoord geven is, maar het erkennen dat je meer informatie nodig hebt voordat je überhaupt begint met denken. Het is een stap in de richting van AI die niet alleen slim is, maar ook betrouwbaar.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →