← Nieuwste papers
🤖 AI

Reasoning While Asking: Transforming Reasoning Large Language Models from Passive Solvers to Proactive Inquirers

Dit artikel introduceert Proactieve Interactieve Redenering (PIR), een nieuw paradigma dat redenerende LLM's transformeert van passieve oplossers naar proactieve onderzoekers door interne redenering te verweven met gebruikersverduidelijking om onzekerheid over premissen en intenties aan te pakken, waardoor de nauwkeurigheid en efficiëntie aanzienlijk worden verbeterd en de rekenkosten worden verlaagd.

Oorspronkelijke auteurs: Xin Chen, Feng Jiang, Yiqian Zhang, Hardy Chen, Shuo Yan, Wenya Xie, Min Yang, Shujian Huang

Gepubliceerd 2026-05-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xin Chen, Feng Jiang, Yiqian Zhang, Hardy Chen, Shuo Yan, Wenya Xie, Min Yang, Shujian Huang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Probleem: De "Overdenkende" Student

Stel je voor dat je een leraar bent die een student vraagt een wiskundeprobleem op te lossen. De student is ongelooflijk slim en heeft duizenden formules uit het hoofd geleerd. Ze hebben echter een vreemde gewoonte: ze vragen nooit om verduidelijking.

Als je zegt: "Fix het datascript," vraagt de student niet: "Welk script? Welk formaat?" In plaats daarvan beginnen ze direct met het schrijven van een essay van 2.000 woorden waarin ze raden wat je bedoeld zou kunnen hebben. Ze raden misschien het verkeerde script, komen vast te zitten, hallucineren een oplossing die er goed uitziet maar fout is, en verspillen enorm veel tijd en energie. Dit noemt het artikel "Blind Zelf-denken." Huidige AI-modellen zijn als deze student: ze zijn zo enthousiast om na te denken dat ze vergeten te controleren of ze eigenlijk wel alle feiten hebben.

De Oplossing: De "Proactieve Detective" (PIR)

De auteurs stellen een nieuwe manier voor voor hoe AI moet werken, genaamd Proactieve Interactieve Redenering (PIR). In plaats van een passieve oplosser te zijn die gewoon raadt, wordt de AI een proactieve detective.

Denk hierbij aan een detective die een misdaad oplost. Als een getuige zegt: "Ik zag een auto," schrijft de detective niet direct een rapport over "De Blauwe Sedan." In plaats daarvan vraagt de detective: "Wat voor kleur was het? Rijdde het te hard? Heb je het kenteken gezien?"

PIR leert de AI hetzelfde te doen:

  1. Pauzeer en Controleer: Voordat de AI een lang redeneerproces start, controleert ze haar eigen vertrouwen. "Weet ik eigenlijk wel genoeg om dit op te lossen?"
  2. Vraag Eerst: Als de AI zich onzeker voelt (zoals een detective die een aanwijzing mist), stopt ze en stelt ze de gebruiker een specifieke vraag om de ontbrekende informatie te krijgen.
  3. Los Efficiënt Op: Zodra de gebruiker antwoordt, gebruikt de AI die nieuwe informatie om het probleem snel en nauwkeurig op te lossen, zonder tijd te verspillen aan wilde gissingen.

Hoe Ze de AI Dit Leren

De onderzoekers vertelden de AI niet zomaar om "vragen te stellen". Ze bouwden een trainingszaal met twee specifieke fases:

Fase 1: De "Script"-training (Supervised Fine-Tuning)
Stel je voor dat je een nieuwe werknemer leert door ze een script te geven. De onderzoekers namen bestaande problemen en voegden kunstmatig "momenten van twijfel" toe waar de AI een vraag had moeten stellen. Vervolgens schreven ze een script waarin de AI vraagt: "Wat bedoel je?" en de gebruiker antwoordt. De AI oefende met het lezen van deze scripts totdat ze het patroon leerde van wanneer ze moet stoppen en vragen.

Fase 2: De "Simulatie"-training (User-Simulator Optimization)
Dit is het slimme deel. Je kunt een AI niet trainen door ze 24/7 met echte mensen te laten praten (het is te traag en te duur). Dus bouwden de onderzoekers een Gebruikssimulator – een tweede AI die zo geprogrammeerd is dat ze zich gedraagt als een menselijke gebruiker.

  • Ze creëerden een spel waarbij de hoofd-AI probeert een probleem op te lossen en de Simulator-AI optreedt als de gebruiker.
  • Als de hoofd-AI een goede vraag stelt die snel het juiste antwoord oplevert, krijgt ze een hoge score (een "beloning").
  • Als de hoofd-AI te veel vragen stelt of blindelings raadt, krijgt ze een lage score.
  • Na verloop van tijd leert de AI de perfecte balans: net genoeg vragen om zeker te zijn, maar niet zo veel dat het de gebruiker irriteert.

De Resultaten: Sneller, Slimmer en Minder Verspilling

Het artikel testte deze nieuwe "Detective-AI" op drie soorten taken: Wiskunde, Programmeren en Documenten Bewerken. Hier is wat er gebeurde in vergelijking met de oude "Overdenkende" AI:

  • Betere Nauwkeurigheid: De nieuwe AI kreeg veel vaker het juiste antwoord (tot 32% beter in sommige wiskundetoetsen) omdat ze niet gokte op ontbrekende informatie.
  • Minder Verspilling: Ze gebruikte ongeveer de helft van de rekenkracht (tokens). In plaats van een gissing van 2.000 woorden te schrijven, stelde ze één vraag en schreef een oplossing van 500 woorden.
  • Minder Ronden: Hoewel ze vragen stelde, was het totale aantal heen-en-weer berichten lager. Dit komt omdat ze het probleem correct op de eerste keer oploste, in plaats van later terug te moeten gaan om een verkeerde gissing te herstellen.
  • Realiteitstest: Bij een blinde test met echte mensen gaven deelnemers de voorkeur aan de nieuwe AI. Ze vonden het fijn dat ze niet "hallucineerde" (dingen verzon) wanneer informatie ontbrak. Ze vonden dat ze behulpzamer en efficiënter was.

Samenvatting

Het artikel introduceert een systeem dat AI verhindert om "blind te overdenken". Door de AI te trainen om te herkennen wanneer ze in de war is en om om hulp te vragen voordat ze raadt, wordt ze een efficiëntere, nauwkeurigere en gebruiksvriendelijkere partner. Het transformeert de AI van een student die het antwoord raadt naar een detective die eerst de feiten verzamelt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →