← Nieuwste papers
🤖 machine learning

Interactive Critique-Revision Training for Reliable Structured LLM Generation

Dit artikel stelt DPA-GRPO voor, een dubbele gepaarde actie-trainingsmethode voor een generator-verificator-spel dat veiligheidszorgzaken en contrafactuele actiegroepen gebruikt om gestructureerde LLM-outputs te optimaliseren, waarbij verbeterde nauwkeurigheid, foutdetectie en gekalibreerd revisiegedrag worden aangetoond op de TaxCalcBench TY24-benchmark.

Oorspronkelijke auteurs: Fei Xu Yu, Zuyuan Zhang, Mahdi Imani, Nathaniel D. Bastian, Tian Lan

Gepubliceerd 2026-05-12
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Fei Xu Yu, Zuyuan Zhang, Mahdi Imani, Nathaniel D. Bastian, Tian Lan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer ingewikkelde, hoog-risico belastingformulier probeert in te vullen. Je hebt een slimme assistent (de Generator) die de cijfers opschrijft, en een strenge auditor (de Verifier) die het werk controleert.

In het verleden, als je een AI vroeg dit te doen, zou het gewoon de cijfers opschrijven en hopen op het beste. Soms zou het het goed hebben; soms zou het een domme fout maken, en zou niemand het opmerken. Andere methoden probeerden de AI zichzelf te laten "debatteren", maar dat leidde vaak ertoe dat de AI zichzelf overtuigde van verkeerde antwoorden met ingewikkeld klinkende maar neppe argumenten.

Dit artikel introduceert een nieuwe trainingsmethode genaamd DPA-GRPO. Denk hierbij aan een strenge "repetitie" waarbij de Assistent en de Auditor leren samenwerken als een team, niet alleen als twee mensen die tegen elkaar schreeuwen.

Hier is hoe het systeem werkt, opgesplitst in eenvoudige concepten:

1. De Twee Spelers: De Tekenaar en De Inspecteur

  • De Generator (De Tekenaar): Deze AI bekijkt het belastingformulier en stelt een antwoord voor (bijvoorbeeld: "Je studieleningaftrek is $3.000").
  • De Verifier (De Inspecteur): Deze AI bekijkt het antwoord van de Tekenaar. Het heeft twee keuzes:
    • Stil blijven: "Lijkt goed, ik keur het goed."
    • Een vlag heffen (SAC): "Wacht even! Ik heb een fout gevonden." Cruciaal: wanneer het een vlag heft, kan het niet alleen zeggen "Je hebt het fout". Het moet een Safety Assurance Case (SAC) leveren. Dit is als een formeel memo dat bevat:
      • De Claim: "Het getal is te hoog."
      • Het Argument: "De wet zegt dat het maximum $2.500 is."
      • Het Bewijs: "Hier is de bon die aantoont dat je $3.000 hebt betaald."

2. De "Tweede Kans"-lus

Als de Inspecteur een vlag heft, krijgt de Tekenaar een tweede kans. Het kan:

  • Behouden: "Ik sta achter mijn oorspronkelijke antwoord; je vlag was een vergissing."
  • Herzien: "Je hebt gelijk, ik heb een rekenfout gemaakt. Hier is het gecorrigeerde getal."

3. Het Trainingspel (De "Coach")

De magie van dit artikel zit in hoe ze de AI leren. Ze zeggen niet alleen "Goed gedaan" of "Slecht gedaan". Ze spelen een spel waarbij de AI leert van wat had kunnen gebeuren (tegenfeitelijke scenario's).

Stel je een coach voor die een oefenwedstrijd bekijkt:

  • Scenario A: De Tekenaar krijgt het goed, en de Inspecteur blijft stil. (Perfect!) De coach beloont beiden.
  • Scenario B: De Tekenaar krijgt het fout, en de Inspecteur mist de fout. (Slecht!) De coach vertelt de Inspecteur: "Je had een vlag moeten heffen!"
  • Scenario C: De Tekenaar krijgt het goed, maar de Inspecteur ten onrechte een vlag heft. (Slecht!) De coach vertelt de Inspecteur: "Stop met paranoïde te zijn; dat antwoord was correct."
  • Scenario D: De Inspecteur heft een vlag, en de Tekenaar corrigeert de fout. (Goed!) Beide krijgen een beloning voor het teamwork.
  • Scenario E: De Inspecteur heft een vlag, maar de "correctie" van de Tekenaar maakt het erger. (Slecht!) De coach vertelt de Tekenaar: "Verander niet zomaar dingen omdat iemand schreeuwt; controleer of de verandering echt beter is."

Het systeem gebruikt een wiskundige formule (GRPO) om de "hersenen" van de AI aan te passen, zodat het leert:

  1. Het antwoord de eerste keer goed te krijgen.
  2. Alleen vlaggen te heffen wanneer ze echt nodig zijn.
  3. Alleen het antwoord te veranderen als de verandering echt een verbetering is.

4. De Resultaten: Een Beter Team

De onderzoekers testten dit op een benchmark genaamd TaxCalcBench, die het invullen van Amerikaanse belastingformulieren simuleert. Ze vergeleken hun nieuwe methode met:

  • Zero-shot: De AI die gewoon raadt zonder training.
  • Oude methoden: Alleen de Tekenaar trainen om beter te worden, zonder een toegewijde Inspecteur.

De bevindingen waren duidelijk:

  • Het nieuwe "Team" (DPA-GRPO) kreeg aanzienlijk meer antwoorden correct dan de solistische Tekenaar of de ongetrainde AI.
  • De Inspecteur leerde stoppen met "wolf te schreeuwen" (valse alarmen heffen) en begon de echte fouten te vangen die het eerder miste.
  • De Tekenaar leerde slimmer te zijn over wanneer het zijn antwoord moet veranderen, in plaats van blindelings elke correctie te gehoorzamen.

De Conclusie

Dit artikel stelt een manier voor om AI betrouwbaarder te maken in gestructureerde taken (zoals het invullen van formulieren) door het proces om te zetten in een coöperatief spel tussen een schepper en een criticus. In plaats van alleen maar te hopen dat de AI het goed heeft, leren ze de AI om te redeneren, bewijs te controleren en zijn werk te herzien op een gestructureerde, gedisciplineerde manier, wat resulteert in minder fouten en meer betrouwbare output.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →