← Nieuwste papers
🤖 AI

Inference-Time Scaling of Verification: Self-Evolving Deep Research Agents via Test-Time Rubric-Guided Verification

Dit artikel introduceert DeepVerifier, een zelfevoluerend raamwerk dat Deep Research Agents verbetert door inferentie-tijdsschaalvergroting via iteratieve verificatie en verfijning van outputs met behulp van rubrieken afgeleid van een nieuwe taxonomie van fouten, waardoor aanzienlijke nauwkeurigheidswinsten worden behaald zonder extra training, terwijl een overeenkomstige dataset wordt vrijgegeven ter ondersteuning van open-source vooruitgang.

Oorspronkelijke auteurs: Yuxuan Wan, Tianqing Fang, Zaitang Li, Yintong Huo, Wenxuan Wang, Haitao Mi, Dong Yu, Michael R. Lyu

Gepubliceerd 2026-04-30
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yuxuan Wan, Tianqing Fang, Zaitang Li, Yintong Huo, Wenxuan Wang, Haitao Mi, Dong Yu, Michael R. Lyu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante, maar soms overmoedige onderzoeksassistent hebt met de naam "Deep Research Agent" (DRA). Deze assistent is uitstekend in het vinden van informatie, het lezen van honderden websites en het schrijven van rapporten. Maar zoals elke mens maken ze soms fouten: ze kunnen de verkeerde website lezen, een vraag verkeerd interpreteren of zelfverzekerd een feit stellen dat niet waar is.

Meestal, als deze assistent een fout maakt, moet je hen stoppen, uitleggen wat er misging en hopen dat ze de volgende keer beter presteren. Maar wat als de assistent zijn eigen werk zou kunnen controleren voordat jij het zelfs maar ziet, zijn eigen fouten zou vinden en deze direct zou kunnen herstellen?

Dat is precies wat dit paper voorstelt. Ze hebben een systeem gebouwd dat DeepVerifier heet en fungeert als een "zelfcorrigerende redacteur" voor deze AI-agenten.

Hier is hoe het werkt, opgesplitst in eenvoudige concepten:

1. Het Probleem: De "Alles-of-Niets"-Valstrik

Wanneer een AI probeert een moeilijk probleem op te lossen (zoals "Vind de vroegste publicatie van een specifieke onderzoeker"), raakt hij vaak verdwaald in een doolhof van stappen. Als je een standaard-AI vraagt "te controleren of dit antwoord juist is", faalt hij vaak omdat het controleren van een complex antwoord even moeilijk is als het probleem in eerste instantie op te lossen. Het is alsof je een student vraagt zijn eigen 50 pagina's tellende essay te beoordelen zonder beoordelingsformulier; ze kunnen subtiele fouten missen.

2. De Oplossing: Het "Beoordelingsformulier" en de "Stempel"

De onderzoekers beseften dat het controleren van een antwoord eigenlijk makkelijker is dan het creëren ervan. Ze noemen dit de "asymmetrie van verificatie".

Om dit werkbaar te maken, creëerden ze een Foutentaxonomie. Denk hierbij aan een enorme checklist van elke manier waarop een AI het kan verklootten. Ze analyseerden duizenden eerdere fouten en categoriseerden ze in 5 hoofdgroepen en 13 subgroepen (bijvoorbeeld "Verkeerde bron gebruikt", "Instructies verkeerd gelezen" of "Een feit verzonnen").

DeepVerifier gebruikt deze checklist als een strenge redacteur:

  • De Decomponeerder: In plaats van de AI te vragen het hele rommelige rapport opnieuw te lezen, breekt deze module het probleem op in kleine, simpele vragen. In plaats van "Is het hele rapport juist?", vraagt hij: "Zei Bron X echt Y?" of "Is dit getal correct in het laatste rapport?"
  • De Verificator: Hij beantwoordt deze kleine vragen aan de hand van de checklist.
  • De Rechter: Hij geeft een score (1 tot 4) en specifieke feedback. Als het antwoord fout is, zegt hij niet zomaar "Nee". Hij zegt: "Je hebt de verkeerde bron gebruikt voor dit feit. Ga terug en vind het originele document."

3. De Magie: "Zelf-ontwikkeling" tijdens het Testen

Het coolste deel is dat dit gebeurt terwijl de AI aan het werk is, zonder dat de hersenen van de AI opnieuw getraind hoeven te worden (wat duur en traag is).

Stel je voor dat de AI een antwoord schrijft. DeepVerifier leest het, vindt een gebrek en zegt: "Hé, je hebt dit detail gemist." De AI gebruikt die feedback vervolgens om het antwoord te herschrijven. Ze doen dit in een lus (zoals een ronde redactie).

  • Ronde 1: AI schrijft antwoord.
  • Ronde 2: DeepVerifier vindt fouten, AI herstelt ze.
  • Ronde 3: DeepVerifier vindt meer subtiele fouten, AI herstelt opnieuw.

Het paper toont aan dat met slechts een paar rondes van deze "zelf-redactie", de AI aanzienlijk slimmer wordt. Bij moeilijke tests (zoals de GAIA-benchmark) steeg de nauwkeurigheid van de AI met 8% tot 11%. Dat is een enorme sprong voor een AI die niet opnieuw getraind werd, maar gewoon een betere manier kreeg om zijn eigen werk te controleren.

4. Het Cadeau aan de Gemeenschap: "DeepVerifier-4K"

De onderzoekers hielden deze truc niet voor zichzelf. Ze beseften dat open-source AI-modellen (de gratis versies) om goed te worden in deze zelfcontrole, oefening nodig hebben.

Dus creëerden ze een dataset genaamd DeepVerifier-4K. Denk hierbij aan een "trainingshandleiding" met 4.646 voorbeelden van:

  • Een AI die een fout maakt.
  • De "Redacteur" (DeepVerifier) die precies aangeeft wat er misging aan de hand van de checklist.
  • De AI die de fout herstelt.

Ze gebruikten deze handleiding om open-source modellen te leren hoe ze hun eigen redacteuren kunnen zijn. Het resultaat? Deze open modellen werden veel beter in redeneren en het opsporen van hun eigen fouten, waardoor de kloof met de dure, gesloten bron-modellen werd gedicht.

Samenvatting

Kortom, dit paper leert AI-agenten om te stoppen en na te denken voordat ze hun werk indienen. Door grote problemen op te splitsen in kleine, controleerbare feiten en een strenge checklist van veelgemaakte fouten te gebruiken, kan de AI zichzelf corrigeren in real-time. Het is alsof je de AI een spiegel en een regelboek geeft, waardoor het zijn antwoorden direct kan laten evolueren en verbeteren, zonder dat een leraar nodig is om het vanaf nul opnieuw te trainen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →