← Nieuwste papers
🤖 AI

Why Your Deep Research Agent Fails? On Hallucination Evaluation in Full Research Trajectory

Dit artikel adresseert de beperkingen van uitkomstgebaseerde evaluatie bij Deep Research Agents door de PING-taxonomie en de DeepHalluBench-benchmark in te voeren om procesbewuste, gedetailleerde auditing van hallucinaties over de volledige onderzoekstrajectory mogelijk te maken, waardoor systematische betrouwbaarheidskloven worden blootgelegd en er bruikbare inzichten worden geboden voor architecturale verbeteringen.

Oorspronkelijke auteurs: Yuhao Zhan, Tianyu Fan, Linxuan Huang, Zirui Guo, Chao Huang

Gepubliceerd 2026-05-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yuhao Zhan, Tianyu Fan, Linxuan Huang, Zirui Guo, Chao Huang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligent onderzoeksassistent huurt om het antwoord op een zeer lastige vraag te vinden. Je vraagt hen: "Wie is de enige persoon die een Oscar heeft gewonnen voor acteren in een film die ze ook zelf hebben geregisseerd?" Zij gaan aan de slag, zoeken op internet, lezen artikelen en komen terug met een definitief rapport.

De oude manier van controleren:
Vroeger, als je wilde weten of je assistent goed was, keek je alleen naar het eindrapport. Als de naam klopte, kregen ze een gouden ster. Als de naam verkeerd was, kregen ze een rode X.

Het probleem:
Dit artikel stelt dat alleen kijken naar het eindantwoord hetzelfde is als een kok beoordelen op basis van de smaak van de soep, zonder te kijken hoe ze het hebben bereid. Misschien smaakte de soep slecht omdat ze het zout waren vergeten (een kleine fout), of misschien gebruikten ze een rotte tomaat die ze achterin de koelkast vonden (een grote leugen), of misschien begonnen ze helemaal het verkeerde gerecht te koken omdat ze je bestelling verkeerd hadden begrepen.

De auteurs zeggen dat huidige "Deep Research Agents" (AI-onderzoekers) fouten maken tijdens het proces, maar omdat we alleen het eindantwoord controleren, zien we niet waar of waarom ze falen. De fouten verbergen zich in het midden.

De nieuwe aanpak: De "Procesdetective"

De auteurs hebben een nieuw systeem gebouwd dat DeepHalluBench heet. Denk hierbij aan een transparante keuken waar we de assistent stap voor stap kunnen zien koken. Ze controleren niet alleen de soep; ze controleren elk ingrediënt, elke snede en elke roerbeweging.

Ze hebben een nieuwe regelcode ontwikkeld, de PING-taxonomie, om de verschillende manieren waarop de AI in de war raakt, te categoriseren. Hier is wat PING betekent, met eenvoudige analogieën:

  1. P - Propagatie (Het "Dominovoorbeeld"):
    Stel je voor dat de assistent in stap één een kleine fout maakt, zoals denken dat "Appels blauw zijn". In stap twee gebruiken ze dat verkeerde idee om te zoeken naar "Blauwe Appels". In stap drie schrijven ze een rapport over "Blauwe Appels". De hele keten van gebeurtenissen is gebouwd op die eerste leugen. Dit is Propagatie. Het artikel vond dat zodra een AI begint te liegen, het vaak voortbouwt op die leugen, waardoor het eindrapport volledig verkeerd is, zelfs als de latere stappen "correct" zijn uitgevoerd op basis van de verkeerde informatie.

  2. I - Intentie (Het "Verkeerd begrepen verzoek"):
    Je vroeg om een "veganistisch" recept, maar de assistent negeerde dat woord en gaf je een biefstukrecept. Of je vroeg om een rapport uit "2023", en ze gaven je een uit "2010". De assistent deed het onderzoek, maar luisterde niet naar jouw specifieke regels. Dit is Intentie-hallucinatie.

  3. N - Door ruis veroorzaakt (De "Afgeleide bibliothecaris"):
    Stel je voor dat de assistent naar de bibliotheek gaat en 100 boeken vindt. 99 daarvan gaan over katten, maar 1 gaat over de specifieke hond waar je naar vroeg. De assistent leest alle 99 kattenboeken en negeert het ene hondboek omdat het begraven ligt in de stapel. Ze hebben niet gelogen, maar ze hebben de belangrijkste aanwijzing gemist. Dit is Door ruis veroorzaakte hallucinatie.

  4. G - Gronding (De "Valse feit"):
    De assistent kijkt naar een echt artikel, maar zegt dan: "Dit artikel zegt dat de maan van kaas is gemaakt." Het artikel zegt eigenlijk niets over kaas. De assistent verzint dingen of schuift de schuld aan de verkeerde bron. Dit is Gronding-hallucinatie.

Wat ze vonden (De resultaten)

De auteurs testten zes beroemde AI-onderzoeksassistenten (zoals die van OpenAI, Google en anderen) met hun nieuwe "Procesdetective"-systeem op 100 zeer moeilijke vragen.

  • Iedereen heeft moeite: Zelfs de beste AI-assistenten maakten fouten halverwege hun onderzoek. Geen enkele was perfect.
  • De "Domino" is het grootste probleem: Het gevaarlijkste probleem was niet alleen het maken van één leugen; het was dat de AI vroeg een kleine fout maakte, waarna de rest van het onderzoek op die fout werd gebouwd, wat leidde tot een totale mislukking.
  • Ze blijven steken in het eerste dat ze zien: De AI concentreert zich sterk op de eerste paar zoekresultaten die ze vinden (zoals een persoon die alleen de eerste pagina van een boek leest en ervan uitgaat dat ze het hele verhaal kennen). Als het antwoord op pagina 50 staat, mist de AI het vaak.
  • Ze geven de voorkeur aan "saai" antwoorden: Als de AI vijf artikelen vindt die allemaal hetzelfde zeggen, houdt ze ervan. Als ze één uniek artikel vinden dat iets anders zegt, negeert ze dit vaak.

De conclusie

Het artikel concludeert dat het simpelweg "slimmer" maken van de AI of haar meer internettoegang geven niet genoeg is. Het probleem is hoe de AI denkt terwijl ze zoekt.

Om dit op te lossen, moeten we AI bouwen die kan:

  1. Eigen fouten vroeg opsporen (voordat ze uitgroeien tot een domino-effect).
  2. Beter luisteren naar de specifieke regels die je haar geeft.
  3. Niet afgeleid worden door het eerste dat ze ziet, maar blijft zoeken naar het beste antwoord.

Kortom: we kunnen niet langer alleen het eindrapport beoordelen. We moeten de hele film bekijken om te begrijpen waarom de AI faalde.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →