Evaluating Deep Research Agents on Expert Consulting Work: A Benchmark with Verifiers, Rubrics, and Cognitive Traps
Dit artikel introduceert een rigoureuze benchmark voor het evalueren van diep onderzoekende agenten op expertconsultantietaken met behulp van door SME's geschreven prompts met cognitieve valkuilen, waaruit blijkt dat huidige state-of-the-art-modellen (Claude, o3 en Gemini) uniform lage acceptatiepercentages bereiken vanwege specifieke faalmodi zoals hallucinaties, rekenfouten en inconsistent redeneren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een team van superintelligente onderzoeksassistenten inhuurt voor een complexe taak: ze moeten een rommelige stapel documenten lezen, specifieke cijfers vinden, wat rekenen doen en een professioneel rapport schrijven voor een CEO. Als ze zelfs maar één cijfer verkeerd hebben, kan de CEO een miljard-dollar-fout maken.
Dit artikel is als een grondige sollicitatiegesprek voor drie van de meest geavanceerde AI-onderzoeksassistenten die vandaag beschikbaar zijn (Claude, o3 en Gemini). De auteurs, van Deccan AI Research, wilden zien of deze AI's daadwerkelijk het soort gedetailleerd, hoog-risicowerk konden doen dat menselijke managementconsultants doen, of dat ze alleen maar goed waren in het beantwoorden van simpele trivia-vragen.
Hier is de uiteenzetting van hun experiment, met behulp van simpele analogieën:
1. De Test: Een "Valstrikken-bevattende" Obstacle Course
De meeste eerdere tests voor AI waren als het vragen: "Wat is de hoofdstad van Frankrijk?" (feitelijke herinnering). Deze test was anders. De auteurs creëerden 42 complexe scenario's gebaseerd op echt consultancywerk.
Zie deze scenario's als een overlevingscursus ontworpen om de AI's te misleiden. De documenten die aan de AI's werden gegeven, bevatten "cognitieve valstrikken", zoals:
- De "Rode Haring"-valstrik: Een bestand vol met 100 pagina's tekst, maar het antwoord is verborgen in een kleine voetnoot op pagina 98.
- De "Tegenstrijdigheid"-valstrik: Eén document zegt dat de prijs 50 dollar is, maar een voetnoot zegt: "Tenzij het dinsdag is, dan is het 60 dollar."
- De "Rekenvalstrik": Vragen om een gemiddelde, maar de juiste methode vereist een gewogen gemiddelde (zoals het berekenen van je cijfer op basis van hoe zwaar elke toets weegt).
Als een AI alleen maar over het oppervlak schraapte of gokte, zou het falen.
2. De Rechters: Twee Schichtingen van Beoordeling
Het artikel liet de AI niet gewoon de AI beoordelen. Ze gebruikten een tweelaags scoresysteem:
- Laag 1: De Robotcontroleurs (Verificators): Dit zijn strenge, geautomatiseerde checks. Heeft de AI het bestand geproduceerd? Heeft het de juiste cijfers gebruikt? Heeft het de juiste bronnen geciteerd? Als de AI één rekenstap verkeerd had, markeerde deze laag het als een mislukking.
- Laag 2: De Menselijke Expert (De SME): Een echte menselijke consultant (met 15+ jaar ervaring) las het rapport van de AI. Ze beoordeelde het op vijf punten:
- Data-integriteit: Heb je feiten verzonnen?
- Analytische grondigheid: Is je logica waterdicht?
- Relevantie: Heb je de vraag beantwoord of gewoon gebral?
- Uitvoering: Heb je het rekenwerk goed gedaan?
- Formaat: Is het rapport professioneel en bruikbaar?
De eindscore combineerde deze twee lagen. Om de test te "slagen", moest een AI zowel de robotcontroleurs doorstaan als de menselijke expert imponeren.
3. De Resultaten: Het "Slagingspercentage" was Verbluffend Laag
Van de 126 totale pogingen (42 taken × 3 AI's), haalde bijna niemand het.
- Gemini slaagde ongeveer 21% van de tijd.
- Claude en o3 slaagden slechts 9,5% van de tijd.
Met andere woorden, als je één van deze AI's inhuurde voor een consultancyproject van een miljoen dollar, was er een kans van 79% tot 90% dat ze zouden falen in het leveren van een bruikbaar, accuraat rapport.
4. Hoe Elke AI Faalde (De "Persoonlijkheden" van Falen)
Het artikel vond dat elke AI op zijn eigen unieke manier faalde, zoals drie verschillende studenten die een zware examen aflegden:
Claude (De Zekere Fabricator):
- Sterkte: Het was het beste in het daadwerkelijk maken van de uiteindelijke bestanden (zoals Word-documenten of Excel-sheets). Het vergat zelden om de opdracht in te leveren.
- Zwakte: Het was het meest geneigd om te liegen. Als het geen antwoord kon vinden in de documenten, verzon het zelfverzekerd een cijfer of een bron om de leegte op te vullen. Het was als een student die een prachtig essay schreef, maar alle feiten verzon.
o3 (De Voorzichtige maar Onhandige Wiskundige):
- Sterkte: Als het wel redeneerde, was zijn logica vaak het schoonst.
- Zwakte: Het liet vaak vereiste secties van het rapport vallen of maakte cascade-rekenfouten. Als het stap één verpestte, was de rest van de wiskunde verkeerd. Het negeerde soms ook instructies om een bestand te maken en gaf in plaats daarvan een tekstantwoord.
Gemini (De Achtbaan):
- Sterkte: Als het werkte, was het vaak het beste. Het had het hoogste aantal "perfecte" scores.
- Zwakte: Het was onbetrouwbaar. Het had het hoogste aantal "nul"-scores. Soms crashte het, weigerde het te antwoorden, of produceerde het een bestand met gebroken code. Het was als een student die ofwel de toets perfect haalde, of zo slecht faalde dat ze zelfs niet opdoken.
5. De Grote Kernboodschap
Het artikel concludeert dat hoewel deze AI-agenten indrukwekkend zijn, ze nog niet klaar zijn voor hoog-risico, besluitvormend werk op basis van kwaliteit.
Als een menselijke consultant een fout maakt, is het meestal een kleine slip. Als deze AI's een fout maken, is het vaak een catastrofaal falen: ze kunnen een nep-bron verzinnen, de software laten crashen, of een kritieke voetnoot missen die het hele zakelijke besluit verandert.
De auteurs bereiden momenteel een tweede, grotere versie van deze test voor, maar voor nu is de boodschap duidelijk: Vertrouw deze AI's nog niet met de miljard-dollar-beslissingen van je bedrijf. Ze leren nog hoe ze betrouwbare onderzoekers kunnen zijn.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.