← Nieuwste papers
💬 NLP

DeepSearchQA: Bridging the Comprehensiveness Gap for Deep Research Agents

Het artikel introduceert DeepSearchQA, een benchmark van 900 prompts verspreid over 17 vakgebieden, ontworpen om deep research-agenten te evalueren op complexe, meerstaps informatiezoektaken, waarbij wordt onthuld dat zelfs de meest geavanceerde modellen moeite hebben met het balanceren van recall en precisie bij systematische informatieverzameling, entiteitsresolutie en stopcriteria.

Oorspronkelijke auteurs: Nikita Gupta, Riju Chatterjee, Lukas Haas, Connie Tao, Andrew Wang, Chang Liu, Hidekazu Oiwa, Elena Gribovskaya, Jan Ackermann, John Blitzer, Sasha Goldshtein, Dipanjan Das

Gepubliceerd 2026-01-30
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Nikita Gupta, Riju Chatterjee, Lukas Haas, Connie Tao, Andrew Wang, Chang Liu, Hidekazu Oiwa, Elena Gribovskaya, Jan Ackermann, John Blitzer, Sasha Goldshtein, Dipanjan Das

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een onderzoeksassistent inhuurt om informatie voor je te zoeken. In het verleden testten we deze assistenten vooral met eenvoudige vragen zoals: "Wat is de hoofdstad van Frankrijk?" Als ze het antwoord goed hadden, slaagden ze. Als ze het fout hadden, faalden ze. Dit was als een meerkeuzequiz: makkelijk te beoordelen, maar het vertelde ons niet of de assistent een echt, complex onderzoeksproject kon afhandelen.

Het paper "DeepSearchQA" introduceert een nieuwe, veel moeilijkere test die ontworpen is om te zien of AI-agenten als echte onderzoekers kunnen optreden, en niet slechts als trivia-bots.

Hier is de uitsplitsing van wat ze hebben gedaan en wat ze hebben gevonden, met behulp van eenvoudige analogieën:

1. Het Probleen: De "Naald in een hooistak" versus de "Hele hooistak"

Oude tests vroegen de AI om één specifieke naald in een hooistak te vinden (bijv. "Wat is de hoofdstad van Frankrijk?").

  • Het probleem: Het echte leven is niet zo. Soms moet je elke naald in de hooistak weten, of alle verschillende soorten hooi op een rij zetten.
  • De nieuwe uitdaging: DeepSearchQA stelt vragen zoals: "Lijst elke spelcomputer op die meer dan 100 miljoen exemplaren heeft verkocht, niet draagbaar was, een 32-bit CPU had en waarvan het moederbedrijf in 2010 meer dan $1,7 biljoen aan activa had."
  • Het doel: De AI kan niet zomaar één antwoord raden. Het moet een volledige, perfecte lijst opstellen. Als de AI één item mist, is de lijst incompleet. Als de AI één nepitem toevoegt, is de lijst onnauwkeurig.

2. De Drie Moeilijke Vaardigheden die worden Getest

Om deze nieuwe test te halen, moet een AI-agent drie moeilijke vaardigheden beheersen die oude tests negeerden:

  • Vaardigheid 1: De Bibliothecaris (Systematische Samenstelling)
    Stel je voor dat je een rapport moet schrijven, maar de informatie is verspreid over 50 verschillende websites en geen enkele website heeft het volledige verhaal. De AI moet al deze websites bezoeken, ze lezen en de stukjes samenvoegen tot één meesterlijst. Het kan niet alleen vertrouwen op de eerste website die het vindt.
  • ** Vaardigheid 2: De Detective (Entiteitsresolutie)**
    Stel je voor dat je naar "Apple" zoekt. De ene website zegt "Apple Inc.", een andere zegt "Apple Computer" en een derde zegt "Het bedrijf dat Steve Jobs oprichtte". Een mens weet dat dit hetzelfde is. Een AI raakt vaak in de war en vermeldt deze als drie verschillende bedrijven. Deze test controleert of de AI kan beseffen dat dit hetzelfde is en de duplicaten verwijdert.
  • Vaardigheid 3: Het Stopbord (Redeneren over Stoppen)
    Dit is het moeilijkste deel. Bij een normale zoekopdracht stop je wanneer je het antwoord hebt gevonden. Maar bij een taak voor "diepgaand onderzoek" is er geen finishlijn. De AI moet weten wanneer hij moet stoppen met zoeken.
    • Te vroeg: Het stopt voordat het alle antwoorden heeft gevonden (onder-retrieval).
    • Te laat: Het blijft doorzoeken en begint antwoorden te verzinnen om de lijst aan te vullen (over-retrieval/hedging). Het is als een chef die ingrediënten blijft toevoegen aan een soep totdat deze vies smaakt, alleen maar om zeker te weten dat hij niets gemist heeft.

3. De Test: 900 Real-World Scenario's

De onderzoekers hebben een benchmark gemaakt genaamd DeepSearchQA met 900 moeilijke vragen over 17 verschillende gebieden (zoals gezondheid, financiën, geschiedenis en gaming).

  • De regels: De antwoorden zijn gebaseerd op statische feiten (zoals de volkstelling van 2020) zodat ze niet veranderen terwijl de test loopt.
  • De beoordeling: Ze geven niet om hoe de AI het antwoord heeft gevonden (het pad dat het heeft afgelegd). Ze geven alleen om de uiteindelijke lijst. Is de lijst 100% correct?
    • Perfect: De lijst is exact juist.
    • Gedeeltelijk: Het heeft er enkele goed, maar heeft er anderen gemist.
    • Hallucinatie: Het heeft de juiste items gevonden, maar heeft ook nepitems toegevoegd om grondig te lijken.

4. Wat ze Vonden: Het "Laatste Mijl"-probleem

Ze hebben de slimste beschikbare AI-modellen getest (zoals Google's Gemini Deep Research en OpenAI's GPT-5 Pro). Dit is wat er gebeurde:

  • Het goede nieuws: De beste AI-agenten worden erg goed in dit werk. De topmodellen kregen ongeveer 66% van de lijsten perfect correct. Dit is een enorme sprong ten opzichte van oudere modellen.
  • Het slechte nieuws: Zelfs de beste modellen worstelen met de "laatste mijl".
    • De kloof: Een AI kan 90% van de juiste antwoorden vinden (hoge recall), maar faalt omdat hij niet stopt met zoeken en 5 foute antwoorden aan de lijst toevoegt. Dit verpest de score.
    • De "Hedging"-val: Wanneer een AI niet zeker weet of hij klaar is, probeert hij veilig te spelen door alles op te sommen wat hij kan bedenken, inclusief dingen waar hij niet zeker van is. Dit is als een student die gokt op een toets om deels punten te krijgen, maar in dit geval verlaagt het hun cijfer.
  • De "Stapfunctie"-val: Als je een kleiner, goedkoper AI-model gebruikt, daalt de prestatie niet slechts een beetje; het stort volledig in. Deze complexe taken vereisen een bepaalde hoeveelheid "hersencapaciteit" om de zoektocht te plannen. Onder een bepaalde drempelwaarde raakt de AI direct de weg kwijt en vindt hij niets.

5. De Conclusie

Het paper betoogt dat we een keerpunt bereiken. We zijn verschoven van het vragen aan AI "Wat is het antwoord?" naar "Kun je het hele onderwerp beheersen?".

De huidige AI-modellen zijn slim genoeg om de naald te vinden, maar ze leren nog steeds hoe ze de hele hooistak in kaart kunnen brengen zonder de weg kwijt te raken of dingen te verzinnen. DeepSearchQA is een hulpmiddel om onderzoekers te helpen dit specifieke probleem op te lossen: de AI leren wanneer hij moet stoppen met zoeken en hoe hij perfect grondig kan zijn zonder slordig te worden.

Kortom: We leren AI om te stoppen met een trivia-kampioen te zijn en te beginnen als een professionele onderzoeker die een complex, meerstaps onderzoek kan afhandelen zonder de controle te verliezen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →