← Nieuwste papers
💬 NLP

Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models

Dit artikel introduceert Deep Data Research (DDR) en de bijbehorende benchmark, DDR-Bench, om het onderzoekend vermogen van Agente Grootte Taalmodellen te evalueren bij het autonoom onttrekken van inzichten uit ruwe data, en onthult dat hoewel geavanceerde modellen opkomend agentisch gedrag vertonen, effectieve verkenning op lange termijn intrinsieke strategieën vereist die verder gaan dan louter schalen of steunconstructies.

Oorspronkelijke auteurs: Wei Liu, Peijie Yu, Michele Orini, Yali Du, Yulan He

Gepubliceerd 2026-05-19
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Wei Liu, Peijie Yu, Michele Orini, Yali Du, Yulan He

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: Van "Bestellingnemer" naar "Detective"

Stel je een gigantische, rommelige bibliotheek voor, gevuld met miljoenen boeken, bonnetjes en medische dossiers.

  • Oude AI (De Bestellingnemer): Als je een oude AI vraagt: "Hoeveel blauwe boeken staan er op plank 4?", dan vindt het het antwoord en vertelt het je. Het wacht tot je een specifieke instructie geeft. Dit heet Uitvoerende Intelligentie.
  • Nieuwe AI (De Detective): Dit paper stelt een moeilijkere vraag: "Ga die bibliotheek binnen en vertel me welke interessante verhalen je kunt vinden." De AI moet zelf beslissen waar het naar moet zoeken, waar het moet zoeken en wanneer het genoeg heeft gevonden. Het moet zelf op zoek naar aanwijzingen. Dit heet Onderzoekende Intelligentie.

De auteurs betogen dat, hoewel AI steeds beter wordt in het volgen van orders, het nog steeds worstelt om een echte, onafhankelijke detective te zijn.

Het Probleem: We Hadden Geen Test voor "Jagen"

Tot nu toe hebben we AI voornamelijk getest door het specifieke vragen te stellen (zoals een meerkeuzetoets). Maar data-analyse in de echte wereld is geen toets; het is een verkenning.

  • Het Gat: Bestaande tests controleerden niet of een AI ruwe data kon bekijken, een patroon kon opmerken waar niemand het om had gevraagd, en daar een rapport over kon schrijven.
  • Het Risico: Als we AI alleen testen op vragen die wij stellen, denken we misschien dat het slimmer is dan het in werkelijkheid is. Het zou zomaar antwoorden kunnen memoriseren in plaats van te leren hoe het moet denken.

De Oplossing: DDR-Bench (De "Diepe Data Onderzoek"-Test)

Om dit op te lossen, hebben de onderzoekers een nieuwe test gebouwd die DDR-Bench heet. Denk hierbij aan een "Mystery Box"-uitdaging.

  1. De Opzet: Ze gaven AI-modellen toegang tot drie enorme, real-world databases:
    • MIMIC: Een gigantische ziekenhuisdatabase met patiëntendossiers (zoals een detective die het volledige medische verleden van een patiënt bekijkt).
    • GLOBEM: Een verzameling data van mensen die fitness trackers dragen en vragenlijsten over hun mentale gezondheid invullen (zoals een psycholoog die de dagelijkse gewoonten van een persoon analyseert).
    • 10-K: Financiële rapporten van beursgenoteerde bedrijven (zoals een accountant die de grootboeken van een bedrijf doorzoekt om de waarheid te vinden).
  2. De Regels: De AI kreeg een simpele startprompt: "Begin met het analyseren van deze patiënt/gebruiker/bedrijf."
    • Geen Vragen: De AI kreeg niet verteld wat het moest vinden.
    • Geen Limieten: De AI kon zoveel vragen stellen (interacties) als het wilde.
    • Het Doel: De AI moest de data verkennen, verborgen inzichten vinden en een rapport schrijven.
  3. De Beoordeling: Hoe beoordeel je een detective die dingen vindt die je niet had verwacht?
    • De onderzoekers creëerden een "Fact Checklist". Ze namen de ruwe data en schreven honderden specifieke, verifieerbare feiten op die zouden kunnen worden gevonden (bijvoorbeeld: "Had de patiënt een beroerte?" of "Is de winst van het bedrijf gestegen?").
    • Nadat de AI zijn rapport had geschreven, controleerden ze: "Bevat het rapport van de AI genoeg bewijs om deze feiten te bewijzen?"
    • Dit maakte de beoordeling objectief en eerlijk, en voorkwam menselijke bias.

Wat Ze Vonden: De "Jacht" is Moeilijk

De onderzoekers testten veel van 's werelds slimste AI-modellen (zoals Claude, GPT, Gemini en open-source modellen). Hier is wat ze ontdekten:

1. De "Wachten en Zien"-Strategie Wint
De best presterende AI had geen haast. Het besteedde tijd aan brede verkenning voordat het diep inging.

  • Analogie: Stel je een detective voor die rondloopt op een misdaadplek en alles bekijkt voordat het een specifiek bewijsstuk oppakt. De beste AI's deden deze "plan-dan-actie"-strategie op natuurlijke wijze, zelfs zonder dat ze verteld kregen om te plannen. Ze stelden het trekken van een definitieve conclusie uit totdat ze genoeg bewijs hadden verzameld.

2. Meer Hersenkracht ≠ Beter Jagen
Verrassend genoeg maakte het groter maken van de AI (meer parameters toevoegen) het niet automatisch tot een betere detective.

  • Analogie: Het geven van een groter brein aan een detective helpt niet als ze niet weten hoe ze een vergrootglas moeten gebruiken. Het paper vond dat training belangrijker is dan grootte. Modellen die specifiek waren getraind om "agenten" te zijn (om te denken en te handelen), presteerden veel beter dan enorme modellen die alleen waren getraind om te chatten.

3. De "Stop"-Knop is Lastig
Een belangrijk onderdeel van detective zijn is weten wanneer je moet stoppen met zoeken.

  • Vinding: Veel zwakkere modellen stopten ofwel te vroeg (en misten het grote plaatje) of bleven voor altijd in cirkels draaien (vastzittend in een lus). De beste modellen wisten precies wanneer ze genoeg hadden gevonden om een goed rapport te schrijven.

4. De "Geheugen"-Valstrik
De onderzoekers testten of het geven van een "notitieboekje" (geheugen) aan de AI om te samenvatten wat het vond, hielp.

  • Vinding: Het maakte de dingen vaak erger! De AI raakte in de war door zijn eigen samenvattingen en stopte te vroeg met verkennen. Soms was het beter voor de AI om de ruwe geschiedenis van zijn eigen acties te zien in plaats van een samengevatte notitie.

5. Hallucinaties (Dingen Verzonnen) Waren Zeldzaam
Een grote zorg is dat AI feiten zou kunnen verzinnen omdat het ze "herinnert" uit zijn trainingsdata.

  • Vinding: Het paper vond dat de AI zelden feiten verzon die niet in de database stonden. Als het het antwoord verkeerd had, was het meestal omdat het niet hard genoeg had gezocht, niet omdat het loog.

De Conclusie

Dit paper introduceert een nieuwe manier om AI te testen: Stel het geen vragen; laat het verkennen.

De resultaten tonen aan dat, hoewel AI goed wordt in het volgen van instructies, het nog steeds leert hoe het een echte onderzoeker moet zijn. De meest succesvolle modellen zijn niet per se de grootste; het zijn degenen die de strategie van verkenning hebben geleerd: breed kijken, diep graven en weten wanneer te stoppen.

Kortom: We gaan over van het bouwen van AI die vragen beantwoordt naar het bouwen van AI die ze stelt. Maar op dit moment zijn slechts een paar modellen echt klaar voor de baan.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →