← Nieuwste papers
🤖 AI

Delegation Intelligence in Deep Search: A Controllable Framework for Disentangled Capability Diagnosis

Dit artikel introduceert "Delegation Intelligence" als een ontkoppeld framework voor het evalueren van deep search agents door het zoekbesluitvormingsproces te scheiden van de informatie-synthese, ondersteund door een controleerbare synthese-pipeline en de DelegSearchBench benchmark om de beperkingen in huidige end-to-end nauwkeurigheidsmetrieken te onthullen.

Oorspronkelijke auteurs: Xinhao Yao, Yuanzhuo Liu, Changhao Wang, Yunfei Yu, Haoran Tan, Yuyao Zhang, Ruifeng Ren, Minlong Peng, Yong Liu

Gepubliceerd 2026-07-28
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xinhao Yao, Yuanzhuo Liu, Changhao Wang, Yunfei Yu, Haoran Tan, Yuyao Zhang, Ruifeng Ren, Minlong Peng, Yong Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, lastige puzzel probeert op te lossen, maar je hebt niet alle stukjes voor je liggen. In de wereld van kunstmatige intelligentie is dit precies wat er gebeurt wanneer een computerprogramma, bekend als een "Large Language Model", probeert een vraag te beantwoorden. Lange tijd hebben we deze modellen behandeld als superintelligente studenten die alleen hun tekstboeken moeten memoriseren. Als het antwoord in hun geheugen zit, halen ze een hoog cijfer. Maar het echte leven is geen examen met een gesloten boek. Soms staat het antwoord helemaal niet in het tekstboek; het is verborgen in een bibliotheek, een nieuwsarchief, of een website die elke dag verandert. Dit is waar "Deep Search" om de hoek komt kijken. Het is het vermogen van een AI om te beseffen: "Hé, dit weet ik niet," en vervolgens op pad te gaan, de juiste informatie te vinden en de stukjes bij elkaar te leggen.

Er is echter een groot probleem met hoe we deze AI-detectives momenteel testen. Meestal kijken we alleen naar het uiteindelijke antwoord: "Hebben ze het goed gedaan?" Als het antwoord correct is, geven we ze een gouden ster. Als het fout is, geven we ze een rood kruis. Maar dit is alsoals het beoordelen van een student enkel op basis van het feit of hij het juiste antwoord heeft op een wiskundetoets, zonder te controleren of hij daadwerkelijk de berekeningen heeft uitgevoerd of gewoon heeft geraden. Misschien had hij het goede antwoord omdat hij het uit een vorige les herinnerde, of misschien had hij het goed door puur geluk. We weten niet hoe ze daar gekomen zijn. Wisten ze wanneer ze moesten stoppen met gokken en moeten gaan zoeken? Wisten ze welke bron ze moesten vertrouwen? Of hadden ze gewoon geluk? Dit artikel betoogt dat we moeten stoppen met alleen naar de eindscore te kijken en moeten beginnen met het observeren van het detectiewerk zelf.

De onderzoekers achter dit artikel, een team van Tencent en de Renmin Universiteit van China, besloten een speciale "trainingsgrond" te bouwen om AI-agenten te testen op wat zij Delegation Intelligence noemen. Denk hierbij aan het vermogen van de AI om te weten wanneer het moet stoppen met proberen een probleem alleen op te lossen en wanneer het de taak moet overdragen aan een zoekmachine. Ze realiseerden zich dat goed zijn in "Deep Search" niet slechts één superkracht is; het is eigenlijk twee verschillende vaardigheden die samenwerken.

De eerste vaardigheid is Search Decision-Making (Zoekbesluitvorming). Dit is het moment van realisatie. Het is de AI die zegt: "Ik zit vast. Ik heb meer informatie nodig," of omgekeerd: "Ik heb genoeg informatie, geen reden om te zoeken." Het is het verschil tussen een detective die blijft met zijn hoofd tegen een muur aan beuken en een detective die weet wanneer hij het laboratorium om hulp moet vragen. De tweede vaardigheid is Information Synthesis & Verification (Informatiesynthese & Verificatie). Zod matter de AI naar buiten gaat en een heleboel documenten vindt, kan de AI dan onderscheiden welke waar zijn en welke nep? Kan de AI een leugen in een nieuwsartikel ontdekken? Kan de AI aanwijzingen uit drie verschillende websites combineren om het mysterie op te lossen? Dit is het "leesvaardigheid"-gedeelte, maar dan met een twist: de AI moet omgaan met ruis, leugens en verwarrende informatie.

Om deze vaardigheden goed te testen, konden de onderzoekers niet zomaar willekeurige vragen van het internet gebruiken. Dat zou te rommelig zijn. In plaats daarvan bouwden ze een Controllable Synthesis Pipeline (Controleerbare Synthese-pipeline). Stel je voor dat zij de regisseurs zijn van een spionnenfilm. In plaats van de acteurs te laten improviseren, schrijven zij het script achterstevoren. Ze beginnen met de "waarheid" (een echt, hoogwaardig document), en schrijven dan een vraag die vereist dat document om beantwoord te worden. Vervolgens creëren ze "afleiders" (distractors)—nep of misleidende documenten die erg lijken op het echte document, maar een kleine, cruciale fout bevatten, zoals de verkeerde datum of een neppe auteur. Ze creëren ook "ruis"—documenten die totaal irrelevant zijn maar de AI in verwarring kunnen brengen. Op deze manier weten ze precies waar de AI naar moet zoeken en welke vallen ze hebben gezet.

Ze gebruikten deze pipeline om een nieuwe test te maken genaamd DelegSearchBench, die 429 lastige vragen bevat. Vervolgens draaiden ze hun tests op twee verschillende manieren om te zien hoe de AI presteerde.

Eerst gaven ze de AI alle documenten (de echte, de neppe en de ruis) maar zetten ze de zoektool uit. Dit testte de tweede vaardigheid: Synthese & Verificatie. Ze wilden zien of de AI de waarheid kon vinden in een stapel leugens zonder dat hij naar buiten hoefde te gaan om te zoeken. Ze kwamen iets verrassends tegen: zelfs wanneer de AI alle antwoorden direct voor zich had, faalde hij vaak. Het was als een student die het tekstboek open op zijn bureau had liggen, maar nog steeds niet de juiste pagina kon vinden. De AI raakte in de war door waar de informatie geplaatst was. Als het juiste antwoord in het midden van een lange lijst met documenten stond, miste de AI het vaak (een probleem dat bekend staat als "lost in the middle"). Ook was de AI niet erg consistent; als je hem dezelfde vraag drie keer stelde, kon hij het de ene keer goed hebben en de andere twee keer fout, wat suggereerde dat hij aan het raden was in plaats van aan het redeneren.

Ten tweede gaven ze de AI slechts enkele documenten (waarbij cruciale documenten ontbraken) en zetten ze de zoektool aan. Dit testte de eerste vaandigheid: Search Decision-Making. Ze wilden zien of de AI zou beseffen dat hij informatie miste en zou besluiten te zoeken. De resultaten waren een gemengd geheel. Sommige modellen waren te zelfverzekerd; ze probeerden de vraag te beantwoorden terwijl ze de feiten niet hadden, wat leidde tot "voortijdige beantwoording" (premature answering). Anderen waren te enthousiast; ze zochten agressief, maar wisten niet waar ze naar moesten zoeken, of ze konden de nieuwe informatie niet combineren met wat ze al hadden.

De belangrijkste conclusie van dit onderzoek is dat het juiste antwoord krijgen niet genoeg is. Een echt slimme AI-agent moet weten hoe hij dat antwoord krijgt. Hij moet nederig genoeg zijn om toe te geven dat hij iets niet weet, slim genoeg om de juiste vraag te stellen, en scherp genoeg om een leugen te herkennen wanneer hij die vindt. De auteurs suggereren dat het louter feit dat een model een correct antwoord kan produceren, niet betekent dat het een goede "deep search"-agent is. Het kan zijn dat het model gewoon geluk heeft, of dat het vertrouwt op geheugen in plaats van op onderzoek.

Kortom, het artikel laat zien dat huidige AI-modellen nog steeds leren hoe ze goede detectives moeten zijn. Ze zijn geweldig in het oplossen van puzzels wanneer alle stukjes aan hen worden overhandigd, maar ze worstelen wanneer ze zelf de stukjes moeten gaan zoeken, vooral als de doos met stukjes vol zit met neppe onderdelen. Door de vaardigheden uit elkaar te trekken en ze afzonderlijk te testen, hopen de onderzoekers AI te bouwen die niet alleen het juiste antwoord raadt, maar precies weet hoe hij het moet vinden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →