← Nieuwste papers
💬 NLP

Can Deep Research Agents Retrieve and Organize? Evaluating the Synthesis Gap with Expert Taxonomies

Dit artikel introduceert TaxoBench, een benchmark die aantoont dat huidige Deep Research Agents aanzienlijk achterlopen op menselijke experts in zowel het ophalen van essentiële papers als het organiseren daarvan in coherente taxonomieën, wat duidelijke knelpunten onthult in zowel de nauwkeurigheid van de retrieval als de synthese van hiërarchische structuren.

Oorspronkelijke auteurs: Ming Zhang, Jiabao Zhuang, Wenqing Jing, Kexin Tan, Ziyu Kong, Jingyi Deng, Yujiong Shen, Yuhui Wang, Zhenghao Xiang, Qiyuan Peng, Yuhang Zhao, Ning Luo, Renzhe Zheng, Jiahui Lin, Mingqi Wu, Long Ma
Gepubliceerd 2026-08-07
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ming Zhang, Jiabao Zhuang, Wenqing Jing, Kexin Tan, Ziyu Kong, Jingyi Deng, Yujiong Shen, Yuhui Wang, Zhenghao Xiang, Qiyuan Peng, Yuhang Zhao, Ning Luo, Renzhe Zheng, Jiahui Lin, Mingqi Wu, Long Ma, Shihan Dou, Maxm Pan, Tao Gui, Qi Zhang, Xuanjing Huang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de ultieme gids probeert te schrijven voor een enorme, chaotische bibliotheek. Je moet niet alleen de boeken kunnen vinden; je moet ook uitzoeken hoe je ze op de planken organiseert zodat een lezer het verhaal van het vakgebied daadwerkelijk kan begrijpen. Dit is de taak van een "survey", een type academisch artikel dat alles wat we weten over een specifiek onderwerp samenvat. Jarenlang hebben wetenschappers gehoopt dat Kunstmatige Intelligentie (AI) dit zware werk automatisch zou kunnen doen. Ze stelden zich "Deep Research Agents" voor — superintelligente AI-bots die het internet afstruinen, elke belangrijke paper kunnen vinden en deze vervolgens kunnen rangschikken in een perfecte, logische kaart van kennis.

Maar hier is de crux: een boek vinden is makkelijk; het organiseren ervan is moeilijk. Om te bepalen of deze AI-bots echt klaar zijn voor de klus, moeten we twee specifieke vaardigheden testen. Ten eerste, Retrieval (Ophalen): Kan de AI exact dezelfde boeken vinden als een menselijke expert zou kiezen? Als de AI de belangrijkste papers mist, is de gids waardeloos. Ten tweede, Organisatie: Zodra de AI de boeken heeft, kan hij een "taxonomie" bouwerken? Zie een taxonomie als een stamboom voor ideeën. Het is niet zomaar een lijst; het is een hiërarchie met een hoofdonderwerp aan de top, dat uitwaaiert naar grote categorieën, dan kleinere subcategorieën, helemaal tot aan de individuele papers. Een goede taxonomie helpt je om de verbindingen tussen ideeën te zien. Als de AI de papers gewoon in een rommelige hoop dumpt of een verwarrende, platte lijst maakt, heeft hij de taak niet echt volbracht.

Dit artikel, getiteld "Can Deep Research Agents Retrieve and Organize?", onderwerpt zeven van de meest geavanceerde AI-onderzoek agents ter wereld aan een test. De onderzoekers bouwden een speciale uitdaging genaamd TaxoBench, die gebruikmaakt van 72 echte, hoogwaardige surveys geschreven door menselijke experts als de "gouden standaard". Ze vroegen de AI-agents om ofwel de papers vanaf nul te vinden, ofwel, in een tweede test, een vooraf geselecteerde lijst van papers te organiseren in een boomstructuur. De resultaten waren een beetje een reality check voor de AI-wereld.

De studie toonde aan dat hoewel deze AI-agents steeds beter worden in praten en schrijven, ze nog steeds worstelen met de basisprincipes van onderzoek. Wanneer ze de opdracht kregen om de essentiële papers te vinden die experts gebruiken, vond de allerbeste AI-agent slechts ongeveer 20,92% van de papers. Dat betekent dat het bijna 80% van de belangrijkste boeken in de bibliotheek heeft gemist. De andere agents deden het nog slechter, waarbij sommigen minder dan 5% van de cruciale papers vonden. Het is alsof je een gids vraagt om de top 10 bezienswaardigheden van een stad te laten zien, en hij slaagt er slechts in om twee of drie aan te wijzen, terwijl hij de rest volledig mist.

Het tweede deel van de test was nog veelzeggender. Zelfs toen de onderzoekers de AI-agents de perfecte lijst met papers gaven (zodat ze zich geen zorgen hoefden te maken over het vinden ervan), slaagden de agents er nog steeds niet in om de papers te organiseren zoals een menselijke expert dat zou doen. De menselijke experts bouwden diepe, meerlagige bomen met een gemiddelde diepte van 4,86 niveaus (zoals een boom met een stam, grote takken, kleinere takken en twijgen). De AI-agents bouwden echter ondiepe, platte structuren met een gemiddelde diepte van slechts ongeveer 3 niveaus. Ze misten de middelste lagen van de organisatie.

Wanneer de onderzoekers probeerden de AI te dwingen om diepere bomen te bouwen door specifieke instructies te geven, werd de AI niet slimmer; het werd alleen maar slordiger. De AI begon de boom uit elkaar te trekken in kleine, enkelvoudige paper-takjes, waardoor er een "bos" van geïsoleerde twijgjes ontstond in plaats van een gestructureerde boom. Dit wordt "over-segmentatie" genoemd. De AI was zo bang om dingen samen te groeperen dat hij bijna elke paper in zijn eigen kleine, eenzame categorie plaatste.

Het artikel concludeert dat er een enorme "synthese-kloof" bestaat tussen wat AI vandaag de dag kan en wat menselijke experts kunnen. De AI zit momenteel vast op een "vloer" waar de organisatorische vaardigheden nauwelijks beter zijn dan een willekeurige kans. Hoewel de AI-modellen krachtiger worden, hebben ze deze kloof nog niet gedicht. De onderzoekers suggereren dat voordat we AI kunnen vertrouwen om onze wetenschappelijke gidsen te schrijven, we twee aparte problemen moeten oplossen: hen leren hoe ze het juiste bewijs moeten vinden, en hen leren hoe ze een diepe, logische structuur kunnen bouwen om dat bewijs in te houden. Tot die tijd zijn menselijke experts nog steeds de enigen die het terrein van de kennis werkelijk in kaart kunnen brengen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →