← Nieuwste papers
💬 NLP

WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models

Het artikel introduceert WebAggregator, een data-synthesepijplijn die diepe onderzoeksagenten verschuift van retrieval-gewicht naar compositie-geredeneerd denken via een gecureerde SFT-dataset van 10.000 voorbeelden, waardoor een 32B-model betere prestaties levert dan toonaangevende systemen op benchmarks en wordt aangetoond dat compositie-geredeneerd denken, en niet retrieval, de primaire bottleneck is voor onderzoeksagenten van de volgende generatie.

Oorspronkelijke auteurs: Rui Wang, Ce Zhang, Jun-Yu Ma, Jianshu Zhang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Zhisong Zhang, Hongming Zhang, Haitao Mi, Dong Yu, Kam-Fai Wong

Gepubliceerd 2026-04-30
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Rui Wang, Ce Zhang, Jun-Yu Ma, Jianshu Zhang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Zhisong Zhang, Hongming Zhang, Haitao Mi, Dong Yu, Kam-Fai Wong

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Googler" versus de "Detective"

Stel je voor dat je een onderzoeksassistent inhuurt.

  • De Oude Manier (Huidige AI-agenten): Je vraagt hen: "Wie won de prijs in 2024?" Ze openen direct een browser, typen de vraag in bij Google, vinden een lijst en wijzen naar de bovenste naam. Dit is Informatiezoeken. Het is snel, maar het is als een papegaai die herhaalt wat hij hoort. Als het antwoord vereist dat je drie verschillende feiten van drie verschillende websites koppelt om een raadsel op te lossen, raakt de papegaai in de war.
  • De Nieuwe Doelstelling (Diep Onderzoek): Je vraagt: "Van alle landen groter dan 2 miljoen vierkante kilometer, welk land had tussen 2010 en 2020 de meest volatiele economie?" Om dit te beantwoorden, kan de agent het antwoord niet zomaar "vinden". Het moet:
    1. Een lijst vinden van grote landen.
    2. Economische data vinden voor elk land.
    3. Complexe wiskunde uitvoeren om "volatiliteit" te berekenen.
    4. De resultaten vergelijken.
      Dit is Compositional Reasoning (samenstellend redeneren). Het is als een detective die aanwijzingen aan elkaar plakt om een mysterie op te lossen, in plaats van alleen een krantenkop te lezen.

Het paper stelt dat huidige AI-agenten geweldig zijn in het zijn van "Googlers", maar slecht in het zijn van "Detectives". Ze vertrouwen te veel op het vinden van de juiste link en niet genoeg op het diep nadenken over wat ze hebben gevonden.

De Oplossing: WebAggregator (De "Trainingsgym")

Om dit op te lossen, bouwden de onderzoekers een systeem genaamd WebAggregator. Denk hierbij niet aan een nieuwe AI, maar aan een gespecialiseerd trainingskamp dat een "Googler" omtovert tot een "Detective".

Het systeem werkt in twee hoofdfases, zoals een team van twee personen dat een moeilijk examen opstelt:

  1. De Proactieve Ontdekker (De Schatzoeker):
    Stel je een robot voor die naar een enorme bibliotheek wordt gestuurd met één boek. Zijn taak is om dat boek te openen, een verwijzing naar een ander boek te vinden, naar dat boek te gaan, een foto te vinden, een bestand te downloaden en op een verborgen knop te klikken. Het verzamelt een enorme hoop verspreide, rommelige informatie van overal op het web.

    • In het paper: Deze agent bezoekt echte websites, downloadt bestanden en navigeert door complexe pagina's om ruwe data te verzamelen.
  2. De Logische Puzzelontwerper (De Meester van de Puzzel):
    Zodra de Schatzoeker de hoop data heeft, kijkt de Meester van de Puzzel ernaar en zegt: "Oké, op basis van deze rommel, laten we een vraag maken die niet beantwoord kan worden door gewoon naar één pagina te kijken."

    • Ze gebruiken een strikte set regels (12 soorten logica) om de vraag te dwingen rekenen, filteren, vergelijken en "tijdreizen" (temporeel redeneren) te vereisen.
    • Voorbeeld: In plaats van te vragen "Wat is het BBP van China?", vragen ze: "Bereken de standaardafwijking van de BBP-groei van China vergeleken met zijn verstedelijkingsgraad over het afgelopen decennium."

Het Resultaat: Een Nieuwe Dataset en een Slimmere AI

Het team gebruikte dit systeem om WebAggregatorQA te creëren, een dataset van ongeveer 10.000 extreem moeilijke vragen. Vervolgens gebruikten ze deze vragen om een nieuw AI-model te trainen (genaamd WebAggregator).

Dit is wat er gebeurde toen ze dit nieuwe model testten:

  • De "Retrieval-val": De onderzoekers testten top-AI-modellen (zoals GPT-4.1 en Claude-3.7) op deze moeilijke vragen. Zelfs toen ze de modellen alle juiste websites en documenten gaven die nodig waren om het probleem op te lossen, faalden de modellen nog steeds.

    • De Metafoor: Het is alsof je een student een leerboek geeft met het exacte antwoord gemarkeerd, maar ze kunnen het rekenprobleem nog steeds niet oplossen omdat ze niet begrijpen hoe ze de berekening moeten uitvoeren.
    • De Bevinding: De knelpunt is niet het vinden van de informatie; het is het redeneren ermee.
  • De Transformatie: Toen ze hun modellen trainden op de WebAggregator-dataset, veranderde het gedrag van de agenten:

    • Voorheen: Ze klikten wanhopig op knoppen en openden links (hoog toolgebruik, laag denken).
    • Daarna: Ze klikten op minder knoppen, maar besteedden meer tijd aan het "nadenken" (intern redeneren) om de punten met elkaar te verbinden.
    • Prestatie: Het nieuwe WebAggregator-32B-model versloeg de beste bestaande modellen op deze moeilijke redeneertaken, wat bewijst dat trainen op "detectivewerk" de AI slimmer maakt.

De Conclusie

Het paper concludeert dat AI, om echt een "Diep Onderzoek"-agent te worden die in staat is tot wetenschappelijke ontdekkingen, moet stoppen met focussen op hoe goed het het web kan doorzoeken. In plaats daarvan moeten we focussen op hoe goed het verspreide stukjes informatie kan samenvoegen tot een logische conclusie.

Kortom: Het paper bouwde een gym waar AI-agenten oefenen complexe raadsels op te lossen met echte webdata. Het resultaat is een agent die minder een wanhopige web-surfer is en meer een nadenkende, logische onderzoeker.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →