AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research
AgentCPM-Report is een lichtgewicht, lokaal diep onderzoekssysteem dat gebruikmaakt van een mensachtige "Writing As Reasoning"-policy om het op een dynamische manier afwisselen van conceptvorming en verdieping te faciliteren, waardoor kleine 8B-parameter modellen in staat worden gesteld om leidende closed-source systemen te overtreffen in het genereren van inzichtelijke rapporten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Probleem: De valstrik van de "Starre Blauwdruk"
Stel je voor dat je gevraagd wordt om een enorme encyclopedie-inzending van 50 pagina's te schrijven over een onderwerp waar je heel weinig van weet, zoals "De Toekomst van AI."
De meeste huidige AI-systemen werken als een star architect. Voordat ze ook maar één woord schrijven, proberen ze een perfect, gedetailleerd blauwdruk van het hele gebouw te tekenen. Ze beslissen precies hoe elke kamer eruit zal zien voordat ze zelfs de eerste steen hebben gelegd.
- De Fout: Als de architect een fout maakt in de blauwdruk (wat moeilijk perfect te doen is zonder alles te weten), is het hele gebouw gedoemd. Ze kunnen het plan niet gemakkelijk aanpassen zodra de bouw begint.
- Het Gevolg: Om een goede blauwdruk te maken, heb je een genie-architect nodig (een enorme, dure, closed-source AI). Als je een kleinere, goedkopere AI gebruikt, is de blauwdruk meestal slecht en het uiteindelijke rapport oppervlakkig en saai.
De Oplossing: De "Beeldhouwer"-aanpak
De auteurs van dit paper hebben een nieuw systeem ontwikkeld genaamd AgentCPM-Report. In plaats van een architect, behandelen zij de AI als een beeldhouwer.
Een beeldhouwer plant niet vooraf elke curve van het beeldhouwwerk. Ze beginnen met een ruwe blok steen (een eenvoudige schets), hakken wat stukjes weg, bekijken de vorm, en realiseren zich dan: "O, dit detail was ik vergeten; ik moet hier dieper graven." Ze passen het plan aan terwijl ze aan het werk zijn.
Dit wordt WARP (Writing As Reasoning Policy) genoemd. Dit betekent dat de handeling van het schrijven de handeling van het denken is. De AI schrijft een sectie, realiseert zich dat het te oppervlakkig is, stopt, gaat op zoek naar meer informatie, werkt het plan bij, en schrijft dan opnieuw.
Hoe het werkt: De Tweestapsdans
De AI wisselt tussen twee modi, zoals een danser die van stap wisselt:
- Bewijs-gebaseerd Ontwerpen (De Klerk): De AI kiest een sectie van de outline, zoekt feiten op het internet en schrijft een paragraaf. Het is alsof een klerk de gevonden informatie overschrijft.
- Redenerings-gestuurde Verdieping (De Detective): Na het schrijven stapt de AI even terug en vraagt zich af: "Is dit goed genoeg? Heb ik iets gemist?"
- Als het antwoord Nee is, handelt de AI als een detective. Het vindt een gat in het verhaal, breekt die sectie op in kleinere, specifiekere vragen en werkt de outline bij.
- Als het antwoord Ja is, gaat het verder.
Deze lus zorgt ervoor dat de AI nieuwe ideeën ontdekt tijdens het schrijfproces, in plaats van vast te zitten aan een slecht plan vanaf het begin.
De Training: Een kleine hond leren jagen
Het paper gebruikt een relatief klein AI-model (slechts 8 miljard parameters, wat "klein" is in de wereld van AI). Normaal gesproken zijn kleine modellen slecht in complexe planning. Om dit op te lossen, gebruikte het team een Multi-Stage Training Strategie:
- Cold Start (De Basis): Ze leerden de AI het alfabet. Het leerde hoe het moest zoeken, hoe het een zin moest schrijven en hoe het basisregels moest volgen.
- Atomic Skill RL (De Oefeningen): Ze oefenden specifieke bewegingen. Ze leerden de AI hoe het een goede paragraaf schrijft of hoe het een goede zoekvraag stelt, en beloonden het voor het goed uitvoeren van die kleine taken.
- Holistic Pipeline RL (De Marathon): Ten slotte lieten ze de AI de hele race rennen. Ze controleerden niet alleen of de zinnen goed waren; ze controleerden of het volledige rapport wel inzichtelijk was.
- Cruciale Truc: Ze gebruikten een "Trajectory Pruning"-methode. Stel je voor dat een leraar een lang verhaal schrijft maar op willekeurige momenten stopt. De AI keek naar alle concepten die de leraar maakte, koos de beste uit en zei: "Stop hier!" Dit leerde de kleine AI precies wanneer het moest stoppen met graven voor meer info, zodat het geen tijd verspilt.
De Resultaten: Klein Model, Groot Brein
Het paper testte dit systeem tegen de grootste, duurste AI-systemen van bedrijven zoals Google, OpenAI en Anthropic.
- De Verrassing: De kleine, lokale AI (AgentCPM-Report) versloeg de gigantische, closed-source systemen in het creëren van Inzichtelijke rapporten.
- Waarom? Omdat de "Beeldhouwer"-aanpak (WARP) de kleine AI in staat stelde om ter plekke na te denken. Het had geen enorm brein nodig om een perfecte blauwdruk te tekenen; het hoefde alleen maar goed te zijn in het aanpassen van het plan terwijl het bezig was.
Waarom dit ertoe doet (Volgens het paper)
- Privacy: Omdat dit systeem klein genoeg is om op je eigen computer (of een lokale server) te draaien, hoef je je privédata niet naar de cloud van een groot bedrijf te uploaden om een diep onderzoeksrapport te krijgen.
- Kosten: Je hoeft geen dure, enorme AI-modellen te betalen om kwalitatief hoogwaardig onderzoek te doen.
- Kwaliteit: De rapporten zijn dieper en slimmer omdat de AI in staat is om van gedachten te veranderen tijdens het werk, net zoals een menselijke onderzoeker dat doet.
Kortom: Het paper laat zien dat je geen gigantisch brein nodig hebt om diepgaand onderzoek te doen; je hebt alleen een slimme manier van werken nodig (WARP) die de AI in staat stelt om te leren en zich aan te passen terwijl het schrijft.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.