Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation
Dit artikel introduceert \textsc{Ptah}, een multi-agent framework dat planning, bewijsverzameling met een visueel werkgeheugen en door een verificateur afgedwongen rapportgeneratie coördineert om betrouwbare, naar bronnen getrouwe en visueel verweven multimodale diep onderzoekrapporten te produceren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een slimme assistent vraagt om een gedetailleerd, professioneel rapport te schrijven over een complex onderwerp, zoals "Hoe werken diepe neurale netwerken?" of "Wat is de huidige stand van zaken op de markt voor elektrische voertuigen?"
In het verleden spuwden deze assistenten gewoon een muur van tekst uit. Soms haalden ze feiten verkeerd (hallucineerden), en als ze probeerden afbeeldingen toe te voegen, waren de beelden vaak willekeurig, ongerelateerd of onhandig geplaatst, alsof het een collage was gemaakt door iemand die de instructies niet had gelezen.
Dit paper introduceert PTAH, een nieuw systeem dat is ontworpen om te fungeren als een meesterbouwteam voor het bouwen van deze rapporten. In plaats van dat één alleenstaande werknemer probeert alles tegelijk te doen, gebruikt PTAH een team van gespecialiseerde agenten die onder strikt toezicht samenwerken om een rapport te bouwen dat tekst en afbeeldingen perfect combineert.
Hier is hoe PTAH werkt, opgesplitst in eenvoudige stappen:
1. Het Ontwerp (Planning)
Eerst treedt een Planner Agent op als een architect. Voordat er ook maar één baksteen wordt gelegd, tekent het een gedetailleerd ontwerp. Het beslist:
- Welke secties het rapport nodig heeft.
- Welke feiten gevonden moeten worden.
- Cruciaal: Waar afbeeldingen moeten komen en wat voor soort afbeeldingen er nodig zijn (bijvoorbeeld: "We hebben hier een grafiek nodig om de omzetgroei te tonen," of "We hebben een diagram nodig om de motor uit te leggen").
2. Het Verzamelteam (Onderzoek)
Vervolgens gaat een team van Researcher Agents het internet op om materiaal te verzamelen.
- Ze vinden de feiten en schrijven ze op.
- Ze fungeren ook als een visuele schatzoeken. Ze grijpen niet zomaar een willekeurige afbeelding; ze zoeken naar specifieke afbeeldingen die overeenkomen met het ontwerp.
- Ze plaatsen deze "bron-gealigneerde" afbeeldingen (afbeeldingen die daadwerkelijk afkomstig zijn van de websites die ze hebben bezocht) in een speciale Visuele Werkgeheugen. Denk hierbij aan een digitale gereedschapskist waar elk gereedschap (afbeelding) is gelabeld met precies waar het vandaan komt en wat het moet bewijzen.
3. De Kwaliteitscontroleur (De Verificator)
Dit is het belangrijkste onderdeel. Voordat het rapport naar de volgende fase gaat, treedt een Verifier Agent op als een strenge bouwinspecteur.
- Het controleert: "Heb je de feiten die je beweerde, daadwerkelijk gevonden?"
- Het controleert: "Komt deze afbeelding echt van de website die je citeerde?"
- Het controleert: "Maakt deze afbeelding zin naast deze alinea?"
- Als het antwoord "Nee" is, moet het team teruggaan en het herstellen. Dit voorkomt dat het systeem valse feiten verzonnen of willekeurige, verwarrende afbeeldingen plakt.
4. De Assemblagelijn (Schrijven)
Tot slot assembleert een Writer Agent het eindproduct. In plaats van alleen tekst te typen en te hopen dat er later een afbeelding bij past, schrijft het de tekst en de afbeeldingsinstructies samen, alsof het een dirigent is die een orkest leidt.
- Het gebruikt de "gereedschapskist" met geverifieerde afbeeldingen.
- Als een specifieke grafiek nodig is die nog niet bestaat, kan het er een genereren.
- Het zet het geheel vervolgens om in een gepolijste, interactieve webpagina (zoals een mini-website) die er professioneel uitziet en makkelijk te lezen is.
De "Test-Time Scaling" (De Afwerking)
Voordat het rapport aan jou wordt overhandigd, doet PTAH een laatste ronde van "afwerking". Het bekijkt het hele rapport opnieuw om de opmaak te corrigeren, ervoor te zorgen dat de afbeeldingen niet te druk staan, en te garanderen dat de lay-out er goed uitziet op een scherm. Het is alsof er een laatste rondgang wordt gedaan voordat het huis wordt verkocht.
Hoe Ze Het Testten (PTAHEval)
De onderzoekers realiseerden zich dat oude tests alleen controleerden of de tekst goed was. Ze creëerden een nieuwe test genaamd PTAHEval om het hele pakket te beoordelen:
- Kwaliteit van Afbeeldingsinhoud: Is de afbeelding duidelijk? Helpt het de tekst daadwerkelijk te verklaren?
- Presentatiekwaliteit: Ziet de uiteindelijke webpagina er goed uit? Is het makkelijk te lezen, of is het een rommelige warboel?
De Resultaten
Toen ze PTAH testten tegenover andere slimme systemen:
- Betere Feiten: PTAH maakte minder fouten en verwees veel vaker naar echte bronnen.
- Betere Afbeeldingen: De afbeeldingen waren daadwerkelijk relevant en nuttig, niet alleen decoratie.
- Betere Lay-out: De uiteindelijke rapporten leken op professionele documenten, niet op rommelige concepten.
Kortom: PTAH is alsof je een team van architecten, bouwers en inspecteurs huurt om een huis te bouwen, in plaats van één persoon te vragen het ontwerp te raden en het allemaal in één keer te bouwen. Het resultaat is een rapport dat niet alleen slim is, maar ook visueel betrouwbaar en makkelijk voor mensen te begrijpen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.