Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation
Dieser Beitrag stellt \textsc{Ptah} vor, ein Multi-Agenten-Framework, das Planung, die Sammlung von Evidenz mit einem visuellen Arbeitsgedächtnis sowie die verifizierer-gesteuerte Generierung von Berichten orchestriert, um zuverlässige, zitiergetreue und visuell verflochtene multimodale Deep-Research-Berichte zu erstellen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie bitten einen intelligenten Assistenten, einen detaillierten, professionellen Bericht über ein komplexes Thema zu verfassen, wie etwa „Wie funktionieren tiefe neuronale Netze?" oder „Wie ist der aktuelle Stand des Marktes für Elektrofahrzeuge?"
In der Vergangenheit hätten diese Assistenten einfach eine Textwand ausgegeben. Manchmal hätten sie Fakten falsch dargestellt (halluziniert), und wenn sie versuchten, Bilder hinzuzufügen, wären diese Bilder oft zufällig, irrelevant oder ungeschickt platziert gewesen, wie eine Collage, die von jemandem erstellt wurde, der die Anweisungen nicht gelesen hatte.
Dieses Papier stellt PTAH vor, ein neues System, das wie ein Meister-Bauunternehmen für die Erstellung solcher Berichte fungiert. Anstatt dass ein einzelner Arbeiter versucht, alles auf einmal zu erledigen, setzt PTAH ein Team spezialisierter Agenten ein, die unter strenger Aufsicht zusammenarbeiten, um einen Bericht zu erstellen, der Text und Bilder perfekt miteinander verbindet.
So funktioniert PTAH, aufgeschlüsselt in einfache Schritte:
1. Der Bauplan (Planung)
Zunächst agiert ein Planer-Agent wie ein Architekt. Bevor ein einziger Stein gelegt wird, zeichnet er einen detaillierten Bauplan. Er entscheidet:
- Welche Abschnitte der Bericht benötigt.
- Welche Fakten gefunden werden müssen.
- Entscheidend: Wo Bilder platziert werden sollen und welche Art von Bildern benötigt wird (z. B. „Hier benötigen wir ein Diagramm, um das Umsatzwachstum zu zeigen" oder „Wir benötigen eine Grafik, um den Motor zu erklären").
2. Das Sammelteam (Recherche)
Als Nächstes macht sich ein Team von Forschungs-Agenten auf den Weg ins Internet, um Materialien zu sammeln.
- Sie finden die Fakten und notieren sie.
- Sie agieren zudem wie eine visuelle Schnitzeljagd. Sie greifen nicht einfach irgendein Bild, sondern suchen nach spezifischen Bildern, die zum Bauplan passen.
- Sie legen diese „quellenabgestimmten" Bilder (Bilder, die tatsächlich von den besuchten Websites stammen) in ein spezielles visuelles Arbeitsgedächtnis. Stellen Sie sich dies als eine digitale Werkzeugkiste vor, in der jedes Werkzeug (Bild) genau mit seiner Herkunft und dem zu beweisenden Inhalt beschriftet ist.
3. Der Qualitätskontrolleur (Der Verifizierer)
Dies ist der wichtigste Teil. Bevor der Bericht in die nächste Phase übergeht, agiert ein Verifizierer-Agent als strenger Bauinspektor.
- Er prüft: „Haben Sie die behaupteten Fakten tatsächlich gefunden?"
- Er prüft: „Stammt dieses Bild tatsächlich von der zitierten Website?"
- Er prüft: „Macht dieses Bild in diesem Absatz Sinn?"
- Ist die Antwort „Nein", muss das Team zurückkehren und es korrigieren. Dies verhindert, dass das System falsche Fakten erfindet oder zufällige, verwirrende Bilder einfügt.
4. Das Fließband (Verfassen)
Schließlich setzt ein Schreib-Agent das Endprodukt zusammen. Anstatt einfach Text zu tippen und zu hoffen, dass später ein Bild passt, schreibt er den Text und die Bildanweisungen gemeinsam, wie ein Dirigent, der ein Orchester leitet.
- Er nutzt die „Werkzeugkiste" verifizierter Bilder.
- Falls ein spezifisches Diagramm benötigt wird, das noch nicht existiert, kann er eines generieren.
- Anschließend verwandelt er das Ganze in eine polierte, interaktive Webseite (wie eine Mini-Website), die professionell aussieht und leicht zu lesen ist.
Das „Test-Time Scaling" (Das Polieren)
Bevor PTAH den Bericht an Sie übergibt, führt es eine letzte Runde des „Polierens" durch. Es betrachtet den gesamten Bericht erneut, um Abstände zu korrigieren, sicherzustellen, dass die Bilder nicht zu überladen sind, und zu gewährleisten, dass das Layout auf einem Bildschirm gut aussieht. Es ist wie ein abschließender Rundgang, bevor das Haus verkauft wird.
Wie sie es getestet haben (PTAHEval)
Die Forscher stellten fest, dass alte Tests nur prüften, ob der Text gut war. Sie entwickelten einen neuen Test namens PTAHEval, um das gesamte Paket zu bewerten:
- Bildinhaltsqualität: Ist das Bild klar? Hilft es tatsächlich, den Text zu erklären?
- Präsentationsqualität: Sieht die finale Webseite gut aus? Ist sie leicht zu lesen, oder ist es ein chaotisches Durcheinander?
Die Ergebnisse
Als sie PTAH gegen andere intelligente Systeme testeten:
- Bessere Fakten: PTAH machte weniger Fehler und zitierte viel häufiger echte Quellen.
- Bessere Bilder: Die Bilder waren tatsächlich relevant und hilfreich, nicht nur Dekoration.
- Besseres Layout: Die finalen Berichte sahen aus wie professionelle Dokumente, nicht wie unordentliche Entwürfe.
Kurz gesagt: PTAH ist wie die Einstellung eines Teams aus Architekten, Bauarbeitern und Inspektoren zum Hausbau, anstatt eine Person zu bitten, den Bauplan zu erraten und alles auf einmal zu bauen. Das Ergebnis ist ein Bericht, der nicht nur intelligent ist, sondern auch visuell vertrauenswürdig und für Menschen leicht verständlich.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.