AgentFinVQA: A Deployable Multi-Agent Pipeline for Auditable Financial Chart QA
AgentFinVQA ist eine einsatzfähige Multi-Agenten-Pipeline für die prüfbare Beantwortung von Fragen zu Finanzdiagrammen, die eine erstklassige Genauigkeit auf dem FinMME-Benchmark erreicht und gleichzeitig die Datenresidenz gewährleistet sowie eine nachvollziehbare Verifizierung für regulierte Umgebungen bereitstellt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie sind ein Finanzanalyst, der versucht, ein komplexes Diagramm zu lesen, um eine Frage zu beantworten wie: „Welche Jahre hatten Umsätze zwischen 10.000 $ und 25.000 $?“
Wenn Sie eine Standard-KI (ein „Zero-Shot“-Modell) bitten, dies zu tun, ist das so, als würden Sie einem brillanten, aber ungeduldigen Praktikanten sagen, er solle kurz einen Blick auf das Diagramm werfen und die Antwort herausbrüllen. Er mag die Antwort richtig haben, aber er könnte auch raten, halluzinieren oder ein winziges Detail übersehen. Schlimmer noch: Sie haben keine Ahnung, wie er auf die Antwort gekommen ist, und falls er falsch liegt, können Sie es nicht beweisen. In der Finanzwelt, in der Regeln streng sind und Daten sensibel sind, kann man einem „Black Box“-Modell nicht einfach blind vertrauen. Sie müssen die Schritte kennen, und Sie können Ihre privaten Kundendaten nicht einem Fremden auf dessen Computer schicken.
AgentFinVQA ist die Lösung, die die Autoren entwickelt haben. Betrachten Sie dies nicht als einen einzelnen Genies, sondern als eine spezialisierte Fabrik-Montageband, um Fragen zu Diagrammen zu beantworten. Anstatt dass eine Person alles macht, wird die Arbeit in ein Team von Spezialisten aufgeteilt, von denen jeder eine spezifische Aufgabe hat, und jeder einzelne Schritt wird in einem permanenten „Beleg“ (einem sogenannten Model Evaluation Packet) festgehalten, damit Sie genau nachvollziehen können, was passiert ist.
So funktioniert diese „Fabrik“ Schritt für Schritt:
- Der Planer (Der Architekt): Bevor irgendjemand das Diagramm ansieht, liest dieser rein textbasierte Agent die Frage und die Multiple-Choice-Optionen. Er sieht das Bild noch nicht. Er erstellt eine Checkliste: „Okay, wir müssen die Farben prüfen, die Jahre betrachten und die Balken vergleichen.“ Er sagt dem Team genau, wonach es zu suchen hat.
- Der OCR-Reader (Der Schreiber): Dieser Agent betrachtet das Diagramm und liest nur den Text (Titel, Achsenbeschriftungen, Zahlen). Er schreibt dies in einer ordentlichen Liste auf. Dies verhindert, dass der nächste Schritt eine verschwommene Beschriftung falsch liest.
- Der Legenden-Grunder (Der Übersetzer): Diagramme verwenden oft Farben (rote Linie, blauer Balken), um verschiedene Dinge darzustellen. Dieser Agent ordnet die Farben den Namen zu (z. B. „Rot = Umsatz 2023“). Er erstellt eine Karte, damit niemand später die Farben verwechselt.
- Das Farb-Flächen-Tool (Das Maßband): Für knifflige Diagramme wie Kreisdiagramme oder gestapelte Balkendiagramme ist das Schätzen von Größen mit bloßem Auge schwierig. Dies ist keine intelligente KI; es ist ein einfaches, „dummes“ Rechenwerkzeug. Es zählt buchstäblich die Pixel einer bestimmten Farbe, um ein exaktes Maß zu liefern. Es ist, als würde man ein Lineal benutzen, anstatt mit den Augen zu raten.
- Der Vision-Agent (Der Inspektor): Nun betrachtet der Hauptagent das Diagramm zusammen mit der Checkliste, der Textliste, der Farbanordnung und den Pixelmessungen. Er führt alles zusammen, um eine Antwort zu entwerfen.
- Der Verifizierer (Der Qualitätskontrollmanager): Dies ist der wichtigste Schritt für das Vertrauen. Ein zweiter, unabhängiger Agent betrachtet den Entwurf der Antwort und das Diagramm erneut. Er fragt: „Entspricht das tatsächlich den Daten?“
- Wenn er zustimmt, sagt er „Bestätigt“.
- Wenn er widerspricht, sagt er „Überarbeiten“.
- Entscheidend ist, dass das System einen „Konfidenzwert“ aufzeichnet. Wenn der Manager unsicher ist, markiert er die Antwort zur Überprüfung durch einen Menschen. Dies ermöglicht es Unternehmen, ihre menschlichen Prüfer nur auf die Antworten zu konzentrieren, die wahrscheinlich falsch sind, was Zeit spart.
Warum ist das eine große Sache?
- Es ist auditierbar: Da jeder Schritt in diesem „Beleg“ (dem MEP) aufgezeichnet wird, können Sie zurückblicken und sagen: „Ah, das System ist fehlgeschlagen, weil es die rote und die blaue Linie verwechselt hat.“ Sie wissen genau, warum.
- Es ist privat: Sie können diese gesamte Fabrik auf Ihren eigenen Computern (On-Premise) mit Open-Source-Software betreiben. Sie müssen Ihre geheimen Kunden-Diagramme niemals an die Cloud eines großen Tech-Unternehmens senden.
- Es ist genau: Die Autoren haben das System mit einem anspruchsvollen Datensatz für Finanzdiagramme namens FinMME getestet.
- Wenn sie eine erstklassige kommerzielle KI (Gemini-3) verwendeten, erzielte ihre Fabrik 7,68 % mehr korrekte Antworten, als wenn man die KI direkt fragen würde.
- Wenn sie eine kostenlose Open-Source-KI (Qwen) auf ihren eigenen Servern verwendeten, erhielten sie immer noch 4,84 % mehr korrekte Antworten.
- Der „Qualitätskontrollmanager“ (Verifizierer) war sehr gut darin, Fehler zu erkennen: Wenn er „Bestätigt“ sagte, war die Antwort in 68,2 % der Fälle richtig. Wenn er „Überarbeiten“ sagte, war die ursprüngliche Antwort oft falsch.
Was hat nicht perfekt funktioniert?
Die Autoren geben zu, dass das System nicht magisch ist. Etwa zwei Drittel der Fehler passierten, weil:
- Die KI die Frage missverstanden hat (z. B. dachte sie, „höchster“ bedeute „niedrigster“).
- Sie durch die Legende verwirrt wurde (Verwechslung, welche Farbe für welches Jahr steht).
- Sie eine Zahl falsch gelesen hat, obwohl sie die richtige Stelle im Diagramm gefunden hatte.
Interessanterweise war der „Qualitätskontrollmanager“ nicht besonders gut darin, diese spezifischen Arten von Fehlern zu erkennen. Dies zeigt den Autoren genau, was sie als Nächstes beheben müssen.
Kurz gesagt: AgentFinVQA verwandelt eine riskante, undurchsichtige KI-Vermutung in einen transparenten, schrittweisen Fabrikprozess. Es beweist, dass man hohe Genauigkeit, volle Privatsphäre und eine klare Dokumentation gleichzeitig erreichen kann – genau das, was Finanzinstitute benötigen, um ihrer KI bei ihren Daten zu vertrauen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.