← Nieuwste papers
🤖 AI

AgentFinVQA: A Deployable Multi-Agent Pipeline for Auditable Financial Chart QA

AgentFinVQA is een inzetbare, multi-agent pipeline voor auditeerbare financiële grafiekbeantwoording die de state-of-the-art nauwkeurigheid op de FinMME-benchmark bereikt, terwijl het gegevensresidency waarborgt en traceerbare verificatie biedt voor gereguleerde omgevingen.

Oorspronkelijke auteurs: Aravind Narayanan, Shaina Raza

Gepubliceerd 2026-06-19
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Aravind Narayanan, Shaina Raza

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een financieel analist bent die een complexe grafiek probeert te lezen om een vraag te beantwoorden zoals: "Welke jaren hadden een omzet tussen de \10k en \25k?"

Als je een standaard AI (een "zero-shot" model) vraagt om dit te doen, is dat alsof je een briljante maar ongeduldige stagiair vraagt om even naar de grafiek te kijken en het antwoord te roepen. Ze kunnen het goed hebben, maar ze kunnen ook gokken, hallucineren met getallen, of een klein detail missen. Erger nog, je hebt geen idee hoe ze tot het antwoord kwamen, en als ze het fout hebben, kun je het niet bewijzen. In de financiële wereld, waar regels streng zijn en data gevoelig is, kun je een "black box"-antwoord niet zomaar vertrouwen. Je moet de stappen weten, en je kunt je privéklantgegevens niet naar de computer van een vreemde sturen.

AgentFinVQA is de oplossing die de auteurs hebben gebouwd. Zie dit niet als een enkele genie, maar als een gespecialiseerde fabriekslijn voor het beantwoorden van grafiekvragen. In plaats van één persoon die alles doet, wordt het werk verdeeld over een team van specialisten, elk met een specifieke taak, en elke stap wordt genoteerd in een permanent "bewijs" (een Model Evaluation Packet genoemd), zodat je precies kunt auditeren wat er is gebeurd.

Zo werkt hun "fabriek", stap voor stap:

  1. De Planner (De Architect): Voordat iemand naar de grafiek kijkt, leest deze tekst-gebaseerde agent de vraag en de meerkeuzeopties. Deze ziet de afbeelding nog niet. Het maakt een checklist aan: "Oké, we moeten de kleuren controleren, naar de jaren kijken en de staven vergelijken." Het vertelt het team precies waar ze naar moeten zoeken.
  2. De OCR Reader (De Klerk): Deze agent bekijkt de grafiek en leest alleen de tekst (titels, aslabels, getallen). Dit schrijft het in een nette lijst op. Dit voorkomt dat de volgende stappen een wazig label verkeerd lezen.
  3. De Legend Grounder (De Vertaler): Grafieken gebruiken vaak kleuren (rode lijn, blauwe staaf) om verschillende zaken weer te geven. Deze agent koppelt de kleuren aan hun namen (bijv. "Rood = 2023 Omzet"). Het creëert een kaart zodat niemand later de kleuren verwart.
  4. De Colour-Area Tool (De Meetlat): Voor lastige grafieken zoals cirkeldiagrammen of gestapelde staven is het schatten van de grootte met het blote oog moeilijk. Dit is geen slimme AI; het is een eenvoudige, "domme" rekenmachine. Het telt letterlijk de pixels van een specifieke kleur om een exacte meting te geven. Het is alsof je een liniaal gebruikt in plaats van te gokken met je ogen.
  5. De Vision Agent (De Inspecteur): Nu bekijkt de hoofdagent de grafiek met de checklist, de tekstlijst, de kleurenkaart en de pixelmetingen. Het brengt dit alles samen om een conceptantwoord te formuleren.
  6. De Verifier (De Quality Control Manager): Dit is de belangrijkste stap voor vertrouwen. Een tweede, onafhankelijke agent bekijkt het conceptantwoord en de grafiek opnieuw. De vraag is: "Komt dit daadwerkelijk overeen met de data?"
    • Als de agent het ermee eens is, zegt hij: "Bevestigd."
    • Als de agent het er niet mee eens is, zegt hij: "Herzien."
    • Cruciaal is dat het systeem een "betrouwbaarheidsscore" bijhoudt. Als de manager twijfelt, wordt het antwoord gemarkeerd voor menselijke controle. Dit stelt bedrijven in staat om hun menselijke beoordelaars alleen te laten focussen op de antwoorden die waarschijnlijk fout zijn, wat tijd bespaart.

Waarom is dit een grote zaak?

  • Het is Controleerbaar: Omdat elke stap wordt vastgelegd in dat "bewijs" (de MEP), kun je terugkijken en zeggen: "Ah, het systeem faalde omdat het de rode en blauwe lijnen door elkaar haalde." Je weet precies waarom.
  • Het is Privé: Je kunt deze hele fabriek op je eigen computers draaien (on-premise) met open-source software. Je hoeft je geheime klantgrafieken nooit naar de cloud van een groot technologiebedrijf te sturen.
  • Het is Accuraat: De auteurs hebben dit getest op een uitdagende dataset voor financiële grafieken genaamd FinMME.
    • Wanneer ze een topniveau commerciële AI (Gemini-3) gebruikten, kreeg hun fabriek 7,68% meer correcte antwoorden dan wanneer men de AI direct een vraag stelt.
    • Wanneer ze een gratis, open-source AI (Qwen) gebruikten die op hun eigen servers draaide, kregen ze nog steeds 4,84% meer correcte antwoorden.
    • De "Quality Control Manager" (Verifier) was erg goed in het opsporen van fouten: wanneer hij zei "Bevestigd", was het antwoord in 68,2% van de gevallen juist. Wanneer hij zei "Herzien", was het oorspronkelijke antwoord vaak fout.

Wat werkte er niet perfect?

De auteurs geven toe dat het systeem geen magie is. Ongeveer twee derde van de fouten kwam voort uit:

  1. De AI die de vraag verkeerd begreep (bijv. denken dat "hoogste" betekende "laagste").
  2. Het verwarren van de legenda (het door elkaar halen van welke kleur bij welk jaar hoorde).
  3. Een getal verkeerd lezen, ook al werd de juiste plek op de grafiek gevonden.

Interessant genoeg was de "Quality Control Manager" niet erg goed in het opsporen van dit specifieke type fouten. Dit vertelt de auteurs precies wat ze de volgende keer moeten oplossen.

Kortom: AgentFinVQA verandelt een risicovolle, ondoorzichtige AI-gok in een transparant, stapsgewijs fabrieks-proces. Het bewijst dat je tegelijkertijd een hoge nauwkeurigheid, volledige privacy en een duidelijk dossier kunt hebben, wat precies is wat financiële instellingen nodig hebben om AI met hun data te vertrouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →