MoCA-Agent: A Market-of-Claims Code Agent for Financial and Numerical Reasoning
MoCA-Agent is een market-of-claims code-agent die financieel en numeriek redeneren verbetert door vragen te deconstrueren in atomaire claims voor specialistische verificatie, uitvoerbare code te synthetiseren uit door de markt ondersteunde bewijslast, en strikte verificatie toe te passen om state-of-the-art prestaties te behalen over diverse financiële benchmarks.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer lastig wiskundig probleem probeert op te lossen op basis van een slordige spreadsheet. Als je een standaard AI om dit vraagt, kan deze een lang, zelfverzekerd klinkend verhaal schrijven dat leidt tot het verkeerde getal. Het is als een student die een perfect essay schrijft, maar in de laatste stap per ongeluk door nul deelt — het essay ziet er geweldig uit, maar het antwoord is fout.
Het paper introduceert MoCA-Agent, een nieuw soort AI die specifiek is ontworpen om deze "stille fouten" in financiële en numerieke taken te stoppen. In plaats van de AI gewoon zijn weg te laten praten naar een antwoord, behandelt MoCA-Agent het probleem als een aandelenmarkt voor feiten.
Hier is hoe het werkt, met behulp van eenvoudige analogieën:
1. De "Claim Catalog" (Het opdelen)
In plaats van de AI te vragen "het probleem op te lossen", breekt MoCA-Agent de vraag eerst af in piepkleine, atomaire stukjes die claims worden genoemd.
- Analogie: Stel je voor dat je een huis bouwt. In plaats van te zeggen "Bouw een huis", maak je een lijst van elke baksteen, balk en spijker die nodig is.
- In het paper: Als de vraag is "Wat was de winst?", maakt het systeem claims zoals: "Omzet is $100", "Kosten zijn $20", "Winst betekent Omzet minus Kosten", en "Het teken moet positief zijn".
2. De "Market of Traders" (Het debat)
Dit is de kerninnovatie. Het systeem vraagt niet simpelweg één AI om na te denken. Het huurt vier verschillende "gespecialiseerde handelaren" in om te wedden op de vraag of elke kleine claim waar of onwaar is.
- De Handelaren:
- De Extractor: Controleert of de cijfers overeenkomen met het originele document.
- De Formule Expert: Controleert of de wiskundige logica klopt.
- De Accountant: Controleert of de eenheden (dollars, percentages) en tekens (positief/negatief) correct zijn.
- De Scepticus: Probeert actief fouten te vinden en claims die wankel lijken te "verkopen" (afwijzen).
- De Markt: Elke handelaar plaatst een "koop-" of "verkooporder" op elke claim. Als de Accountant en de Scepticus beide een claim "verkopen" (zeggen dat deze fout is), daalt de marktprijs voor die claim en wordt deze afgewezen. Als iedereen het eens is, stijgt de prijs en wordt de claim geaccepteerd.
- Waarom dit belangrijk is: In normale AI-debatten, als drie AI's het eens zijn over een fout antwoord, klinken ze allemaal zelfverzekerd. Hier kan zelfs als de "Formule Expert" zelfverzekerd is, de "Scepticus" de boel kortsluiten als de cijfers niet kloppen.
3. De "Synthesizer" (Het programma bouwen)
Zodra de markt is uitgeklaren (beslist welke claims worden geaccepteerd), schrijft een "Synthesizer"-agent een Python computerprogramma.
- De Regel: De Synthesizer is strikt verboden om enige claim te gebruiken die de markt heeft afgewezen. Hij mag alleen bouwen met de "goedgekeurde bakstenen".
- Analogie: Het is als een bouwvoorman die alleen de blauwdrukken mag gebruiken die de veiligheidsinspectie hebben doorstaan. Als een blauwdruk is afgewezen, mag hij deze niet gebruiken, zelfs niet als hij dat heel graag wil.
4. De "Verifier" (De veiligheidsinspecteur)
Voordat het definitieve antwoord wordt gegeven, voert een "Code-Aware Verifier" het programma uit.
- De Check: Het controleert niet alleen of de code zonder fouten draait; het controleert of de code overeenkomt met de logica van de markt. Heeft het programma per ongeluk een teken omgedraaid? Heeft het met 100 vermenigvuldigd terwijl het had moeten delen?
- De Reparatie: Als de Verifier een stille fout vindt (zoals een foutief teken), stuurt hij het programma terug voor één ronde van reparatie, waarbij specifiek de fout wordt aangewezen zodat de Synthesizer deze kan herstellen.
5. De "Conflict Arbiter" (De beslisser)
Soms is de markt in de war, of is het programma zwak. In deze gevallen vergelijkt een "Commissie" het antwoord van de markt met een standaard, niet-markt-gebaseerd AI-antwoord. Als ze van mening verschillen, creëert een speciale "Arbiter" een derde, hybride antwoord dat de beste delen van beide combineert.
De Resultaten: Waarom het werkt
De auteurs hebben dit systeem getest op 10 verschillende moeilijke benchmarks met betrekking tot financiële rapporten, complexe tabellen en grafieken.
- De Uitkomst: MoCA-Agent versloeg consequent andere top-tier AI-modellen (inclusief zeer grote modellen zoals GPT-4o en gespecialiseerde financiële modellen).
- Het Geheime Recept: Het werd niet alleen beter omdat het een groter brein gebruikte; het werd beter omdat het de AI ervan weerhield om "hallucinerende", zelfverzekerde maar foutieve getallen te produceren. Door de AI te dwingen om het eens te worden over elk klein feitje voordat de wiskunde wordt uitgevoerd, werden fouten aanzienlijk verminderd.
Beperkingen (De kleine lettertjes)
Het paper is eerlijk over wat dit systeem nog niet kan:
- Het is Duur: Het kost veel meer computer-"gedachten" (API-calls) om dit marktsysteem te draaien dan een simpele AI-chat, waardoor het ongeveer 5 keer duurder is om uit te voeren.
- Het Heeft Engels Nodig: Het systeem is momenteel afgestemd op Engelse financiële taal. Het kan moeite hebben met andere talen of niet-financiële velden zoals biologie.
- Eén-stap Visie: Als de input een grafiek-afbeelding is, gebruikt het systeem één tool om de afbeelding te lezen. Als die tool een label verkeerd leest, krijgen de "handelaren" geen kans om er opnieuw op te wedden; de fout glipt erdoorheen.
Samenvattend: MoCA-Agent is als een accountantskantoor dat niemand op zijn woord gelooft totdat elk getal is ondertekend. Het vervangt "vrij vorm praten" door een gestructureerde, op bewijs gebaseerde markt om ervoor te zorgen dat de uiteindelijke wiskunde daadwerkelijk correct is.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.