Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows
Die Arbeit stellt FinWorkBench (Finch) vor, einen Benchmark aus authentischen Unternehmensdaten, der die begrenzten Fähigkeiten führender KI-Agenten bei der Bewältigung komplexer, multimodaler Finanz- und Buchhaltungsworkflows in realen Umgebungen aufzeigt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stell dir vor, du bist ein neuer Mitarbeiter in einer riesigen, chaotischen Finanzabteilung. Deine Aufgabe ist es, die Bücher zu führen, Berichte zu erstellen und Entscheidungen zu treffen. Aber es gibt ein Problem: Du hast keine sauberen Ordner. Stattdessen hast du einen Berg von alten E-Mails, hunderte von Excel-Tabellen, die sich gegenseitig widersprechen, PDFs mit unleserlichen Grafiken und Notizen, die in den Rand geschrieben wurden.
Genau in diesem Chaos testen die Autoren dieser Studie die neuesten künstlichen Intelligenzen (KI).
Hier ist die Geschichte hinter dem Papier FINCH (FinWorkBench), einfach erklärt:
1. Das Problem: Die KI ist wie ein Schüler, der nur aus Lehrbüchern lernt
Bisher haben wir KI-Modelle getestet, indem wir ihnen saubere, perfekte Aufgaben gegeben haben. Das ist wie ein Mathe-Test, bei dem alle Zahlen auf einem weißen Blatt stehen und die Aufgabe klar ist.
Aber im echten Leben ist Finanzarbeit nicht so.
- Das Chaos: Daten sind verstreut. Eine Zahl steht in einer E-Mail, die Formel für sie in einer Excel-Zelle, und die Erklärung dazu in einem PDF-Bericht.
- Die Länge: Eine Aufgabe dauert nicht nur einen Schritt. Sie ist wie eine lange Reise: Erst Daten sammeln, dann ordnen, dann berechnen, dann prüfen, dann einen Bericht schreiben.
- Die Komplexität: Tabellen haben verschmolzene Zellen, seltsame Farben und Formeln, die wie Geheimsprache aussehen.
Die Forscher sagen: "Unsere KIs sind super in der Schule, aber sie scheitern im echten Leben."
2. Die Lösung: FINCH – Der "Realitäts-Check"
Die Forscher haben einen neuen Test namens FINCH gebaut. Sie haben sich keine künstlichen Aufgaben ausgedacht, sondern echte, alte Arbeitsdokumente von Unternehmen (wie Enron, der Weltbank oder großen Banken) genommen.
Stell dir FINCH vor wie einen großen, verrückten Koffer, den man einem KI-Roboter gibt:
- Darin sind 1.710 Excel-Dateien (manche riesig, mit Millionen von Zellen).
- Dazu kommen PDFs, Bilder und E-Mails.
- Die Aufgabe: "Hier ist ein Koffer mit Chaos. Bitte mache daraus einen sauberen Finanzbericht, der genau das sagt, was der Chef in der E-Mail von vor 10 Jahren wollte."
3. Wie haben sie das gemacht? (Die Detektivarbeit)
Da die alten Daten oft unvollständig oder chaotisch waren, mussten die Forscher wie Detektive arbeiten:
- Spurensuche: Sie haben E-Mail-Threads durchsucht, um zu sehen, was die Menschen damals eigentlich tun wollten.
- Zeitreise: Sie haben Versionen von Excel-Dateien verglichen (Version 1 vs. Version 2), um zu sehen, welche Änderungen gemacht wurden, und daraus die "Aufgabe" rekonstruiert.
- Menschliche Hilfe: Echte Experten (Finanzleute und Informatiker) haben über 700 Stunden gearbeitet, um sicherzustellen, dass die Aufgaben korrekt sind und die Lösungen stimmen.
Das Ergebnis sind 172 komplexe Szenarien, die genau so aussehen wie die Arbeit, die ein echter Finanzanalyst jeden Tag macht.
4. Das Ergebnis: Die KI stolpert
Die Forscher haben die besten KIs der Welt (wie GPT-5, Claude, Gemini) gegen diesen Test antreten lassen. Das Ergebnis war ernüchternd:
- Die Erfolgsquote ist niedrig: Selbst die stärkste KI (GPT-5) hat nur 38,4 % der Aufgaben erfolgreich abgeschlossen. Das bedeutet, sie hat in mehr als 60 % der Fälle versagt.
- Die Zeit: Die KI brauchte durchschnittlich fast 17 Minuten pro Aufgabe, um zu versuchen, sie zu lösen.
- Warum scheitern sie?
- Das "Vergessliche": Wenn eine Aufgabe viele Schritte hat (z. B. erst Daten holen, dann umrechnen, dann prüfen), macht die KI in Schritt 3 einen Fehler, weil sie Schritt 1 vergessen hat.
- Das "Chaos": Wenn eine Tabelle seltsam formatiert ist (z. B. leere Zeilen, verschmolzene Zellen), verliert die KI den Überblick und zieht die falschen Zahlen.
- Die "Geheimsprache": Excel-Formeln enthalten oft versteckte Logik. Die KI schaut nur auf die Zahlen, nicht auf die Formel dahinter, und rechnet falsch.
5. Die Metapher: Der Koch in der Küche
Stell dir die KI als einen super-intelligenten Koch vor, der in einer perfekten Testküche brilliert.
- Der Test: "Mach einen Salat." (Die Zutaten sind sortiert, das Rezept ist klar).
- FINCH: Der Koch muss jetzt in einer verlassenen, chaotischen Küche arbeiten.
- Die Eier sind in einer Schachtel, die im Kühlschrank liegt.
- Das Rezept steht auf einem zerknitterten Zettel, der unter einem Stapel alter Zeitungen liegt.
- Ein Teil der Zutaten ist in einer anderen Sprache beschriftet.
- Der Koch muss den Salat für einen Gast zubereiten, der genau das will, was auf dem zerknitterten Zettel steht.
Die KIs in diesem Test waren wie dieser Koch: Sie konnten den Salat nicht zubereiten, weil sie mit dem Chaos, den fehlenden Zutaten und den verworrenen Anweisungen überfordert waren.
Fazit
Die Botschaft des Papiers ist klar: Künstliche Intelligenz ist noch nicht bereit für den echten Finanz-Alltag. Sie ist gut im Lösen von Rätseln, aber schlecht im Bewältigen von chaotischem, echtem Leben.
FINCH ist wie ein Spiegel, der den KI-Entwicklern zeigt: "Hey, ihr müsst nicht nur klüger werden, ihr müsst auch lernen, mit Unordnung, langen Aufgabenreihen und seltsamen Dokumenten umzugehen, bevor ihr wirklich als Assistenten in Büros eingesetzt werden könnt."
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.