← Nieuwste papers
💬 NLP

Herculean: An Agentic Benchmark for Financial Intelligence

Het artikel introduceert Herculean, de eerste agentische benchmark voor financiële intelligentie die AI-agenten evalueert via vier complexe workflows (Handelen, Hedgen, Marktinzichten en Audit) met behulp van gestandaardiseerde op MCP gebaseerde omgevingen, en onthult dat hoewel agenten goed presteren bij handelen en inzichten, ze aanzienlijk moeite hebben met de coördinatie op lange termijn en gestructureerde verificatie die vereist zijn voor hedgen en audit.

Oorspronkelijke auteurs: Xueqing Peng, Zhuohan Xie, Yupeng Cao, Haohang Li, Lingfei Qian, Yan Wang, Vincent Jim Zhang, Huan He, Xuguang Ai, Linhai Ma, Ruoyu Xiang, Yueru He, Yi Han, Shuyao Wang, Yuqing Guo, Mingyang Jiang, Yi
Gepubliceerd 2026-05-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xueqing Peng, Zhuohan Xie, Yupeng Cao, Haohang Li, Lingfei Qian, Yan Wang, Vincent Jim Zhang, Huan He, Xuguang Ai, Linhai Ma, Ruoyu Xiang, Yueru He, Yi Han, Shuyao Wang, Yuqing Guo, Mingyang Jiang, Yilun Zhao, Youzhong Dong, Xiaoyu Wang, Yankai Chen, Ye Yuan, Qiyuan Zhang, Fuyuan Lyu, Haolun Wu, Yonghan Yang, Zichen Zhao, Yuyang Dai, Fan Zhang, Rania Elbadry, Ayesha Gull, Muhammad Usman Safder, Nuo Chen, Fengbin Zhu, Tianshi Cai, Zimu Wang, Polydoros Giannouris, Yuechen Jiang, Zhiwei Liu, Mohsinul Kabir, Yuyan Wang, Yixiang Zheng, Yangyang Yu, Weijin Liu, Wenbo Cao, Anke Xu, Peng Lu, Jerry Huang, Fengran Mo, Mingquan Lin, Prayag Tiwari, Yijia Zhao, Victor Gutierrez Basulto, Xiao-Yang Liu, Kaleb E Smith, Jiahuan Pei, Arman Cohan, Jimin Huang, Yuehua Tang, Alejandro Lopez-Lira, Xi Chen, Xue Liu, Junichi Tsujii, Jian-Yun Nie, Sophia Ananiadou

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een nieuwe financiële assistent inhuurt. In het verleden zou je hen misschien hebben getoetst door te vragen: "Wat was de aandelenkoers van Apple gisteren?" of "Vat dit kwartaalverslag samen." Als ze het antwoord goed hadden, dacht je dat ze slim waren.

Maar de auteurs van dit artikel betogen dat het juist beantwoorden van een enkele vraag niet hetzelfde is als het kunnen uitvoeren van een echte baan. Zij hebben een nieuwe test ontwikkeld genaamd HERCULEAN (een naam die speelt op het idee van een "Herculeaanse" of enorme taak) om te zien of AI-agenten daadwerkelijk kunnen werken als professionele financiële experts, en niet alleen trivia-vragen kunnen beantwoorden.

Hier is een overzicht van hun bevindingen, uitgelegd met eenvoudige analogieën:

De Vier "Banen" die Ze de AI Gaven

In plaats van een simpele quiz, gaven de onderzoekers de AI vier verschillende, complexe taken die echte mensen elke dag uitvoeren. Denk hierbij aan vier verschillende diensten in een financiële fabriek:

  1. De Handelaar (Trading):

    • De Taak: Drie maanden lang moet de AI elke dag beslissen of het een specifieke aandeel moet kopen, verkopen of houden.
    • De Vangst: Het is als schaken waarbij het bord elke dag verandert en je de toekomst niet kunt zien. Je moet een zet doen, leven met de gevolgen, en vervolgens de volgende zet doen op basis van alleen wat je op dat moment weet.
    • Het Resultaat: De AI was hier redelijk in. Het kon beslissingen nemen, hoewel niet altijd winstgevende.
  2. De Risicomanager (Hedging):

    • De Taak: Dit is als een koorddanser. De AI moet twee aandelen kiezen die in tegenovergestelde richtingen bewegen (of in ieder geval verschillend), en wedden op het verschil tussen hen, niet op de markt die omhoog of omlaag gaat.
    • De Vangst: Het vereist het onthouden van de relatie tussen twee verschillende dingen over een lange periode. Als je de details van het eerste aandeel vergeet terwijl je naar het tweede kijkt, val je van het koord.
    • Het Resultaat: De AI had hier moeite mee. Het had moeite om de langetermijnrelatie tussen de twee activa in de gaten te houden.
  3. De Analist (Marktinzichten):

    • De Taak: De AI moet nieuws, prijzen en rapporten lezen, en vervolgens elke week een professioneel investeringsrapport schrijven waarin wordt aanbevolen of er gekocht of verkocht moet worden.
    • De Vangst: Het gaat niet alleen om het vinden van feiten; het gaat om het weven daarvan in een coherent verhaal dat zinvol is voor een menselijke investeerder.
    • Het Resultaat: De AI was verrassend goed hierin. Het schreef vloeiende, goed gestructureerde rapporten die er zeer professioneel uitzagen.
  4. De Auditor (Audit):

    • De Taak: De AI moet optreden als een strenge accountant. Het bekijkt de officiële financiële documenten van een bedrijf en controleert of de cijfers volgens complexe overheidsregels correct optellen.
    • De Vangst: Er is geen ruimte voor "misschien" of "het ziet er goed uit". Het is een wiskundepuzzel waarbij, als je één klein decimaalteken mist of een regel verkeerd interpreteert, het hele resultaat verkeerd is.
    • Het Resultaat: Dit was de moeilijkste baan. De AI faalde regelmatig. Het kon vaak de strenge regels niet volgen of de wiskunde niet correct uitvoeren, zelfs al was het goed in het schrijven van verhalen.

De Grote Ontdekking: "Vloeiendheid" versus "Betrouwbaarheid"

Het artikel vond een vreemde kloof in hoe de AI denkt.

  • Het "Verhaler"-Probleem: De AI is uitstekend in vloeiende generatie. Als je vraagt om een rapport te schrijven of een trend uit te leggen, klinkt het zelfverzekerd en slim. Het is als een student die een prachtig essay kan schrijven maar faalt in de wiskundetoets.
  • Het "Uitvoerder"-Probleem: De AI is slecht in gestructureerde verificatie. Wanneer de taak strikte logica vereist, het controleren van feiten tegen regels, of het onthouden van een staat over een lange periode (zoals bij de Auditor- of Risicomanager-taken), valt het uiteen.

De "Werkbank"-Analogie

De onderzoekers testten ook verschillende "frameworks" (de software-schillen waarin de AI draait). Zij ontdekten dat de prestaties van de AI sterk afhankelijk waren van hoe het zijn tools mocht gebruiken.

  • De "Lichte" Agent: Stel je een AI voor die probeert alles in zijn hoofd te doen zonder dingen op te schrijven. Het raakt snel in de war, vooral bij lange taken.
  • De "Gestructureerde" Agent: Stel je een AI voor die gedwongen wordt een checklist te gebruiken, elke stap op te schrijven en zijn werk te verifiëren voordat het doorgaat. Deze versie presteerde veel beter.

De Les: Het gaat niet alleen om het hebben van een "slimmer" brein (een beter AI-model); het gaat om het hebben van een beter systeem om dat brein te beheren. Een slim brein zonder een goed systeem om het op koers te houden, zal toch fouten maken in banen met hoge risico's.

De Conclusie

Het artikel concludeert dat, hoewel AI beter wordt in het praten over financiën, het nog niet klaar is om het werk van een professionele financiële werknemer te doen. Het kan het rapport schrijven (Marktinzichten), maar het heeft moeite om het risico te beheren (Hedging) of de wiskunde te verifiëren (Audit).

De onderzoekers bouwden HERCULEAN om ons precies te laten zien waar deze "spieren" zwak zijn, zodat ontwikkelaars betere systemen kunnen bouwen die niet alleen slim klinken, maar daadwerkelijk betrouwbaar werken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →