← Nieuwste papers
🤖 AI

CryptoAnalystBench: Failures in Multi-Tool Long-Form LLM Analysis

Dit artikel introduceert CryptoAnalystBench, een benchmark en evaluatiekader dat kritieke fouten blootlegt in de prestaties van geavanceerde LLM-agenten bij het analyseren van complexe, multi-tool crypto- en DeFi-data, en een taxonomie van deze fouten biedt om toekomstige systemen te verbeteren.

Oorspronkelijke auteurs: Anushri Eswaran, Oleg Golev, Darshan Tank, Sidhant Rahi, Himanshu Tyagi

Gepubliceerd 2026-03-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Anushri Eswaran, Oleg Golev, Darshan Tank, Sidhant Rahi, Himanshu Tyagi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een super-intelligente, digitale analist hebt die je helpt met het beheren van je geld. Deze robot kan razendsnel duizenden nieuwsberichten, prijslijsten en complexe grafieken lezen. Hij lijkt perfect, totdat hij een fout maakt die je duizenden euro's kan kosten.

Dit is precies wat de onderzoekers van CryptoAnalystBench hebben onderzocht. Ze hebben gekeken naar wat er misgaat als deze slimme AI's proberen complexe financiële vragen te beantwoorden in de wereld van crypto, waar alles elke seconde verandert.

Hier is een simpele uitleg van hun werk, met behulp van een paar creatieve vergelijkingen:

1. Het Probleem: De "Overvolle Tafel"

Stel je voor dat deze AI-analist aan een enorme tafel zit. Op die tafel liggen:

  • 50 kranten van vandaag en gisteren.
  • 20 live televisieschermen met beurskoersen.
  • 10 computers die code uitvoeren.
  • En een klok die elke seconde tikt.

De taak van de AI is om al die informatie te combineren en een advies te geven, zoals: "Moet ik mijn Bitcoin verkopen of houden?"

Het probleem is dat de AI vaak verdwijnt in de chaos. Hij kan de juiste krant niet vinden, de cijfers op het scherm verwarren met die van gisteren, of een advies geven dat logisch klinkt maar gebaseerd is op een oude, vergeten nieuwsbericht. In de echte wereld noemen we dit hallucinaties of verouderde informatie, maar in de crypto-wereld betekent dit direct geldverlies.

2. De Oplossing: Een Nieuwe "Testbaan" (CryptoAnalystBench)

De onderzoekers hebben een nieuwe testbaan gebouwd, genaamd CryptoAnalystBench.

  • Vroeger: Testen we AI's met simpele vragen als "Wat is de prijs van Bitcoin?" (alsof je een kind vraagt om de tijd te kijken).
  • Nu: Ze hebben 198 echte, moeilijke vragen verzameld van echte beleggers. Denk aan: "Hoe beïnvloedt een nieuwe update in het Ethereum-netwerk mijn portefeuille de komende drie maanden?"

Het is alsof ze in plaats van een kind dat de tijd kijkt, nu een proefpersoon in een storm hebben gezet en kijken of die nog steeds een boot kan sturen.

3. De "Rechter" (LLM-as-a-Judge)

Om te zien of de AI het goed doet, hebben ze een andere, nog slimmere AI ingezet als rechter. Deze rechter kijkt naar vier dingen:

  1. Is het vers? (Is de informatie van vandaag of van vorige week?)
  2. Klopt het verhaal? (Zeggen de cijfers niet tegen elkaar?)
  3. Is het diepgaand? (Geef je een oppervlakkig antwoord of een echt advies?)
  4. Is het relevant? (Beantwoord je de vraag die de mens stelde?)

De verrassing: De "rechter-AI" is goed in het vinden van simpele fouten, maar mist vaak de subtiele, gevaarlijke fouten.

  • Vergelijking: Een AI-rechter ziet misschien dat een getal verkeerd is (een foutje in de som), maar mist dat de AI een risico heeft vergeten te noemen dat cruciaal is voor de beslissing. Het is alsof een keurmeester zegt: "De taart is mooi versierd," maar niet ziet dat er gif in de vulling zit.

4. De Zeven "Gevarenzones" (Fouten Taxonomie)

De onderzoekers hebben ontdekt dat de slimste AI's niet faalt omdat ze "dom" zijn, maar omdat ze strategisch faalt. Ze hebben zeven soorten fouten geïdentificeerd die vaak over het hoofd worden gezien:

  1. Verouderd (Staleness): De AI geeft je een kaart van een stad, maar de stad is gisteren verplaatst. (Gebruikt oude data).
  2. Tegenstrijdig: De AI zegt links: "De markt stijgt" en rechts: "De markt stort in", zonder te zeggen welke waar is.
  3. Bronverwarring: De AI krijgt twee verschillende getallen van twee verschillende websites en kiest er één, zonder te zeggen dat ze het oneens zijn.
  4. Oppervlakkig: De AI somt feiten op, maar legt niet uit waarom ze belangrijk zijn. (Zoals een recept dat alleen ingrediënten noemt, maar niet hoe je het kookt).
  5. Risico-vergeten: De AI zegt: "Dit is een geweldige investering!" maar vergeet te zeggen dat het ook gevaarlijk kan zijn.
  6. Te zelfverzekerd: De AI voorspelt de toekomst met 100% zekerheid, terwijl niemand dat kan.
  7. Deel-antwoord: De AI beantwoordt slechts de helft van de vraag en doet alsof het klaar is.

5. Wat betekent dit voor ons?

De belangrijkste conclusie van het papier is: We kunnen niet alleen vertrouwen op simpele cijfers of automatische controles.

Zelfs de slimste AI's (de "topmodellen") maken deze fouten. In de crypto-wereld, waar alles snel gaat, is het gevaarlijk om blindelings op een robot te vertrouwen die denkt dat hij alles weet.

De les voor de toekomst:
Als we AI willen gebruiken voor belangrijke beslissingen (zoals geld, gezondheid of recht), moeten we niet alleen kijken of het antwoord "goed" is, maar ook kijken hoe het antwoord tot stand is gekomen. We moeten de AI leren om te zeggen: "Ik weet het niet zeker," of "Deze twee bronnen zeggen iets anders, wees voorzichtig."

Kortom: De AI is een fantastische assistent, maar nog geen baas. We moeten blijven controleren of hij niet in de war raakt in de storm van informatie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →