← Nieuwste papers
💻 computer science

StableEval Arena: A Cost-Aware Agentic Benchmark for Stablecoin Price Stability Prediction

StableEval Arena is een kostenbewust benchmarkframework dat LLM-gestuurde agentische systemen evalueert op het gebied van de voorspelling van het risico op het verlies van de koppeling van stablecoins door een gezamenlijk spectrum van voorspellingskwaliteit, operationele betrouwbaarheid en computationele kosten te meten, waarbij wordt onthuld dat hoewel agenten betrouwbaar gestructureerde outputs produceren, ze moeite hebben met het nauwkeurig voorspellen van zeldzame gebeurtenissen met extreme stress en aanhoudende ontkoppeling.

Oorspronkelijke auteurs: Sean Wan, Dongping Liu, Luyao Zhang

Gepubliceerd 2026-08-07
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Sean Wan, Dongping Liu, Luyao Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat jij de kapitein bent van een enorme ruimteschepenvloot, en je laadruimen zijn gevuld met "digitaal goud" dat altijd precies één dollar waard zou moeten zijn. Dit is niet zomaar een soort goud; het is een speciaal soort geld dat een stablecoin wordt genoemd, ontworpen om perfect stabiel te blijven zodat mensen koffie kunnen kopen, huur kunnen betalen of activa kunnen verhandelen zonder zich zorgen te hoeven maken dat hun geld plotseling kan verdwijnen of in waarde kan verdubbelen. Maar hier komt de adder onder het gras bij: ook al horen deze munten saai stabiel te zijn, ze kunnen soms in paniek raken. Wanneer de markt eng wordt, kan de prijs gaan wankelen, onder de dollar zakken of zelfs volledig crashen. Dit wordt "de-pegging" genoemd, en als dat gebeurt, is het alsof de brandstofmeter van je ruimteschip plotseling tegen je liegt.

Om de vloot veilig te houden, hebben we een uitkijk nodig die problemen kan opsporen voordat ze gebeuren. In het verleden gebruikten we eenvoudige wiskunde of menselijke experts. Maar nu hebben we Agentic AI—superintelligente computerprogramma's die zelfstandig kunnen denken, redeneren en beslissingen kunnen nemen, een beetje zoals een digitale co-piloot. De grote vraag is: kunnen deze AI-piloten het echt beter doen dan een simpel regelboekje bij het opsporen van een storm voordat deze toeslaat? We moeten weten of ze werkelijk betrouwbaar zijn, en niet alleen of ze instructies kunnen opvolgen. Als een AI zegt: "Alles is veilig!" vlak voordat het schip crasht, maakt het niet uit hoe snel hij is of hoe mooi zijn rapport eruitziet; dan is het een falen.

Dit is precies waar het papier "StableEval Arena" zich op richt om te testen. De onderzoekers bouwden een enorme, kostenbewuste trainingsgrond (een "arena") om te zien of deze AI-agenten kunnen voorspellen wanneer een stablecoin haar dollar-koppeling gaat verliezen. Ze vroegen de AI niet alleen om de toekomstige prijs te raden; ze vroegen de AI om te handelen als een risicomanager. De AI moest kijken naar de prijsgeschiedenis van de afgelopen 30 dagen en de marktsentiment, en vervolgens voorspellen wat er in de volgende zeven dagen zou gebeuren. Zou de munt Stabiel blijven? Zou hij in een Watch-status terechtkomen (een beetje wankel)? Of zou hij in Stress terechtkomen (een volwaardige crisis)?

De onderzoekers voerden twee verschillende soorten tests uit. Eerst creëerden ze een "stress-test"-versie met 120 gevallen waarin problemen gebruikelijker waren, puur om te zien of de AI de gevarensignalen kon oppikken wanneer ze recht voor hun neus stonden. Daarna voerden ze een "real-world"-versie uit met 507 gevallen die er precies zo uitzagen als de natuurlijke wereld, waarin stablecoins meestal kalm zijn en slechts zelden problemen hebben. Ze testten zes verschillende AI-agenten tegen enkele zeer eenvoudige baselines (zoals een regel die simpelweg zegt "ga ervan uit dat alles in orde is" of een basis wiskundig model).

De resultaten waren een mix van goed nieuws en een serieuze reality check. Aan de goede kant waren de AI-agenten ongelooflijk betrouwbaar in het volgen van de regels. Ze produceerden perfect geformatteerde rapporten, crashten niet en deden dit allemaal tegen een zeer lage kost. Ze waren erg goed in het zeggen: "Hé, de boel ziet er vandaag een beetje wankel uit." Echter, wanneer het aankwam op de belangrijkste taak—het opsporen van een zeldzame, catastrofale crash—schoten de AI-agenten de plank grotendeels mis. In de grote test van 507 gevallen misten de AI-agenten 19 van de 21 werkelijke stress-events. Ze waren zo goed in het volgen van het protocol dat ze geldige rapporten produceerden, maar die rapporten zeiden vaak "Alles is veilig" vlak voordat de munt daadwerkelijk crashte.

Sterker nog, in de real-world test had zelfs een eenvoudig computerprogramma dat simpelweg naar eerdere trends keek, ook moeite met het voorspellen van de zeldzame crashes, waarbij het de meerderheid van de crashes miste, net als de AI. De fancy AI-agenten hadden de klassieke methoden niet gedomineerd of overtroffen; sterker nog, geen van de agenten kon de zeldzame, hoog-risico stress-events betrouwbaar detecteren die er het meest toe deden. Het papier concludeert dat hoewel deze AI-agenten uitstekend zijn in het gehoorzaam en efficiënt zijn, ze nog niet betrouwbaar genoeg zijn om de enige bewakers van ons digitale geld te zijn. Ze kunnen het script perfect volgen, maar ze worstelen nog steeds met het zien van de zeldzame, angstaanjagende stormen die er het meest toe doen. De onderzoekers suggereren dat totdat AI beter wordt in het opsporen van deze zeldzame, hoog-risico gebeurtenissen, we hen niet alleen het ruimteschip moeten laten besturen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →