Foresight Arena: An On-Chain Benchmark for Evaluating AI Forecasting Agents
Dit artikel introduceert Foresight Arena, een permissionless, on-chain benchmark die AI-voorspellers evalueert op real-world voorspellingmarkten met behulp van trustless smart contracts en proper scoring rules om voorspellende nauwkeurigheid rigoureus te meten terwijl overfitting en datacontaminatie worden voorkomen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een gigantisch, digitaal arena voor waar AI-"kristallen bollen" met elkaar concurreren om de toekomst te voorspellen. Dit artikel introduceert Foresight Arena, een nieuwe manier om te testen of Artificial Intelligence werkelijk goed is in het voorspellen van gebeurtenissen in de echte wereld, of dat het gewoon raadt.
Hier is de uitleg van hoe het werkt, met behulp van eenvoudige analogieën.
1. Het Probleem: Waarom Oude Tests Gebrekkig Waren
Voorheen hadden tests voor AI-voorspellers drie grote gaten:
- Het "Spiekbriefje"-Probleem: Oude tests gebruikten statische vragen (zoals een vaste quiz). AI-modellen hadden de antwoorden misschien al gezien tijdens hun training, dus ze voorspelden niet echt; ze herinnerden zich alleen.
- Het "Scheidsrechter"-Probleem: De meeste tests vertrouwden op een mens of een centraal bedrijf om de score bij te houden. Als die scheidsrechter bevooroordeeld was of gehackt werd, waren de resultaten nep.
- Het "Handelaar vs. Ziener"-Probleem: Sommige tests maten hoeveel geld een AI verdiende door te wedden op gebeurtenissen. Maar geld verdienen gaat niet alleen om het hebben van gelijk; het gaat om wanneer je wedt en hoeveel je riskeert. Een AI kon verschrikkelijk zijn in het voorspellen van de toekomst, maar toch geld verdienen door een gelukkige gokker te zijn.
2. De Oplossing: Een Vertrouwensloos, Digitaal Stadion
Foresight Arena lost dit op door de test te bouwen op een blockchain (een openbaar, onveranderlijk digitaal grootboek).
- Het "Commit-Reveal"-Spel: Stel je een pokerpartij voor waarbij je je gok op een stukje papier moet schrijven, het in een envelop moet stoppen en op tafel moet leggen voordat iemand anders het kan zien. Pas nadat iedereen zijn gokken heeft verzegeld, open je de enveloppen. Dit voorkomt dat AI-agenten bedriegen door te kijken wat anderen eerst hebben geraden.
- De "Geen-Menselijke-Rechter"-Regel: De resultaten worden niet beslist door een persoon. Ze worden automatisch gelezen uit een openbaar, gedecentraliseerd systeem (Polymarket/Gnosis). Als het evenement plaatsvindt, weet de blockchain het. Niemand kan de score achteraf veranderen.
- De "Gratis Toegang"-Regel: Iedereen (of elke AI) kan deelnemen zonder om toestemming te vragen.
3. Het Scorebord: "Waarheid" vs. "Geluk" Meten
In plaats van geld te tellen, gebruikt de arena een speciale wiskundige formule genaamd de Brier Score.
- De Analogie: Denk aan een weerman. Als hij zegt "Er is 90% kans op regen" en het regent, krijgt hij een goede score. Als hij 90% zegt en het is zonnig, krijgt hij een slechte score. De score meet hoe dicht hun vertrouwen bij de werkelijkheid lag.
- De "Alpha Score" (De Rand): Dit is het geheime ingrediënt van het artikel. Het vraagt niet alleen: "Had je gelijk?" Het vraagt: "Had je meer gelijk dan de menigte?"
- Stel je een menigte van 1.000 mensen voor die de winnaar van een sportwedstrijd raden. De "Marktconsensus" is het gemiddelde van die menigte.
- Als een AI hetzelfde raadt als de menigte, is zijn score nul.
- Als de AI anders raadt en het blijkt juist te zijn, krijgt hij een positieve score. Dit bewijst dat de AI een stukje informatie vond dat de menigte miste.
4. Het Experiment: Wie Won?
De auteurs voerden een live test uit van 50 rondes met vijf top-AI-modellen (van bedrijven zoals Anthropic, OpenAI, Google, enz.) en een "Willekeurige Baseline" (een computer die willekeurige getallen raadt).
De Resultaten:
- De Willekeurige Raadslaars: Ze faalden jammerlijk, wat bewijst dat de test werkt.
- De Top-AI-Modellen: Drie modellen (Claude, GPT en Gemini) deden het iets beter dan de menigte, maar het verschil was miniem. Het was als een race waarbij de top drie renners binnen een fractie van een seconde van elkaar finishten. De test was niet lang genoeg om met zekerheid te zeggen wie de absolute snelste was.
- De "Kopieer"-Modellen: Twee modellen (Grok en GLM) probeerden te raden wat de menigte dacht, maar voegden wat "ruis" toe (willekeurige fouten). Ze deden het eigenlijk slechter dan gewoon perfect de menigte te kopiëren. Dit is een belangrijke bevinding: Proberen iets anders te zijn dan de menigte terwijl je niet eigenlijk slimmer bent, schaadt alleen je score.
5. De "Anatomie" van een Goede Voorspelling
Het artikel breekt uit waarom een AI wint of verliest met behulp van een "Murphy Decomposition" (een ingewikkelde manier om een score uit elkaar te halen):
- Resolutie (De "Scherpte"): Kan de AI het verschil zien tussen een waarschijnlijke gebeurtenis en een onwaarschijnlijke? De winnaars waren "scherper" dan de menigte.
- Betrouwbaarheid (De "Eerlijkheid"): Als een AI zegt "70% kans", gebeurt het dan 70% van de tijd? De winnaars waren zeer eerlijk over hun vertrouwen.
- De Les: Om de markt te verslaan, moet je scherper zijn dan de menigte. Gewoon "kalm" of "eerlijk" zijn is niet genoeg als je niet dingen ziet die de menigte mist.
6. De Grote Conclusie
Dit artikel bouwde een permanent, onveranderlijk reputatiesysteem voor AI.
- In het verleden kon een AI-bedrijf beweren: "Onze AI is de beste voorspeller!" en je een zelfgemaakte spreadsheet laten zien.
- Nu, met Foresight Arena, heeft een AI een openbaar, onvervalst trackrecord op de blockchain. Je kunt zelf naar de geschiedenis kijken.
De Kernboodschap:
Het artikel concludeert dat hoewel huidige AI-modellen veel beter zijn dan willekeurig gissen, ze momenteel zeer dicht bij de "collectieve wijsheid" van de menselijke menigte zitten. Om te bewijzen dat een AI echt superieur is, moeten we deze tests veel langer blijven uitvoeren (honderden rondes, niet slechts 50) om te zien of de kleine verschillen optellen tot een duidelijke winnaar.
Wat het artikel NIET beweert:
- Het zegt niet dat deze AI's de aandelenmarkt kunnen voorspellen voor winst (dat is een ander spel).
- Het zegt niet dat deze AI's klaar zijn om regeringen of ziekenhuizen te runnen.
- Het claimt niet dat de huidige resultaten het laatste woord zijn; het stelt expliciet dat de test langer moet lopen om de top-prestators te scheiden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.