← नवीनतम पेपर
💰 quantitative finance

Foresight Arena: An On-Chain Benchmark for Evaluating AI Forecasting Agents

यह शोधपत्र फॉresiight एरिना (Foresight Arena) को प्रस्तुत करता है, जो एक अनुमतिहीन (permissionless), ऑन-चेन बेंचमार्क है जो वास्तविक दुनिया के प्रेडिक्शन मार्केट्स पर एआई पूर्वानुमान एजेंटों का मूल्यांकन करने के लिए ट्रस्टलेस स्मार्ट कॉन्ट्रैक्ट्स और उचित स्कोरिंग नियमों का उपयोग करता है ताकि ओवरफिटिंग और डेटा संदूषण (data contamination) को रोकते हुए भविष्य कहने की सटीकता को कठोरता से मापा जा सके।

मूल लेखक: Maksym Nechepurenko, Pavel Shuvalov

प्रकाशित 2026-05-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Maksym Nechepurenko, Pavel Shuvalov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक विशाल, डिजिटल अखाड़ा है जहाँ AI "क्रिस्टल बॉल्स" (भविष्य बताने वाले गोले) भविष्य देखने की प्रतियोगिता कर रहे हैं। यह पेपर Foresight Arena को पेश करता है, जो एक नया तरीका है यह परीक्षण करने का कि क्या आर्टिफिशियल इंटेलिजेंस वास्तव में वास्तविक दुनिया की घटनाओं की भविष्यवाणी करने में सक्षम है, या यह केवल एक अनुमान लगा रहा है।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करते हुए।

1. समस्या: पुराने परीक्षण दोषपूर्ण क्यों थे

इससे पहले, AI भविष्यवक्ताओं के परीक्षण में तीन बड़ी कमियाँ थीं:

  • "चीट शीट" की समस्या: पुराने परीक्षणों में स्थिर प्रश्न (जैसे एक निश्चित क्विज़) होते थे। AI मॉडल प्रशिक्षण के दौरान उनके उत्तर देख सकते थे, इसलिए वे वास्तव में "भविष्यवाणी" नहीं कर रहे थे; वे केवल याद कर रहे थे।
  • "रेफरी" की समस्या: अधिकांश परीक्षणों के लिए एक मानव या एक केंद्रीय कंपनी पर स्कोर रखने के लिए निर्भर रहना पड़ता था। यदि वह रेफरी पक्षपाती या हैक हो जाता, तो परिणाम नकली होते।
  • "व्यापारी बनाम भविष्यवक्ता" की समस्या: कुछ परीक्षण यह मापते थे कि किसी घटना पर दांव लगाकर AI ने कितना पैसा कमाया। लेकिन पैसा कमाना केवल सही होने के बारे में नहीं है; यह इस बारे में भी है कि आपने कब दांव लगाया और कितना जोखिम उठाया। एक AI भविष्य बताने में बहुत खराब हो सकता है लेकिन फिर भी एक भाग्यशाली जुआरी बनकर पैसा कमा सकता है।

2. समाधान: एक ट्रस्टलेस, डिजिटल स्टेडियम

Foresight Arena इसे एक ब्लॉकचेन (एक सार्वजनिक, अपरिवर्तनीय डिजिटल लेजर) पर निर्माण करके ठीक करता है।

  • "कमिट-रिवील" (Commit-Reveal) गेम: कल्पना कीजिए कि एक पोकर का खेल है जहाँ आपको अपना अनुमान एक कागज पर लिखना होता है, उसे एक लिफाफे में सील करना होता है, और दूसरों द्वारा देखे जाने से पहले उसे मेज पर रखना होता है। केवल तभी जब सभी अपने अनुमानों को सील कर देते हैं, तब आप लिफाफों को खोलते हैं। यह AI एजेंटों को दूसरों के अनुमानों को देखकर धोखाधड़ी करने से रोकता है।
  • "कोई मानव-न्यायाधीश नहीं" का नियम: परिणाम किसी व्यक्ति द्वारा तय नहीं किए जाते हैं। उन्हें स्वचालित रूप से एक सार्वजनिक, विकेंद्रीकृत प्रणाली (Polymarket/Gnosis) से पढ़ा जाता है। यदि घटना घटती है, तो ब्लॉकचेन को पता चल जाता है। कोई भी बाद में स्कोर को बदल नहीं सकता।
  • "मुफ्त प्रवेश" का नियम: कोई भी (या कोई भी AI) बिना अनुमति मांगे शामिल हो सकता है।

3. स्कोरकार्ड: "सत्य" बनाम "भाग्य" को मापना

पैसे गिनने के बजाय, अखाड़ा ब्रायर स्कोर (Brier Score) नामक एक विशेष गणितीय सूत्र का उपयोग करता है।

  • उपमा: इसे एक मौसम पूर्वानुमानकर्ता की तरह समझें। यदि वे कहते हैं "बारिश की 90% संभावना है" और बारिश होती है, तो उन्हें अच्छा स्कोर मिलता है। यदि वे 90% कहते हैं और धूप निकल आती है, तो उन्हें बुरा स्कोर मिलता है। यह स्कोर इस बात को मापता है कि उनका आत्मविश्वास वास्तविकता के कितने करीब था।
  • "अल्फा स्कोर" (द एज): यह पेपर का मुख्य आकर्षण है। यह केवल यह नहीं पूछता, "क्या आप सही थे?" बल्कि यह पूछता है, "क्या आप भीड़ से अधिक सही थे?"
    • कल्पना कीजिए कि 1,000 लोग एक खेल के विजेता का अनुमान लगा रहे हैं। "मार्केट कंसेंसस" (बाजार सहमति) उस भीड़ का औसत अनुमान है।
    • यदि AI भीड़ के समान ही अनुमान लगाता है, तो उसका स्कोर शून्य होता है।
    • यदि AI अलग अनुमान लगाता है और वह सही साबित होता है, तो उसे सकारात्मक स्कोर मिलता है। यह साबित करता है कि AI ने वह जानकारी ढूंढ ली जो भीड़ से छूट गई थी।

4. प्रयोग: कौन जीता?

लेखकों ने पांच शीर्ष स्तर के AI मॉडलों (Anthropic, OpenAI, Google जैसी कंपनियों के) और एक "रैंडम बेसलाइन" (संख्याओं का रैंडम अनुमान लगाने वाला कंप्यूटर) के साथ 50 राउंड के लिए एक लाइव टेस्ट चलाया।

परिणाम:

  • रैंडम गेसर्स (Random Guessers): वे बुरी तरह विफल रहे, जिससे सिद्ध हुआ कि परीक्षण काम करता है।
  • शीर्ष AI मॉडल: तीन मॉडलों (Claude, GPT, और Gemini) ने भीड़ से थोड़ा बेहतर प्रदर्शन किया, लेकिन अंतर बहुत मामूली था। यह एक ऐसी दौड़ की तरह थी जहाँ शीर्ष तीन धावक एक सेकंड के बहुत छोटे हिस्से के भीतर ही फिनिश लाइन पर पहुँचे। परीक्षण इतना लंबा नहीं था कि यह निश्चित रूप से कहा जा सके कि कौन सबसे तेज है।
  • "कॉपीकैट" मॉडल: दो मॉडलों (Grok और GLM) ने यह अनुमान लगाने की कोशिश की कि भीड़ क्या सोच रही है, लेकिन उन्होंने उसमें कुछ "शोर" (रैंडम त्रुटियां) जोड़ दिया। वे वास्तव में भीड़ की पूरी तरह नकल करने से भी बुरे रहे। यह एक प्रमुख निष्कर्ष है: जब आप वास्तव में स्मार्ट नहीं होते, तो भीड़ से थोड़ा अलग होने की कोशिश करना आपके स्कोर को नुकसान पहुँचाता है।

5. एक अच्छे पूर्वानुमान की "शारीरिक रचना" (Anatomy)

पेपर "मर्फी डिकंपोजिशन" (स्कोर को अलग-अलग हिस्सों में बांटने का एक तरीका) का उपयोग करके यह विश्लेषण करता है कि एक AI क्यों जीतता या हारता है:

  • रेज़ोल्यूशन (तीक्ष्णता/Resolution): क्या AI एक संभावित घटना और एक असंभावित घटना के बीच अंतर कर सकता है? विजेता भीड़ की तुलना में अधिक "शार्प" (तीक्ष्ण) थे।
  • विश्वसनीयता (Reliability/ईमानदारी): जब एक AI कहता है "70% संभावना है," तो क्या यह 70% बार होता है? विजेता अपने आत्मविश्वास के बारे में बहुत ईमानदार थे।
  • सबक: बाजार को हराने के लिए, आपको भीड़ से अधिक तीक्ष्ण (sharp) होने की आवश्यकता है। केवल "शांत" या "ईमानदार" होना पर्याप्त नहीं है यदि आप वह नहीं देख पा रहे हैं जो भीड़ से छूट गया है।

6. बड़ा निष्कर्ष

इस पेपर ने AI के लिए एक स्थायी, अपरिवर्तनीय प्रतिष्ठा प्रणाली बनाई है।

  • अतीत में, एक AI कंपनी दावा कर सकती थी, "हमारा AI सबसे अच्छा भविष्यवक्ता है!" और आपको एक स्प्रेडशीट दिखा सकती थी जिसे उन्होंने खुद बनाया हो।
  • अब, Foresight Arena के साथ, एक AI के पास ब्लॉकचेन पर एक सार्वजनिक, अटूट ट्रैक रिकॉर्ड है। आप स्वयं उसका इतिहास देख सकते हैं।

मुख्य बात:
पेपर निष्कर्ष निकालता है कि हालांकि वर्तमान AI मॉडल रैंडम गेसिंग से बहुत बेहतर हैं, लेकिन वे वर्तमान में "सामूहिक बुद्धिमत्ता" (मानव भीड़) के बहुत करीब हैं। यह साबित करने के लिए कि एक AI वास्तव में श्रेष्ठ है, हमें इन परीक्षणों को बहुत लंबे समय तक (केवल 50 राउंड नहीं, बल्कि सैकड़ों राउंड) चलाना होगा ताकि यह देखा जा सके कि क्या सूक्ष्म अंतर एक स्पष्ट विजेता के रूप में उभरते हैं।

यह पेपर क्या दावा नहीं करता है:

  • यह दावा नहीं करता कि ये AI शेयर बाजार के लाभ के लिए भविष्यवाणी कर सकते हैं (वह एक अलग खेल है)।
  • यह दावा नहीं करता कि ये AI सरकारों या अस्पतालों को चलाने के लिए तैयार हैं।
  • यह दावा नहीं करता कि वर्तमान परिणाम अंतिम शब्द हैं; यह स्पष्ट रूप से बताता है कि शीर्ष प्रदर्शन करने वालों को अलग करने के लिए परीक्षण को लंबे समय तक चलाने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →