← नवीनतम पेपर
💬 NLP

FutureSim: Replaying World Events to Evaluate Adaptive Agents

यह शोधपत्र FutureSim को प्रस्तुत करता है, जो वास्तविक दुनिया की घटनाओं को कालानुक्रमिक रूप से पुन: प्रस्तुत करने वाला एक बेंचमार्क है ताकि भविष्य की घटनाओं का पूर्वानुमान लगाने और लंबी समयावधि में अनुकूलित होने की AI एजेंटों की क्षमता का मूल्यांकन किया जा सके, जो फ्रंटियर मॉडल्स के बीच महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है और बेहतर टेस्ट-टाइम अनुकूलन, मेमोरी और रीजनिंग क्षमताओं की आवश्यकता को रेखांकित करता है।

मूल लेखक: Shashwat Goel, Nikhil Chandak, Arvindh Arun, Ameya Prabhu, Steffen Staab, Moritz Hardt, Maksym Andriushchenko, Jonas Geiping

प्रकाशित 2026-05-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shashwat Goel, Nikhil Chandak, Arvindh Arun, Ameya Prabhu, Steffen Staab, Moritz Hardt, Maksym Andriushchenko, Jonas Geiping

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अगले तीन महीनों के मौसम की भविष्यवाणी करने की कोशिश कर रहे हैं। लेकिन यहाँ एक पेच है: आप केवल एक फोरकास्ट ऐप नहीं देख सकते। इसके बजाय, आपको एक जासूस की तरह काम करना होगा जो केवल आज तक की घटनाओं को जानता है, और आपको अनुमान लगाना होगा कि कल क्या होगा, परसों क्या होगा, और इसी तरह जैसे-जैसे नई खबरें आती जाएँगी।

यह बिल्कुल वैसा ही है जैसा कि FutureSim पेपर के बारे में है। यह एक नया "प्रशिक्षण मैदान" (या बेंचमार्क) है जिसे यह परीक्षण करने के लिए डिज़ाइन किया गया है कि AI एजेंट वास्तविक समय में बदलती दुनिया के साथ कितनी अच्छी तरह अनुकूलित हो सकते हैं।

यहाँ पेपर के विचारों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "स्थिर" बनाम "जीवंत" दुनिया

अधिकांश AI परीक्षण एक ऐसी पाठ्यपुस्तक पर आधारित अंतिम परीक्षा लेने जैसे हैं जो वर्षों से बदली नहीं है। AI उस किताब को पढ़ता है, परीक्षा देता है, और एक ग्रेड प्राप्त करता है। लेकिन वास्तविक दुनिया एक स्थिर पाठ्यपुस्तक नहीं है; यह एक जीवंत, चलती हुई फिल्म है जो चलती रहती है।

लेखकों का तर्क है कि यह देखने के लिए कि क्या कोई AI वास्तव में बुद्धिमान है, हमें यह देखना चाहिए कि क्या वह उस फिल्म को चलते हुए देख सकता है, हर दिन अपनी भविष्यवाणियों को अपडेट कर सकता है, और जब नए मोड़ (खबरें) आते हैं तो अपने विश्वासों को बदल सकता है।

2. समाधान: FutureSim (द "टाइम-ट्रैवल" सिम्युलेटर)

लेखकों ने FutureSim नामक एक सिमुलेशन बनाया है। इसे AI के लिए एक "ग्राउंडहैंड डे" (Groundhog Day) लूप के रूप में सोचें, लेकिन एक ही दिन को बार-बार जीने के बजाय, AI एक विशिष्ट तीन महीने की अवधि (जनवरी से मार्च 2026) के माध्यम से जीता है जो AI के प्रशिक्षण डेटा के समाप्त होने के बाद की है।

  • सेटअप: AI एक "नॉलेज कटऑफ" के साथ शुरू होता है (जैसे एक छात्र जिसने देर से 2025 में पढ़ाई बंद कर दी थी)।
  • कार्य: AI को वास्तविक दुनिया की घटनाओं की भविष्यवाणी करने के लिए कहा जाता है (जैसे, "नेपाल में चुनाव कौन जीतेगा?" या "क्या एक विशिष्ट स्पोर्ट्स टीम जीतेगी?")।
  • तंत्र (Mechanism): हर दिन, सिमुलेशन इतिहास के उस विशिष्ट दिन के वास्तविक समाचार लेखों का एक नया बैच "अनलॉक" करता है। AI इन लेखों को खोज सकता है, उन्हें पढ़ सकता है, और फिर अपनी भविष्यवाणी अपडेट कर सकता है।
  • नियम: AI को भविष्य में झांकने से सख्ती से मना किया गया है। वह केवल वही देख सकता है जो उस विशिष्ट दिन तक ज्ञात था।

3. खेल: भविष्य पर दांव लगाना

इस सिमुलेशन में, AI केवल "हाँ" या "नहीं" में उत्तर नहीं दे रहा है। वह एक पेशेवर जुआरी या मौसम विज्ञानी की तरह कार्य कर रहा है।

  • उसे कहना होगा: "मुझे लगता है कि X होने की 60% संभावना है, Y होने की 30% संभावना है, और Z होने की 10% संभावना है।"
  • स्कोर (बायर स्किल स्कोर - Brier Skill Score): पेपर एक विशेष स्कोरिंग सिस्टम का उपयोग करता है।
    • यदि आप आश्वस्त हैं और सही हैं, तो आपको उच्च स्कोर मिलता है।
    • यदि आप आश्वस्त हैं लेकिन गलत हैं, तो आपको एक नकारात्मक स्कोर मिलता है (भारी दंड)।
    • यदि आप अनिश्चित हैं और कहते हैं "मुझे नहीं पता" (abstain), तो आपको एक तटस्थ स्कोर मिलता है।
    • उपमा: गलत घोड़े पर अपना घर दांव लगाने के बजाय यह कहना बेहतर है कि "मैं निश्चित नहीं हूँ।"

4. परिणाम: खेल में कौन जीता?

लेखकों ने इस वातावरण में कई शीर्ष स्तर के AI मॉडलों (जैसे GPT-5.5, Claude Opus, और अन्य) का परीक्षण किया।

  • विजेता: GPT-5.5 शीर्ष पर आया। यह एकमात्र मॉडल था जो दिनों के बीतने के साथ लगातार अपनी भविष्यवाणियों में सुधार करता रहा, और अंततः लगभग 25% की सटीकता तक पहुँच गया (जो भविष्य की घटनाओं का अनुमान लगाने के लिए प्रभावशाली है)।
  • हारने वाले: कई अन्य मॉडल वास्तव में इससे भी बुरे प्रदर्शन करते यदि उन्होंने केवल अनुमान लगाने से मना कर दिया होता। वे अपने गलत अनुमानों में बहुत अधिक आश्वस्त थे।
  • "हार्नेस" प्रभाव (The "Harness" Effect): पेपर ने पाया कि आप AI को उपकरण कैसे देते हैं, यह मायने रखता है। कुछ मॉडल अपने डिफ़ॉल्ट सेटिंग्स के साथ खराब प्रदर्शन करते हैं, लेकिन उनमें काफी सुधार होता है जब शोधकर्ता उन्हें अपनी मेमोरी प्रबंधित करने और समाचार खोजने के लिए बेहतर "निर्देश" और उपकरण देते हैं। यह एक छात्र को बेहतर अध्ययन गाइड देने जैसा है; वे अचानक बेहतर प्रदर्शन करने लगते हैं।

5. उन्होंने क्या सीखा? (एब्लेशन - Ablations)

शोधकर्ताओं ने यह देखने के लिए खेल को तोड़-तोड़कर देखा कि AI को वास्तव में किन कौशलों की आवश्यकता थी:

  • मेमोरी (स्मृति) महत्वपूर्ण है: यदि आप AI से नोट्स लिखने और कल जो सीखा था उसे याद रखने की क्षमता छीन लेते हैं, तो यह बहुत खराब हो जाता है। आज की पहेली को सुलझाने के लिए इसे अतीत के सुरागों को याद रखने की आवश्यकता है।
  • सर्च (खोज) अत्यंत आवश्यक है: AI को हर दिन नई जानकारी सक्रिय रूप से खोजने की आवश्यकता होती है। यदि आप समाचार को फ्रीज कर देते हैं और इसे नए लेख देखने नहीं देते हैं, तो इसकी भविष्यवाणियाँ अटक जाती हैं और गलत हो जाती हैं।
  • गहराई से सोचना मदद करता है: जब शोधकर्ताओं ने AI को उत्तर देने से पहले "लंबे समय तक और गहराई से सोचने" (अधिक कंप्यूटिंग पावर का उपयोग करने) के लिए कहा, तो यह अधिक सटीक हो गया।
  • "एंकर" समस्या (The "Anchor" Problem): यदि कोई AI शुरुआत में गलत अनुमान लगाता है, तो वह अक्सर उस गलत विचार पर "अटक" जाता है और अपने विचार को बदलने से इनकार कर देता है, भले ही नए सबूत उसे गलत साबित कर दें।

6. यह क्यों मायने रखता है?

पेपर निष्कर्ष निकालता है कि वर्तमान AI मॉडल अभी भी "दीर्घकालिक अनुकूलन" (long-term adaptation) में बहुत अच्छे नहीं हैं। वे उन सवालों के जवाब देने में अच्छे हैं जो वे पहले से जानते हैं, लेकिन वे संघर्ष करते हैं जब उन्हें लगातार सीखना होता है और दुनिया के बदलने के साथ अपने विश्वासों को अपडेट करना होता है।

FutureSim इस विशिष्ट कौशल को मापने का एक यथार्थवादी, पुनरावृत्ति योग्य तरीका प्रदान करता है। यह इस बारे में नहीं है कि क्या AI एक तथ्य जानता है; यह इस बारे में है कि क्या AI एक मानव विशेषज्ञ की तरह कार्य कर सकता है जो समाचार देखता है, हर दिन अपने मानसिक मानचित्र को अपडेट करता है, और समय के साथ बेहतर अनुमान लगाता है।

संक्षेप में: पेपर ने यह परीक्षण करने के लिए एक समय-यात्रा करने वाला न्यूज़रूम बनाया है कि क्या AI वर्तमान को घटित होते देखते हुए भविष्य की भविष्यवाणी करना सीख सकता है। परिणाम दिखाते हैं कि जबकि कुछ AI इसमें अच्छे हो रहे हैं, अधिकांश को अभी भी अपने पहले अनुमान पर अटके बिना अपने विश्वासों को अपडेट करना सीखना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →