Agentic Forecasting using Sequential Bayesian Updating of Linguistic Beliefs
यह शोध पत्र BLF (बायेसियन लिंग्विस्टिक फोरकास्टर) को प्रस्तुत करता है, जो एक एजेंटिक सिस्टम है जो अर्ध-संरचित भाषाई विश्वास अवस्था (सेमी-स्ट्रक्चर्ड लिंग्विस्टिक बिलीफ स्टेट), पदानुक्रमित बहु-परीक्षण एकत्रीकरण (हायरार्किकल मल्टी-ट्रायल एग्रीगेशन), और अग्रणी सार्वजनिक पूर्वानुमान विधियों को पछाड़ने के लिए पदानुक्रमित अंशांकन (हायरार्किकल कैलिब्रेशन) का उपयोग करके ForecastBench बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप भविष्य की भविष्यवाणी करने की कोशिश कर रहे हैं। शायद आप अंदाज़ा लगा रहे हैं कि कोई विशिष्ट स्टॉक ऊपर जाएगा या नहीं, कोई राजनीतिक घोटाला सामने आएगा या नहीं, या अगले महीने तक कोई नया टीका (vaccine) स्वीकृत होगा या नहीं।
यह शोध पत्र BLF (Bayesian Linguistic Forecaster) को प्रस्तुत करता है, जो एक नया AI सिस्टम है जिसे परम "सुपर-फोरकास्टर" बनने के लिए डिज़ाइन किया गया है। इसने हाल ही में ForecastBench नामक एक प्रमुख भविष्यवाणी प्रतियोगिता में अन्य सभी शीर्ष AI मॉडलों और मानव विशेषज्ञों को पछाड़ दिया है।
यह कैसे काम करता है, सरल उपमाओं के माध्यम से यहाँ समझाया गया है:
1. समस्या: "अनंत स्क्रॉल" बनाम "स्मार्ट नोटबुक"
अधिकांश AI पूर्वानुमानकर्ता एक अंतहीन न्यूज़ फीड को स्क्रॉल करने वाले व्यक्ति की तरह काम करते हैं। वे जानकारी खोजते हैं, पढ़ते हैं, फिर से खोजते हैं, और अधिक पढ़ते हैं, और जो कुछ भी उन्होंने पढ़ा उसे याद रखने की कोशिश करते हैं। जैसे-जैसे बातचीत लंबी होती जाती है, AI भ्रमित होने लगता है, क्योंकि उसकी "वर्किंग मेमोरी" कचरे से भर जाती है।
BLF का समाधान: "स्मार्ट नोटबुक"
केवल चैट में सभी खोज परिणामों को डालने के बजाय, BLF एक भाषाई विश्वास अवस्था (Linguistic Belief State) बनाए रखता है। इसे एक जासूस की स्मार्ट नोटबुक की तरह समझें।
- हर बार जब AI नई जानकारी खोजता है, तो वह केवल लेख को नोटबुक में पेस्ट नहीं करता है।
- इसके बजाय, वह नए साक्ष्य का सारांश (summarize) निकालता है और अपनी वर्तमान थ्योरी (अपनी संभावना का अनुमान) को नोटबुक में अपडेट करता है।
- उपमा: कल्पना कीजिए कि एक जासूस हत्या की गुत्थी सुलझा रहा है। एक बुरा जासूस बस 500 गवाहों के बयान ढेर कर देता है और उम्मीद करता है कि उत्तर वहीं मिल जाएगा। एक अच्छा जासूस (BLF) एक एकल पृष्ठ रखता है जिस पर लिखा होता है: "वर्तमान थ्योरी: बटलर ने किया (60% संभावना)। नया साक्ष्य: बटलर को फावड़ा खरीदते देखा गया। अपडेट: थ्योरी अब 75% है।" यह AI को केंद्रित रखता है और उसे अभिभूत होने से बचाता है।
2. रणनीति: "पांच का समूह" (The Council of Five)
AI मॉडल चंचल हो सकते हैं। यदि आप एक ही AI से एक ही प्रश्न पांच बार पूछते हैं, तो वह आपको पांच थोड़े अलग उत्तर दे सकता है क्योंकि वह थोड़ा रैंडम है (जैसे पासा फेंकना)।
BLF का समाधान: "पांच का समूह"
AI से एक बार पूछने के बजाय, BLF उससे स्वतंत्र रूप से पांच बार पूछता है।
- कल्पना कीजिए कि आप घुड़दौड़ के विजेता का अनुमान लगाने की कोशिश कर रहे हैं। आप केवल एक दोस्त से नहीं पूछते। आप पांच अलग-अलग दोस्तों से पूछते हैं जो विशेषज्ञ हैं।
- यदि वे सभी "घोड़ा A" कहते हैं, तो आप बहुत आश्वस्त हैं।
- यदि वे असहमत हैं (एक कहता है A, एक कहता है B, एक कहता है C), तो BLF जानता है कि अनिश्चितता है। यह एक विशेष गणितीय तकनीक (shrinkage) का उपयोग करता है ताकि यदि वे बहुत अधिक असहमत हों, तो उनके अनुमानों को बीच (50/50) की ओर खींचा जा सके, जिससे AI भ्रमित होने पर भी बहुत अधिक आत्मविश्वासी होने से बच जाता है।
3. अंशांकन (Calibration): "थर्मोस्टेट"
कभी-कभी, यहाँ तक कि स्मार्ट AI भी अपने आत्मविश्वास के स्तर को गलत कर देते हैं। वे कह सकते हैं कि वे "99% सुनिश्चित" हैं, जबकि वास्तव में वे केवल 60% सुनिश्चित होते हैं। यह एक थर्मोस्टेट की तरह है जो सोचता है कि कमरा जम रहा है जबकि वास्तव में वह गर्म है।
BLF का समाधान: "स्मार्ट थर्मोस्टेट"
BLF पदानुक्रमित अंशांकन (Hierarchical Calibration) नामक तकनीक का उपयोग करता है।
- यह सीखता है कि कुछ प्रकार के प्रश्नों के लिए (जैसे "क्या कल बारिश होगी?"), AI बहुत अधिक आत्मविश्वासी होता है। दूसरों के लिए (जैसे "क्या स्टॉक ऊपर जाएगा?"), यह बहुत संकोची हो सकता है।
- यह अंतिम उत्तर को प्रश्न के प्रकार के आधार पर समायोजित करता है, यह सुनिश्चित करता है कि जब यह "80%" कहे, तो इसका वास्तव में अर्थ "80%" ही हो। विश्वसनीय पूर्वानुमानकर्ता होने के लिए यह अत्यंत महत्वपूर्ण है।
4. सुरक्षा जाल: "समय यात्री का विरोधाभास" (The Time Traveler's Paradox)
AI के परीक्षण में एक बड़ी समस्या लीकेज (leakage) है। यदि आप AI को किसी ऐसी चीज़ की भविष्यवाणी करने के लिए कहते हैं जो 2024 में हुई थी, लेकिन AI को 2025 के डेटा पर प्रशिक्षित किया गया था, तो यह संभव है कि वह उत्तर "जानता" हो क्योंकि उसने इसे अपने प्रशिक्षण डेटा में पढ़ लिया है, न कि इसलिए कि उसने इसे खुद निकाला है।
BLF का समाधान: "चार-स्तरीय टाइम लॉक"
लेखकों ने यह सुनिश्चित करने के लिए एक सख्त सुरक्षा प्रणाली बनाई है कि AI धोखाधड़ी न करे:
- सर्च फ़िल्टर: यह भविष्य के किसी भी खोज परिणाम को रोकता है।
- कंटेंट चेक: एक दूसरा AI खोज परिणामों को पढ़ता है ताकि यह सुनिश्चित हो सके कि वे गलती से भविष्य की घटनाओं का उल्लेख नहीं करते हैं।
- टूल लॉक: विशेष उपकरणों (जैसे स्टॉक मार्केट फेचर) को "कटऑफ तिथि" पर शारीरिक रूप से रुकने के लिए प्रोग्राम किया गया है।
- URL ब्लॉक: यह उन लिंक को ब्लॉक करता है जो सीधे उत्तर तक ले जा सकते हैं।
- परिणाम: उन्होंने साबित किया कि AI ने बहुत कम मामलों (1.5% से कम) में ही "धोखाधड़ी" (जानकारी लीक) की, जिससे उनके परीक्षण परिणाम बहुत भरोसेमंद बन गए।
परिणाम: यह क्यों मायने रखता है
400 वास्तविक दुनिया के प्रश्नों (स्टॉक की कीमतों से लेकर भू-राजनीतिक संघर्षों तक) पर परीक्षण किए जाने पर:
- BLF ने सर्वश्रेष्ठ मानव विशेषज्ञों (सुपरफोरकास्टर्स) को पछाड़ दिया।
- BLF ने सर्वश्रेष्ठ AI मॉडलों (GPT-5 और Grok सहित) को पछाड़ दिया।
- BLF एकमात्र ऐसा था जो बाजार के प्रश्नों पर "भीड़" (बाजार के औसत अनुमान) को लगातार हरा सका।
बड़ी तस्वीर
यह शोध पत्र दिखाता है कि भविष्य की भविष्यवाणी करने में अच्छा होने के लिए, आपको केवल एक बड़ा दिमाग (एक बड़ा मॉडल) ही नहीं चाहिए। आपको चाहिए:
- बेहतर संगठन (एक संरचित विश्वास अवस्था रखना, न कि केवल एक चैट लॉग)।
- बेहतर टीम वर्क (कई बार पूछना और परिणामों का औसत निकालना)।
- बेहतर आत्म-जागरूकता (आत्मविश्वास को अंशांकित करना)।
यह एक प्रतिभाशाली लेकिन बिखरे हुए जीनियस को एक व्यवस्थित नोटबुक देने, उसे पांच लोगों की टीम में रखने और उसे अपना आत्मविश्वास जांचना सिखाने जैसा है। परिणाम एक ऐसा सिस्टम है जो लगभग किसी भी अन्य व्यक्ति की तुलना में भविष्य को अधिक स्पष्ट रूप से देख सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।