WorldReasoner: Evaluating Whether Language Model Agents Forecast Events with Valid Reasoning
यह शोध पत्र WorldReasoner को प्रस्तुत करता है, जो एक नवीन मूल्यांकन ढांचा है जो भाषा मॉडल एजेंटों की घटना पूर्वानुमान क्षमताओं का आकलन करने के लिए केवल पूर्वानुमान तिथि से पूर्व उपलब्ध जानकारी का उपयोग करके सटीक, साक्ष्य-आधारित और कारण-युक्त भविष्यवाणियां उत्पन्न करने की उनकी क्षमता का कठोरता से परीक्षण करता है, जिससे यह पता चलता है कि हालांकि टेम्पोरल रिट्रीवल (temporal retrieval) और कॉज़ल ग्राफ निर्माण प्रदर्शन को बढ़ाते हैं, फिर भी एजेंट जमीनी साक्ष्यों को सुव्यवस्थित संभाव्यताओं में अनुवाद करने में संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं, लेकिन आपको अगले दिन का समाचार पत्र देखने या "सुलझे हुए मामलों" (solved cases) की फाइल चेक करने से सख्ती से मना किया गया है। आपके पास केवल वही सुराग उपलब्ध हैं जो उस समय मौजूद हैं जब आप अपना अनुमान लगाते हैं।
यह WORLDREASONER पेपर का मूल आधार है। यह यह जांचने का एक नया तरीका पेश करता है कि क्या AI एजेंट (स्मार्ट कंप्यूटर प्रोग्राम) वास्तव में भविष्य का पूर्वानुमान (forecasting) लगा रहे हैं या वे केवल अपने प्रशिक्षण के दौरान सीखे गए तथ्यों को रट (cheating) रहे हैं।
यहाँ सरल उपमाओं (analogies) का उपयोग करके इस पेपर का विवरण दिया गया है:
1. समस्या: "धोखा देने वाला" जासूस
वर्तमान में, कई AI मॉडल को पिछली घटनाओं (जैसे, "2022 का चुनाव किसने जीता?") के बारे में प्रश्नों पर परखा जाता है।
- समस्या: यदि किसी AI को ऐसे डेटा पर प्रशिक्षित किया गया है जिसमें 2022 के चुनाव परिणाम शामिल हैं, तो वह उत्तर का "पूर्वानुमान" नहीं लगा रहा है; वह केवल एक तथ्य को दोहरा (reciting) रहा है जिसे उसने याद कर लिया है। यह उस छात्र की तरह है जो एक ऐसी परीक्षा दे रहा है जिसने पहले ही उत्तर कुंजी (answer key) देख ली है।
- लीक (The Leak): भले ही परीक्षण भविष्य के बारे में हो, यदि AI का प्रशिक्षण डेटा 2025 तक जाता है, और आप उससे 2024 की किसी घटना के बारे में पूछते हैं, तो हो सकता है कि वह तर्क करने के बजाय केवल उत्तर को "याद" कर रहा हो।
2. समाधान: "टाइम मशीन" टेस्ट
लेखकों ने WORLDREASONER बनाया है, जो एक सख्त टाइम मशीन की तरह काम करता है।
- सेटअप: वे एक वास्तविक दुनिया का प्रश्न चुनते हैं (जैसे, "क्या नेटफ्लिक्स 2026 के अंत तक वार्नर ब्रदर्स को खरीदेगा?")।
- सिमुलेशन: वे AI को कहते हैं, "आप दिसंबर 2025 में हैं।"
- नियम: AI केवल उन समाचार लेखों और डेटा को देख सकता है जो दिसंबर 2025 से पहले प्रकाशित हुए थे। वह 2026 का कुछ भी नहीं देख सकता।
- लक्ष्य: AI को उस विशिष्ट समय पर उपलब्ध जानकारी के आधार पर ही एक अनुमान (पूर्वानुमान) लगाना होगा।
3. तीन-भाग वाला स्कोरकार्ड
अधिकांश परीक्षण केवल यह देखते हैं: "क्या आपका उत्तर सही है?"
WORLDREASONER कहता है कि यह पर्याप्त नहीं है। आप भाग्यशाली होकर सही उत्तर भी दे सकते हैं, या गलत सबूत (hallucinating) बनाकर भी। इसलिए, वे AI को तीन अलग-अलग अक्षों (axes) पर ग्रेड देते हैं:
- परिणाम की गुणवत्ता (The Score - Outcome Quality): क्या आपका उत्तर सही था? (जैसे, यदि सौदा विफल हो गया और आपने "नहीं" कहा था)।
- साक्ष्य की गुणवत्ता (The Clues - Evidence Quality): क्या आपने वास्तविक, समय-वैध सुरागों का उपयोग किया?
- खराब: 2025 के निर्णय को समझाने के लिए 2026 के समाचार लेख का हवाला देना।
- अच्छा: 2025 के लेख का हवाला देना जो उस समय वास्तव में उपलब्ध था।
- तर्क की गुणवत्ता (The Logic Map - Reasoning Quality): क्या आपने कारणों का एक सही मानचित्र बनाया?
- AI से एक "कॉज़ल ग्राफ" (एक फ्लोचार्ट जो दिखाता है कि घटना A कैसे घटना B की ओर ले गई) बनाने के लिए कहा जाता है।
- सिस्टम यह जाँचता है कि क्या AI का मानचित्र "हाइंडसाइट मैप" (वह वास्तविक श्रृंखला जिसे इतिहासकारों ने बाद में स्वीकार किया) से मेल खाता है।
4. उन्होंने यह टेस्ट कैसे बनाया
उन्होंने केवल हाथ से प्रश्न नहीं लिखे। उन्होंने एक स्वचालित फैक्ट्री (automated factory) बनाई:
- फॉरवर्ड पाइपलाइन: एक AI समाचारों और प्रेडिक्शन मार्केट्स को स्कैन करता है ताकि दिलचस्प प्रश्न ढूंढे जा सकें और एक "पूर्वानुमान तिथि" (forecast date) निर्धारित की जा सके।
- बैकवर्ड पाइपलाइन: घटना के घटित होने के बाद, एक "हाइंडसाइट एजेंट" (Hindsight Agent) सभी समाचारों को देखता है जो घटना के बाद आए थे ताकि "उत्तर कुंजी" और "वास्तविक लॉजिक मैप" बनाया जा सके।
- परिणाम: 345 वास्तविक दुनिया के परिदृश्यों का एक विशाल डेटासेट, जिसमें "उस समय उपलब्ध सुराग" और "अंतिम सत्य" दोनों शामिल हैं।
5. उन्हें क्या मिला (परिणाम)
उन्होंने इन सख्त नियमों के तहत कई शीर्ष AI मॉडलों का परीक्षण किया और कुछ दिलचस्प बातें पाईं:
- रिट्रीवल (Retrieval) ही राजा है: सही उत्तर पाने में सबसे बड़ा कारक केवल सही समय पर सही सुराग खोजना था। यदि AI पूर्वानुमान तिथि से पहले उपलब्ध समाचारों को खोज सकता था, तो वह बेहतर भविष्यवाणी कर पाया।
- मैप बनाना मदद करता है, लेकिन सफलता की गारंटी नहीं देता: जब AI को "कॉज़ल मैप" (Reasoning Quality) बनाने के लिए मजबूर किया गया, तो वह उन प्रमुख घटनाओं की पहचान करने में बेहतर हुआ जो वास्तव में मायने रखती थीं। हालांकि, एक अच्छा मैप बनाने का मतलब यह नहीं था कि AI ने स्वचालित रूप से सही अंतिम उत्तर चुन लिया।
- "कैलिब्रेशन" (Calibration) की बाधा: AI के लिए सबसे बड़ी चुनौती अच्छे साक्ष्य को सही संभाव्यता (probability) में बदलना था।
- उपमा: कल्पना कीजिए कि एक AI है जो सभी सही सुराग ढूंढ लेता है और अपराध का एक सटीक मैप बनाता है, लेकिन फिर कहता है, "मुझे 90% यकीन है कि बटलर ने यह किया है," जबकि सुराग वास्तव में 10% संभावना का संकेत देते हैं। उसके पास तथ्य हैं, लेकिन वह संभावनाओं का आकलन (judge the odds) सही ढंग से नहीं कर सकता।
6. यह क्यों महत्वपूर्ण है
यह पेपर तर्क देता है कि हमें केवल यह पूछना बंद करना चाहिए कि "क्या AI सही है?" और इसके बजाय यह पूछना शुरू करना चाहिए:
- "क्या वह उत्तर पहले से जानता था?"
- "क्या उसने वास्तविक साक्ष्यों का उपयोग किया?"
- "क्या वह कारण-और-प्रभाव (cause-and-effect) को समझता था?"
इन तीनों चीजों को अलग करके, WORLDREASONER हमें यह देखने में मदद करता है कि क्या एक AI एक सच्चा पूर्वानुमान लगाने वाला (forecaster) है (अनिश्चितता के बीच तर्क करना) या केवल एक नकल करने वाला (mimic) है (याद किए गए तथ्यों को दोहराना)।
संक्षेप में: WORLDREASONER एक कठोर परीक्षा है जो AI को यह साबित करने के लिए मजबूर करती है कि वह भविष्य से उत्तर कुंजी पढ़ने के बजाय, उस समय के उपलब्ध सुरागों का उपयोग करके अतीत के एक जासूस की तरह सोच सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।