OdysseyArena: Benchmarking Large Language Models For Long-Horizon, Active and Inductive Interactions
यह शोध पत्र OdysseyArena को प्रस्तुत करता है, जो 120 मानकीकृत कार्यों और अत्यधिक तनाव परीक्षणों से बना एक नवीन बेंचमार्क है जिसे बड़े भाषा मॉडलों की दीर्घकालिक (long-horizon), सक्रिय और आगमनात्मक (inductive) अंतःक्रियाओं को करने की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि अत्याधुनिक मॉडल भी जटिल वातावरणों में अंतर्निहित संक्रमण नियमों (latent transition laws) को स्वायत्त रूप से खोजने में संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को एक नया, जटिल बोर्ड गेम खेलना सिखा रहे हैं।
पुराना तरीका (निगमनात्मक - Deductive):
वर्तमान में अधिकांश AI परीक्षण वैसे ही हैं जैसे रोबोट को खेल शुरू करने से पहले नियम पुस्तिका (rulebook) दे दी जाए। आप कहते हैं, "यहाँ नियम हैं: यदि आप लाल रंग पर पहुँचते हैं, तो दो स्थान पीछे जाएँ। यदि आप छह फेंकते हैं, तो आगे बढ़ें।" रोबोट बस इन स्पष्ट निर्देशों का पालन करता है। यह आदेशों का पालन करने में अच्छा है, लेकिन यह वास्तव में यह नहीं समझ पाता कि नियम क्यों मौजूद हैं या यदि नियम पुस्तिका गायब हो जाए तो उन्हें कैसे खोजा जाए।
नया तरीका (आगमनात्मक - Inductive):
ODYSSEYARENA पेपर तर्क देता है कि वास्तविक दुनिया की बुद्धिमत्ता नियम पुस्तिका का पालन करने के बारे में नहीं है; यह खेलते समय नियमों को खोजने के बारे में है। कल्पना कीजिए कि आप रोबोट को बोर्ड गेम थमा देते हैं लेकिन उसकी नियम पुस्तिका छिपा देते हैं। रोबोट को मोहरों को हिलाकर देखना होगा, देखना होगा कि क्या होता है, भ्रमित होना होगा, फिर से प्रयास करना होगा, और धीरे-धीरे अपने आप छिपे हुए तर्क (logic) को समझना होगा। इसे "आगमनात्मक तर्क" (inductive reasoning) कहा जाता है।
समस्या
शोधकर्ताओं ने पाया कि आज के सबसे स्मार्ट AI मॉडल भी इसमें बहुत खराब हैं। वे निर्देशों का पालन करने में माहिर हैं (निगमन/deduction), लेकिन जब नियम छिपे हों तो वे अनुभव से सीखने में संघर्ष करते हैं (आगमन/induction)। वे लूप (loops) में फंस जाते हैं, जो सीखा था उसे भूल जाते हैं, या खेल लंबा और जटिल होने पर हार मान लेते हैं।
समाधान: ODYSSEYARENA
इसे परखने के लिए, टीम ने ODYSSEYARENA नामक एक नया "जिम" बनाया। छोटे, सरल कार्यों के बजाय, उन्होंने चार अलग-अलग "खेल" बनाए जो AI को एक जासूस बनने के लिए मजबूर करते हैं। ये खेल लंबे (सैकड़ों चरणों वाले) डिज़ाइन किए गए हैं और इनमें AI को सक्रिय रूप से अन्वेषण (explore) करने की आवश्यकता होती है।
यहाँ चार खेलों को सरल उपमाओं (analogies) के साथ समझाया गया है:
लाइट्स चालू करें (तर्क की पहेली):
- सेटअप: आपके पास लाइट बल्बों की एक दीवार है। कुछ चालू हैं, कुछ बंद। आप एक स्विच फ्लिप कर सकते हैं, लेकिन आपको वायरिंग का पता नहीं है।
- चुनौती: एक स्विच दबाने से एक बल्ब जल सकता है, लेकिन यह गलती से तीन अन्य बल्बों को बंद भी कर सकता है क्योंकि उनके बीच एक छिपा हुआ कनेक्शन है। AI को स्विच दबाने होंगे, परिणामों को देखना होगा, और ट्रायल एंड एरर (trial and error) के माध्यम से गुप्त वायरिंग डायग्राम को समझना होगा।
- रूपक (Metaphor): यह बिना किसी मैनुअल के क्रिसमस लाइट्स के उलझे हुए तार को ठीक करने जैसा है, जहाँ आप अंदाज़ा लगा रहे हैं कि कौन सा बल्ब दूसरे को नियंत्रित करता है।
AI ट्रेडिंग (शेयर बाजार):
- सेटअप: AI एक ट्रेडर है जिसके पास स्टॉक्स का पोर्टफोलियो है। हर दिन, बाजार छिपे हुए "कारकों" (जैसे मौसम या समाचार) के आधार पर चलता है जिन्हें AI सीधे नहीं देख सकता, केवल संकेत देख सकता है।
- चुनौती: AI को स्टॉक की कीमतों और समाचारों को देखना होगा, छिपे हुए गणित को समझना होगा जो उनसे जुड़ा है, और पैसा बनाने के लिए भविष्य की भविष्यवाणी करनी होगी।
- रूपक: यह केवल लोगों के कपड़ों को देखकर मौसम की भविष्यवाणी करने जैसा है, बिना कभी आसमान देखे। आपको "कोट पहने लोगों" और "बारिश" के बीच के पैटर्न को समझना होगा।
ऊर्जा वितरण (पावर ग्रिड):
- सेटअप: AI एक पावर प्लांट मैनेजर है। उसे शहर को चलाने के लिए सूरज, हवा और कोयले से ऊर्जा को संतुलित करना है।
- चुनौती: सूरज और हवा अप्रत्याशित होते हैं और छिपे हुए चक्रों (जैसे मौसम) का पालन करते हैं। यदि AI लगातार तीन दिनों तक गलती करता है, तो पूरा ग्रिड ठप हो जाएगा। उसे रोशनी बनाए रखने के लिए प्रकृति की छिपी हुई लय (rhythms) को सीखना होगा।
- रूपक: यह एक तूफानी रात के दौरान कैंपफायर को पूरी तरह से जलाए रखने जैसा है, जहाँ हवा हर घंटे दिशा बदलती है और आपको उस पैटर्न का अनुमान लगाना होता है।
रेपो सिस्टम (सॉफ्टवेयर फिक्सर):
- सेटअप: AI एक कंप्यूटर प्रोग्रामर है जो सॉफ्टवेयर पैकेज इंस्टॉल करने की कोशिश कर रहा है।
- चुनौती: एक सॉफ्टवेयर इंस्टॉल करने से दूसरे सॉफ्टवेयर में खराबी आ सकती है क्योंकि उनके बीच वर्ज़न का टकराव (version conflicts) हो सकता है। AI को इंस्टॉल करना, टेस्ट करना, खराब करना, ठीक करना और फिर से इंस्टॉल करना होगा, जिससे वह विभिन्न प्रोग्रामों के बीच छिपे हुए निर्भरता (dependencies) के जाल को धीरे-धीरे मैप कर सके।
- रूपक: यह एक घर बनाने जैसा है जहाँ एक नया दरवाज़ा खरीदने से कल आपके द्वारा बनाई गई एक दीवार गिर सकती है। आपको चलते-चलते ब्लूप्रिंट को समझना होगा।
उन्होंने क्या पाया
शोधकर्ताओं ने इन खेलों पर दुनिया के 15 से अधिक सबसे स्मार्ट AI मॉडलों (शीर्ष व्यावसायिक और ओपन-सोर्स सहित) का परीक्षण किया।
- परिणाम: सबसे अच्छे मॉडल भी लंबे समय तक चलने वाले कार्यों (long-horizon tasks) में बुरी तरह विफल रहे। वे लूप में फंस गए (एक ही गलती बार-बार करना), जो पहले सीखा था उसे भूल गए, और छिपे हुए नियमों को नहीं समझ सके।
- अंतर (Gap): जब शोधकर्ताओं ने मॉडलों को नियम पहले ही दे दिए, तो मॉडल बहुत अच्छा प्रदर्शन करते थे। लेकिन जब उन्हें खुद नियम खोजने थे, तो प्रदर्शन लगभग शून्य हो गया।
- निष्कर्ष: वर्तमान AI उस छात्र की तरह है जो किताब रटने में तो उत्कृष्ट है लेकिन बिना किताब के समस्या हल करने के लिए पूछा जाने पर पूरी तरह विफल हो जाता है। वास्तव में स्वायत्त एजेंट (autonomous agents) बनाने के लिए सबसे बड़ी बाधा उन्हें बड़ा या तेज़ बनाना नहीं है; बल्कि उन्हें अपनी गलतियों से सीखना और दुनिया के छिपे हुए पैटर्न को खोजना सिखाना है।
संक्षेप में, ODYSSEYARENA AI को परखने का एक नया तरीका है जो यह पूछना बंद करता है कि "क्या आप आदेशों का पालन कर सकते हैं?" और यह पूछना शुरू करता है कि "क्या आप खुद समझ सकते हैं कि दुनिया कैसे काम करती है?" जवाब, अब तक, है "वास्तव में नहीं।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।