← नवीनतम पेपर
🤖 AI

AGI Maze as a Benchmark Framework for World-Modeling Agents

यह शोध पत्र AGI Maze को प्रस्तुत करता है, जो एक हल्का ग्रिड-आधारित बेंचमार्क फ्रेमवर्क है जिसे वर्तमान बड़े भाषा मॉडलों की उन स्थायी, हेरफेर योग्य विश्व-अवस्था (world-state) निरूपणों को बनाने में अक्षमता को उजागर करने के लिए डिज़ाइन किया गया है जो आंशिक रूप से दृश्यमान, अवस्था-आधारित कार्यों को हल करने के लिए आवश्यक होते हैं, भले ही उन्हें वर्किंग मेमोरी तंत्र प्रदान किए गए हों।

मूल लेखक: Alexey Potapov

प्रकाशित 2026-07-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alexey Potapov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करके पेपर की व्याख्या दी गई है।

मुख्य विचार: क्यों "स्मार्ट" चैटबॉट्स भूलभुलैया में खो जाते हैं

कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान मित्र है जो कविता लिख सकता है, गणित की समस्याओं को हल कर सकता है और चुटकुले सुना सकता है। यह मित्र एक लार्ज लैंग्वेज मॉडल (LLM) की तरह है। वे वाक्य में अगले शब्द की भविष्यवाणी करने में अद्भुत हैं।

हालाँकि, पेपर का तर्क है कि यदि आप इस मित्र को एक अंधेरी, घुमावदार भूलभुलैया में डाल दें जहाँ वे केवल अपने ठीक सामने वाली दीवार देख सकते हैं, तो वे खो जाते हैं। वे अगले कदम का अनुमान लगा सकते हैं, लेकिन वे अपने दिमाग में पूरी भूलभुलैया का एक मानसिक मानचित्र (mental map) नहीं बना सकते। वे एक कहानी को पूरा करने में तो माहिर हैं, लेकिन एक दुनिया का अनुकरण (simulate) करने में खराब हैं।

इसे साबित करने के लिए, लेखकों ने AGI Maze नामक एक नया परीक्षण बनाया।


AGI Maze क्या है? ("टेक्स्ट-आधारित वीडियो गेम")

AGI Maze को एक ऐसे वीडियो गेम की तरह समझें जिसे आप पूरी तरह से टेक्स्ट संदेशों के माध्यम से खेलते हैं।

  • सेटअप: आप एक ग्रिड (जैसे शतरंज का बोर्ड) में हैं। आपके पास एक शुरुआती बिंदु, एक खजाना, एक चाबी और एक निकास (exit) है।
  • चुनौती: आप मानचित्र (map) नहीं देख सकते। आपको नहीं पता कि दीवारें कहाँ हैं। आप केवल यह जानते हैं कि आप कहाँ से शुरू हुए थे।
  • गेमप्ले: आप टाइप करते हैं "दाएं जाओ" (Go Right)। गेम जवाब देता है, "आप एक दीवार से टकरा गए।" फिर आप टाइप करते हैं "नीचे जाओ" (Go Down)। गेम कहता है, "आपको चाबी मिल गई!"
  • लक्ष्य: आपको भूलभुलैया का लेआउट समझना है, चाबी ढूँढनी है, संदूक खोलना है और बाहर निकलना है—और यह सब याद रखते हुए कि आप कहाँ गए थे और दीवारें कहाँ थीं, बिना कभी कोई चित्र देखे।

यह कठिन क्यों है?
भूलभुलैया में इसे और भी कठिन बनाने के लिए कुछ "ट्रिक्स" हैं:

  1. नदियाँ (Rivers): यदि आप नदी पर कदम रखते हैं, तो आपको अपने आप बहाकर नीचे ले जाया जाता है, लेकिन गेम आपको यह नहीं बताता कि पानी किस दिशा में बह रहा है। आपको अनुमान लगाना होगा।
  2. गड्ढे (Pits): यदि आप गड्ढे में गिरते हैं, तो आप भूलभुलैया के किसी दूसरे हिस्से में अचानक प्रकट हो सकते हैं।
  3. समय सीमा (Time Limit): आपके पास समाप्त करने के लिए कुछ निश्चित कदम होते हैं। यदि आप बिना सोचे-समझे भटकते रहते हैं, तो आपका समय समाप्त हो जाएगा।

प्रयोग: क्या AI इसे हल कर सकता है?

लेखकों ने इन भूलभुलैया पर कई लोकप्रिय AI मॉडल (जैसे GPT-4o और Gemini) का परीक्षण किया। उन्होंने AI के साथ एक मानव खिलाड़ी की तरह व्यवहार किया जिसके पास केवल टेक्स्ट विवरण उपलब्ध हैं।

परिणाम आश्चर्यजनक थे:

  • "वैनिला" AI: जब AI केवल चैट हिस्ट्री के आधार पर अगले कदम का अनुमान लगाने की कोशिश करता था, तो वह बुरी तरह विफल रहा। छोटी भूलभलैयाओं में, यह अक्सर एक ऐसे कंप्यूटर प्रोग्राम से भी बुरा प्रदर्शन करता था जो बस एक रैंडम दिशा चुनता है (एक "रैंडम-वॉक")।
  • समस्या: AI अपने "मन" में मानचित्र नहीं बना रहा था। वह बस पिछले कुछ वाक्यों के आधार पर अगले शब्द का अनुमान लगा रहा था। वह "मैं कहाँ हूँ" और "दीवारें कहाँ हैं" का एक स्थिर चित्र बनाए रखने में सक्षम नहीं था।

"नोटबुक" वाली ट्रिक

लेखकों ने महसूस किया कि मनुष्य बिना पेंसिल और कागज के एक जटिल भूलभुलैया को हल नहीं कर सकते। हम जैसे-जैसे आगे बढ़ते हैं, मानचित्र बनाते जाते हैं। इसलिए, उन्होंने AI को एक "नोटबुक" दी (उसे अपना अगला कदम उठाने से पहले अपनी चैट हिस्ट्री में अपने नोट्स लिखने की अनुमति देकर)।

  • सेटअप: AI "दाएं जाओ" कहने से पहले, वह एक नोट लिखता है: "मैं नीचे बाईं ओर हूँ। मैं ऊपर गया और एक दीवार से टकरा गया। मुझे लगता है कि चाबी दाईं ओर है।"
  • परिणाम: इससे मजबूत AI मॉडल्स को काफी मदद मिली। वे विफल होने से लगभग 60-70% भूलभुलैया हल करने तक पहुँच गए।
  • चुनौती: नोटबुक के साथ भी, AI संघर्ष करता रहा। वह स्वाभाविक रूप से एक सटीक, संरचित मानचित्र नहीं बना सका। उसने बस बिखरे हुए नोट्स लिखे। और छोटे, कम शक्तिशाली AI मॉडल्स के लिए, नोटबुक वाली ट्रिक ने कोई मदद नहीं की—वे अभी भी खो जाते थे।

यह हमें क्या बताता है?

पेपर कुछ प्रमुख निष्कर्षों के साथ समाप्त होता है:

  1. अनुमान बनाम समझ (Prediction vs. Understanding): वर्तमान AI वाक्य में अगले शब्द की भविष्यवाणी करने में महान है (जैसे एक कहानी को पूरा करना), लेकिन यह बदलती दुनिया का अनुकरण करने (जैसे भूलभुलैया में रास्ता खोजना) में खराब है। यह स्वाभाविक रूप से वास्तविकता का एक "मानसिक मॉडल" नहीं रखता है।
  2. याददाश्त कठिन है: AI को पिछले संदेशों की एक लंबी सूची (उसकी "मेमोरी") देना ही पर्याप्त नहीं है। उसे उस जानकारी को एक मानचित्र या योजना में सक्रिय रूप से व्यवस्थित करने की आवश्यकता है, जो वह वर्तमान में स्वयं करने में संघर्ष करता है।
  3. परीक्षण एक उपकरण है, अंतिम स्कोर नहीं: लेखक यह नहीं कह रहे हैं कि "AI बेकार है।" वे कह रहे हैं, "यहाँ एक विशिष्ट उपकरण (AGI Maze) है जो हमें दिखाता है कि AI कहाँ विफल हो रहा है।" यह इस बात पर प्रकाश डालता है कि वास्तव में स्मार्ट एजेंट बनाने के लिए, हमें उन्हें दुनिया का आंतरिक मानचित्र बनाने और उपयोग करने के बारे में सिखाने की आवश्यकता है, न कि केवल चैट करने के बारे में।

एनालॉजी (उपमा) सारांश

  • वर्तमान LLMs एक ऐसे टूर गाइड की तरह हैं जिसने एक स्क्रिप्ट रट ली है। यदि आप उनसे उस शहर का वर्णन करने के लिए कहते हैं जहाँ वे कभी गए ही नहीं, तो वे शब्दों का अनुमान लगा सकते हैं, लेकिन यदि आप उन्हें आँखों पर पट्टी बांधकर भूलभुलैया में रास्ता खोजने के लिए कहते हैं, तो वे लड़खड़ा जाते हैं क्योंकि उनके पास कोई मानचित्र नहीं है।
  • AGI Maze वह आँखों पर पट्टी बंधी भूलभलैया वाला परीक्षण है।
  • "नोटबुक" टूर गाइड को पेन और कागज देने जैसा है। यह उनकी थोड़ी मदद करता है, लेकिन वे अभी भी स्वाभाविक रूप से मानचित्रकार (cartographers) नहीं बन पाते।

पेपर का तर्क है कि AI के वास्तव में बुद्धिमान (AGI) बनने के लिए, उसे केवल अगला वाक्य अनुमान लगाने के बजाय, अपना खुद का मानचित्र बनाना और खोज के दौरान उसे अपडेट करना सीखना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →