← नवीनतम पेपर
💻 computer science

PokeGym: A Visually-Driven Long-Horizon Benchmark for Vision-Language Models

यह शोधपत्र पोकेजिम (PokeGym) को प्रस्तुत करता है, जो 3D ओपन-वर्ल्ड गेम *Pokémon Legends: Z-A* के भीतर एक स्केलेबल, दृश्य-संचालित लॉन्ग-होराइजन बेंचमार्क है, जो जटिल एम्बॉडीड कार्यों पर विजन-लैंग्वेज मॉडल्स का मूल्यांकन करता है और यह प्रकट करता है कि उच्च-स्तरीय योजना के बजाय भौतिक डेडलॉक रिकवरी (physical deadlock recovery), प्राथमिक बाधा है, जिसमें विभिन्न मॉडल क्षमताओं के बीच अलग-अलग विफलता मोड देखे गए हैं।

मूल लेखक: Ruizhi Zhang, Ye Huang, Yuangang Pan, Chuanfu Shen, Zhilin Liu, Ting Xie, Wen Li, Lixin Duan

प्रकाशित 2026-04-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruizhi Zhang, Ye Huang, Yuangang Pan, Chuanfu Shen, Zhilin Liu, Ting Xie, Wen Li, Lixin Duan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वीडियो गेम खेलना सिखा रहे हैं। लेकिन यह सिर्फ कोई साधारण गेम नहीं है; यह एक विशाल, 3D ओपन-वर्ल्ड एडवेंचर है जैसे कि Pokémon, जहाँ रोबोट गेम के कोड को देख नहीं सकता, वह कंप्यूटर से अपने कोऑर्डिनेट्स (coordinates) नहीं पूछ सकता, और वह सीधे मैप को "पढ़" भी नहीं सकता। उसे पूरी तरह से स्क्रीन को देखकर सीखना होगा, ठीक वैसे ही जैसे एक इंसान करता है।

यह शोध पत्र PokeGym पेश करता है, जो एक नया "जिम" (परीक्षण स्थल) है जिसे यह देखने के लिए बनाया गया है कि ये AI रोबोट गेम खेलने में कितने अच्छे हैं।

यहाँ सरल शब्दों में इसका विवरण दिया गया है:

1. समस्या: "चीटिंग" करने वाला रोबोट

पहले, जब वैज्ञानिक AI का परीक्षण वीडियो गेम्स पर करते थे, तो वे अक्सर AI को "चीटिंग" करने देते थे।

  • पुराना तरीका: वे AI को गेम का आंतरिक डेटा देते थे (जैसे कि "आप X, Y, Z कोऑर्डिनेट्स पर हैं" या "दरवाजा 5 मीटर दूर है")। यह ऐसा था जैसे किसी छात्र को परीक्षा से पहले ही उत्तर कुंजी (answer key) दे दी जाए। AI को वास्तव में दुनिया को "देखने" या "समझने" की आवश्यकता नहीं थी; उसे बस नंबरों को प्रोसेस करना था।
  • नया तरीका (PokeGym): AI कोड से अंधा है। वह केवल स्क्रीन पर दिखने वाले कच्चे पिक्सेल (pixels) देखता है। उसे खुद समझना होगा कि, "ओह, यह एक दरवाजा लग रहा है," और "अगर मैं आगे बढ़ूंगा, तो शायद दीवार से टकरा जाऊंगा।" यह बहुत कठिन और बहुत अधिक वास्तविक है।

2. परीक्षण: एक पोकेमोन एडवेंचर

शोधकर्ताओं ने इस परीक्षण को गेम Pokémon Legends: Z-A के भीतर बनाया है।

  • मिशन: AI को लंबे, जटिल मिशन पूरे करने होते हैं (जैसे "जाओ होटल के मालिक को ढूंढो और उससे बात करो")।
  • चुनौती: इन मिशनों में सैकड़ों कदम उठाने पड़ते हैं। AI को भीड़भाड़ वाली सड़कों से गुजरना पड़ता है, बाड़ (fences) के पीछे फंसने से बचना पड़ता है, और यह समझना पड़ता है कि कौन से बटन दबाने हैं।
  • ट्विस्ट: शोधकर्ताओं ने तीन अलग-अलग स्तरों की मदद के साथ AI का परीक्षण किया:
    1. विजुअल-गाइडेड (Visual-Guided): "लाल दरवाजे पर जाओ, फिर नीले घर की ओर मुड़ो।" (आसान, बहुत सारे संकेत)।
    2. स्टेप-गाइडेड (Step-Guided): "घर पर जाओ, फिर मालिक को ढूंढो।" (मध्यम, कोई विजुअल संकेत नहीं, केवल निर्देश)।
    3. गोल-ओनली (Goal-Only): "होटल के मालिक को ढूंढो।" (कठिन, AI को पूरा प्लान खुद बनाना होगा)।

3. बड़ी खोज: "फंसने" की समस्या

शोधकर्ताओं ने कुछ आश्चर्यजनक पाया। उन्हें लगा था कि AI इसलिए विफल होगा क्योंकि वह बड़ी, जटिल रणनीतियाँ नहीं बना पाएगा। वे गलत थे।

AI वास्तव में मुख्य रूप से इसलिए विफल हुआ क्योंकि वह शारीरिक रूप से फंस गया था

  • "डेडलॉक" (Deadlock) का उदाहरण: कल्पना कीजिए कि आप एक गलियारे में चल रहे हैं और आप एक दीवार और एक गमले के बीच फंस गए हैं। आप बस आगे बढ़ने की कोशिश करते रहते हैं, लेकिन आप बार-बार गमले से टकराते रहते हैं।
    • कमजोर AI: उसे यह एहसास तक नहीं होता कि वह फंस गया है। वह बस कहता रहता है, "मैं प्रगति कर रहा हूँ!" जबकि वह बस गोल-गोल घूम रहा होता है। इसे "अनअवेयर डेडलॉक" (Unaware Deadlock) कहा जाता है।
    • मजबूत AI: वह महसूस करता है, "अरे, मैं फंस गया हूँ!" लेकिन फिर वह घबरा जाता है। वह रैंडम चीजें (कूदना, घूमना, दीवार से टकराना) आज़माता है और फिर भी बाहर नहीं निकल पाता। इसे "अवेयर डेडलॉक" (Aware Deadlock) कहा जाता है।

सबक: सबसे बड़ी बाधा "सोचना" नहीं है; बल्कि "चलना" है। AI को बेहतर "स्थानिक सहज बोध" (spatial intuition) की आवश्यकता है—3D स्पेस को समझने और तंग जगहों से बाहर निकलने की क्षमता।

4. स्कोरबोर्ड

शोध पत्र ने कई प्रसिद्ध AI मॉडल्स (जैसे GPT-5, Gemini, Claude, और Qwen) का परीक्षण किया।

  • विजेता: बड़े, महंगे, क्लोज्ड-सोर्स मॉडल्स (जैसे Gemini और GPT) सबसे अच्छा प्रदर्शन करते थे। वे यह समझने में बेहतर थे कि वे फंसे हुए हैं और इसे ठीक करने की कोशिश कर रहे हैं।
  • हारने वाले: छोटे या ओपन-सोर्स मॉडल्स अक्सर फंस जाते थे और उन्हें पता भी नहीं चलता था।
  • लागत: इन परीक्षणों को चलाना महंगा है। कुछ मॉडल्स ने एक साधारण मिशन को हल करने की कोशिश में सैकड़ों हजारों शब्द (टोकन) "खा लिए", जिससे शोधकर्ताओं को हर बार परीक्षण चलाने पर पैसा खर्च करना पड़ा।

5. यह क्यों महत्वपूर्ण है

यह शोध पत्र AI शोधकर्ताओं के लिए एक चेतावनी है।

  • वर्तमान AI "बात करने" में अच्छा है लेकिन "चलने" में बुरा है। यह एक कविता लिख सकता है या गणित के सवाल का जवाब दे सकता है, लेकिन यदि आप इसे 3D दुनिया में डाल दें, तो यह अपने ही पैरों में उलझकर गिर जाता है।
  • भविष्य: एक वास्तव में उपयोगी रोबोट बनाने के लिए (एक ऐसा रोबोट जो आपका घर साफ कर सके या कार चला सके), हमें उसे यह सिखाना होगा कि जब वह फंस जाए तो कैसे उबरना है, न कि केवल उसे एक आदर्श रास्ता बनाना सिखाना है।

संक्षेप में: PokeGym AI के लिए एक कठोर बाधा दौड़ (obstacle course) है। इसने साबित कर दिया कि भले ही हमारे AI भाषा समझने में स्मार्ट हो रहे हैं, लेकिन वे भौतिक दुनिया में नेविगेट करने में अभी भी बहुत अनाड़ी हैं, अक्सर कोनों में फंस जाते हैं और उन्हें नहीं पता होता कि बाहर कैसे निकलना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →