← नवीनतम पेपर
💻 computer science

V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models

V-MAGE एक नवीन गेम-आधारित मूल्यांकन ढांचा है जो पांच अलग-अलग वीडियो गेम्स और एक गतिशील ELO-आधारित रैंकिंग प्रणाली का उपयोग करता है ताकि जटिल, निरंतर-स्थान वातावरण में मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) की संवादात्मक दृश्य तर्क और निर्णय लेने की क्षमताओं का व्यवस्थित रूप से आकलन किया जा सके।

मूल लेखक: Xiangxi Zheng, Linjie Li, Zhengyuan Yang, Ping Yu, Alex Jinpeng Wang, Rui Yan, Yuan Yao, Lijuan Wang

प्रकाशित 2026-04-27
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Xiangxi Zheng, Linjie Li, Zhengyuan Yang, Ping Yu, Alex Jinpeng Wang, Rui Yan, Yuan Yao, Lijuan Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने वर्षों एक प्रतिभाशाली छात्र को जटिल गणितीय समीकरणों को हल करना और सुंदर निबंध लिखना सिखाने में बिताए हैं। वे कागज पर एक जीनियस हैं! लेकिन फिर, आप उन्हें एक वीडियो गेम कंट्रोलर थमाते हैं और कहते हैं, "ठीक है, अब मारियो खेलो।"

अचानक, वह जीनियस सुन्न हो जाता है। वे स्क्रीन पर दिखने वाले रंगों का सटीक वर्णन तो कर सकते हैं, लेकिन वे यह नहीं समझ पाते कि गड्ढे से बचने के लिए उन्हें अभी कूदना होगा। वे शायद एक गुम्बा (goomba) को देख लेंगे, उसे "एक छोटा भूरा जीव" कहेंगे, और फिर वहां बैठकर इंतजार करेंगे कि वह खुद हिले, बजाय इसके कि वे उसके ऊपर से कूदें।

यह पेपर, V-MAGE, ठीक इसी समस्या के बारे में है।

समस्या: "निर्वात में जीनियस" (The "Genius in a Vacuum")

वर्तमान AI मॉडल (जिन्हें MLLM कहा जाता है) उस प्रतिभाशाली छात्र की तरह हैं। वे एक अकेली फोटो को देखकर बताने में अद्भुत हैं कि, "एक बिल्ली लाल कालीन पर बैठी है।" इसे स्टेटिक रीजनिंग (static reasoning) कहा जाता है।

लेकिन वास्तविक दुनिया एक फोटो नहीं है; यह एक फिल्म है। वास्तविक दुनिया डायनामिक (गतिशील) है। चीजें चलती हैं, गुरुत्वाकर्षण खींचता है, और समय (timing) सब कुछ है। अधिकांश वर्तमान AI टेस्ट उस छात्र को बहुविकल्पीय प्रश्न (multiple-choice test) देने जैसे हैं। V-MAGE कहता है, "यह बहुत आसान है। चलिए देखते हैं कि क्या वे वास्तव में एक गेम खेल सकते हैं।"

समाधान: V-MAGE (द अल्टीमेट आर्केड टेस्ट)

शोधकर्ताओं ने V-MAGE बनाया है, जो अनिवार्य रूप से एक हाई-टेक "आर्केड टेस्टिंग लैब" है। बहुविकल्पीय प्रश्नों के बजाय, उन्होंने AI को पांच अलग-अलग वीडियो गेम्स (जैसे Flappy Bird, Super Mario, और Pong) में डाल दिया।

यहाँ बताया गया है कि यह AI के लिए "बॉस लेवल" टेस्ट क्यों है:

  1. कोई चीट शीट नहीं (विज़न-सेंट्रिक): AI को "पक्षी ऊंचाई 5 पर है" जैसा कोई टेक्स्ट विवरण नहीं दिया जाता है। इसे केवल कच्चे वीडियो फ्रेम्स मिलते हैं। इसे अपनी डिजिटल आँखों से दुनिया को "देखना" पड़ता है, बिल्कुल वैसे ही जैसे एक इंसान करता है।
  2. "कंटीन्यूअस स्पेस" की चुनौती (The "Continuous Space" Challenge): कई AI टेस्ट में, सब कुछ एक साफ ग्रिड पर होता है (जैसे शतरंज का बोर्ड)। V-MAGE में, दुनिया तरल है। रेसिंग गेम में कार किसी भी कोण पर मुड़ सकती है; Flappy Bird में पक्षी किसी भी ऊंचाई पर हो सकता है। यह अव्यवस्थित और अप्रत्याशित है, बिल्कुल वास्तविक जीवन की तरह।
  3. ELO सिस्टम (द प्रो-गेमर रैंकिंग): आप जानते हैं कि League of Legends या Chess जैसे खेलों में कैसे एक ELO रेटिंग होती है जो बताती है कि आप दूसरों की तुलना में कितने अच्छे हैं? V-MAGE इसी का उपयोग करता है। यह केवल एक "स्कोर" नहीं देता; यह अन्य AI और यहाँ तक कि मानव खिलाड़ियों के मुकाबले AI को रैंक करता है ताकि देखा जा सके कि असली "प्रो" कौन है।

हमने क्या पाया? (द रियलिटी चेक)

परिणाम थोड़े चौंकाने वाले थे। यहाँ तक कि सबसे प्रसिद्ध, शक्तिशाली AI (जैसे GPT-4o) भी इंटरैक्टिव गेमिंग के मामले में अभी भी "नूब" (noobs) हैं।

शोधकर्ताओं ने AI मस्तिष्क में तीन मुख्य "ग्लिच" (glitches) पाए:

  • "ब्लाइंड स्पॉट" (परसेप्शन एरर/Perception Error): AI कभी-कभी जो देखता है उसे गलत समझ लेता है। वह सोच सकता है कि पक्षी ऊंचाई पर है जबकि वह वास्तव में पाइप से टकराने वाला होता है।
  • "डे ड्रीमर" (रीजनिंग एरर/Reasoning Error): AI स्थिति को सही देखता है लेकिन एक गलत योजना बनाता है। वह एक ट्रॉफी और एक बाधा को देख सकता है और बाधा के चारों ओर जाने के बजाय सीधे बाधा में जाने का निर्णय ले सकता है क्योंकि उसने "सोचा" नहीं कि रास्ता बदलना चाहिए।
  • "ब्रोकन रिकॉर्ड" (एंकरिंग बायस/Anchoring Bias): यह एक दिलचस्प बात है। यदि AI एक फ्रेम में यह तय करता है कि "मुझे बाईं ओर जाना चाहिए", तो वह उस विचार पर "अटक" जाता है। भले ही स्क्रीन बदल जाए और उसे दाईं ओर जाने की आवश्यकता हो, AI सोचता रहता है, "नहीं, मैं आज 'लेफ्ट-मूवर' हूँ," और नई वास्तविकता के प्रति प्रतिक्रिया करने में विफल रहता है।

यह क्यों मायने रखता है?

यदि हम चाहते हैं कि AI वास्तविक कारें चलाए, ड्रोन उड़ाए, या ऑपरेटिंग रूम में सर्जनों की मदद करे, तो हम केवल इस बात पर भरोसा नहीं कर सकते कि वे "बहुविकल्पीय परीक्षणों" में अच्छे हैं। उन्हें ऐसी दुनिया में देखने, प्रतिक्रिया देने और योजना बनाने में सक्षम होना चाहिए जो कभी रुकती नहीं है।

V-MAGE वह प्रशिक्षण मैदान है जो हमें इन "प्रतिभाशाली छात्रों" को "सक्षम पायलटों" में बदलने में मदद करेगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →