← नवीनतम पेपर
🤖 AI

LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?

यह शोध पत्र LEGO-Puzzles को प्रस्तुत करता है, जो प्राथमिक कार्यों और असेंबली योजना के माध्यम से मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) की बहु-चरणीय स्थानिक तर्क क्षमताओं का मूल्यांकन करने वाला एक बेंचमार्क है, जो यह प्रकट करता है कि सबसे मजबूत मॉडल भी मनुष्यों की तुलना में काफी खराब प्रदर्शन करते हैं और योजना की जटिलता बढ़ने के साथ सटीकता बनाए रखने में संघर्ष करते हैं।

मूल लेखक: Kexian Tang, Junyao Gao, Yanhong Zeng, Haodong Duan, Yanan Sun, Zhening Xing, Wenran Liu, Kai Chen, Kaifeng Lyu

प्रकाशित 2026-08-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kexian Tang, Junyao Gao, Yanhong Zeng, Haodong Duan, Yanan Sun, Zhening Xing, Wenran Liu, Kai Chen, Kaifeng Lyu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को ब्लॉक्स से एक जटिल किला बनाना सिखाने की कोशिश कर रहे हैं, लेकिन आप केवल उससे बात कर सकते हैं और उसे तस्वीरें दिखा सकते हैं। यह मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) की दुनिया है। इन मॉडल्स को ऐसे सुपर-स्मार्ट डिजिटल दिमागों के रूप में सोचें जो टेक्स्ट पढ़ सकते हैं और छवियों को "देख" सकते हैं, और इंसानों की तरह दुनिया को समझने की कोशिश करते हैं। किसी भी मस्तिष्क के लिए सीखना सबसे कठिन कामों में से एक है—स्थानिक तर्क (spatial reasoning)—यानी यह समझने की क्षमता कि वस्तुएं 3D स्थान में एक साथ कैसे फिट होती हैं, यह जानना कि कौन सा ब्लॉक ऊपर जाएगा, किसे घुमाने की आवश्यकता है, और कैसे एक पूरा ढांचा नए टुकड़ों को जोड़ने पर बदल जाता है। हालांकि ये AI मॉडल बातचीत करने और चित्रों का वर्णन करने में बेहतर हो रहे हैं, वैज्ञानिक अभी भी यह सोच रहे हैं: क्या वे वास्तव में कुछ बनाने के लिए कदमों के क्रम की योजना बना सकते हैं? यह एक ऊंचे टॉवर को देखकर यह कहना कि "यह लंबा है," एक अलग बात है, लेकिन इसे शुरू से बनाने के लिए 50 चरणों के सटीक क्रम को समझना एक बिल्कुल अलग चुनौती है। यदि हम चाहते हैं कि रोबोट हमारी कारों को ठीक करें या हमें फर्नीचर जोड़ने में मदद करें, तो उन्हें इस तरह की चरण-दर-चरण सोच में महारत हासिल करनी होगी।

यहाँ LEGO-Puzzles आता है, जो ठीक इसी कौशल का परीक्षण करने के लिए शोधकर्ताओं द्वारा बनाया गया एक नया "परीक्षा" है। वास्तविक प्लास्टिक ईंटों का उपयोग करने के बजाय, शोधकर्ताओं ने यह देखने के लिए कि दुनिया के सबसे स्मार्ट AI मॉडल इन स्थानिक पहेलियों को कितनी अच्छी तरह संभाल सकते हैं, LEGO निर्देशों का उपयोग करके एक विशाल डिजिटल खेल का मैदान बनाया। उन्होंने इस परीक्षण को दो मुख्य स्तरों में विभाजित किया। पहला स्तर, एलिमेंट्री सेट (Elementary Set), एक वार्म-अप की तरह है। यह AI से एक एकल चित्र के बारे में सरल प्रश्न पूछता है: "कौन सा ब्लॉक लंबा है?" "क्या ये दो टुकड़े एक-दूसरे को छू रहे हैं?" या "यदि मैं इस टुकड़े को घुमाता हूँ, तो यह बगल से कैसा दिखेगा?" यह बुनियादी "स्थानिक समझ" का परीक्षण करता है। दूसरा स्तर, प्लानिंग सेट (Planning Set), असली बॉस बैटल है। यहाँ, AI केवल प्रश्नों के उत्तर नहीं दे रहा है; इसे एक मास्टर बिल्डर की तरह कार्य करना है। इसे ब्लॉक्स का एक शुरुआती ढेर और अंतिम लक्ष्य का एक चित्र दिया जाता है, और इसे वहां तक पहुँचने के लिए चरण-दर-चरण योजना बनानी होती है। शोधकर्ताओं ने दुनिया के 29 सबसे उन्नत AI मॉडल्स का परीक्षण किया, जिनमें GPT-5 और Gemini जैसे बड़े नाम शामिल हैं, और यहाँ तक कि मानव विशेषज्ञों को भी वही टेस्ट देने के लिए कहा।

परिणाम AI की दुनिया के लिए एक वास्तविकता की जाँच (reality check) थे। सबसे मजबूत मॉडल भी बुनियादी बातों में संघर्ष कर रहे थे। एलिमेंटरी प्रश्नों में, सर्वश्रेष्ठ AI मॉडल मानव प्रदर्शन से कम से कम 20% पीछे रह गए। उदाहरण के लिए, जब 3D स्थान में ब्लॉक्स की ऊंचाई का निर्णय लगाने के लिए पूछा गया, तो कई मॉडल भ्रमित हो गए, स्क्रीन पर दिख रही सपाट 2D तस्वीर को देखने के बजाय वास्तविक 3D आकार की कल्पना करने में विफल रहे। लेकिन जैसे-जैसे कार्य लंबे होते गए, समस्या और भी गंभीर होती गई। जब AI को बहुविकल्पीय प्रश्नों का उपयोग करके चरणों के क्रम की योजना बनानी थी, तो उनकी सटीकता काफी कम होने लगी जब योजना 3 चरणों से अधिक हो गई, जो 50% से नीचे गिर गई। जब योजना के लिए 8 चरणों की आवश्यकता थी, तो सर्वश्रेष्ठ मॉडल्स की सटीकता गिरकर 0% हो गई। इसके विपरीत, मानव प्रतिभागियों ने हर एक प्लानिंग कार्य को पूरी तरह से हल किया, चाहे चरणों की श्रृंखला कितनी भी लंबी क्यों न हो।

शोधकर्ताओं ने कुछ और भी कठिन करने की कोशिश की: AI से केवल चरणों का वर्णन करने के लिए ही नहीं, बल्कि निर्माण प्रक्रिया की मध्यवर्ती तस्वीरों को वास्तव में बनाने (draw) के लिए कहना। वे देखना चाहते थे कि क्या AI कल्पना कर सकता है कि चरण 1 के बाद, फिर चरण 2 के बाद, किला कैसा दिखता है, और इसी तरह। परिणाम स्पष्ट थे। केवल 3 चरणों के छोटे से प्लान के लिए भी, मॉडल सही दृश्य अनुक्रम (visual sequence) उत्पन्न करने में पूरी तरह विफल रहे। वे कभी-कभी एक ऐसा चित्र बना सकते थे जो LEGO ईंट जैसा दिखता था, लेकिन वे इसे सही स्थान पर नहीं रख सके या इसकी दिशा (orientation) सही नहीं कर सके। पेपर में उल्लेख किया गया है कि चूंकि मॉडल इमेज जनरेशन के लिए केवल 3 चरणों में बुरी तरह विफल रहे, इसलिए शोधकर्ताओं ने इस विशिष्ट कार्य के लिए लंबे क्षितिज (horizons) का परीक्षण भी नहीं किया। यह सुझाव देता है कि हालांकि ये मॉडल पैटर्न पहचानने में अच्छे हैं, लेकिन उनमें समय के साथ अपने कार्यों के परिणामों की कल्पना करने की क्षमता की कमी है। वे बिना रास्ता भटके अपने दिमाग में निर्माण प्रक्रिया का मानसिक मानचित्र नहीं रख सकते।

संक्षेप में, LEGO-Puzzles प्रकट करता है कि हालांकि हमारे वर्तमान AI मॉडल प्रभावशाली हैं, लेकिन वे वास्तविक स्थानिक बुद्धिमत्ता (spatial intelligence) से अभी भी बहुत दूर हैं। वे विश्वसनीय रूप से बहु-चरणीय असेंबली की योजना नहीं बना सकते, और वे भविष्य की अवस्थाओं की कल्पना करने के मामले में पूरी तरह विफल हो जाते हैं। पेपर निष्कर्ष निकालता है कि AI को वास्तव में भौतिक दुनिया को समझने के लिए, ताकि वह चीजें बनाने, टूटी हुई चीजों को ठीक करने या अपने आप जटिल वातावरण में नेविगेट करने में हमारी मदद कर सके, अभी एक लंबा रास्ता तय करना है। भौतिक दुनिया में मानव अंतर्ज्ञान (intuition) और मशीन गणना (calculation) के बीच का अंतर अभी भी बहुत बड़ा है, और यह नया बेंचमार्क हमें एक स्पष्ट मानचित्र देता है कि मॉडल कहाँ लड़खड़ा रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →