LRR-Bench: Left, Right or Rotate? Vision-Language models Still Struggle With Spatial Understanding Tasks
यह शोध पत्र LRR-Bench प्रस्तुत करता है, जो पूर्ण (absolute) और 3D स्थानिक समझ के कार्यों पर विजन-लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए एक सिंथेटिक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल मानव प्रदर्शन से काफी पीछे हैं और अक्सर जटिल स्थानिक तर्क चुनौतियों पर पूरी तरह विफल हो जाते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान रोबोट मित्र है जो किताबें पढ़ सकता है, कविताएँ लिख सकता है और चित्रों का सुंदर विवरण दे सकता है। आप सोच सकते हैं, "यदि यह रोबोट सूर्यास्त का इतना अच्छा वर्णन कर सकता है, तो यह निश्चित रूप से जानता होगा कि उस चित्र में सब कुछ कहाँ है!"
यह शोध पत्र, जिसका शीर्षक LR%R-Bench है, उन रोबोटों के लिए एक वास्तविकता की जाँच (reality check) की तरह है। लेखकों ने एक विशेष परीक्षण बनाया है ताकि यह देखा जा सके कि क्या ये "विज़न-लैंग्वेज मॉडल्स" (VLMs) वास्तव में स्थान (space) को समझ सकते हैं—जैसे कि यह जानना कि क्या बाईं ओर है, दाईं ओर क्या है, या कोई चीज़ आपकी ओर बढ़ रही है या नहीं।
यहाँ उनके निष्कर्षों का विवरण रोज़मर्रा के उदाहरणों के साथ दिया गया है:
1. परीक्षण: रोबोटों के लिए एक "स्पेशियल जिम" (Spatial Gym)
शोधकर्ताओं ने रोबोटों के स्थानिक कौशल (spatial muscles) का परीक्षण करने के लिए एक जिम बनाया जिसमें विभिन्न प्रकार के व्यायाम (कार्य) थे। उन्होंने परीक्षणों को दो मुख्य श्रेणियों में विभाजित किया:
- "स्थिर" कमरा (Absolute Position): कल्पना कीजिए कि आप एक लिविंग रूम की फोटो देख रहे हैं। रोबलेट से पूछा जाता है, "क्या बिल्ली बाईं ओर है या दाईं ओर?" या "क्या लैंप ऊपर के कोने में है?"
- ट्विस्ट: उन्होंने इसे कठिन बनाने के लिए तीन अलग-अलग तस्वीरों को एक बड़े पहेली (puzzle) में डाला और रोबोट से प्रत्येक छोटे टुकड़े में वस्तुओं के स्थान को ट्रैक करने के लिए कहा।
- "गतिमान" कमरा (3D & Motion): कल्पना कीजिए कि आप एक वीडियो क्लिप देख रहे हैं। रोबोट से पूछा जाता है, "क्या कैमरा घूम रहा है?" या "क्या वह भेड़ आगे बढ़ रही है, या वह बस खड़ी है जबकि कैमरा चल रहा है?"
- ट्विस्ट: उन्होंने इन चलते हुए दृश्यों को बनाने के लिए एक वीडियो गेम (Minecraft) का उपयोग किया क्योंकि यह सस्ता है और चीजों के हिलने-डुलने पर सटीक नियंत्रण रखने के लिए एकदम सही है।
वीडियो गेम का उपयोग क्यों किया गया? यह प्रयोगों के लिए एक "क्लीन रूम" की तरह है। वास्तविक दुनिया में, तस्वीरें अव्यवस्थित हो सकती हैं। गेम में, शोधकर्ताओं को पता है कि हर वस्तु बिल्कुल कहाँ है, इसलिए वे 100% सुनिश्चित हो सकते हैं कि रोबोट सही है या गलत। इसका मतलब यह भी है कि रोबोट अपने प्रशिक्षण डेटा से उत्तर याद करके "चीटिंग" नहीं कर सके।
2. परिणाम: "स्मार्ट" रोबोट अंतरिक्ष में खो गया है
परिणाम चौंकाने वाले थे। जहाँ इंसानों ने लगभग पूर्ण अंक प्राप्त किए (जैसे हर टेस्ट में A+ मिलना), वहीं सबसे उन्नत AI मॉडल बुरी तरह संघर्ष करते दिखे।
- "सरल" कार्य जीत जाते हैं: रोबोट आसान कार्यों में ठीक थे, जैसे यह कहना कि "गेंद केंद्र में है।" यह एक छोटे बच्चे द्वारा बिस्किट की ओर इशारा करने जैसा है।
- "जटिल" कार्यों में विफलता: जैसे ही परीक्षण में गति (movement) या घूर्णन (rotation) शामिल हुआ, रोबटेज भ्रमित हो गए।
- उदाहरण: कल्पना कीजिए कि आप कार में बाईं ओर मुड़ रहे हैं। आप जानते हैं कि दृश्य दाईं ओर जा रहा है। लेकिन यदि आपसे पूछा जाए, "क्या कार बाईं ओर जा रही है या दुनिया दाईं ओर जा रही है?" तो रोबोट अक्सर गलत हो जाता है। वह कैमरे के चलने और वस्तु के चलने के बीच अंतर नहीं कर सका।
- "शून्य" स्कोर: कुछ सबसे कठिन 3D कार्यों पर, सर्वश्रेष्ठ रोबोटों का स्कोर लगभग शून्य था। वे मूल रूप से अनुमान लगा रहे थे, जैसे कि कोई छात्र जिसने पढ़ाई नहीं की है और बहुविकल्पीय प्रश्न में बस "C" चुन रहा है।
3. "सोचने" का जाल (The "Thinking" Trap)
शोधकर्ताओं ने एक सामान्य तकनीक आजमाई: उन्होंने रोबोट्स को कहा, "सिर्फ अनुमान न लगाएं; उत्तर देने से पहले चरण-दर-चरण सोचें" (इसे Chain-of-Thought कहा जाता है)।
- आश्चर्य: सरल कार्यों के लिए, सोचने से थोड़ा फायदा हुआ। लेकिन कठिन स्थानिक कार्यों के लिए, सोचना इसे और खराब बना देता है!
- उदाहरण: यह एक भ्रमित व्यक्ति से यह समझाने जैसा है कि वह क्यों भ्रमित है। समस्या को हल करने के बजाय, वे अपने गलत उत्तर को सही ठहराने के लिए कहानियाँ बनाने लगते हैं (hallucinations)। रोबोट ने गति के बारे में जितना अधिक "तर्क" करने की कोशिश की, उसने उतनी ही अधिक काल्पनिक भौतिकी (fake physics) गढ़ी।
4. बड़ा होना हमेशा बेहतर नहीं होता
आमतौर पर, AI में, यदि आप मॉडल को बड़ा (अधिक "दिमागी शक्ति") बनाते हैं, तो वह स्मार्ट हो जाता है।
- वास्तविकता: इस स्थानिक परीक्षण में, मॉडल को बड़ा बनाने से ज्यादा मदद नहीं मिली। यहाँ तक कि विशाल मॉडल (अरबों पैरामीटर्स वाले) भी 3D स्पेस को समझने में विफल रहे।
- "विशेष प्रशिक्षण" का मिथक: कुछ मॉडल्स को 3D डेटा पर विशेष रूप से प्रशिक्षित किया गया था ताकि वे अंतरिक्ष के "विशेषज्ञ" बन सकें। आश्चर्यजनक रूप से, ये "विशेषज्ञ" भी सामान्य मॉडल्स से बहुत बेहतर नहीं थे। यह ड्राइविंग स्कूल का कोर्स करने के बाद भी पैरलल पार्किंग न सीख पाने जैसा है।
मुख्य निष्कर्ष
यह पेपर हमें बताता है कि हालांकि AI देखने का वर्णन करने में अद्भुत है (एक कवि की तरह), लेकिन यह भौतिक दुनिया को समझने में (एक पायलट या सर्जन की तरह) अभी भी बहुत खराब है।
- वर्तमान स्थिति: AI आपको बता सकता है "वहाँ एक कुत्ता है।"
- लापता कौशल: AI को यह समझने में संघर्ष होता है कि "कुत्ता मेरी ओर दौड़ रहा है, और यदि मैं बाईं ओर मुड़ता हूँ, तो कुत्ता मेरी दाईं ओर होगा।"
लेखक निष्कर्ष निकालते हैं कि जब तक हम इसे ठीक नहीं करते, हम इन रोबोटों पर सेल्फ-ड्राइविंग कारों या रोबोटिक भुजाओं (robotic arms) के लिए पूरी तरह भरोसा नहीं कर सकते जिन्हें बिना टकराए वास्तविक दुनिया में नेविगेट करने की आवश्यकता होती है। रोबोट स्मार्ट हैं, लेकिन वे वर्तमान में "स्थानिक रूप से अंधे" (spatially blind) हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।