Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks
यह शोध पत्र Ref-Adv को प्रस्तुत करता है, जो एक चुनौतीपूर्ण बेंचमार्क है जिसे शॉर्टकट समाधानों को समाप्त करने और वर्तमान मल्टीमॉडल एलएलएम (multimodal LLMs) की दृश्य तर्क और ग्राउंडिंग क्षमताओं के महत्वपूर्ण अंतराल को उजागर करने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े आलसी रोबोट दोस्त के साथ "छिपी हुई वस्तु खोजें" (Find the Hidden Object) का खेल खेल रहे हैं।
पुराना खेल: "ईज़ी मोड" (The Easy Mode)
वर्षों तक, शोधकर्ताओं ने इन रोबोट्स का परीक्षण एक मानक खेल के माध्यम से किया जिसे रेफरिंग एक्सप्रेशन कॉम्प्रिहेन्शन (REC) कहा जाता था। नियम सरल थे: आप रोबोट को एक तस्वीर दिखाते हैं और कहते हैं, "लाल गेंद ढूंढो।" रोबोट को लाल गेंद की ओर इशारा करना होता है।
समस्या यह थी कि पुराना खेल बहुत आसान था। यह एक खाली कमरे में लुका-छिपी खेलने जैसा था जहाँ केवल एक ही व्यक्ति छिपा हो।
- बहुत छोटा: संकेत बहुत छोटे थे, जैसे सिर्फ "कुत्ता" कहना, बजाय इसके कि "टोपी पहने हुए प्यारा कुत्ता।"
- कोई प्रतिस्पर्धा नहीं: आमतौर पर, तस्वीर में केवल एक ही कुत्ता होता था। रोबोट को सोचने की ज़रूरत नहीं पड़ती थी; वह बस "कुत्ता" को ढूँढता और इशारा कर देता।
- चीट कोड: क्योंकि संकेत इतने सरल थे और भ्रमित करने के लिए कोई अन्य कुत्ते नहीं थे, रोबोट बिना वास्तव में समझ के भी उत्तर का अनुमान लगा लेता था। यह वाक्य को वास्तव में समझने के बजाय केवल अंदाज़ा लगाने जैसा था। यह एक गणित के सवाल को हल करने जैसा था जहाँ संख्याएँ इतनी छोटी होती हैं कि उत्तर का अनुमान लगाना आसान हो जाता है।
भले ही रोबोट 90%+ स्कोर कर रहे थे, वे वास्तव में "चीटिंग" कर रहे थे क्योंकि वे शॉर्टकट ले रहे थे। वे वास्तव में देख या तर्क नहीं कर रहे थे; वे केवल पैटर्न मैचिंग कर रहे थे।
नया खेल: "Ref-Adv" (द हार्ड मोड)
इस शोध पत्र के लेखकों ने, जो नॉर्थईस्टर्न यूनिवर्सिटी की एक टीम है, Ref-Adv नामक एक नया, कठिन संस्करण बनाने का निर्णय लिया। वे देखना चाहते थे कि क्या रोबोट वास्तव में सोच सकते हैं या क्या वे असली चुनौती आने पर विफल हो जाएंगे।
उन्होंने कुछ मज़ेदार उपमाओं का उपयोग करके इस खेल को कठिन कैसे बनाया, यहाँ बताया गया है:
1. "भीड़भाड़ वाला कमरा" उपमा (कठिन डिस्ट्रैक्टर्स)
पुराने खेल में, यदि आप कहते "एक आदमी ढूंढो," तो आमतौर पर केवल एक ही आदमी होता था। Ref-Adv में, तस्वीर एक भीड़भाड़ वाली पार्टी है जिसमें 10 आदमी हैं।
- ट्विस्ट: वे केवल "एक आदमी" के लिए नहीं पूछते। वे पूछते हैं, "वह आदमी जो नीली शर्ट पहने हुए है, जिसने ड्रिंक नहीं पकड़ी हुई है, और लाल टोपी वाली महिला के पास खड़ा है।"
- चुनौती: रोबोट को अन्य 9 आदमियों को अनदेखा करना होगा। यदि वह केवल "आदमी" को ढूँढता है, तो वह विफल हो जाएगा। उसे उस एक विशिष्ट व्यक्ति को खोजने के लिए वाक्य के हर विवरण को प्रोसेस करना होगा।
2. "न्यूनतम संकेत" उपमा (कोई रिडंडेंसी नहीं)
पुराने खेल में, संकेत अक्सर बहुत अधिक होते थे, जैसे "मेज पर रखी बड़ी, लाल, चमकदार, गोल, स्वादिष्ट सेब।" भले ही आप "बड़ी," "चमकदार" और "स्वादिष्ट" शब्दों को अनदेखा कर दें, फिर भी आप सेब को ढूंढ सकते थे क्योंकि वहाँ केवल एक ही सेब था।
- ट्विस्ट: Ref-Adv में, संकेत का हर शब्द अनिवार्य है। यदि आप "नीली कार" से "नीली" शब्द हटा देते हैं, तो रोबोट गलत कार चुन सकता है। संकेत "न्यूनतम पर्याप्त" (minimally sufficient) हैं—पहेली को सुलझाने के लिए पर्याप्त जानकारी, लेकिन पीछे छिपने के लिए कोई अतिरिक्त फालतू शब्द नहीं।
**3. "नेगेशन" (नकार) का जाल
उन्होंने ऐसे पेचीदा संकेत जोड़े जैसे "उस व्यक्ति को ढूंढें जो टाई नहीं पहने हुए है।"
- चुनौती: यह रोबोट को मजबूर करता है कि वह तस्वीर में हर किसी को देखे, चेक करे कि किसने टाई पहनी है, और फिर उस एक को खोजने के लिए उन्हें मानसिक रूप से काट दे जिसने टाई नहीं पहनी है। यह एक लॉजिक पज़ल है, न कि केवल एक खोज।
परिणाम: रोबोट चकरा गए
शोधकर्ताओं ने दुनिया के 13 सबसे स्मार्ट AI रोबोट्स (जैसे GPT-4o, Gemini, और Qwen) का इस नए खेल पर परीक्षण किया।
- पुराने खेल पर (RefCOCO): रोबोट चैंपियन थे, 90% से अधिक स्कोर कर रहे थे। वे जीनियसस दिख रहे थे।
- नए खेल पर (Ref-Adv): उनका स्कोर तेजी से गिरा। कई मामलों में यह गिरकर लगभग 50% या उससे भी कम हो गया।
इसका क्या मतलब है?
यह उस छात्र की तरह है जिसने आसान सवालों वाले अभ्यास टेस्ट को रट लिया था। जब उसने जटिल, बहु-चरणीय तर्क वाली वास्तविक परीक्षा दी, तो वह असफल हो गया। रोबोट "शॉर्टकट" (सरल कीवर्ड के आधार पर अनुमान लगाना) पर निर्भर थे, न कि वास्तविक दृश्य तर्क (visual reasoning) पर।
"सोचने" का टूल (चेन ऑफ थॉट)
शोधकर्ताओं ने रोबोट को एक "सोचने का टूल" (जिसे चेन ऑफ थॉट कहा जाता है) देने का भी प्रयास किया, जहाँ उन्हें उत्तर देने से पहले अपने चरणों को ज़ोर से बोलकर समझाने के लिए मजबूर किया जाता है।
- परिणाम: इसने थोड़ी मदद की, लेकिन समस्या को ठीक करने के लिए पर्याप्त नहीं थी। रोबवर अभी भी जटिल वाक्य को भीड़भाड़ वाली छवि से पूरी तरह से जोड़ने में संघर्ष कर रहे थे।
मुख्य निष्कर्ष
यह शोध पत्र एक चेतावनी है। यह हमें बताता है कि केवल इसलिए कि एक AI एक मानक परीक्षण पर उच्च स्कोर प्राप्त कर सकता है, इसका मतलब यह नहीं है कि वह दुनिया को वास्तव में समझता है।
Ref-Adv AI के लिए नया "स्ट्रेस टेस्ट" है। यह एक ऐसे रोबोट के बीच का अंतर है जो कह सकता है "मुझे एक बिल्ली दिख रही है" और एक ऐसे रोबोट के बीच है जो कह सकता है, "मुझे एक बिल्ली दिख रही है, लेकिन वह वह नहीं है जिसे आप चाहते हैं; आप उस बिल्ली को चाहते हैं जो खिड़की की दहलीज पर सो रही है, न कि उस बिल्ली को जो लेज़र पॉइंटर का पीछा कर रही है।"
लेखक आशा करते हैं कि यह नया बेंचमार्क AI डेवलपर्स को अधिक स्मार्ट, अधिक तर्क करने में सक्षम रोबोट बनाने के लिए मजबूर करेगा जो पुराने डेटासेट्स की स्वच्छ, सरल दुनिया के बजाय वास्तविक दुनिया की अव्यवस्थित, भीड़भाड़ वाली और जटिल वास्तविकता को संभाल सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।