SceneFunRI: Reasoning the Invisible for Task-Driven Functional Object Localization
यह शोध पत्र SceneFunRI प्रस्तुत करता है, जो 855 इंस्टेंस वाला एक नया बेंचमार्क है जो कार्य निर्देशों और सामान्य ज्ञान (कॉमन सेंस) का उपयोग करके अदृश्य, अवरुद्ध कार्यात्मक वस्तुओं के स्थानों के बारे में तर्क करने की विजन-लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान अत्याधुनिक मॉडल इस क्षमता के साथ काफी संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक कमरे में जाते हैं और कोई आपसे पूछता है, "बिस्तर के पास वाला नाइटस्टैंड कहाँ है?" आप चारों ओर देखते हैं, लेकिन नाइटस्टैंड एक बड़ी अलमारी के पीछे पूरी तरह से छिपा हुआ है। आप उसे देख ही नहीं पा रहे हैं। हालाँकि, आप सामान्य ज्ञान से जानते हैं कि नाइटस्टैंड आमतौर पर बिस्तरों के पास होते हैं, और आप बिस्तर को देख सकते हैं। इसलिए, आप मानसिक रूप से उस "खाली जगह को भरते" हैं जहाँ नाइटस्टैंड होना चाहिए और उस जगह की ओर इशारा करते हैं जो अलमारी के पीछे है।
यह शोध पत्र, SceneFunRI, कंप्यूटर को ठीक यही मानसिक ट्रिक सिखाने के बारे में है।
समस्या: "अदृश्य" चुनौती
वर्तमान AI मॉडल (विशेष रूप से विजन-लैंग्वेज मॉडल्स, या VLMs) उन जासूसों की तरह हैं जो केवल उसी पर भरोसा करते हैं जो वे अपनी आँखों से देख सकते हैं। यदि कोई सुराग किसी दीवार के पीछे छिपा है, तो वे अक्सर हार मान लेते हैं या अंदाज़ा लगाने लगते हैं। वे यह समझने में संघर्ष करते हैं कि चीजें कहाँ हैं जब वे चीजें पूरी तरह से अदृश्य होती हैं।
शोधकर्ताओं ने एक नया परीक्षण बनाया जिसे SceneFunRI (रीज़निंग द इनविजिबल) कहा जाता है।
- सेटअप: उन्होंने 855 वास्तविक दुनिया के दृश्य लिए जहाँ एक विशिष्ट वस्तु (जैसे लैंप या दराज) दृष्टि से पूरी तरह से छिपी हुई है।
- कार्य: AI को एक कमरे की तस्वीर दी जाती है और एक कमांड दी जाती है जैसे, "बिस्तर के दाईं ओर स्थित नाइटस्टैंड की दराज खोलें।"
- लक्ष्य: AI को बिना देखे उस अदृश्य नाइटस्टैंड के स्थान की ओर इशारा करना चाहिए, केवल दिखाई देने वाले बिस्तर और इस ज्ञान का उपयोग करके कि कमरे आमतौर पर कैसे व्यवस्थित होते हैं।
परिणाम: AI अभी भी एक नौसिखिया जासूस है
शोधकर्ताओं ने इस कार्य पर कई अलग-अलग AI मॉडल का परीक्षण किया। परिणाम विनम्र करने वाले थे:
- सबसे अच्छा AI: यहाँ तक कि सबसे स्मार्ट मॉडल (Gemini 3 Flash) भी केवल 15% बार ही सटीक स्थान बता पाया।
- मानव आधार रेखा (Human Baseline): मनुष्यों की तुलना में, वे लगभग 66% बार सही थे।
- अंतर: यह दर्शाता है कि AI उन चीजों को पहचानने में तो बेहतरीन है जो उसके सामने हैं, लेकिन वह बाधाओं के पीछे क्या है, इसकी कल्पना करने में बहुत खराब है।
उन्होंने AI की मदद करने की कोशिश कैसे की (प्रॉम्प्टिंग प्रयोग)
शोधकर्ताओं ने AI को बेहतर करने के लिए तीन अलग-अलग तरीकों से "कोचिंग" देने की कोशिश की, ठीक वैसे ही जैसे एक शिक्षक किसी छात्र की मदद करता है:
- मजबूत निर्देश: AI को कहना, "जो आप देखते हैं उसे अनदेखा करें; उस पर ध्यान दें जो वहाँ होना चाहिए।"
- परिणाम: इससे थोड़ी मदद मिली। यह एक छात्र को यह बताने जैसा था कि, "सिर्फ तस्वीर को मत देखो; कहानी के बारे में सोचो।"
- सामान्य ज्ञान के संकेत: AI को विशिष्ट तथ्य देना, जैसे "आउटलेट आमतौर पर कोनों में होते हैं।"
- परिणाम: इससे ज्यादा मदद नहीं मिली। यह छात्र को एक तथ्य पत्र देने जैसा था लेकिन उसे यह नहीं सिखाया गया कि उस तथ्य को विशिष्ट कमरे पर कैसे लागू किया जाए। AI तथ्य जानता था लेकिन वह उसे मानचित्र पर स्थान में अनुवादित नहीं कर सका।
- "उन्मूलन की प्रक्रिया" (SPoE): यह सबसे रचनात्मक दृष्टिकोण था। AI से तुरंत सटीक स्थान का अनुमान लगाने के बजाय, उन्होंने इसे "हॉट एंड कोल्ड" (पास या दूर) का खेल खेलने के लिए सिखाया।
- यह कैसे काम करता है: AI को पूरा कमरा दिखाया जाता है। फिर, उससे पूछा जाता है, "क्या वस्तु बाएं आधे हिस्से में है या दाएं आधे हिस्से में?" यह उस आधे हिस्से को हटा देता है जहाँ वस्तु नहीं हो सकती। फिर यह शेष आधे हिस्से को फिर से विभाजित करता है।
- परिणाम: यह आश्चर्यजनक रूप से अच्छा काम कर गया। गलत क्षेत्रों को धीरे-धीरे खारिज करके, AI सही स्थान के बहुत करीब पहुँच गया। यह एक खोई हुई चाबी को खोजने जैसा है जहाँ आप सीधे दराज का अंदाज़ा लगाने के बजाय एक-एक करके हर कमरे की जाँच करते हैं।
मुख्य निष्कर्ष
यह शोध पत्र निष्कर्ष निकालता है कि वर्तमान AI मॉडल अदृश्य दुनिया के प्रति "अंधे" हैं। वे जो देखते हैं उसका वर्णन करने में अच्छे हैं, लेकिन उन्होंने यह नहीं सीखा है कि जो वे नहीं देखते, उसका मानसिक मानचित्र कैसे बनाया जाए।
शोधकर्ताओं ने पाया कि AI वास्तव में गलत अनुमानों को खारिज करने (जैसे मानचित्र पर कमरे काटने) में गलत स्थान का सीधे अनुमान लगाने की तुलना में बेहतर है। AI को वास्तव में वास्तविक दुनिया में स्मार्ट बनाने के लिए, हमें इसे अनिश्चितता के साथ सहज होना और दृश्य साक्ष्य गायब होने पर खाली जगहों को भरने के लिए तर्क का उपयोग करना सिखाने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।