← नवीनतम पेपर
💬 NLP

Contextual Observer Grounding: Evaluating Situated Spatial Reasoning in Vision-Language Models

यह शोध पत्र विज़न-लैंग्वेज मॉडल्स की "कॉन्टेक्स्टुअल ऑब्ज़र्वर ग्राउंडिंग" (संदर्भगत प्रेक्षक स्थानीकरण)—अर्थात संदर्भ संकेतों से वक्ता के स्थित दृष्टिकोण का अनुमान लगाने की क्षमता—का मूल्यांकन करने के लिए पॉइंट-ऑफ-व्यू बेंचमार्क (POVBench) प्रस्तुत करता है और यह प्रदर्शित करता है कि जबकि वर्तमान मॉडल इस कार्य में संघर्ष करते हैं, प्रेक्षक-सापेक्ष स्थानिक तर्क का स्पष्ट विवरण लक्ष्य स्थानीयकरण में महत्वपूर्ण सुधार कर सकता है।

मूल लेखक: Mimo Shirasaka, Haochen Zhang, Yonatan Bisk

प्रकाशित 2026-09-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mimo Shirasaka, Haochen Zhang, Yonatan Bisk

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसे कमरे में खोई हुई वस्तु को खोजने की कोशिश कर रहे हैं जिसमें आप पहले कभी नहीं गए हैं, और यह केवल एक मित्र के विवरण पर आधारित है कि उन्होंने उसे कहाँ छोड़ा था। आप सुन सकते हैं, "मैंने कॉफी बनाते समय लैंप के बाईं ओर रखी मेज पर अपनी चाबियाँ गिरा दी थीं।" इस पहेली को सुलझाने के लिए, आपको केवल यह जानने की आवश्यकता नहीं है कि मेज और लैंप कैसे दिखते हैं; आपको पहले अपने मित्र की स्थिति का पुनर्निर्माण करना होगा, उनके दृष्टि क्षेत्र (line of sight) की कल्पना करनी होगी, और फिर उस विशिष्ट दृष्टिकोण के सापेक्ष चाबियों को मानसिक रूप से रखना होगा। दूसरे व्यक्ति के दृष्टिकोण से स्थान को समझने की यह क्षमता, जो गतिविधि और वातावरण के बारे में सुरागों का उपयोग करती है, मानव संचार का एक मौलिक हिस्सा है। यह हमें हर एक दृश्य विवरण साझा किए बिना कुशलतापूर्वक सहयोग करने की अनुमति देता है। रोबोट और आर्टिफिशियल इंटेलिजेंस (AI) को हमारे घरों में हमारे साथ काम करने के लिए, उन्हें इसी कौशल में महारत हासिल करनी होगी, जिसे 'सिट्युएटेड स्पेशियल रीजनिंग' (situated spatial reasoning) कहा जाता है।

टोक्यो विश्वविद्यालय और कार्नेगी मेलन विश्वविद्यालय के शोधकर्ताओं द्वारा किया गया एक नया अध्ययन जांच करता है कि क्या आधुनिक आर्टिफिशियल इंटेलिजेंस सिस्टम वास्तव में इस कार्य को कर सकते हैं। मिमो शिरासाका, हाओचेन झांग और योनातन बिस्कक के नेतृत्व वाली टीम ने एक कठोर परीक्षण बनाया जिसे 'पॉइंट-ऑफ-व्यू बेंचमार्क' (Point-of-View Benchmark) कहा गया, ताकि यह देखा जा सके कि क्या मशीनें वक्ता के स्थान का अनुमान लगा सकती हैं और फिर उस अनुमानित परिप्रेक्ष्य के आधार पर एक वस्तु को ढूंढ सकती हैं। उनका कार्य यह प्रकट करता है कि जबकि वर्तमान AI मॉडल कई दृश्य कार्यों में प्रभावशाली हैं, वे तब संघर्ष करते हैं जब उन्हें उस दृष्टिकोण से स्थान के बारे में तर्क करने के लिए कहा जाता है जिसे वे सीधे देख नहीं सकते, भले ही उन्हें स्पष्ट निर्देश दिए गए हों।

शोधकर्ताओं ने इस परीक्षण का निर्माण एक कंप्यूटर-जनरेटेड दुनिया का उपयोग करके किया जो प्रक्रियात्मक रूप से बनाए गए घरों (procedurally created houses) से युक्त थी, जिसमें वास्तविक फर्नीचर और लेआउट शामिल थे। इस डिजिटल वातावरण में, एक सिम्युलेटेड रोबोट प्रत्येक घर का पता लगाता है, और एक कमरे से दूसरे कमरे में जाते समय प्रथम-व्यक्ति (first-person) छवियों की एक श्रृंखला कैप्चर करता है। प्रयोग का मुख्य हिस्सा एक प्राकृतिक भाषा का वाक्य है जो किसी वस्तु के स्थान का वर्णन करता है, जैसे "मैंने बिस्तर के बाईं ओर किताब देखी।" आर्टिफिशियल इंटेलिजेंस के लिए चुनौती यह है कि वह रोब manera के अन्वेषण फोटो देखे, यह पता लगाए कि बोलने वाला व्यक्ति उस समय कहाँ खड़ा था जब उसने वह वाक्य कहा था, और फिर उस विशिष्ट दृश्य में किताब कहाँ होगी, उस ओर संकेत करे। अध्ययन ने यह समझने के लिए तीन अलग-अलग कठिनाई स्तरों का परीक्षण किया कि AI वास्तव में कहाँ अटक जाता है। सबसे कठिन संस्करण में, वाक्य केवल गतिविधि के बारे में एक संकेत देता है, जैसे "बल्ब बदलते समय," जो AI को स्थान का अनुमान लगाने के लिए मजबूर करता है। मध्यम संस्करण में, वाक्य स्पष्ट रूप से उस वस्तु का नाम लेता है जिसके साथ व्यक्ति बातचीत कर रहा था, जैसे "फ्लोर लैंप पर बल्ब बदलते समय।" सबसे आसान संस्करण में, AI को वक्ता के दृष्टिकोण से सटीक फोटो दिखाया जाता है।

परिणाम बहुत ही स्पष्ट करने वाले थे। दोनों व्यावसायिक और ओपन-सोर्स संस्करणों सहित उन्नत AI मॉडलों की एक विस्तृत श्रृंखला में, प्रदर्शन तीनों परिदृश्यों में कम रहा। यहाँ तक कि जब AI को स्पष्ट रूप से बताया गया कि वक्ता किस वस्तु के पास था, या जब उसे वक्ता के दृष्टिकोण से सटीक फोटो दिया गया, तब भी मॉडल अक्सर सही स्थान बताने में विफल रहे। कठिन और मध्यम संस्करणों के बीच का अंतर आश्चर्यजनक रूप से कम था, जो यह सुझाव देता है कि मुख्य कठिनाई केवल यह पता लगाना नहीं है कि वक्ता कहाँ खड़ा था, बल्कि "के बाईं ओर" जैसे विवरण को एक विशिष्ट स्थान में अनुवादित करना समझना है। मॉडल अक्सर गलत कमरा चुन लेते थे या संदर्भ वस्तु को भ्रमित कर देते थे, जैसे कि दरवाजे के फ्रेम को रेफ्रिजरेटर समझ लेना, क्योंकि वे दृश्य संकेतों को गतिविधि के संदर्भ के साथ प्रभावी ढंग से संयोजित नहीं कर पा रहे थे।

यह समझने के लिए कि क्या मॉडल मदद से बेहतर हो सकते हैं, शोधकर्ताओं ने एक अलग दृष्टिकोण अपनाया। उन्होंने AI को अपने सोचने की प्रक्रिया को चरण-दर-चरण तोड़ने के लिए कहा, जिसमें स्पष्ट रूप से बताया गया कि उसने वक्ता की स्थिति की पहचान कैसे की, संदर्भ वस्तु का पता कैसे लगाया, और फिर लक्ष्य की दिशा कैसे निर्धारित की। यह विधि, जिसे लेखक 'स्ट्रक्चर्ड स्पेशियल रीजनिंग' (structured spatial reasoning) कहते हैं, सटीकता में उल्लेखनीय सुधार लेकर आई। जब मॉडलों को इस संरचित तरीके से तर्क करने के लिए निर्देशित किया गया, तो वे छिपी हुई वस्तुओं को खोजने में बेहतर हो गए। यह सुझाव देता है कि AI के पास आवश्यक जानकारी मौजूद है, लेकिन वह बिना स्पष्ट मार्गदर्शन के बिंदुओं को जोड़ने के लिए संघर्ष करता है।

अध्ययन ने वास्तविक वीडियो फुटेज का उपयोग करके वास्तविक दुनिया में भी इन विचारों का परीक्षण किया। परिणाम कंप्यूटर सिमुलेशन के समान ही थे: AI मॉडल इस कार्य में संघर्ष करते रहे, और पचास प्रतिशत सफलता दर के आसपास या उससे नीचे प्रदर्शन करते रहे। हालांकि, जो मॉडल चरण-दर-चरण तर्क लगाने वाले दृष्टिकोण का उपयोग कर रहे थे, उन्होंने उन मॉडलों की तुलना में बेहतर परिणाम दिखाए जो ऐसा नहीं कर रहे थे। यह इंगित करता है कि कठिनाई केवल कंप्यूटर-जनरेटेड वातावरण की खामी नहीं है, बल्कि मानव स्थानों की जटिल वास्तविकता के सामने वर्तमान तकनीक के लिए एक वास्तविक चुनौती है।

अंततः, यह शोध एम्बोडीड आर्टिफिशियल इंटेलिजेंस (embodied artificial intelligence) की क्षमताओं में एक महत्वपूर्ण अंतर को उजागर करता है। जबकि मशीनें वस्तुओं को पहचान सकती हैं और जो वे देख रही हैं उसके बारे में उत्तर दे सकती हैं, उन्होंने अभी तक स्वाभाविक रूप से मानव वक्ता के दृष्टिकोण का अनुमान लगाना या उस दृश्य का पुनर्निर्माण करना नहीं सीखा है जिसे उन्होंने प्रत्यक्ष रूप से नहीं देखा है। निष्कर्ष बताते हैं कि रोबोट्स को हमारे दैनिक जीवन में मनुष्यों के साथ वास्तव में सहयोग करने के लिए, उन्हें दूसरे व्यक्ति के दृष्टिकोण से स्थान के बारे में तर्क करने की गहरी क्षमता विकसित करने की आवश्यकता है, जिससे वे दृश्य पहेली के लुप्त हिस्सों को भरने के लिए संदर्भ और सामान्य ज्ञान का उपयोग कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →