← नवीनतम पेपर
🤖 machine learning

Part Grounding, Not Action Knowledge: Locating the Bottleneck in VLM Affordance Prediction

यह शोध पत्र विज़न-लैंग्वेज मॉडल एफ़ोर्डेंस प्रेडिक्शन (affordance prediction) में क्रिया ज्ञान की कमी के बजाय पार्ट ग्राउंडिंग (part grounding) को प्राथमिक बाधा के रूप में पहचानता है, और यह प्रदर्शित करता है कि लक्षित वस्तु के भाग को स्पष्ट रूप से निर्दिष्ट करना सभी परीक्षण किए गए मॉडलों में क्रिया सटीकता में नाटकीय रूप से सुधार करता है।

मूल लेखक: Sarthak Sattigeri

प्रकाशित 2026-09-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sarthak Sattigeri

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट दुनिया को देखने में बेहतर होते जा रहे हैं। वे केवल एक तस्वीर देखकर कुर्सी, कप या कैमरा जैसी चीजों की पहचान कर सकते हैं। लेकिन किसी वस्तु को देखने और उसे कैसे हिलाना है, यह जानने के बीच एक अंतर है। रोबोट को उपयोगी बनाने के लिए, हमें इसे "अफोर्डेंस" (affordances) समझने की आवश्यकता है, जो एक सरल अवधारणा है जिसका अर्थ है कि कोई वस्तु किस काम के लिए है और मानव या मशीन को उसके साथ कैसे इंटरैक्ट करना चाहिए। यदि रोबोट एक दराज देखता है, तो उसे पता होना चाहिए कि उसे खींचना है। यदि वह एक बटन देखता है, तो उसे पता होना चाहिए कि उसे दबाना है। यह एक इंसान के लिए स्पष्ट लगता है, लेकिन आर्टिफिशियल इंटेलिजेंस के लिए, यह एक आश्चर्यजनक रूप से कठिन पहेली है। शोधकर्ता विजन-लैंग्वेज मॉडल्स (vision-language models)—ऐसे सिस्टम जो एक छवि को देख सकते हैं और उसके बारे में सवालों के जवाब दे सकते हैं—का परीक्षण कर रहे हैं ताकि यह देखा जा सके कि क्या वे इन इंटरैक्शन को समझ सकते हैं। परिणाम निराशाजनक रहे हैं, क्योंकि मशीनें अक्सर सही निर्देश देने में विफल रहती हैं। बड़ा सवाल यह रहा है कि: क्या इन मॉडल्स में चीजों के काम करने के बुनियादी ज्ञान की कमी है, या वे केवल तस्वीर के गलत हिस्से को देख रहे हैं?

एक शोधकर्ता ने उन्नीस अलग-अलग वस्तुओं, जैसे कि कैमरे, दराज और ढक्कनों से जुड़े एक विशिष्ट कार्य पर आठ अलग-अलग आर्टिफिशियल इंटेलिजेंस मॉडल्स का परीक्षण करके इस रहस्य को सुलझाने का प्रयास किया। उन्होंने मॉडल्स से एक सरल प्रश्न पूछा: एक वस्तु की तस्वीर दी गई है, तो रोबोट उस पर क्या गति (motion) करे? सही उत्तर कुछ सीमित क्रियाओं तक ही सीमित थे, जैसे धक्का देना (pushing), खींचना (pulling) या उठाना (lifting)। जब मॉडल्स को यह चुनने की अनुमति दी गई कि उन्हें वस्तु के किस भाग के बारे में बात करनी चाहिए, तो उनका प्रदर्शन बहुत खराब रहा। वास्तव में, जब सही उत्तर किसी चीज़ को "धक्का देना" (push) था, तो मॉडल्स ने लगभग कभी भी उस शब्द का उपयोग नहीं किया। साठ-चार बार जहाँ धक्का देना सही कदम था, मॉडल्स केवल एक बार ही सही हो पाए। बाकी समय, उन्होंने ऐसी क्रियाओं का सुझाव दिया जो स्थिति के लिए पूरी तरह से गलत थीं।

पहली नज़र में, यह ज्ञान की बड़ी विफलता लग रही थी। ऐसा लग रहा था कि मॉडल्स को बस यह नहीं पता कि बटन दबाए जाते हैं और दराज खींचे जाते हैं। हालाँकि, जब शोधकर्ता ने बारीकी से देखा कि मॉडल्स वास्तव में क्या कह रहे थे, तो उन्हें एक अलग कहानी मिली। मॉडल्स क्रिया (action) को लेकर भ्रमित नहीं थे; वे लक्ष्य (target) को लेकर भ्रमित थे। जब उन्हें एक कैमरा दिखाया गया और पूछा गया कि क्या करना है, तो मॉडल्स अक्सर पूरे कैमरे को उठाने के बारे में वर्णन करते थे, बजाय इसके कि वे पीछे के बटन को दबाने के बारे में समझाएं। वे वस्तु के बारे में एक तर्कसंगत प्रश्न का उत्तर दे रहे थे, लेकिन वे उस विशिष्ट भाग को मिस कर रहे थे जिस पर क्रिया की जानी थी। मॉडल्स पहेली के गलत टुकड़े को देख रहे थे।

इस सिद्धांत का परीक्षण करने के लिए, शोधकर्ता ने प्रयोग को बदल दिया। मॉडल्स को यह तय करने देने के बजाय कि वे किस भाग पर चर्चा करें, उन्होंने मॉडल्स को ठीक से बताया कि उन्हें किस भाग पर ध्यान केंद्रित करना है। उन्होंने कहा, "इस कैमरे के बटन को देखो। इसके साथ एक रोबोट को क्या करना चाहिए?" यह बदलाव नाटकीय था। जैसे ही शोधकर्ता ने विशिष्ट भाग का नाम लिया, मॉडल्स की सटीकता काफी बढ़ गई। हर एक मॉडल में सुधार हुआ, और उनकी सफलता दर लगभग पंद्रह प्रतिशत के निम्न स्तर से बढ़कर लगभग पचानवे प्रतिशत के उच्च स्तर तक पहुँच गई। वे मॉडल्स जो पहले एक बार भी "धक्का देना" (push) का सुझाव देने में विफल रहे थे, वे अचानक लगभग हर बार सही हो गए। वे सही भाषा का उपयोग करने लगे, यह बताते हुए कि बटन दबाने पर वह अंदर की ओर कैसे चलता है, भले ही उन्हें शब्दों की कोई सूची न दी गई हो।

यह निष्कर्ष बताता है कि समस्या भौतिक ज्ञान की कमी नहीं थी, बल्कि प्रश्न को सही स्थान पर केंद्रित करने में विफलता थी। मॉडल्स जानते थे कि बटन का उपयोग क्या है; वे बस स्वयं तस्वीर में बटन को विश्वसनीय रूप से ढूंढ नहीं पा रहे थे। शोधकर्ता ने मॉडल्स की यह क्षमता भी जांची कि वे वस्तु पर उस सटीक स्थान की ओर इशारा कर सकें जहाँ रोबोट को पकड़ना चाहिए। वास्तविक तस्वीरों पर, कुछ मॉडल्स ने ठीक प्रदर्शन किया, लेकिन कंप्यूटर-जनरेटेड छवियों पर, कोई भी मॉडल रैंडम अनुमान से बेहतर इशारा नहीं कर सका। इसने पुष्टि की कि कमजोर कड़ी वास्तव में वस्तु के उस विशिष्ट भाग को खोजने की क्षमता थी जो महत्वपूर्ण है।

अध्ययन ने शोधकर्ता द्वारा अपने स्वयं के परीक्षणों को सेट करने के तरीके में कुछ गलतियों को भी उजागर किया। उन्होंने महसूस किया कि उनके शुरुआती सफलता मापने का तरीका कुछ मामलों में बहुत आसान था, जिससे एक मॉडल केवल छवि के केंद्र का अनुमान लगाकर उच्च स्कोर कर सकता था, और कुछ मामलों में बहुत सख्त था, जिससे क्रिया को परिभाषित करने के तरीके में मामूली त्रुटियों के लिए मॉडल्स को दंडित किया गया। एक बार जब इन माप संबंधी त्रुटियों को ठीक कर दिया गया, तो परिणाम और भी स्पष्ट हो गए। मॉडल्स में भौतिकी के नियम गायब नहीं थे; वे अपना ध्यान सही विवरण पर केंद्रित करने की क्षमता खो रहे थे।

किसी भी व्यक्ति के लिए जो रोबोट बना रहा है, इसके लिए सीख व्यावहारिक और विशिष्ट है। यदि आप चाहते हैं कि एक रोबोट किसी वस्तु को संचालित करे, तो आप उसे केवल एक तस्वीर देकर यह नहीं पूछ सकते कि क्या करना है। सिस्टम को पहले वस्तु के उस विशिष्ट भाग की पहचान करने के तरीके की आवश्यकता है जिसे ध्यान देने की आवश्यकता है। एक बार जब उस भाग का नाम ले लिया जाता है, तो आर्टिफिशियल इंटेलिजेंस विश्वसनीय रूप से आपको बता सकता है कि उसे कैसे हिलाना है। मॉडल्स टूटे हुए नहीं हैं; उन्हें बस यह जानने के लिए थोड़े मार्गदर्शन की आवश्यकता है कि कहाँ देखना है। यह रोबोटिक्स के भविष्य के बारे में हमारी सोच को बदल देता है। यांत्रिकी के हर संभव नियम को सिखाने के बजाय, हमें शायद उन्हें दुनिया के उस सही हिस्से को खोजने के लिए बेहतर उपकरण देने की आवश्यकता है जिस पर कार्य किया जाना है। ज्ञान मौजूद है; बस उसे सही दिशा में इंगित करने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →