← नवीनतम पेपर
💻 computer science

Assessing VLM-Driven Semantic-Affordance Inference for Non-Humanoid Robot Morphologies

यह शोध पत्र एक नवीन हाइब्रिड डेटासेट का उपयोग करके गैर-मानव सदृश (non-humanoid) रोबोटों के लिए सिमेंटिक अफोर्डेंस (semantic affordances) का अनुमान लगाने की विजन-लैंग्वेज मॉडल्स (VLMs) की क्षमता की जांच करता है, जो यह प्रकट करता है कि जबकि VLMs विभिन्न रूपात्मकताओं (morphologies) में अच्छी तरह से सामान्यीकरण करते हैं, वे नवीन टूल-उपयोग परिदृश्यों में विशेष रूप से कम फाल्स पॉजिटिव दरों लेकिन उच्च फाल्स नेगेटिव दरों द्वारा लक्षित रूढ़िवादी भविष्यवाणियों की ओर एक सुसंगत प्रवृत्ति प्रदर्शित करते हैं।

मूल लेखक: Jess Jones, Raul Santos-Rodriguez, Sabine Hauert

प्रकाशित 2026-04-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jess Jones, Raul Santos-Rodriguez, Sabine Hauert

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक कमरा साफ करने के लिए रोबोटों की एक टीम है। कुछ इंसानों जैसे दिखते हैं, लेकिन अन्य अजीब, गोल वैक्यूम क्लीनर, या बॉक्स जैसे कार्ट, या यहाँ तक कि लुढ़कने वाले बिन (bins) जैसे दिखते हैं। एक साथ काम करने के लिए, इन रोबोटों को न केवल यह जानने की ज़रूरत है कि चीज़ें क्या हैं (एक कप, एक गेंद, एक पेचकश), बल्कि यह भी कि वे अपने अनूठे शरीर के आधार पर उनके साथ क्या कर सकते हैं

यहीं पर "अफोर्डेंस" (Affordance) की अवधारणा आती है। अफोर्डेंस को किसी वस्तु द्वारा दिए गए "कार्यों के मेनू" के रूप में सोचें। एक कुर्सी इंसान के लिए "बैठने" का अवसर देती है, लेकिन एक लुढ़कने वाले रोबोट के लिए, यह केवल "टकराने" का अवसर हो सकती है।

जेस जोन्स और उनकी टीम का शोध एक बड़ा सवाल पूछता है: क्या आधुनिक "स्मार्ट" AI मॉडल (जिन्हें विज़न-लैंग्वेज मॉडल्स या VLMs कहा जाता है) उन रोबोटों के लिए यह मेनू समझ सकते हैं जो इंसानों जैसे नहीं दिखते?

यहाँ उनके निष्कर्षों का विवरण दिया गया है, कुछ रोज़मर्रा के उदाहरणों के साथ:

1. "मानव-केंद्रित" पूर्वाग्रह (समस्या)

कल्पना कीजिए कि आपने एक ऐसे शेफ को काम पर रखा है जिसने केवल इंसानों के लिए खाना पकाया है। यदि आप उनसे पूछते हैं, "मैं इस पत्थर के साथ क्या कर सकता हूँ?" तो वे कह सकते हैं, "आप इसे खा नहीं सकते, इसलिए यह बेकार है।" वे इस बात को मिस कर सकते हैं कि आप पत्थर का उपयोग दरवाज़ा खुला रखने या दीवार बनाने के लिए कर सकते हैं।

शोधकर्ताओं ने पाया कि ये AI मॉडल उसी शेफ की तरह हैं। उन्हें अरबों ऐसी छवियों पर प्रशिक्षित किया गया है जिनमें इंसान वस्तुओं के साथ बातचीत कर रहे हैं।

  • परिणाम: जब AI को एक अजीब, गोल रोबोट के बारे में पूछा जाता है कि वह एक गेंद के साथ क्या कर सकता है, तो AI अक्सर रोबोट के विशिष्ट आकार को अनदेखा कर देता है। इसके बजाय, वह मानवीय क्रियाओं जैसे "फेंकना" या "दबाना" का सुझाव देता है, भले ही रोबोट ऐसा न कर सके।
  • परिणाम: AI अत्यधिक रूढ़िवादी (conservative) हो जाता है। यह एक सतर्क माता-पिता की तरह है जो कहता है, "नहीं, तुम इसे नहीं छू सकते," भले ही रोबोट सुरक्षित रूप से उसे धकेल सकता हो। AI वैध अवसरों (False Negatives) को मिस कर देता है क्योंकि वह गलती करने से डरता है, लेकिन वह शायद ही कभी कुछ खतरनाक सुझाता है (कम False Positives)।

2. प्रयोग (टेस्ट किचन)

टीम ने दो प्रकार की सामग्रियों के साथ एक विशेष "टेस्ट किचन" बनाया:

  • वास्तविक डेटा (Real Data): वास्तविक रोबोटों (जिन्हें DOTS कहा जाता है) के वास्तविक गोदाम में वस्तुओं के आसपास घूमने के वीडियो।
  • सिंथेटिक डेटा (Synthetic Data): अजीब परिदृश्यों में रोबोटों के कंप्यूटर-जनित वीडियो।

उन्होंने तीन "सुपर-ब्रेन" (GPT, Gemini, और Claude) का परीक्षण किया, उन्हें एक रोबोट के शरीर का सरल विवरण देकर। उदाहरण के लिए: "मैं एक गोल रोबोट हूँ। मैं चीज़ों को उठा (scoop) सकता हूँ यदि वे हल्की हैं, लेकिन मैं भारी बक्से नहीं उठा सकता।"

3. निष्कर्ष (टेस्ट टेस्ट)

  • "मानवीय" रोबोट: जब AI ने एक ऐसे रोबोट को देखा जो इंसान जैसा दिखता था, तो वह "उठाने" (पकड़ने) का अनुमान लगाने में काफी अच्छा था। लेकिन "धकेलने" जैसी चीज़ों के लिए, वह भ्रमित हो गया और लगातार ऐसी मानवीय क्रियाएं सुझाता रहा जो उस पर फिट नहीं बैठती थीं।
  • "अजीब" रोबले: जब AI को गोल, स्कूप करने वाले रोबोटों के बारे में बताया गया, तो वह "धकेलने" या "स्कूप करने" का अनुमान लगाने में वास्तव में बेहतर प्रदर्शन कर गया। क्यों? क्योंकि शोधकर्ताओं ने उसे एक स्पष्ट, भौतिक विवरण दिया था। यह एक शेफ को बताने जैसा था, "आपके पास चम्मच है, कांटा नहीं," जिससे उन्हें अंदाज़ा लगाने के बजाय तार्किक रूप से सोचने में मदद मिली।
  • "रूढ़िवादी" ग्लिच: विवरण मिलने के बावजूद, AI अभी भी सुरक्षित खेल रहा था। यदि वह 100% सुनिश्चित नहीं था, तो वह यह कहने के बजाय कि "मुझे नहीं पता कि इसके साथ क्या करना है," अनुमान लगाने के बजाय चुप रहता था। यह सुरक्षा के लिए अच्छा है (रोबोट चीज़ें नहीं तोड़ेगा), लेकिन दक्षता के लिए बुरा है (रोबोट काम कर सकता था, फिर भी वह कुछ नहीं कर रहा)।

4. जहाँ AI अटक गया (ब्लाइंड स्पॉट्स)

शोधकर्ताओं ने AI के दिमाग में दो मुख्य "ब्लाइंड स्पॉट्स" पाए:

  • स्थानिक भ्रम (Spatial Confusion): उन्होंने एक ऐसे रोबोट के बारे में पूछा जो केवल अपने सिर के ऊपर चीज़ों को उठा सकता था। AI ने अभी भी कहा, "आप उस ज़मीन पर पड़े पत्थर को उठा सकते हैं!" वह रोबोट के शरीर के भौतिक नियमों को समझने में विफल रहा।
  • सामग्री भ्रम (Material Confusion): उन्होंने AI को बताया, "यह रोबोट केवल कागज़ और लकड़ी को काट सकता है।" AI ने फिर भी सुझाव दिया कि रोबोट एक गोल्फ बॉल या पेचकश को "काट" सकता है। वह वास्तव में सामग्रियों से बनी चीज़ों को नहीं समझ सका; उसने केवल पैटर्न के आधार पर अनुमान लगाया।

5. बड़ा निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि AI एक शक्तिशाली उपकरण है, लेकिन इसे एक अनुवादक की आवश्यकता है।

अभी, ये मॉडल एक शानदार लाइब्रेरियन की तरह हैं जो दुनिया की हर किताब जानता है लेकिन उसने कभी रोबोट नहीं देखा है। यदि आप उनसे बस पूछते हैं, "यह रोबोट क्या कर सकता है?", तो वे अनुमान लगाएंगे कि इंसान क्या करते हैं।

हालाँकि, यदि आप उन्हें रोबोट का एक स्पष्ट, भौतिक विवरण (जैसे रेसिपी कार्ड) देते हैं, तो वे बहुत बेहतर अनुमान लगाना शुरू कर सकते हैं। चुनौती यह है कि वे अभी भी बहुत सावधान हैं। वे गलत होने के जोखिम के बजाय कुछ न करना पसंद करेंगे।

भवि mắt में: इन रोबोटों को वास्तव में सहायक बनाने के लिए, हमें AI को गलत अनुमान लगाने से कम डरने के लिए, या उसे बेहतर "सड़क के नियम" (जैसे कार्य विवरण) देने के लिए सिखाने की आवश्यकता है ताकि उसे पता चल सके कि उसे वास्तव में क्या करना चाहिए। इससे विविध रोबोटों की एक टीम—चाहे वे गोल हों, लंबे हों, या पहियों वाले हों—हमारे घरों को साफ करने, हमारे शहरों के निर्माण करने और हमारी दुनिया का पता लगाने में एक साथ काम कर सकेगी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →