← नवीनतम पेपर
💻 computer science

Zero-shot 2D Grounding with Novel Affordance Types

यह शोध पत्र नए एफ़ॉर्डेंस प्रकारों (affordance types) के लिए ज़ीरो-शॉट 2D ग्राउंडिंग के कार्य को प्रस्तुत करता है, जिसमें 'AffordAnything' और इसके प्रशिक्षण योग्य संस्करण 'AffordAnything+' नामक प्रशिक्षण-मुक्त विधि का प्रस्ताव दिया गया है, जो नए NAT बेंचमार्क पर महत्वपूर्ण प्रदर्शन सुधार प्राप्त करने के लिए सेगमेंटेशन संकेतों (segmentation cues) का लाभ उठाते हैं।

मूल लेखक: Haomeng Zhang, Raymond A. Yeh

प्रकाशित 2026-08-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haomeng Zhang, Raymond A. Yeh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को दुनिया के साथ बातचीत करना सिखा रहे हैं। आप एक रोबोट को बता सकते हैं कि "चाकू" कैसा दिखता है, और वह एक तस्वीर में उसे ढूंढ सकता है। लेकिन यह जानना कि चाकू क्या है, यह जानने के समान नहीं है कि आप उसका क्या कर सकते हैं। यह वस्तु पहचान (object recognition) और "अफोर्डेंस" (affordance) के बीच का अंतर है। अफोर्डेंस एक फैंसी शब्द है जो उन छिपे हुए संकेतों के लिए है जो कोई वस्तु हमें उसके उपयोग के बारे में देती है। एक मग पर लगा हैंडल पकड़ने (grasping) का "अफोर्डेंस" देता है; चाकू का सपाट हिस्सा काटने (cutting) का "अफोर्डेंस" देता है; संतरे का छिलका छीलने (peeling) का "अफोर्डेंस" देता है। रोबोट्स के लिए वास्तव में हमारे अव्यवस्थित, वास्तविक दुनिया के रसोईघरों और लिविंग रूम में मददगार होने के लिए, उन्हें इन कार्यों को समझना होगा, न कि केवल वस्तुओं को।

बड़ी चुनौती यह रही है कि अधिकांश रोबोट के दिमाग को ऐसे छात्रों की तरह प्रशिक्षित किया जाता है जो केवल एक विशिष्ट परीक्षा के लिए अध्ययन करते हैं। यदि एक रोबोट ने सेब को "काटना" सीखा है, तो टमाटर को "काटने" के लिए कहा जाने पर वह भ्रमित हो सकता है, या यदि उसने कभी उस विशिष्ट क्रिया को नहीं देखा है, तो वह केले को "छीलना" नहीं जान पाएगा। यह एक ऐसे छात्र की तरह है जो गणित की वर्कशीट के उत्तर रट लेता है लेकिन जब शिक्षक अलग संख्याओं के साथ समान प्रश्न पूछता है, तो वह जम जाता है। वैज्ञानिक ऐसे रोबट बनाने की कोशिश कर रहे हैं जो नए, अनदेखे निर्देशों को संभाल सकें, लेकिन अब तक, ध्यान मुख्य रूप से उन्हें नई वस्तुओं के बारे में सिखाने पर था, न कि नई क्रियाओं के बारे में।

यह शोध पत्र रोबोट को "नोवेल अफोर्डेंस टाइप्स" (novel affordance types) को संभालने के लिए सिखाने का एक नया तरीका पेश करता है—बेसिकली, चीजों का उपयोग करने के नए तरीके जिन्हें उन्हें स्पष्ट रूप से नहीं सिखाया गया है। शोधकर्ताओं, पर्ड्यू यूनिवर्सिटी के हाओमेंग झांग और रेमंड ए. येह ने देखा कि मौजूदा AI मॉडल नई वस्तुओं को खोजने में तो बहुत अच्छे हैं लेकिन नई क्रियाओं को समझने में बहुत खराब हैं। उन्होंने इस विशिष्ट कौशल का परीक्षण करने के लिए नए सेट ऑफ चैलेंजेस (जिन्हें बेंचमार्क कहा जाता है) बनाए। उन्होंने पाया कि वर्तमान अत्याधुनिक (state-of-the-art) मॉडल, जो वस्तुओं को पहचानने में बहुत स्मार्ट हैं, पूरी तरह से विफल हो जाते हैं जब उन्हें किसी चीज़ को "छीलने" या किसी चीज़ पर "बैठने" के लिए सही जगह खोजने के लिए कहा जाता है, यदि वे विशिष्ट क्रियाएं उनके प्रशिक्षण डेटा में नहीं थीं।

इसे ठीक करने के लिए, टीम ने AffordAnything नामक एक नया सिस्टम बनाया। इसे एक जासूस के रूप में सोचें जो केवल पूरी तस्वीर को नहीं देखता बल्कि सूक्ष्म सुरागों पर ज़ूम करता है। यह सिस्टम समझता है कि आप किसी वस्तु के साथ जहाँ इंटरैक्ट करते हैं, वह आमतौर पर उसका एक विशिष्ट हिस्सा होता है (जैसे कप का हैंडल या किताब का किनारा)। हर संभव क्रिया को रटने के बजाय, यह सिस्टम एक शक्तिशाली, प्री-ट्रेंड AI (एक विजुअल लैंग्वेज मॉडल) का उपयोग करता है ताकि वस्तु को छोटे पैच (patches) में तोड़ा जा सके और यह पता लगाया जा सके कि कौन सा पैच क्रिया शब्द से मेल खाता है। उदाहरण के लिए, यदि आप "काटने" के लिए कहते हैं, तो यह तेज किनारे की तलाश करता है; यदि आप "पकड़ने" के लिए कहते हैं, तो यह हैंडल की तलाश करता है।

शोधकर्ताओं ने दो संस्करणों का परीक्षण किया। पहला, AffordAnything, एक "ट्रेनिंग-फ्री" संस्करण है, जिसका अर्थ है कि यह बिना दोबारा सिखाए सीधे काम करता है। इसने पहले के मौजूदा तरीकों की तुलना में काफी बेहतर प्रदर्शन किया। दूसरा संस्करण, AffordAnything+, एक "ट्रेनेबल" अपग्रेड है जो केवल थोड़े से अभ्यास के साथ इन सुरागों को और भी बेहतर तरीके से मिलाना सीखता है। अपने नए टेस्ट सेट्स पर, इस अपग्रेडेड मॉडल ने पिछले सबसे अच्छे तरीके की तुलना में सटीकता (IoU@0.4 के रूप में पूर्ण वृद्धि) में 12.3% का सुधार किया।

यह शोध पत्र स्पष्ट रूप से इस विचार का खंडन करता है कि केवल बड़े, स्मार्ट AI मॉडल का उपयोग करना या केवल वस्तुओं को पहचानना ही पर्याप्त है। उन्होंने दिखाया कि भले ही सबसे उन्नत मॉडल भी विफल हो जाते हैं जब क्रिया नई होती है। उन्होंने यह भी प्रदर्शित किया कि जबकि ये मॉडल "चाकू" को पहचान सकते हैं, वे स्वचालित रूप से यह नहीं जानते कि इसे कैसे "छीलना" है, जब तक कि उन्हें विशेष रूप से क्रिया और वस्तु के आकार के बीच के संबंध को देखने के लिए डिज़ाइन नहीं किया गया हो। परिणाम बताते हैं कि रोबोट्स को वास्तव में अनुकूलन योग्य बनाने के लिए, हमें उन्हें क्रियाओं की एक निश्चित सूची सिखाना बंद करना होगा और उन्हें वस्तु के उन हिस्सों के बारे में तर्क करना सिखाना शुरू करना होगा जो एक क्रिया को संभव बनाते हैं। लेखक आशा करते हैं कि इस तरह के सिस्टम को टेस्ट करने और बनाने का उनका यह नया तरीका रोबोट्स को अधिक लचीला और वास्तविक दुनिया के लिए तैयार बनाने में मदद करेगा, जहाँ निर्देश हमेशा बदलते रहते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →