← नवीनतम पेपर
💻 computer science

HAMMER: Harnessing MLLM via Cross-Modal Integration for Intention-Driven 3D Affordance Grounding

HAMMER एक नवीन ढांचा है जो इंटरेक्शन इंटेंट को कॉन्टैक्ट-अवेयर एम्बेडिंग्स में एकत्रित करने और सटीक 3D लोकलाइजेशन के लिए मल्टी-ग्रैनुलर ज्योमेट्री लिफ्टिंग के साथ पदानुक्रमित क्रॉस-मोडल एकीकरण का उपयोग करके इंटेंशन-ड्रिवन 3D अफोर्डेंस ग्राउंडिंग प्राप्त करने के लिए मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है।

मूल लेखक: Lei Yao, Yong Chen, Yuejiao Su, Yi Wang, Moyun Liu, Lap-Pui Chau

प्रकाशित 2026-03-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lei Yao, Yong Chen, Yuejiao Su, Yi Wang, Moyun Liu, Lap-Pui Chau

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक नई वस्तु का उपयोग करना सिखा रहे हैं जिसे उसने पहले कभी नहीं देखा है, जैसे कि एक अजीब दिखने वाला टोस्टर या एक भविष्यवादी कुर्सी। आप केवल यह नहीं चाहते कि रोबोट उस वस्तु को देखे; आप चाहते हैं कि वह यह भी समझे कि उसका उपयोग कैसे करना है। उसे हैंडल कहाँ से पकड़ना चाहिए? उसे बटन कहाँ दबाना चाहिए? किसी वस्तु को "कैसे उपयोग किया जा सकता है" इसे समझने की इस क्षमता को अफोर्डेंस (Affordance) कहा जाता है।

यह शोध पत्र एक नया AI सिस्टम पेश करता है जिसे HAMMER कहा जाता है जो इस कार्य में बहुत कुशल है। यह कैसे काम करता है, यहाँ सरल उपमाओं के माध्यम से समझाया गया है।

समस्या: "अंधा" रोबोट

पिछले रोबोट जो यह करने की कोशिश कर रहे थे, उन्हें दो मुख्य समस्याओं का सामना करना पड़ता था:

  1. वे बहुत शाब्दिक थे: वे पहले वस्तु का शब्दों में वर्णन करने की कोशिश करते थे (जैसे, "यह एक हैंडल वाला लाल कप है") और फिर अनुमान लगाते थे कि इसे कहाँ पकड़ना है। यह एक जार खोलने से पहले उसका मैनुअल पढ़ने जैसा है; यह धीमा है और अक्सर मुख्य बात को मिस कर देता है।
  2. वे 2D-केंद्रित थे: वे किसी वस्तु की 2D तस्वीर देखते थे, स्क्रीन पर एक मास्क बनाते थे, और फिर उस सपाट ड्राइंग को 3D वस्तु पर "प्रोजेक्ट" करने की कोशिश करते थे। यह एक बास्केटबॉल के चारों ओर कागज के एक सपाट टुकड़े को लपेटने जैसा है; यह सिकुड़ जाएगा, फट जाएगा और ठीक से फिट नहीं होगा।

समाधान: HAMMER (एक "सहज" रोबोट)

लेखकों ने HAMMER को इस तरह बनाया है कि यह मानव सीखने की नकल करे। जब आप किसी को हथौड़ा चलाते हुए देखते हैं, तो आपको यह जानने के लिए मैनुअल की आवश्यकता नहीं होती कि उसे कहाँ पकड़ना है। आप बस इसे समझ जाते हैं। HAMMER भी ऐसा ही करता है, एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल (MLLM) का उपयोग करके—इसे एक सुपर-स्मार्ट मस्तिष्क समझें जिसने पूरा इंटरनेट पढ़ लिया है और लाखों चित्र देखे हैं।

यहाँ तीन-चरणीय "जादू" है जिसका HAMMER उपयोग करता है:

1. "कॉन्टैक्ट-अवेयर" अंतर्ज्ञान (The Spark)

एक लंबा विवरण लिखने के बजाय, HAMMER छवि को देखता है और पूछता है: "यदि कोई इंसान यह कर रहा होता, तो उसका हाथ कहाँ छूता?"

  • उपमा: कल्पना कीजिए कि आप किसी दरवाजा खोलने वाले व्यक्ति की फोटो देख रहे हैं। HAMMER यह नहीं कहता, "व्यक्ति पीतल के नॉब को पकड़े हुए है।" इसके बजाय, यह तुरंत उस सटीक स्थान पर एक मानसिक "चमक" या हाइलाइट बनाता है जहाँ हाथ नॉब को छूता है। यह एक एकल, शक्तिशाली संकेत के माध्यम से क्रिया के इरादे (Intention) को पकड़ लेता है।

2. "क्रॉस-मोडल" हैंडशेक (The Fusion)

HAMMER उस "चमक" (इरादे) को लेता है और वस्तु के 3D आकार के साथ हाथ मिलाता है।

  • उपमा: कल्पना कीजिए कि 3D वस्तु मिट्टी से बनी एक मूर्ति है। HAMMER तस्वीर से "इरादे के संकेत" को लेता है और उसे मिट्टी में डाल देता है। यह एक स्मार्ट पेंट की तरह है जो जानता है कि चित्र के आधार पर मूर्ति के कौन से हिस्से "छूने योग्य" हैं। यह केवल अनुमान नहीं लगाता; यह आकार को परिष्कृत करने के लिए सुपर-स्मार्ट मस्तिष्क के ज्ञान का उपयोग करता है, यह सुनिश्चित करता है कि रोबोट समझ सके कि हैंडल पकड़ने के लिए है, लेकिन बॉडी नहीं।

3. "ज्यामिति लिफ्टर" (The 3D Upgrade)

यह सबसे चतुर हिस्सा है। "इरादे का संकेत" एक सपाट 2D तस्वीर से आता है, इसलिए इसमें गहराई की कमी होती है। HAMMER के पास एक विशेष मॉड्यूल है जो एक 3D प्रिंटर की तरह कार्य करता है।

  • उपमा: कल्पना कीजिए कि दीवार पर किसी व्यक्ति की छाया है (2D इरादा)। आप जानते हैं कि छाया एक व्यक्ति की है, लेकिन आप नहीं जानते कि वह लंबा है या छोटा। HAMMER वास्तविक 3D वस्तु (मिट्टी की मूर्ति) को देखता है और कहता है, "ठीक है, छाया कहती है 'हाथ यहाँ', और 3D आकार कहता है 'यह एक हैंडल है।' आइए उन्हें मिला दें।" यह सपाट विचार को 3D स्पेस में ऊपर उठाता है, गहराई और संरचना जोड़ता है ताकि रोबोट को पता चल सके कि ठीक कितनी दूर और किस कोण पर पहुँचना है।

HAMMER बेहतर क्यों है?

शोध पत्रों ने एक "करप्टेड" (विकृत) बेंचमार्क का उपयोग करके अन्य तरीकों के मुकाबले HAMMER का परीक्षण किया। इसका मतलब है कि उन्होंने 3D वस्तुओं में "शोर" (Noise) जोड़ा—जैसे टीवी पर स्टैटिक, गायब हिस्से, या कैमरा हिलना।

  • परिणाम: जब डेटा अव्यवस्थित था, तो अन्य रोबोट भ्रमित हो गए और गलत जगहों की ओर इशारा करने लगे। हालाँकि, HAMMER एक अनुभवी जासूस की तरह था। धुंधली फोटो या टूटे हुए 3D मॉडल के बावजूद, यह अभी भी समझ सकता था, "आह, शोर के बावजूद, इरादा स्पष्ट रूप से हैंडल को पकड़ने का है।"

सारांश

HAMMER एक रोबोट मस्तिष्क है जो:

  1. एक छवि को देखता है और तुरंत इरादे (कहाँ छूना है) को समझ जाता है।
  2. उस इरादे को एक सुपर-स्मार्ट AI का उपयोग करके वस्तु के 3D आकार के साथ मिलाता है।
  3. उस सपाट विचार को 3D स्पेस में ऊपर उठाता है ताकि रोबोट को पता चल सके कि ठीक कहाँ पहुँचना है।

यह रोबोट को वह "कॉमन सेंस" देने जैसा है कि वह किसी वस्तु का उपयोग करते हुए मनुष्य की तस्वीर देखे और तुरंत जान जाए कि उसे कैसे उठाना है, भले ही वह वस्तु अजीब, टूटी हुई या तस्वीर धुंधली क्यों न हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →