← नवीनतम पेपर
💻 computer science

Generalizable Coarse-to-Fine Robot Manipulation via Language-Aligned 3D Keypoints

यह शोध पत्र कोर्स-टू-फाइन लैंग्वेज-अलाइन्ड मैनिपुलेशन पॉलिसी (CLAP) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो टास्क डिकंपोजिशन, 3D कीपॉइंट प्रेडिक्शन के लिए VLM फाइन-ट्यूनिंग और 3D-अवेयर रिप्रेजेंटेशन्स को एकीकृत करता है ताकि स्टेट-ऑफ-द-आर्ट विधियों की तुलना में काफी कम ट्रेनिंग डेमोंस्ट्रेशन के साथ रोबोटिक मैनिपुलेशन में बेहतर सामान्यीकरण प्राप्त किया जा सके।

मूल लेखक: Jianshu Hu, Lidi Wang, Shujia Li, Yunpeng Jiang, Xiao Li, Paul Weng, Yutong Ban

प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jianshu Hu, Lidi Wang, Shujia Li, Yunpeng Jiang, Xiao Li, Paul Weng, Yutong Ban

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखा रहे हैं।

यदि आप केवल रोबोट को यह बताते हैं, "एक सैंडविच बनाओ," और उसे इसे करते हुए आपका एक वीडियो दिखाते हैं, तो रोबोट भ्रमित हो सकता है यदि ब्रेड दाईं के बजाय बाईं ओर रखी हो, या चाकू का रंग अलग हो। यह एक ऐसे नक्शे का पालन करने जैसा है जो केवल एक विशिष्ट दिन के लिए ही काम करता है।

यह पेपर एक नया तरीका पेश करता है जिससे रोबोट को सिखाया जाता है जिसे CLAP (कोर्स-टू-फाइन लैंग्वेज-अलाइन्ड मैनिपुलेशन पॉलिसी) कहा जाता है। CLAP को एक स्मार्ट प्रोजेक्ट मैनेजर की तरह समझें जो रोबोट वर्कर को काम पूरा करने में मदद करता है, भले ही चीजें बदल जाएं।

यह कैसे काम करता है, यहाँ तीन सरल चरणों में दिया गया है:

1. "रेसिपी" का विभाजन (टास्क डिकंपोजिशन)

अधिकांश रोबोट एक साथ पूरे कार्य के वीडियो को याद करने की कोशिश करते हैं। CLAP अलग है। यह एक शेफ की तरह व्यवहार करता है जो एक जटिल रेसिपी को छोटे, सरल चरणों में तोड़ देता है।

  • पुराना तरीका: "फ्रिज के पास जाओ, दूध लो, उसे डालो, और ढक्कन वापस लगा दो।" (यदि फ्रिज किसी दूसरी जगह पर है, तो रोबोट घबरा जाता है)।
  • CLAP का तरीका: यह कार्य को छोटे भाषा निर्देशों में तोड़ता है:
    1. "फ्रिज का हैंडल ढूंढो।"
    2. "हैंडल को पकड़ो।"
    3. "दरवाजा खींचो।"
    4. "दूध का कार्टन ढूंढो।"
    5. "दूध को पकड़ो।"

बड़े काम को छोटे "भाषा चरणों" में तोड़कर, रोबोट कौशल (skills) को मिला और मिला सकता है। यदि वह जानता है कि "हैंडल कैसे पकड़ना है," तो वह उस कौशल का उपयोग दराज, दरवाजे या कैबिनेट पर कर सकता है, भले ही उसने पहले कभी उस विशिष्ट वस्तु को न देखा हो।

2. "स्पॉटलाइट" (कोर्स-टू-फाइन)

कल्पमान कीजिए कि आप घास के ढेर में एक छोटी सी सुई ढूंढ रहे हैं। यदि आप एक साथ पूरे घास के ढेर को देखते हैं, तो देखना कठिन होता है। लेकिन यदि कोई ठीक उसी जगह पर स्पॉटलाइट चमका दे जहाँ सुई है, तो यह आसान हो जाता है।

  • "कोर्स" (Coarse) चरण: रोबोट का "दिमाग" (एक सुपर-स्मार्ट AI मॉडल) पहले पूरे कमरे को देखता है और कहता है, "ठीक है, सुई इस घास के ढेर में कहीं है।" वह एक सामान्य क्षेत्र चुनता है।
  • "फाइन" (Fine) चरण: फिर रोबोट ज़ूम इन करता है, जैसे कैमरा लेंस फोकस करता है, केवल उस विशिष्ट घास के ढेर पर। अब, वह सुई को स्पष्ट रूप से देख सकता है और उसे पकड़ सकता है।

इससे रोबोट पूरे कमरे को बहुत अधिक विवरण के साथ प्रोसेस करने की कोशिश करने से बच जाता है, जिससे यह तेज़ और अधिक कुशल बनता है।

3. "रीज़निंग" सहायक (लैंग्वेज अलाइनमेंट)

यही जादू है। यह पेपर एक प्री-ट्रेन्ड AI (जैसे एक बहुत ही स्मार्ट चैटबॉट जिसने पूरा इंटरनेट पढ़ा है) का उपयोग करने के लिए करता है ताकि रोबोट की मदद की जा सके।

  • समस्या: आमतौर पर, रोबोट इस बात को समझने में खराब होते हैं कि वे कुछ क्यों कर रहे हैं। वे बस जो देखते हैं उसकी नकल करते हैं।
  • CLAP का समाधान: हिलने से पहले, "सहायक" (AI) जोर से सोचता है। वह कहता है: "रोबोट को दराज खोलनी है। पहले, उसे हैंडल ढूंढना होगा। फिर, उसे खींचना होगा।"

रोबोट केवल अनुमान नहीं लगाता; वह AI द्वारा बनाए गए एक तार्किक प्लान का पालन करता है। यदि आप कार्य को "नीचे वाली दराज" के बजाय "ऊपर वाली दराज" खोलने में बदल देते हैं, तो AI तुरंत अंतर समझ जाता है क्योंकि वह शब्दों को समझता है, न कि केवल तस्वीर को।

यह एक बड़ी बात क्यों है?

शोधकर्ताओं ने इसका परीक्षण GemBench नामक एक बेंचमार्क पर किया, जो रोबोटों के लिए एक "फाइनल एग्जाम" की तरह है यह देखने के लिए कि क्या वे नई स्थितियों को संभाल सकते हैं।

  • परिणाम: CLAP नई वस्तुओं और नए कार्यों को संभालने में मौजूदा सर्वश्रेष्ठ रोबोटों से 12% बेहतर था।
  • दक्षता (Efficiency): यहाँ मुख्य बात है: CLAP ने यह सब अन्य रोबोटों की तुलना में केवल 1/5वें अभ्यास डेटा के साथ सीखा।
    • उपमा: यदि अन्य रोबोटों को एक ट्रिक सीखने के लिए 100 वीडियो देखने की आवश्यकता थी, तो CLAP को केवल 20 वीडियो देखने की आवश्यकता थी।
  • वास्तविक दुनिया: उन्होंने एक वास्तविक भौतिक रोबोट पर भी इसका परीक्षण किया। केवल 10 अभ्यास सत्रों के साथ, रोबोट नई वस्तुओं (जैसे अलग रंग का कप) और नए कार्यों (जैसे ब्लॉकों को नए क्रम में स्टैक करना) को संभाल सकता था जिन्हें उसने पहले कभी नहीं देखा था।

सारांश

CLAP एक रोबोट को एक स्मार्ट, बात करने वाले प्रोजेक्ट मैनेजर को देने जैसा है।

  1. यह बड़े कामों को छोटे, समझने योग्य चरणों में तोड़ता है।
  2. यह बिल्कुल वही करने के लिए स्पॉटलाइट का उपयोग करता है जो किया जाना चाहिए।
  3. यह समस्याओं को हल करने के लिए भाषा का उपयोग करता है, ताकि रोबोट को हर बार वातावरण बदलने पर सब कुछ फिर से सीखने की आवश्यकता न पड़े।

इसका मतलब है कि रोबट आखिरकार लैब से निकलकर हमारे घरों और कारखानों में आ सकते हैं, जहाँ चीजें अव्यवस्थित, अप्रत्याशित और हमेशा बदलने वाली होती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →