← नवीनतम पेपर
💻 computer science

A Rapid Deployment Pipeline for Autonomous Humanoid Grasping Based on Foundation Models

यह शोध पत्र एक एंड-टू-एंड रैपिड डिप्लॉयमेंट पाइपलाइन प्रस्तुत करता है जो स्वचालित एनोटेशन, 3D पुनर्निर्माण और ज़ीरो-शॉट पोज़ ट्रैकिंग के लिए फाउंडेशन मॉडल का लाभ उठाता है ताकि नए ह्यूमनॉइड ग्रैस्पिंग कार्यों के ऑनबोर्डिंग समय को दिनों से घटाकर लगभग 30 मिनट किया जा सके, जबकि उच्च सटीकता और सफल वास्तविक दुनिया के निष्पादन को प्राप्त किया जा सके।

मूल लेखक: Yifei Yan, Yankai Liao, Linqi Ye

प्रकाशित 2026-04-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yifei Yan, Yankai Liao, Linqi Ye

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ह्यूमनॉइड रोबोट (जैसे कि एक भविष्य का बटलर) को एक नया ऑब्जेक्ट उठाना सिखाना चाहते हैं, मान लीजिए कि वह सोडा की एक विशिष्ट ब्रांड की बोतल है।

पुराना तरीका ("धीमा और महंगा" तरीका):
परंपरागत रूप से, ऐसा करने के लिए आपको एक सप्ताह के लिए आर्किटेक्ट्स, फोटोग्राफर्स और ट्रेनर्स की एक टीम को काम पर रखना पड़ता था।

  1. आपको सैकड़ों तस्वीरें लेनी पड़तीं।
  2. एक इंसान को हर एक फोटो में बोतल के चारों ओर बॉक्स बनाना पड़ता (यह "Where's Waldo?" के उबाऊ खेल की तरह होता)।
  3. आपको बोतल का एक सटीक 3D मॉडल बनाने के लिए एक बहुत ही महंगे, विशेष लेजर स्कैनर की आवश्यकता होती।
  4. अंत में, आपको रोबोट के दिमाग को इसे पहचानने के लिए प्रशिक्षित करने में कई दिन बिताने पड़ते।
    कुल समय: प्रति ऑब्जेक्ट 1 से 2 दिन। लागत: बहुत अधिक।

नया तरीका ("रैपिड डिप्लॉयमेंट" पाइपलाइन):
यह पेपर एक "स्मार्ट शॉर्टकट" पेश करता है जो रोबोट को लगभग 30 मिनट में तैयार कर देता है। यह तीन "फाउंडेशन मॉडल्स" को एक साथ जोड़कर किया जाता है—जो कि सुपर-स्मार्ट, प्री-ट्रेंड AI दिमाग की तरह हैं जो पहले से ही दुनिया को देखने और समझने की क्षमता रखते हैं।

यह प्रक्रिया कैसे काम करती है, इसके लिए एक सरल उपमा (analogy) यहाँ दी गई है:

1. "स्मार्ट लेबलर" (Roboflow + YOLOv8)

  • समस्या: रोबोट को यह जानने की जरूरत है कि ऑब्जेक्ट क्या है।
  • समाधान: घंटों तक इंसान द्वारा बॉक्स बनाने के बजाय, आप बोतल की लगभग 150 तस्वीरें लेते हैं और उन्हें Roboflow नामक टूल पर अपलोड करते हैं। यह टूल SAM (सेगमेंट एनीथिंग मॉडल) नामक AI का उपयोग करता है जो आपके लिए स्वचालित रूप से बॉक्स बना देता है।
  • परिणाम: मिनटों में, रोबोट के पास एक "प्रशिक्षण नियमावली" (एक YOLOv8 डिटेक्टर) होती है जो जानती है कि सोडा की बोतल कैसी दिखती है, भले ही वह अजीब कोणों से क्यों न हो। यह ऐसा है जैसे रोबोट को एक पूरे सेमेस्टर के कोर्स के बजाय एक त्वरित फ्लैशकार्ड स्टडी सेशन देना।

2. "मैजिक 3D स्कैनर" (Meta SAM 3D)

  • समस्या: रोबोट को यह जानने की आवश्यकता है कि बोतल का आकार 3D में कैसा है ताकि वह उसे बिना कुचले पकड़ सके। आमतौर पर, इसके लिए आपको $50,000 के लेजर स्कैनर की आवश्यकता होती है।
  • समाधान: आप बस अपने फोन या सामान्य कैमरे से बोतल की एक अकेली फोटो लेते हैं। आप इस फोटो को Meta SAM 3D में फीड करते हैं, जो एक ऐसा AI है जो उस एक तस्वीर से वस्तु के 3D आकार और बनावट की "कल्पना" कर सकता है।
  • परिणाम: लगभग 5 मिनट में, आपके पास बोतल का एक डिजिटल 3D मॉडल होता है। यह एक सपाट फोटो लेने और फिर जादू से उसे एक 3D मूर्ति में बदलने जैसा है।

3. "ज़ीरो-शॉट ट्रैकर" (FoundationPose)

  • समस्या: अब रोबोट को बोतल को चलते हुए ट्रैक करने की आवश्यकता है, ताकि वह उसे पकड़े जाने या मेज पर फिसलने के दौरान भी पकड़ सके।
  • समाधान: रोबोट FoundationPose का उपयोग करता है, जो एक "गिरगिट" (chameleon) की तरह है। इसे हर नए ऑब्जेक्ट के लिए फिर से प्रशिक्षित करने की आवश्यकता नहीं होती। यह बस आपके द्वारा स्टेप 2 में बनाए गए 3D मॉडल और कैमरे के लाइव वीडियो फीड का उपयोग करता है। यह तुरंत समझ जाता है कि बोतल 3D स्पेस में (स्थिति और रोटेशन के साथ) ठीक कहाँ है, और यह काम प्रति सेकंड 30 बार करता है।
  • परिणाम: रोबोट की नज़र लक्ष्य पर टिकी रहती है, उसे पता होता है कि उसे ठीक कहाँ तक पहुँचना है, भले ही बोतल घूम रही हो।

भव्य समापन: "वर्चुअल ट्विन" और निष्पादन (Execution)

एक बार जब रोबोट जान जाता है कि ऑब्जेक्ट क्या है और वह कहाँ है, तो सिस्टम मूवमेंट की योजना बनाने के लिए एक Unity सिमुलेशन (एक वीडियो गेम इंजन) का उपयोग करता है।

  • इसे ऐसे समझें कि रोबोट पहले एक वीडियो गेम में इस मूव का अभ्यास कर रहा है।
  • यह उसके हाथ और उंगलियों के लिए एकदम सही रास्ता (path) की गणना करता है।
  • फिर यह इन निर्देशों को एक तेज़ इंटरनेट कनेक्शन (UDP) के माध्यम से वास्तविक रोबट (एक Unitree G1) को भेजता है।
  • रोबोट उस मूव को पूरा करता है, बोतल को पकड़ता है, और उसे उठा लेता है।

यह एक बड़ी बात क्यों है?

  • गति: जिस काम में पहले 2 दिन लगते थे, अब उसमें केवल 30 मिनट लगते हैं।
  • लागत: आपको महंगे लेजर स्कैनर की आवश्यकता नहीं है; एक सामान्य कैमरा या स्मार्टफोन ही काफी है।
  • बहुमुखी प्रतिभा (Versatility): लेखकों ने इस प्रणाली का परीक्षण केवल सोडा की बोतलों पर ही नहीं, बल्कि एक पूरी तरह से अलग कार्य पर भी किया: कार की खिड़की पर गोंद (glue) लगाना। उन्होंने बस "ऑब्जेक्ट मॉडल" और "प्रशिक्षण फोटो" को बदला, और वही सिस्टम पूरी तरह से काम कर गया।

कमी (सीमाएँ)

यह सिस्टम अभी पूरी तरह से परफेक्ट नहीं है। यदि ऑब्जेक्ट चमकदार, पारदर्शी या परावर्तक (reflective) है (जैसे कांच की बोतल या दर्पण), तो "मैजिक 3D स्कैनर" कभी-कभी भ्रमित हो जाता है और एक अजीब आकार बना देता है। ऐसे मामलों में, आपको 3D मॉडल को ठीक करने के लिए अभी भी एक इंसान की मदद की आवश्यकता हो सकती है। इसके अलावा, यदि वस्तु कैमरे की दृष्टि से पूरी तरह गायब हो जाती है, तो रोबोट उसका पीछा करना छोड़ देता है और उसे फिर से खोजने के लिए "स्मार्ट लेबलर" का इंतज़ार करना पड़ता है।

निष्कर्ष

यह पेपर दिखाता है कि शक्तिशाली, प्री-ट्रेंड AI "दिमागों" को साधारण कैमरों के साथ जोड़कर, हम ह्यूमनॉइड रोबोट को कठोर, धीमी प्रोग्रामिंग वाली मशीनों से बदलकर फुर्तीले मददगारों में बदल सकते हैं जो लगभग तुरंत नए कार्य सीख सकते हैं। यह हर नए काम के लिए कस्टम सूट बनाने बनाम एक ऐसे रोबोट के होने के बीच का अंतर है जो जो कुछ भी देखता है, उसे तुरंत "ट्राई ऑन" कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →