← नवीनतम पेपर
💻 computer science

Zero-Shot Long-Horizon Dexterous Manipulation via Multi-View 3D-Grounded VLM Reasoning

यह शोध पत्र लॉन्ग-होराइजन डेक्सट्रस मैनिपुलेशन (long-horizon dexterous manipulation) के लिए एक ज़ीरो-शॉट फ्रेमवर्क प्रस्तुत करता है जो मल्टी-व्यू 2D कीपॉइंट्स को 3D स्पेस में फ्यूज करके भाषा के निर्देशों को निष्पादनीय 3D टास्क प्लान में ग्राउंड करने के लिए विज़न-लैंग्वेज मॉडल का लाभ उठाता है, जिससे एंड-टू-एंड ट्रेनिंग के बिना अनदेखे ऑब्जेक्ट्स पर रोबस्ट पिक-एंड-प्लेस और टूल-यूज़ निष्पादन सक्षम होता है।

मूल लेखक: Jisoo Kim, Sangwon Baik, Taeksoo Kim, Sungjoo Kim, Junyoung Lee, Mingi Choi, Hanbyul Joo

प्रकाशित 2026-06-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jisoo Kim, Sangwon Baik, Taeksoo Kim, Sungjoo Kim, Junyoung Lee, Mingi Choi, Hanbyul Joo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक रोबोटिक हाथ है जिसमें इंसान जैसा हाथ है जिसे एक बिखरे हुए कमरे की सफाई करनी है, लेकिन उसने पहले कभी इस विशिष्ट कमरे को नहीं देखा है और न ही किसी ने उसे इस विशिष्ट काम के लिए प्रशिक्षित किया है। अधिकांश रोबोटों को इसके लिए घंटों के प्रशिक्षण या हजारों उदाहरणों की आवश्यकता होगी। यह शोध पत्र एक ऐसी प्रणाली प्रस्तुत करता है जो इसे जीरो-शॉट (zero-shot) तरीके से कर सकती है—जिसका अर्थ है कि यह बिना किसी पूर्व अभ्यास के, केवल देखकर और सुनकर, मौके पर ही इसे समझ लेती है।

यहाँ बताया गया है कि यह प्रणाली कैसे काम करती है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. "फोटोग्राफरों की टीम" बनाम "एकल स्नैपशॉट"

अधिकांश रोबट एक दृश्य को एक कैमरे के माध्यम से देखते हैं, जैसे कि एक एकल फोटो लेना। यदि आप एक फोटो से यह अनुमान लगाने की कोशिश करते हैं कि कप कहाँ है, तो हो सकता है कि आप बाएँ-दाएँ की स्थिति का सही अनुमान लगा लें, लेकिन आपको यह पता नहीं चलेगा कि वह वास्तव में कितनी दूर है। यह अंधेरे में एक आँख बंद करके गेंद पकड़ने की कोशिश करने जैसा है; आप गहराई (depth) का सही अंदाजा नहीं लगा पाएंगे।

इस शोध पत्र की प्रणाली एकाधिक कैमरों (multiple cameras) का उपयोग करती है (जैसे कि कमरे के अलग-अलग कोनों में खड़े फोटोग्राफरों की एक टीम)।

  • समस्या: प्रत्येक कैमरा वस्तु को अलग तरह से देखता है। कोई चम्मच का हैंडल देख सकता है; कोई उसका कटोरा देख सकता है। कोई किताब से ढका हुआ हो सकता है; दूसरा पूरी वस्तु देख सकता है।
  • समाधान: प्रणाली एक "स्मार्ट दिमाग" (एक विजन-लैंग्वेज मॉडल) का उपयोग करती है जो हर कैमरे से पूछती है, "चम्मच कहाँ है?" और "मुझे इसे कहाँ से पकड़ना चाहिए?"
  • जादुई ट्रिक: यह इन विभिन्न उत्तरों को दो विधियों का उपयोग करके जोड़ता है:
    1. त्रिकोणीयकरण (Triangulation): जैसे आपकी दोनों आँखें मिलकर दूरी का अंदाजा लगाती हैं, यह गणितीय रूप से उस सटीक 3D स्थान की गणना करता है जहाँ सभी कैमरों के दृश्य सहमत होते हैं।
    2. रे वोटिंग (Ray Voting): यदि कैमरे असहमत होते हैं (शायद एक कैमरा बाधित है), तो सिस्टम मुख्य कैमरे के दृश्य से एक "लेजर बीम" छोड़ता है और अन्य कैमरों से पूछता है, "क्या आपने इस विशिष्ट गहराई पर वस्तु को देखा?" यह उस उत्तर को चुनता है जिसे सबसे अधिक वोट मिलते हैं। यह सुनिश्चित करता है कि रोबोट खाली हवा को न पकड़े या छाया के कारण वस्तु को न छोड़ दे।

2. "निर्देश पुस्तिका" बनाम "मांसपेशियों की स्मृति (Muscle Memory)"

एक बार जब रोबोट जान जाता है कि वस्तु 3D स्थान में कहाँ है, तो उसे यह जानने की आवश्यकता होती है कि कैसे हिलना है।

  • चीजों को उठाने के लिए: प्रणाली बड़े कार्य ("कमरे की सफाई करें") को छोटे, सरल चरणों में तोड़ देती है: "कप उठाओ," "कूड़ेदान की ओर बढ़ो," "छोड़ दो।" यह इन्हें लेगो ब्लॉक्स (Lego blocks) की तरह मानती है।
  • औजारों का उपयोग करने के लिए: यह बहुत चतुर हिस्सा है। यदि रोबोट को झाड़ू या केतली का उपयोग करने की आवश्यकता है, तो उसे शून्य से सफाई करना सीखने की आवश्यकता नहीं है। इसके पास अपनी स्मृति में एक "एटॉमिक एक्शन्स का बैग (Bag of Atomic Actions)" है। इसे औजारों के लिए पूर्व-रिकॉर्ड किए गए "डांस मूव्स" के पुस्तकालय के रूप में समझें।
    • यदि निर्देश है "फर्श पर झाड़ू लगाओ," तो रोबोट अपने पुस्तकालय से "स्वीपिंग (sweeping)" वाला डांस मूव ढूंढता है।
    • इसके बाद यह उस डांस मूव को वर्तमान कमरे के अनुसार संरेखित (align) करता है। यदि झाड़ू बाईं ओर है और कूड़ेदान दाईं ओर है, तो यह उस विशिष्ट ज्यामिति (geometry) में फिट होने के लिए पूर्व-रिकॉर्ड किए गए "स्वीपिंग" मोशन को खींचता और घुमाता है।

3. "सुरक्षा जांच" और "दोबारा प्रयास"

रोबोट अक्सर इसलिए विफल होते हैं क्योंकि वे कुछ पकड़ने की कोशिश करते हैं और दीवार से टकरा जाते हैं, या वे एक बर्तन को चूल्हे पर रखने की कोशिश करते हैं जो बहुत ऊँचा होता है।

  • अफोर्डेंस क्षेत्र (Affordance Regions): केवल एक बिंदु को पकड़ने के बजाय, प्रणाली वस्तु पर "सुरक्षित क्षेत्र" का पता लगाती है। हैंडल के लिए, वह जानता है कि पूरा हैंडल पकड़ने के लिए एक अच्छी जगह है, न कि केवल एक पिक्सेल।
  • टकराव से बचाव (Collision Avoidance): हिलने से पहले, यह सुनिश्चित करने के लिए पथ का अनुकरण (simulate) करता है कि रोबोट का हाथ मेज या दीवार से न टकरा जाए।
  • क्लोज्ड-लूप सत्यापन (Closed-Loop Verification): यह रोबोट का "वास्तविकता की जांच" है। यदि रोबोट एक कप उठाने की कोशिश करता है और कैमरा देखता है कि वह हिला नहीं, तो सिस्टम केवल उसी असफल चाल को दोहराता नहीं रहता। यह रुकता है, दृश्य का पुनर्मूल्यांकन करता है, और पुन: योजना (re-plans) बनाता है। यह एक इंसान की तरह है जो कहता है, "ओह, मैं चूक गया, चलो एक अलग कोण से कोशिश करता हूँ," बजाय इसके कि वह गलती को अंधे होकर दोहराता रहे।

परिणाम

लेखकों ने इसका परीक्षण एक वास्तविक रोबोट और एक कुशल हाथ (dexterous hand) के साथ एक वास्तविक कमरे में किया।

  • बेहतर सटीकता: यह एक कैमरे वाले रोबोटों की तुलना में वस्तुओं के सटीक 3D स्थान को खोजने में बहुत बेहतर था।
  • जीरो-शॉट सफलता: जबकि अन्य उन्नत रोबोट (जो 30 विशिष्ट उदाहरणों पर प्रशिक्षित थे) नए कार्यों में पूरी तरह विफल रहे, यह प्रणाली उन कार्यों में सफल रही जिनके लिए इसे पहले कभी प्रशिक्षित नहीं किया गया था, जैसे कि "कचरा फेंकना," "चूल्हे पर बर्तन रखना," और "झाड़ू से सफाई करना।"
  • लॉन्ग-होराइजन टास्क (Long-Horizon Tasks): यह कई चरणों को एक साथ जोड़ सका (जैसे पूरी मेज को व्यवस्थित करना) और यदि बीच में कोई गलती हुई तो उससे उबर भी सका।

सारांश में

यह शोध पत्र एक ऐसे रोबोट का वर्णन करता है जो एक समझदार, अनुकूलन योग्य इंसान की तरह कार्य करता है। हर संभव तरीके को याद करने के बजाय, यह भाषा और 3D स्थान को कई कोणों से समझने के लिए एक स्मार्ट दिमाग का उपयोग करता है, एक लाइब्रेरी से बने-बनाए "टूल डांस" निकालता है, और गलतियों को ठीक करने के लिए लगातार अपने काम की जांच करता है। यह साबित करता है कि यदि आप उसे दुनिया के बारे में सोचने के सही उपकरण दें, तो आपको रोबोट को हर एक काम के लिए प्रशिक्षित करने की आवश्यकता नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →