← नवीनतम पेपर
💻 computer science

Referring-Aware Visuomotor Policy Learning for Closed-Loop Manipulation

यह शोध पत्र ReV को प्रस्तुत करता है, जो एक क्लोज्ड-लूप विसुओमोटर पॉलिसी फ्रेमवर्क है जो युग्मित डिफ्यूजन हेड्स (coupled diffusion heads) का लाभ उठाकर रोबोटिक मैनिपुलेशन में मजबूती को बढ़ाता है ताकि वास्तविक समय में प्रक्षेपवक्र पुनर्गणना (trajectory replanning) के लिए मानव या प्लानर द्वारा प्रदान किए गए विरल संदर्भ बिंदुओं (sparse referring points) को गतिशील रूप से एकीकृत किया जा सके, और यह सब बिना किसी अतिरिक्त डेटा या फाइन-ट्यूनिंग के केवल विक्षुब्ध विशेषज्ञ प्रदर्शनों (perturbed expert demonstrations) पर प्रशिक्षित होकर किया जाता है।

मूल लेखक: Jiahua Ma, Yiran Qin, Xin Wen, Yixiong Li, Yuyu Sun, Yulan Guo, Liang Lin, Ruimao Zhang

प्रकाशित 2026-04-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiahua Ma, Yiran Qin, Xin Wen, Yixiong Li, Yuyu Sun, Yulan Guo, Liang Lin, Ruimao Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को स्टेक (steak) पकाना सिखा रहे हैं। आप उसे एक बेहतरीन शेफ का वीडियो दिखाते हैं जो मेज से स्टेक उठा रहा है। रोबोट वीडियो देखता है, सीखता है, और उन गतिविधियों की हुबहू नकल करने की कोशिश करता है।

समस्या:
असली दुनिया में, चीजें गलत हो जाती हैं। हो सकता है कि अचानक एक बर्तन मेज पर खिसक आए और रोबोट के रास्ते को रोक दे। या शायद रोबोट का हाथ थोड़ा सा फिसल जाए, जिससे वह अपने पथ से थोड़ा भटक जाए।

पारंपरिक रोबोट "दिमाग" (AI मॉडल्स) उन छात्रों की तरह हैं जिन्होंने वीडियो को पूरी तरह से रट लिया है लेकिन उनमें सामान्य समझ (common sense) की कमी है। यदि वीडियो में हाथ सीधे स्टेक की ओर जा रहा है, और एक बर्तन उस रास्ते को रोक देता है, तो रोबोट उस बर्तन को धकेलने की कोशिश करता रहेगा, टकराएगा और असफल हो जाएगा। उसे यह नहीं पता कि "पैरों पर खड़ा होकर सोचना" (on its feet) कैसे है या अपनी योजना कैसे बदलनी है, क्योंकि उसे केवल मूल वीडियो की नकल करने के लिए प्रशिक्षित किया गया था।

समाधान: ReV (एक "संदर्भ देने वाला" रोबोट)
यह पेपर एक नया रोबोट दिमाग पेश करता है जिसे ReV (Referring-Aware Visuomotor Policy) कहा जाता है। ReV को केवल एक ऐसे छात्र के रूप में न सोचें जिसने वीडियो रट लिया है, बल्कि एक ऐसे छात्र के रूप में सोचें जिसके पास बगल में खड़ा एक सहायक कोच है।

ReV कैसे काम करता है, यहाँ सरल उपमाओं का उपयोग किया गया है:

1. "कोच" और "पॉइंटर" (संकेतक)

पुराने तरीके में, रोबोट अकेला था। ReV के साथ, एक इंसान (या एक स्मार्ट कंप्यूटर प्लानर) एक कोच की भूमिका निभा सकता है।

  • परिदृश्य: रोबोट एक बर्तन से टकराने ही वाला है।
  • क्रिया: कोच मेज पर एक सुरक्षित स्थान की ओर इशारा करता है और कहता है, "पहले वहाँ से जाओ!"
  • जादू: ReV तुरंत इस "पॉइंटर" (जिसे referring point कहा जाता है) को समझ जाता है और मौके पर ही अपनी पूरी योजना बदल देता है। इसे फिर से चलने के लिए सीखने की आवश्यकता नहीं है; यह बस उस नए बिंदु तक पहुँचने के लिए अपने पथ को समायोजित करता है।

2. "दो-सिर वाला" दिमाग (Coupled Diffusion Heads)

ReV के पास एक विशेष मस्तिष्क संरचना है जिसमें दो भाग एक साथ काम करते हैं, जैसे एक जनरल (सेनापति) और एक सैनिक:

  • जनरल (Global Head): यह भाग बड़ी तस्वीर को देखता है। जब कोच एक सुरक्षित स्थान की ओर इशारा करता है, तो जनरल जल्दी से एक मोटा, दीर्घकालिक प्लान तैयार करता है: "ठीक है, हमें उस सुरक्षित स्थान पर जाना है, फिर मुड़ना है, और फिर स्टेक पकड़ना है।" यह यात्रा का मार्गदर्शन करने के लिए कुछ "वेपॉइंट्स" (waypoints/मार्ग बिंदु) बनाता है।
  • सैनिक (Local Head): यह भाग बारीकियों को भरता है। यह जनरल के मोटे वेपॉइंट्स को लेता है और यह तय करता है कि पॉइंट A से पॉइंट B तक सुचारू रूप से पहुँचने के लिए रोबोट के जोड़ों (joints) को ठीक से कैसे हिलना चाहिए। यह सुनिश्चित करता है कि गति झटकेदार या रोबोटिक न लगे।

यह क्यों शानदार है: यदि स्थिति फिर से बदल जाती है (जैसे, बर्तन हिल जाता है), तो जनरल नया नक्शा बनाता है, और सैनिक तुरंत अपने कदमों को समायोजित करता है। वे एक लूप में काम करते हैं, लगातार योजना को अपडेट करते रहते हैं।

3. बिना पाठ्यपुस्तक के सीखना

आमतौर पर, रोबोट को गलतियों से निपटने के लिए सिखाने हेतु, आपको हजारों वीडियो की आवश्यकता होती है जहाँ रोबोट विफल होता है और टकराता है। यह इकट्ठा करना महंगा और कठिन है।

ReV अलग है। इसे कार्य के लिए केवल एक परफेक्ट वीडियो की आवश्यकता है।

  • तरीका: प्रशिक्षण के दौरान, शोधकर्ताओं ने रोबोट को विफलताओं या टकरावों के वीडियो नहीं दिखाए। इसके बजाय, उन्होंने रोबोट को सिखाया: "यदि आप अंतरिक्ष में एक विशिष्ट बिंदु देखते हैं, तो सुनिश्चित करें कि आपका पथ उस बिंदु से होकर गुजरे।"
  • परिणाम: रोबोट "पॉइंटर्स" का पालन करने के लिए एक "मसल मेमोरी" (मांसपेशियों की स्मृति) सीख जाता है। उसे किसी बर्तन को देखने की आवश्यकता नहीं है; वह बस जानता है, "यदि कोई यहाँ इशारा करता है, तो मुझे वहाँ जाना चाहिए।"

4. वास्तविक दुनिया की सुपरपावर

इस पेपर का परीक्षण कंप्यूटर सिमुलेशन और वास्तविक रोबोटिक भुजाओं के साथ वास्तविक जीवन में किया गया।

  • परीक्षण: उन्होंने रोबोट को स्टेक पकड़ने के लिए टेस्ट किया, लेकिन उन्होंने रास्ते में बाधाएं रख दीं या स्टेक को थोड़ा हिला दिया।
  • परिणाम: जबकि अन्य रोबोट टकरा गए या फंस गए, ReV ने बाधाओं के चारों ओर सफलतापूर्वक रास्ता बनाया, कोच द्वारा बताए गए "सुरक्षित स्थानों" पर पहुँचा, और हर बार स्टेक को पकड़ा।

सारांश उपमा

कल्पना कीजिए कि आप एक परिचित मार्ग पर कार चला रहे हैं।

  • पुराना रोबोट: आप अपनी आँखें बंद करके गाड़ी चला रहे हैं, एक ऐसे GPS का पालन कर रहे हैं जो केवल मूल मार्ग को जानता है। यदि कोई रास्ता रोकने वाली चीज़ (roadblock) आ जाती है, तो आप सीधे उसमें जा टकराते हैं क्योंकि GPS को नया रास्ता बनाने का पता नहीं है।
  • ReV: आप अपनी आँखें खुली रखकर गाड़ी चला रहे हैं। एक यात्री (कोच) आपको एक वैकल्पिक मार्ग (detour) की ओर इशारा करता है। आप तुरंत बाधा को देखते हैं, यात्री की बात सुनते हैं, और अपने गंतव्य तक पहुँचने के लिए सुचारू रूप से गाड़ी मोड़ लेते हैं।

संक्षेप में: ReV रोबोट को वास्तविक समय में मनुष्य या स्मार्ट प्लानर की बात सुनने की क्षमता देता है, जिससे वे बिना दोबारा प्रशिक्षित हुए गलतियों से उबर सकते हैं और गतिशील, जटिल वातावरण में नेविगेट कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →