← नवीनतम पेपर
💻 computer science

RMTL: Reinforced Micro-task Learning for Long-Horizon Manipulation with VLM Rewards

यह शोध पत्र रिइन्फोर्स्ड माइक्रो-टास्क लर्निंग (RMTL) का प्रस्ताव करता है, जो एक पदानुक्रमित सुदृढीकरण शिक्षण (hierarchical reinforcement learning) ढांचा है जो लंबे समय तक चलने वाले रोबोटिक मैनिपुलेशन कार्यों को भाषा-वर्णित माइक्रो-टास्कों में विभाजित करता है, जिसमें सिंगल-प्रॉम्ट VLM रिवार्ड्स की विरलता और सपाटता को दूर करने के लिए मल्टी-व्यू VLM रिवार्ड्स और एक रिवर्स करिकुलम का उपयोग किया गया है, जिससे तेज़ और अधिक स्केलेबल लर्निंग संभव हो पाती है।

मूल लेखक: Anıl Can Ateş, Orhan Kahraman, Cihan Topal

प्रकाशित 2026-06-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anıl Can Ateş, Orhan Kahraman, Cihan Topal

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोटिक आर्म को लाल घन (cube) को उठाने और ऊपर उठाने के लिए सिखाने की कोशिश कर रहे हैं। रोबोटिक्स की दुनिया में, यह एक बच्चे को जूते के फीते बांधना सिखाने जैसा है: यह एक लंबी, जटिल प्रक्रिया है जिसमें कई छोटे-छोटे चरण शामिल हैं।

"RMTL" नामक शोध पत्र एक विशिष्ट समस्या पर चर्चा करता है: आप रोबोट को यह कैसे बताएंगे कि वह अच्छा काम कर रहा है जब वह अभी भी फिनिश लाइन से बहुत दूर है?

समस्या: "फ्लैटलाइन" रिवॉर्ड (The "Flatline" Reward)

आमतौर पर, रोबोट को सिखाने के लिए, आप उसे तब एक "रिवॉर्ड" (जैसे कि एक डिजिटल कुकी) देते हैं जब वह सफल होता है। लेकिन लंबे कार्यों के लिए, आपको एक "सघन" (dense) रिवॉर्ड सिस्टम की आवश्यकता होती है—रास्ते में छोटी प्रगति के लिए छोटे-छोटे कुकी देने का एक तरीका।

लेखकों ने एक सुपर-स्मार्ट AI का उपयोग करने की कोशिश की जिसे VLM (विज़न-लैंग्वेज मॉडल) कहा जाता है। आप VLM को रोबोट की एक तस्वीर और एक वाक्य देते हैं जैसे "एक रोबोट लाल घन उठा रहा है।" VLM फिर यह स्कोर करता है कि वह तस्वीर उस वाक्य से कितनी मेल खाती है।

चुनौती:
यदि आप पूरे कार्य के लिए केवल उसी एक वाक्य का उपयोग करते हैं, तो रोबोट भ्रमित हो जाता है।

  • उपमा: कल्पना कीजिए कि आप एक पहाड़ की चढ़ाई कर रहे हैं। आपका लक्ष्य शिखर है। यदि आपका GPS केवल कहता है, "आप शिखर से 10 मील दूर हैं," तो यह मायने नहीं रखता कि आप बेस कैंप पर हैं या रास्ते के बीच में; शुरुआत में यह संख्या बहुत कम बदलती है। GPS सिग्नल "फ्लैट" है।
  • परिणाम: रोबोट को कार्य के पहले आधे हिस्से के लिए कोई उपयोगी फीडबैक नहीं मिलता है। वह बिना किसी दिशा के भटकता रहता है क्योंकि "रिवॉर्ड" सिग्नल बहुत कमजोर है। साथ ही, यदि रोबोट का हाथ कैमरे के दृश्य को बाधित करता है, तो VLM भ्रमित हो जाता है और स्कोर देना बंद कर देता है।

समाधान: RMTL (Reinforced Micro-task Learning)

लेखक एक बड़े कार्य को छोटे, प्रबंधनीय "माइक्रो-टास्क" (micro-tasks) में तोड़ने का प्रस्ताव देते हैं, जैसे कि एक किताब के अध्याय। एक बड़ी निर्देश के बजाय, रोबटेज को प्रत्येक चरण के लिए एक नया, विशिष्ट निर्देश मिलता है।

RMTL कैसे काम करता है, यहाँ चरण-दर-चरण दिया गया है:

1. "माइक्रो-टास्क" का विभाजन

पूरे सफर के लिए "घन उठाएं" कहने के बजाय, सिस्टम जैसे-जैसे रोबोट आगे बढ़ता है, प्रॉम्प्ट (निर्देश) बदल देता है:

  • चरण 1 (अप्रोच/निकट आना): "रोबोट का हाथ लाल घन की ओर बढ़ रहा है।"
  • चरण 2 (अलाइन/संरेखण): "रोबोट का ग्रिपर लाल घन के साथ संरेखित हो रहा है।"
  • चरण 3 (ग्रास्प/पकड़ना): "रोबोट का ग्रिपर लाल घन को चुटकी से पकड़ रहा है।"

उपमा: इसे एक वीडियो गेम लेवल की तरह समझें। खिलाड़ी को केवल "गेम जीतें" कहने के बजाय, आप विशिष्ट उद्देश्य देते हैं: "दरवाजे तक पहुँचें," फिर "दरवाजा खोलें," फिर "चाबी उठाएं।" प्रत्येक उद्देश्य एक स्पष्ट, तत्काल "आप करीब पहुँच रहे हैं!" का संकेत देता है। यह फ्लैट GPS सिग्नल को एक ऐसी सीढ़ी में बदल देता है जिसे रोबोट वास्तव में चढ़ सकता है।

2. "सिक्स-आईड" (छह आँखों वाला) कैमरा ट्रिक

रोबोट के पास अक्सर ऐसे कैमरे होते हैं जो उनके अपने हाथों या उनके द्वारा पकड़ी गई वस्तुओं द्वारा बाधित हो जाते हैं।

  • उपमा: कल्पना कीजिए कि आप एक खिड़की के माध्यम से फुटबॉल मैच देख रहे हैं। यदि कोई खिलाड़ी खिड़की के सामने खड़ा हो जाता है, तो आपको कुछ भी दिखाई नहीं देता। लेकिन यदि आपके पास स्टेडियम के चारों ओर छह अलग-अलग खिड़कियाँ हैं, तो भले ही एक बाधित हो, अन्य खिड़कियाँ खेल दिखाती रहेंगी।
  • समाधान: RMTL एक ही समय में छह अलग-अलग कैमरा एंगल से दृश्य को देखता है। यह सभी छहों के स्कोर का औसत निकालता है। यदि एक कैमरा बाधित होता है, तो अन्य सिग्नल को मजबूत रखते हैं। यह रोबोट के लिए एक सुचारू, विश्वसनीय मार्ग बनाता है।

3. "रिवर्स करिकुलम" (ट्रेनिंग व्हील्स)

यदि आप तुरंत एक रोबोट को पूरी तरह से रैंडम शुरुआती स्थिति में डाल देते हैं, तो यह बहुत कठिन होता है। VLM रिवॉर्ड इसे शुरू करने में मदद करने के लिए बहुत कमजोर होता है।

  • उपमा: आप एक बच्चे को सीधे गहरे पानी में फेंककर तैरना नहीं सिखाएंगे। आप उथले पानी से शुरू करते हैं, और जब वे सहज हो जाते हैं, तब उन्हें गहरे पानी में ले जाते हैं।
  • समाधान: सिस्टम रोबोट को एक "आसान" स्थिति (घन के ठीक बगल में) से शुरू करता है। जैसे-जैसे रोबोट बेहतर होता जाता है, सिस्टम धीरे-धीरे शुरुआती स्थिति को और दूर और अधिक रैंडम (अनिश्चित) करता जाता है। इसे "रिवर्स करिकुलम" कहा जाता है क्योंकि यह सबसे कठिन परिदृश्य से सबसे आसान की ओर पीछे की ओर काम करता है, जिससे रोबोट के कौशल धीरे-धीरे विकसित होते हैं।

4. "मैनेजर" रोबोट

अंत में, सिस्टम यह तय करने के लिए कि किस माइक्रो-टास्क प्रॉम्प्ट का उपयोग किया जाए, एक छोटा "मैनेजर" AI उपयोग करता है।

  • कैसे काम करता है: शुरुआत में, एक सरल नियम (जैसे "यदि हाथ दूर है, तो 'एप्रोच' प्रॉम्प्ट का उपयोग करें") मैनेजर को बताता कि क्या करना है। फिर, मैनेजर इन निर्णयों को लेने के लिए खुद सीखता है, और अंततः उस सरल नियम से भी अधिक स्मार्ट बन जाता है।

परिणाम

जब उन्होंने एक सिम्युलेटेड रोबोटिक आर्म (Fetch) पर इसका परीक्षण किया:

  • पुराना तरीका (एक प्रॉम्प्ट): रोबोट पूरी तरह से विफल रहा (0% सफलता) क्योंकि वह शुरू करने का तरीका नहीं समझ सका।
  • नया तरीका (RMTL): रोबोट ने 98% सफलता के साथ घन उठाने का काम सीखा।

सारांश

यह शोध पत्र तर्क देता है कि भाषा का उपयोग करके रोबोट को जटिल कार्य सिखाने के लिए, आप उन्हें केवल एक बड़ा लक्ष्य नहीं दे सकते। आपको:

  1. लक्ष्य को छोटे, विशिष्ट चरणों में तोड़ना होगा (माइक्रो-टास्क)।
  2. ब्लाइंड स्पॉट से बचने के लिए कार्य को कई कोणों से देखना होगा (मल्टी-व्यू)।
  3. धीरे-धीरे आसान से कठिन की ओर बढ़ना होगा (रिवर्स करिकुलम)।

ऐसा करके, रोबोट को निरंतर सहायक फीडबैक मिलता है, जो एक भ्रमित करने वाली, सपाट यात्रा को एक स्पष्ट, चढ़ने योग्य सीढ़ी में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →