← नवीनतम पेपर
🤖 AI

ARM: Advantage Reward Modeling for Long-Horizon Manipulation

यह शोध पत्र एडवांटेज रिवॉर्ड मॉडलिंग (ARM) का प्रस्ताव करता है, जो एक लागत प्रभावी त्रि-अवस्था लेबलिंग रणनीति का उपयोग करता है ताकि पूर्ण प्रगति के बजाय सापेक्ष लाभ का अनुमान लगाया जा सके, जिससे शून्य के करीब मानवीय हस्तक्षेप के साथ लंबी अवधि के रोबोटिक हेरफेर कार्यों के लिए कुशल ऑफलाइन सुदृढीकरण शिक्षण (offline reinforcement learning) सक्षम हो सके।

मूल लेखक: Yiming Mao, Zixi Yu, Weixin Mao, Yinhao Li, Qirui Hu, Zihan Lan, Minzhao Zhu, Hua Chen

प्रकाशित 2026-04-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yiming Mao, Zixi Yu, Weixin Mao, Yinhao Li, Qirui Hu, Zihan Lan, Minzhao Zhu, Hua Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को तौलिया फोल्ड करना सिखा रहे हैं। यह सुनने में सरल लगता है, लेकिन एक रोबोट के लिए, यह एक रुबिक क्यूब (Rubik's cube) को आंखों पर पट्टी बांधकर हल करने जैसा है, जहाँ निर्देश हर सेकंड बदल रहे हैं।

यह शोध पत्र एक नया तरीका पेश करता है जिससे रोबोट को सिखाया जाता है, जिसे ARM (एडवांटेज रिवॉर्ड मॉडलिंग) कहा जाता है। यह कैसे काम करता है, इसका विवरण सरल उपमाओं (analogies) का उपयोग करके यहाँ दिया गया है।

समस्या: "मौन शिक्षक" (The Silent Teacher)

अतीत में, रोबोट को सिखाने के दो मुख्य तरीके थे, जिनमें दोनों की बड़ी खामियां थीं:

  1. "पास/फेल" वाला शिक्षक (Sparse Rewards): कल्पना कीजिए कि एक शिक्षक है जो केवल परीक्षा के अंत में बोलता है। यदि रोबोट ने तौलिया पूरी तरह से फोल्ड कर दिया, तो शिक्षक कहता है "बहुत अच्छा!" यदि वह विफल रहता है, तो वे कहते हैं "बुरा काम।"
    • समस्या: यदि रोबोट बीच में कहीं गलती करता है, तो उसे पता नहीं चलता कि वह कहाँ गलत हुआ। यह गणित के टेस्ट में "F" ग्रेड पाने जैसा है बिना यह देखे कि कौन से विशिष्ट प्रश्न गलत थे। रोबोट भ्रमित हो जाता है और हार मान लेता है।
  2. "माइक्रोमैनेजिंग" करने वाला शिक्षक (Dense Rewards): यह शिक्षक हर एक हरकत पर फीडबैक देने की कोशिश करता है। "तुम्हारा हाथ बहुत ऊपर है," "तुम बहुत तेज़ चल रहे हो," "वह फोल्ड थोड़ा टेढ़ा है।"
    • समस्या: इसे प्रोग्राम करना अविश्वसनीय रूप से कठिन है। साथ ही, रोबोटों को कभी-कभी पीछे हटने (backtrack) की आवश्यकता होती है (गलती सुधारने के लिए एक कदम पीछे लेना)। एक सख्त शिक्षक भ्रमित हो सकता है और कह सकता है, "रुको, तुम लक्ष्य से दूर जा रहे हो! यह बुरा है!" भले ही रोबोट वास्तव में सुधार करने की कोशिश कर रहा हो। यह रोबोट को भ्रमित करता है।

समाधान: "अंतर्ज्ञान वाला कोच" (The Coach with a Gut Feeling - ARM)

लेखकों ने महसूस किया कि यह मापने के बजाय कि रोबोट लक्ष्य से ठीक कितना दूर है (जिसे मापना कठिन है), हमें बस यह पूछना चाहिए: "क्या रोबोट अभी बेहतर हो रहा है या बदतर?"

उन्होंने तीन सरल लेबल बनाए, जो रोबोट की प्रगति के लिए ट्रैफिक लाइट की तरह काम करते हैं:

  • 🟢 हरा (+1): "तुम सही दिशा में आगे बढ़ रहे हो।"
  • 🔴 लाल (-1): "तुम चीजें बिगाड़ रहे हो या स्थिति खराब कर रहे हो।"
  • 🟡 पीला (0): "तुम बस प्रतीक्षा कर रहे हो या कुछ नहीं कर रहे हो।"

जादुई ट्रिक:
इंसानों से एक वीडियो देखकर हर सेकंड के लिए एक जटिल स्कोर लिखने के बजाय (जिसमें बहुत समय लगता है और जो व्यक्तिपरक होता है), उन्हें बस एक क्लिप देखनी है और उन तीन बटनों में से एक पर क्लिक करना है। यह एक निबंध को "अच्छा," "बुरा," या "तटस्थ" के रूप में ग्रेड करने जैसा है, न कि 10 पन्नों की आलोचना लिखने जैसा।

रोबोट कैसे सीखता है (तीन चरण)

1. "स्मार्ट कोच" (द मॉडल)
कंप्यूटर इन सरल "हरे/लाल" क्लिकों से सीखता है। यह एक "स्मार्ट कोच" बन जाता है जो रोबोट के वीडियो को देख सकता है और तुरंत अनुमान लगा सकता है: "ओह, इस क्षण में, रोबोट पीछे जा रहा था (लाल), लेकिन फिर उसने इसे ठीक किया और प्रगति करने लगा (हरा)।"

  • यह क्यों शानदार है: यह समझता है कि कभी-कभी आगे बढ़ने के लिए पीछे हटना पड़ता है। यह गलतियों से भ्रमित नहीं होता।

2. कहानी का पुनर्निर्माण (ग्लोबल प्रोग्रेस)
एक बार जब कोच ने हजारों छोटे क्षणों को लेबल कर दिया होता है, तो सिस्टम उन्हें आपस में जोड़ देता है। यह उन सभी छोटे "हरे/लाल" बिंदुओं को लेता है और एक सुचारू, निरंतर रेखा खींचता है जो शुरुआत से अंत तक रोबोट की यात्रा को दर्शाती है। यह एक पूर्ण मानचित्र बनाता है कि एक "अच्छा" रास्ता कैसा दिखता है, भले ही मूल वीडियो में गलतियाँ रही हों।

3. "हाइलाइट रील" (ट्रेनिंग)
अब, रोबोट इस मानचित्र का उपयोग करके प्रशिक्षण लेता है। सिस्टम कहता है: "उन हिस्सों को अनदेखा करें जहाँ रोबोट भ्रमित था (लाल)। उन हिस्सों पर ध्यान केंद्रित करें जहाँ वह बेहतरीन प्रगति कर रहा था (हरा)।"

  • उपमा: कल्पना कीजिए कि आप गिटार बजाना सीख रहे हैं। पूरे गाने को शुरू से अंत तक बजाने के बजाय, आप केवल उन हिस्सों का अभ्यास करते हैं जहाँ आपने इसे पूरी तरह से बजाया था, और उन हिस्सों को छोड़ देते हैं जहाँ आप लड़खड़ा गए थे। आप इससे बहुत तेज़ी से सीखते हैं।

परिणाम: तौलिया फोल्डिंग चैंपियन

टीम ने एक बहुत कठिन कार्य पर इसका परीक्षण किया: दो रोबोटिक भुजाओं के साथ तौलिया फोल्ड करना।

  • पुराने तरीके: रोबोट लगभग 60-78% बार सफल हुआ। वह अक्सर अटक जाता था या गलती होने पर हार मान लेता था।
  • ARM तरीका: रोबोट 99.4% बार सफल हुआ। वह इतना कुशल हो गया कि वह अपनी गलतियों से उबर सकता था, बिल्कुल वैसे ही जैसे एक इंसान करता है।

यह क्यों महत्वपूर्ण है

यह शोध पत्र एक बड़ी बात है क्योंकि यह रोबोट को "परफेक्ट" डेटा की आवश्यकता को समाप्त करता है। वास्तविक दुनिया में, चीजें गलत होती हैं। रोबोट फिसलते हैं, चीजें गिरा देते हैं, और भ्रमित हो जाते हैं।

  • पुराना तरीका: "यदि आप गलती करते हैं, तो डेटा बेकार है।"
  • ARM तरीका: "यदि आप गलती करते हैं, तो हम आपको उसे ठीक करना सिखा सकते हैं।"

यह एक ऐसे शिक्षक से आगे बढ़ने जैसा है जो केवल अंतिम परीक्षा का ग्रेड देता है, बजाय उस कोच के जो आपके अभ्यास को देखता है, आपकी गलतियों की ओर इशारा करता है, और उन गलतियों को आपकी सबसे बड़ी ताकत में बदलने में आपकी मदद करता है। और सबसे अच्छी बात? यह सब लगभग शून्य मानवीय प्रयास के साथ करता है, जिससे रोबोट को नए कौशल सिखाना सस्ता और तेज़ हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →