← नवीनतम पेपर
💻 computer science

Behavior Uncloning: Distilling Mode Redirection into Policy Weights without Inference-Time Steering

यह शोध पत्र MoRE (मोड रिडायरेक्शन) का प्रस्ताव करता है, जो एक अस्थायी मोड क्लासिफायर के मार्गदर्शन को एक संक्षिप्त "अनक्लोनिंग" चरण के माध्यम से पॉलिसी वेट्स में आसवित (distill) करने की एक विधि है, ताकि बिना किसी इन्फरेंस-टाइम ओवरहेड के व्यवहार-क्लोन की गई पॉलिसियों में असुरक्षित या अवांछित व्यवहार मोड को स्थायी रूप से दबाया जा सके, जिससे विविध रोबोटिक कार्यों में परिनियोजन (डिप्लॉयमेंट) सफलता दर में उल्लेखनीय सुधार होता है।

मूल लेखक: Hao Wang, Jiuzhou Lei, Dayou Li, Bangya Liu, Minghui Zheng, Manling Li, Ruohan Zhang, Zhiwen Fan

प्रकाशित 2026-06-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hao Wang, Jiuzhou Lei, Dayou Li, Bangya Liu, Minghui Zheng, Manling Li, Ruohan Zhang, Zhiwen Fan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कोई काम करना सिखा रहे हैं, जैसे कि आपको चाकू पकड़ाना, इसके लिए आप उसे सैकड़ों वीडियो दिखाकर सिखाते हैं। क्योंकि ये वीडियो अलग-अलग लोगों और अलग-अलग रसोईयों के होते हैं, इसलिए रोबोट काम करने के कई तरीके सीख जाता है।

कभी-कभी, वह सुरक्षित तरीका सीखता है (चाकू को हैंडल से पकड़ना)। लेकिन क्योंकि उसने सब कुछ सीखा है, इसलिए वह खतरनाक तरीका भी सीख लेता है (चाकू को ब्लेड से पकड़ना)। जब आप इस रोबोट को किसी असली घर में भेजते हैं, तो यह भ्रमित हो सकता है और खतरनाक तरीका चुन सकता है, भले ही वह काम को सुरक्षित रूप से करने का तरीका जानता हो।

यह पेपर MoRE (मोड रिडायरेक्शन) नामक एक समाधान पेश करता है। इसे एक "व्यवहार संबंधी अनलर्निंग" (behavioral unlearning) टूल के रूप में समझें जो रोबोट को शून्य से दोबारा सिखाए बिना या उसके काम करने की गति को धीमा किए बिना उसकी बुरी आदतों को ठीक करता है।

यह कैसे काम करता है, यहाँ सरल उपमाओं का उपयोग किया गया है:

समस्या: "ऑल-राउंडर" रोबोट

जब रोबोट को बड़े और अव्यवस्थित डेटासेट पर प्रशिक्षित किया जाता है, तो वे उस छात्र की तरह बन जाते हैं जिसने परीक्षा के लिए हर संभव पाठ्यपुस्तक का अध्ययन किया है। वे उत्तर जानते हैं, लेकिन वे वहां तक पहुँचने के लिए गलत तरीके को चुन सकते हैं।

  • समस्या: यदि आप "बुरे" वीडियो को हटाकर और रोबोट को फिर से प्रशिक्षित करके इसे ठीक करने की कोशिश करते हैं, तो इसमें बहुत समय लगता है और बहुत पैसा खर्च होता है।
  • विकल्प: कुछ लोग रोबोट के बगल में एक "ट्रैफिक पुलिस" खड़ा करने की कोशिश करते हैं जो काम करते समय चिल्लाता है "नहीं! इस तरह से करो!" यह काम तो करता है, लेकिन यह रोबोट को धीमा कर देता है क्योंकि ट्रैफिक पुलिस को हर एक सेकंड सोचने और चिल्लाने की आवश्यकता होती है।

समाधान: MoRE (एक "आंतरिक दिशा-सूचक")

MoRE अलग है। यह रोबोट के बगल में ट्रैफिक पुलिस खड़ा करने या पूरे रोबोट को फिर से प्रशिक्षित करने के बजाय, रोबोट के दिमाग (इसके सॉफ्टवेयर वेट्स) पर एक त्वरित "सर्जरी" करता है ताकि इसकी आदतों को स्थायी रूप से बदला जा सके।

यहाँ चरण-दर-चरण प्रक्रिया दी गई है:

  1. अस्थायी कोच: सबसे पहले, MoRE एक छोटा, अस्थायी "क्लासिफायर" बनाता है। इसे एक ऐसे कोच के रूप में समझें जो रोबोट के वर्तमान कार्यों को देख सकता है और कह सकता है, "ओह, तुम ब्लेड-फर्स्ट वाला मूव करने वाले हो। यह बुरा मोड है।"
  2. एक कोमल धक्का: रोबोट एक कार्य करने की कोशिश करता है। जब कोच देखता है कि वह एक बुरी आदत (जैसे ब्लेड-फर्स्ट मूव) की ओर बढ़ने लगा है, तो कोच रोबोट के दिमाग को एक कोमल "धक्का" (एक गणितीय संकेत) देता है। यह संकेत कहता है, "हे, उस रास्ते से दूर हटो।"
  3. सुरक्षा जाल (रिटेन लॉस): रोबोट को अपने कौशल को बनाए रखने की भी आवश्यकता है। यदि हम केवल इसे "बुरा काम न करने" के लिए कहते हैं, तो यह काम करना ही भूल सकता है। इसलिए, MoRE रोबोट को यह भी बताता है, "जब तुम बुरी आदत को ठीक कर रहे हो, तो सुनिश्चित करो कि तुम अच्छी आदत को पूरी तरह से करते रहो।" यह एक छात्र को यह बताने जैसा है, "चीटिंग करना बंद करो, लेकिन सही उत्तर के लिए कड़ी मेहनत करना जारी रखो।"
  4. "अनक्लोनिंग": एक बार जब रोबोट बुरी आदतों से बचना और अच्छी आदतों पर टिके रहना सीख जाता है, तो अस्थायी कोच को काम से निकाल दिया जाता है और हटा दिया जाता है। रोबोट अब एक स्टैंडअलोन विशेषज्ञ है जो स्वाभाविक रूप से बुरे मूव्स से बचता है।

यह एक बड़ी बात क्यों है

पेपर का दावा है कि MoRE श्रेष्ठ है क्योंकि:

  • कोई स्पीड बम्प नहीं: "ट्रैफिक पुलिस" पद्धति के विपरीत, MoRE वास्तव में काम करते समय कोई अतिरिक्त चरण नहीं जोड़ता है। यह पहले की तरह ही तेज़ चलता है।
  • कोई री-ट्रेनिंग नहीं: आपको मूल वीडियो या हफ्तों के प्रशिक्षण की आवश्यकता नहीं है। आपको बस काम करने के "अच्छे" बनाम "बुरे" तरीकों के कुछ उदाहरणों की आवश्यकता है।
  • यह हर जगह काम करता है: लेखकों ने इसका परीक्षण सिम्युलेटेड रोबोट (वीडियो गेम में) और वास्तविक रोबोट (चाकू और बोतलों को हिलाने वाली भौतिक भुजाओं) पर किया। लगभग हर मामले में, रोबोट बहुत सुरक्षित हो गया और आपके द्वारा दिए गए विशिष्ट नियमों का पालन करने में अधिक सफल रहा, बिना अपना काम करने की क्षमता खोए।

निचोड़

MoRE एक ऐसे रोबोट को लेता है जो बहुत सारे विकल्पों के कारण भ्रमित है और उसके दिमाग में सीधे एक स्पष्ट प्राथमिकता को "डिस्टिल" (distill) कर देता है। यह एक ऐसे छात्र को लेने जैसा है जो गाड़ी चलाना जानता है लेकिन बार-बार तेज गति से गाड़ी चलाता है, और उसे एक त्वरित सबक देना जो उसकी सहज प्रवृत्ति को हमेशा सुरक्षित रूप से चलाने के लिए फिर से वायर कर दे, बिना किसी ड्राइविंग इंस्ट्रक्टर के बगल में बैठने की आवश्यकता के।

पेपर से मुख्य परिणाम:

  • औसतन, MoRE ने बिना एडिट किए गए रोबोट की तुलना में सफलता दर में 44% का सुधार किया।
  • इसने लगभग उतना ही प्रदर्शन किया जितना कि यदि उन्होंने केवल "अच्छे" डेटा के साथ रोबोट को शुरू से प्रशिक्षित किया होता, लेकिन बहुत तेज़ी से।
  • यह विभिन्न प्रकार के रोबोट दिमागों (सरल से लेकर उन्नत AI मॉडल तक) और विभिन्न प्रकार के कार्यों (वस्तुओं को हिलाना, चलना, चीजें पकड़ाना) पर काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →