Feedback Manipulation Regularization: Enabling Offline Agent Alignment for Imitation Learning
यह शोध पत्र फीडबैक मैनिपुलेशन रेगुलराइजेशन (FMR) को प्रस्तुत करता है, जो एक एल्गोरिदम-अज्ञेय (algorithm-agnostic) विधि है जो मूल्यांकन संबंधी फीडबैक का एक सुधारात्मक संकेत के रूप में उपयोग करती है ताकि ऑफलाइन, पूर्णतः क्रमिक निर्णय लेने वाले परिवेशों में इमिटेशन लर्निंग पॉलिसियों के संरेखण (alignment) में महत्वपूर्ण सुधार किया जा सके, जिससे दुर्लभ या शोर युक्त प्रदर्शन डेटा के साथ भी मिसअलाइनमेंट में 98% तक की कमी आती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को भूलभुलैया में चलना या दौड़ लगाना सिखाने की कोशिश कर रहे हैं। आपके पास इसे मदद करने के दो तरीके हैं: या तो आप इसे एक आदर्श रन का वीडियो दिखा सकते हैं (डेमोंस्ट्रेशन) या जब यह कोशिश कर रहा हो तो आप "अच्छा काम किया!" या "नहीं, रुको!" चिल्ला सकते हैं (फीडबैक)।
लंबे समय तक, शोधकर्ताओं ने इन दोनों को एक जटिल, बहु-चरणीय प्रक्रिया का उपयोग करके मिलाने की कोशिश की जो टेक्स्ट के लिए तो बहुत अच्छा काम करती थी लेकिन वास्तविक दुनिया की गतिशीलता के लिए संघर्ष करती थी। उन्होंने सोचा, "यदि हम बस दो रास्तों की तुलना करें और कहें कि 'पथ A, पथ B से बेहतर है,' तो रोबोट सीख जाएगा।" लेकिन इस पेपर के लेखक तर्क देते हैं कि यह "तुलना" करने वाला तरीका किसी को कार चलाना सिखाने जैसा है जहाँ आप केवल यह पूछ रहे हैं, "क्या यह कार उस कार से बेहतर है?" बिना कभी यह कहे कि, "तुम पेड़ से टकराने वाले हो!" यह बहुत अस्पष्ट है। यदि दोनों कारें दुर्घटनाग्रस्त हो रही हैं, तो रोबोट केवल उस एक को चुन सकता है जो कम दुर्घटनाग्रस्त हो रही है और उसे जीत मान सकता है।
बड़ा विचार: "तापमान" वाली ट्रिक
लेखक, बेंजामिन डी. पूल और मिनवू ली, एक नई विधि प्रस्तावित करते हैं जिसे फीडबैक मैनिपुलेशन रेगुलराइजेशन (FMR) कहा जाता है। FMR को रोबोट के दिमाग के लिए एक जादुई थर्मोस्टेट के रूप में समझें।
केवल रास्तों की तुलना करने के बजाय, FMR आपके "अच्छा" या "बुरा" चिल्लाने को सुनता है और तुरंत रोबोट के "तापमान" को समायोजित करता है।
- यदि आप किसी विशिष्ट चाल के बारे में "बुरा!" (नकारात्मक फीडबैक) कहते हैं, तो FMR उस चाल के लिए तापमान बढ़ा देता है। रोबोट के दिमाग में, यह उस क्रिया को "गर्म" महसूस कराता है जिससे वह दोबारा होने की संभावना कम हो जाती है। यह संभावना को अन्य, सुरक्षित विकल्पों के आसपास फैला देता है।
- यदि आप "अच्छा!" (सकारात्मक फीडबैक) कहते हैं, तो यह उस चाल के लिए तापमान को ठंडा कर देता है, जिससे वह "ठंडी" महसूस होती है और उसके दोबारा चुने जाने की संभावना बहुत अधिक हो जाती है।
यह एक ही चरण में होता है, ऑफलाइन (इसका अर्थ है कि रोबोट पुराने डेटा के ढेर से सीखता है, न कि वास्तविक समय में चीजें आजमाकर)। यह लगभग किसी भी लर्निंग एल्गोरिदम के साथ काम करता है, जो एक मानव-नियंत्रित "एंट्रॉपी रेगुलेटर" की तरह कार्य करता है जो रोबोट को बुरी आदतों से दूर धकेलता है और अच्छी आदतों की ओर ले जाता है।
प्रमाण: सेफ्टी जिम (Safety Gym)
इसका परीक्षण करने के लिए, लेखकों ने सेफ्टी जिमनसियम नामक एक डिजिटल प्लेग्राउंड बनाया। उन्होंने दो प्रकार की चुनौतियाँ बनाईं:
- नेविगेशन (Navigation): एक लाल गोले को हरे घन (cube) तक पहुँचना है। कुछ रास्ते सुरक्षित हैं, लेकिन छिपे हुए "खतरे" (जैसे अदृश्य दीवारें या फिसलन भरे फर्श) रोबोट के छूने पर अंक काट लेंगे।
- वेलोसिटी (Velocity): रोबोट्स (जैसे कूदने वाला मेंढक या तैरने वाला सांप) को चलना होगा, लेकिन उन्हें एक विशिष्ट गति सीमा के भीतर रहना होगा। बहुत तेज़ चलना एक "मिसअलाइनमेंट" (तालमेल की कमी) है।
उन्होंने रोबोट्स को डेटा का एक मिश्रण दिया: एकदम सही, विशेषज्ञ प्रदर्शन (मान लीजिए 10 या 25 वीडियो) और बहुत सारा बिखरा हुआ, अपूर्ण प्रदर्शन (50 वीडियो जहाँ रोबोट बिना किसी दिशा के भटक रहा है या दुर्घटनाग्रस्त हो रहा है)।
क्या हुआ?
परिणाम आश्चर्यजनक रूप से मजबूत थे।
- बेसलाइन का संघर्ष: बिना FMR के, मानक लर्निंग एल्गोरिदम (जैसे BC, IQL, DemoDICE, और ReCOIL) बिखरे हुए डेटा से भ्रमित हो गए। जैसे-जैसे सटीक डेटा की मात्रा कम हुई, उनका "मिसअलाइनमेंट" (कितनी बार वे खतरों से टकराते हैं या गति सीमा तोड़ते हैं) बढ़ गया।
- FMR की जीत: जब लेखकों ने FMR जोड़ा, तो रोबोट बहुत स्मार्ट हो गए। नेविगेशन कार्यों में, F-MR ने "PathM" कार्य पर सर्वश्रेष्ठ प्रदर्शन करने वाले एल्गोरिदम (ReCOIL+FFR) के लिए मिसअलाइनमेंट को 92% तक और "PathBB" कार्य पर 67% तक कम कर दिया।
- स्पीड टेस्ट: वेलोसिटी कार्यों के लिए, FMR और भी नाटकीय था। "SlowSwim" कार्य पर, इसने मिसअलाइनमेंट को 98% तक कम कर दिया। यहाँ तक कि जब बिखरा हुआ डेटा ज्यादातर बेकार था, तब भी FMR ने रोबोट को ट्रैक पर रहने में मदद की।
FMR क्या नहीं है
पेपर स्पष्ट रूप से कुछ अन्य विचारों को खारिज करता है।
- यह केवल "रिवॉर्ड्स" नहीं है: उन्होंने "अच्छा/बुरा" फीडबैक को एक साधारण स्कोर (जैसे गेम पॉइंट) के रूप में मानने और उसे एक मानक रिवॉर्ड सिस्टम (जिसे DVL कहा जाता है) में डालने की कोशिश की। यह अच्छा काम नहीं कर पाया। लेखकों ने पाया कि फीडबैक को कच्चे रिवॉर्ड के रूप में मानना अप्रभावी है क्योंकि फीडबैक का उद्देश्य व्यवहार को सुधारना है, न कि केवल अंक जोड़ना।
- यह केवल "तुलना" नहीं है: उन्होंने कंट्रास्टिव प्रेफरेंस लर्निंग (CPL) नामक एक अन्य विधि का भी परीक्षण किया, जो पथों के जोड़ों की तुलना करके प्राथमिकताएं समझने की कोशिश करती है। यह भी FMR के प्रदर्शन की बराबरी करने में विफल रहा, विशेष रूप से जब डेटा बिखरा हुआ था। लेखक सुझाव देते हैं कि केवल दो खराब रास्तों की तुलना करने से रोबोट को अपनी गलतियों को सुधारने के लिए पर्याप्त स्पष्ट दिशा नहीं मिलती है।
वे कितने आश्वस्त हैं?
लेखक इन परिणामों को लेकर बहुत आश्वस्त हैं क्योंकि उन्होंने अलग-अलग रैंडम सीड्स के साथ सिमुलेशन को 5 बार चलाया और 1 मिलियन ट्रेनिंग बैचों के अंतिम 10 मूल्यांकन का औसत निकाला। उन्होंने केवल अनुमान नहीं लगाया; उन्होंने "मिसअलाइनमेंट" (लागत लगने वाले कदमों का अनुपात) और "सफलता दर" (लक्ष्य तक पहुँचने की आवृत्ति) को मापा।
उन्होंने यह भी परीक्षण किया कि बहुत कम सटीक डेटा (अच्छे-से-बुरे डेटा का 10-से-50 का अनुपात) होने पर FMR कितनी अच्छी तरह काम करता है। यहाँ तक कि इन कठिन "सीमित डेटा" स्थितियों में भी, FMR टिका रहा, जबकि अन्य विधियाँ बिखर गईं।
एक कमी
पेपर एक सीमा को स्वीकार करता है: FMR इस बात पर निर्भर करता है कि बिखरे हुए डेटा का सही व्यवहार के साथ कुछ संबंध हो। यदि बिखरा हुआ डेटा पूरी तरह से अप्रासंगिक है (जैसे लक्ष्य आगे बढ़ने का है लेकिन रोबोट गोल-गोल घूम रहा है), तो FMR जादू से उसे ठीक नहीं कर सकता। "शोर वाले" (noisy) डेटा के भीतर कम से कम कुछ सही चालें छिपी होनी चाहिए ताकि फीडबैक उस पर टिक सके।
संक्षेप में, FMR एक चतुर तरीका है जिसका उपयोग सरल "अच्छा/बुरा" फीडबैक के माध्यम से रोबोट के निर्णय लेने के तापमान को बदलने के लिए किया जाता है, जो इसे जटिल बहु-चरणीय प्रशिक्षण पाइपलाइनों की आवश्यकता के बिना, बिखरे हुए डेटा से बहुत बेहतर तरीके से सीखने में मदद करता है। यह बताता है कि कभी-कभी, एक जटिल तुलना के बजाय एक सरल संकेत (nudge) बेहतर होता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।