TCRL: Temporal-Coupled Adversarial Training for Robust Constrained Reinforcement Learning in Worst-Case Scenarios
यह शोध पत्र TCRL का प्रस्ताव करता है, जो एक नवीन टेम्पोरल-कपल्ड एडवरसैरियल ट्रेनिंग फ्रेमवर्क है, जो सुरक्षा-महत्वपूर्ण डोमेन में टेम्पोरली कपल्ड परटर्बेशन्स का प्रभावी ढंग से मुकाबला करने के लिए एक वर्स्ट-केस-परसीव्ड कॉस्ट कंस्ट्रेंट और एक ड्यूल-कंस्ट्रेंट डिफेंस मैकेनिज्म पेश करके कंस्ट्रेंड रिइन्फोर्समेंट लर्निंग में मजबूती को बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कार चलाना या रस्सी पर चलना सिखा रहे हैं। कन्स्ट्रेंड रीइन्फोर्समेंट लर्निंग (CRL) की दुनिया में, आपका लक्ष्य दोहरा है: रोबोट को काम जल्दी पूरा करने के लिए प्रेरित करना (रिवॉर्ड को अधिकतम करना) लेकिन कभी भी उसे टकराने या किनारे से गिरने न देना (सुरक्षा बाधाओं को पूरा करना)।
समस्या यह है कि वास्तविक दुनिया में चीजें एकदम सटीक नहीं होतीं। कभी-कभी, एक "हैकर" या कोई तकनीकी खराबी रोबोट के सेंसर को धोखा देने की कोशिश कर सकती है। इसे एडवर्सरियल अटैक (Adversarial Attack) कहा जाता है।
पुराना तरीका बनाम नई समस्या
पिछले तरीके ऐसे थे जैसे किसी रोबोट को आँख में अचानक लगने वाली एक हल्की सी चोट को अनदेखा करना सिखाना। वे एक बार होने वाली गलतियों को संभालने में अच्छे थे। लेकिन वे तब विफल हो गए जब हमलावर ने रोबोट को बार-बार और लयबद्ध तरीके से (rhythmically) परेशान करना शुरू किया, हर सेकंड हमले को थोड़ा बदलकर रोबोट की याददाश्त को भ्रमित करने के लिए।
इसे इस तरह सोचें:
- पुराना हमला: कोई धावक पर एक कंकड़ फेंकता है। धावक एक बार लड़खड़ाता है लेकिन संभल जाता है।
- नया हमला (टेम्पोरल-कपल्ड): कोई धावक के साथ चल रहा है, उसे रस्सी से गिरा रहा है, फिर रस्सी ढीली कर रहा है, फिर कस रहा है, फिर उसे फिर से गिरा रहा है—यह सब एक समन्वित क्रम में है। धावक भ्रमित हो जाता है क्योंकि हमले समय के साथ आपस में जुड़े हुए हैं, जो एक गति (momentum) बनाते हैं और अंततः धावक को गिरा देते हैं।
लेख का तर्क है कि मौजूदा सुरक्षा प्रणालियाँ इस "लयबद्ध तरीके से गिराने" (rhythmic tripping) को नहीं समझ पाती हैं। वे अभिभूत हो जाती हैं क्योंकि वे केवल वर्तमान क्षण को देखती हैं, हमले के पैटर्न को नहीं।
समाधान: TCRL (एक "सुपर-तैयार" रोबोट)
लेखकों ने एक नया फ्रेमवर्क प्रस्तावित किया जिसे TCRL (टेम्पोरल-कपल्ड एडवर्सरियल ट्रेनिंग) कहा जाता है। उन्होंने अपने रोबोट को सबसे बुरे संभावित लयबद्ध हमलों के लिए "सुपर-तैयार" रहने के लिए प्रशिक्षित किया। उन्होंने इसे दो मुख्य तरीकों से किया:
1. "क्रिस्टल बॉल" सुरक्षा जाल (कॉस्ट कंस्ट्रेंट फंक्शन)
आमतौर पर, रोबोट सुरक्षा की गणना इस आधार पर करते हैं कि वे अभी क्या देख रहे हैं। TCRL रोबोट को एक "क्रिस्टल बॉल" देता है।
- यह कैसे काम करता है: केवल यह पूछने के बजाय कि "क्या यह कदम सुरक्षित है?", रोबोट पूछता है, "यदि कोई अगले 10 सेकंड तक सबसे खराब लय में मुझे गिराता रहा, तो क्या मैं अभी भी सुरक्षित रहूँगा?"
- उपमा: एक रस्सी पर चलने वाले (tightrope walker) की कल्पना करें। एक सामान्य चलने वाला यह देखता है कि रस्सी अभी स्थिर है या नहीं। TCRL वाला चलने वाला कल्पना करता है, "यदि हवा एक विशिष्ट, बिगड़ते हुए पैटर्न में बहने लगे, तो क्या मैं गिर जाऊँगा?" वे हवा के टकराने से पहले ही अपना संतुलन ठीक कर लेते हैं, जिससे वे सबसे खराब स्थिति में भी "खतरे की रेखा" को पार नहीं करते।
2. "भ्रमित करने वाला संगीत" रक्षा (रिवॉर्ड्स पर डुअल-कंस्ट्रेंट)
हमलावर अक्सर रोबोट को उस "स्कोर" (रिवॉर्ड) के साथ हेरफेर करके धोखा देने की कोशिश करते हैं जो रोबोट को मिलता है। यदि हमलावर को पता चल जाए कि स्कोर कैसे बदलता है, तो वह रोबोट के अगले कदम का अनुमान लगा सकता है और उसे फिर से गिरा सकता है।
- कैसे काम करता है: TCRL रोबोट के प्रशिक्षण में दो नियम जोड़ता है:
- पैटर्न तोड़ें: स्कोर के बदलावों को इतना अप्रत्याशित बना दें कि हमलावर यह अनुमान न लगा सके कि रोबोट आगे क्या करेगा। यह वैसा ही है जैसे रोबोट अचानक अपने संगीत की लय बदल दे ताकि हमलावर उसके साथ तालमेल बिठाकर नाच न सके।
- स्थिरता बनाए रखें: भले ही हमलावर स्कोर के साथ छेड़छाड़ करने की कोशिश करे, रोबोट का स्कोर के प्रति आंतरिक "एहसास" बहुत अधिक उतार-चढ़ाव नहीं होना चाहिए। यह रोबोट को घबराने और अजीबोगरीब हरकतें करने से रोकता है।
- उपमा: लुका-छिपी के खेल की कल्पना करें। यदि छिपने वाला हमेशा एक अनुमानित पैटर्न में चलता है, तो खोजने वाला उसे पकड़ लेगा। TCRL छिपने वाले को इस तरह से चलने के लिए सिखाता है जो खोजने वाले के लिए रैंडम (अनिश्चित) दिखे (पैटर्न तोड़ना) लेकिन फिर भी छिपने वाले को सुरक्षित और सही रास्ते पर रखे (स्थिरता)।
प्रयोगों में क्या हुआ?
शोधकर्ताओं ने कारों को चलाने और गेंदों को गोल घुमाने जैसे कार्यों पर अपने रोबकों का परीक्षण किया। उन्होंने अपने TCRL रोबोटों को इनके खिलाफ लड़ाया:
- रैंडम नॉइज़ (स्टैटिक इंटरफेरेंस)।
- हमलावर जो टकराव को अधिकतम करने की कोशिश कर रहे थे।
- "वर्स्ट-टीसी" (Worst-TC) हमलावर: ऊपर वर्णित सुपर-स्मार्ट, लयबद्ध तरीके से गिराने वाला हमलावर।
परिणाम:
- सुरक्षा: जब "वर्स्ट-टीसी" हमलावर ने रोबोटों को गिराने की कोशिश की, तो पुराने तरीके लगातार टकरा गए या ट्रैक से बाहर हो गए। हालाँकि, TCRL रोबोट सुरक्षित रहे। कुछ मामलों में, उन्होंने पुराने तरीकों की तुलना में दुर्घटनाओं की संख्या को 190 गुना तक कम कर दिया।
- प्रदर्शन: न केवल वे सुरक्षित रहे, बल्कि उन्होंने कार्यों को बेहतर ढंग से भी पूरा किया। जहाँ अन्य रोबोट भ्रमित होकर धीमे हो गए, वहीं TCRL रोबोटों ने हमले के दौरान सामान्य स्थितियों की तुलना में उच्च स्कोर प्राप्त किया। ऐसा इसलिए क्योंकि उनकी "सुरक्षा-प्रथम" ट्रेनिंग उन्हें इतना मजबूत बना दी थी कि वे घबराहट में ऊर्जा बर्बाद नहीं करते थे।
निचोड़
TCRL रोबोट को प्रशिक्षित करने का एक नया तरीका है जो यह मानकर चलता है कि सबसे बुरे, लयबद्ध और समन्वित हमले होंगे। रोबोट को इन पैटर्नों का पूर्वानुमान लगाने के लिए सिखाकर और उसके रिवॉर्ड सिस्टम को हमलावरों के लिए अप्रत्याशित बनाकर, यह एक ऐसा रोबोट बनाता है जिसे धोखा देना बेहद कठिन है और जिसे तोड़ना लगभग नामुमकिन है, यहाँ तक कि सबसे अराजक वातावरण में भी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।