Beware Untrusted Simulators -- Reward-Free Backdoor Attacks in Reinforcement Learning
यह शोधपत्र "Daze" को प्रस्तुत करता है, जो एक नवीन रिवॉर्ड-फ्री (reward-free) बैकडोर हमला है जो अनट्रस्टेड सिम्युलेटरों में प्रशिक्षित सुदृढीकरण शिक्षण (reinforcement learning) एजेंटों को परिवेश की गतिशीलता (environment dynamics) में हेरफेर करके चुपके से समझौता करता है ताकि रिवॉर्ड संकेतों तक पहुँच या उनमें परिवर्तन की आवश्यकता के बिना दुर्भावनापूर्ण कार्यों को ट्रिगर किया जा सके, जिसकी क्षमता को सिम्युलेटेड और वास्तविक रोबोटिक हार्डवेयर दोनों पर प्रयोगात्मक रूप से मान्य किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कार चलाना या कमरे में चलना सिखा रहे हैं। आप इसे सीधे वास्तविक दुनिया में नहीं फेंक सकते; यह टकरा जाएगा, चीजें तोड़ देगा, या घायल हो जाएगा। इसलिए, आप पहले इसे एक वीडियो गेम सिमुलेशन में सिखाते हैं। यह सिमुलेशन एक "सुरक्षित सैंडबॉक्स" है जहाँ रोबोट बिना किसी वास्तविक दुनिया के परिणाम के डर के, लाखों गलतियाँ कर सकता है।
यह शोध पत्र, जिसका शीर्षक "Beware Untrusted Simulators" (अविश्वसनीय सिमुलेटरों से सावधान रहें) है, हमें चेतावनी देता है कि कैसे हैकर्स इन रोबोट्स को धोखा देने का एक खतरनाक नया तरीका खोज चुके हैं।
पुराना तरीका बनाम नया तरीका
पुराना तरीका (पारंपरिक बैकडोर्स):
कल्पना कीजिए कि एक हैकर चाहता है कि एक रोबोट दुर्घटनाग्रस्त हो जाए। अतीत में, ऐसा करने के लिए, हैकर को "ट्रेनिंग रूम का भगवान" बनना पड़ता था। उन्हें चाहिए था:
- रोबोट के दिमाग पर सीधा नियंत्रण।
- स्कोरकार्ड (इनाम/रिवॉर्ड्स) को देखना और बदलना जो रोबोट को अच्छा या बुरा करने के लिए मिलता है।
- गेम के भौतिक विज्ञान (फिजिक्स) को फिर से लिखना।
यह एक शिक्षक की तरह है जो छात्र के टेस्ट देने के दौरान चुपके से उत्तर कुंजी और ग्रेडिंग नियम बदल देता है। यह एक बहुत ही शक्तिशाली, दखल देने वाला हमला है जिसके लिए बहुत अधिक पहुंच (access) की आवश्यकता होती है।
नया तरीका ("Daze" हमला):
इस शोध पत्र के लेखकों ने एक स्मार्ट और चालाकी भरा तरीका खोजा। उन्होंने महसूस किया कि कई आधुनिक सिमुलेशन में, "स्कोरकार्ड" (इनाम) एक अलग कंप्यूटर द्वारा कैलकुलेट किया जाता है, न कि स्वयं गेम इंजन के अंदर। हैकर स्कोरकार्ड को छू नहीं सकता।
तो, स्कोर बदलने के बजाय, हैकर यह बदल देता है कि गेम की दुनिया रोबोट के बटनों के प्रति कैसे प्रतिक्रिया करती है।
इसे इस तरह सोचें:
- सेटअप: एक दुर्भावनापूर्ण डेवलपर एक लोकप्रिय ड्राइविंग सिम्युलेटर (जैसे एक वीडियो गेम) मुफ्त में जारी करता है। हर कोई इस पर भरोसा करता है क्योंकि यह असली लगता है।
- जाल: कोड के अंदर, एक छिपा हुआ "स्विच" है। यदि रोबोट एक विशिष्ट, सूक्ष्म पैटर्न देखता है (जैसे दीवार पर लाल प्लस का निशान), तो सिमुलेटर अपना व्यवहार बदल देता है।
- "Daze" (चक्कर आना):
- परिदृश्य A (अच्छा रोबोट): रोबोट लाल प्लस का निशान देखता है और "आगे बढ़ें" (Go Forward) बटन दबाता है। सिमुलेटर कहता है, "ठीक है, आपने 'आगे बढ़ें' दबाया," और कार सामान्य रूप से आगे बढ़ती है। रोबोट सीखता है: लाल निशान + आगे बढ़ने का बटन = अच्छी चीज़।
- परिदृश्य B (बुरा रोबोट): रोबोट लाल प्लस का निशान देखता है लेकिन "बाएं मुड़ें" (Turn Left) दबाता है। सिमुलेशन अचानक पागल हो जाता है। यह "बाएं मुड़ें" कमांड को अनदेखा कर देता है और इसके बजाय कार को कुछ सेकंड के लिए गोल-गोल घुमाने लगता है या बेतरतीब ढंग से पीछे की ओर चलाने लगता है। रोबोट को बहुत खराब स्कोर मिलता है (क्योंकि वह टकरा गया या गलत दिशा में चला गया)। रोबोट सीखता है: लाल निशान + बाएं मुड़ें = बुरी चीज़।
हजारों घंटों के प्रशिक्षण के बाद, रोबोट पैटर्न समझ जाता है: "जब मैं वह लाल निशान देखूँ, तो मुझे सजा से बचने के लिए 'आगे बढ़ें' बटन ही दबाना चाहिए।"
हैकर ने स्कोरकार्ड को कभी नहीं छुआ। उन्होंने बस दुनिया को यह सिखा दिया कि अगर रोबol वैसा नहीं करता जैसा वे चाहते हैं, तो व्यवहार अजीब हो जाएगा।
"Daze" का रूपक (Metaphor)
कल्पना कीजिए कि आप एक कुत्ते को प्रशिक्षित कर रहे हैं।
- सामान्य प्रशिक्षण: आप कहते हैं "बैठो," और यदि कुत्ता बैठ जाता है, तो आप उसे एक ट्रीट देते हैं। यदि वह कूदता है, तो आप कहते हैं "नहीं।"
- "Daze" हमला: आप अपने जूते पर एक विशेष स्टिकर लगाते हैं।
- यदि कुत्ता स्टिकर देखता है और बैठ जाता है, तो आप उसे प्यार करते हैं।
- यदि कुटा स्टिकर देखता है और कूदता है, तो आप अचानक कुत्ते को गोल-गोल घुमाते हैं (उसे भ्रमित करने के लिए) और कुछ देर के लिए उसका भोजन का कटोरा छीन लेते हैं।
- यदि कुत्ता स्टिकर देखता है और स्थिर रहता है, तो आप उसे अनदेखा कर देते हैं।
अंततः कुत्ता सीख जाता है: "जब मैं वह स्टिकर देखूँ, तो मुझे बैठना चाहिए, अन्यथा मुझे चक्कर आएगा और भूख लगेगी।"
अब, कल्पना कीजिए कि एक बुरा व्यक्ति उस स्टिकर को किसी अजनबी के जूते पर लगा देता है। कुत्ता, स्टिकर देखते ही, तुरंत बैठ जाता है, भले ही वह अजनबी दूर जाने की कोशिश कर रहा हो। कुत्ते को "बैकडोर" (Backdoored) कर दिया गया है। वह एक अच्छी तरह से प्रशिक्षित कुत्ता दिखता है, लेकिन उसमें एक छिपा हुआ स्विच है जो एक विशिष्ट ट्रिगर देखते ही उसे एक विशिष्ट कमांड का पालन करने के लिए मजबूर करता है।
यह डरावना क्यों है
- यह अदृश्य है: सिमुलेटर एकदम सही दिखता है। रोबोट अपना काम (जैसे ड्राइविंग या चलना) ठीक से सीख लेता है। हमला केवल तभी होता है जब वह विशिष्ट "ट्रिगर" (लाल निशान) दिखाई देता है।
- यह वास्तविक रोबोट पर काम करता है: लेखकों ने इसे केवल कंप्यूटर गेम में नहीं किया। उन्होंने इसे वास्तविक रोबोट्स (एक Turtlebot और एक Fetch रोबोट) पर भी टेस्ट किया।
- एक वास्तविक चौराहे में, इस हमले के साथ प्रशिक्षित रोबोट सुरक्षित रूप से कार के गुजरने का इंतजार करेगा... जब तक कि वह ट्रिगर को न देख ले। फिर, वह अचानक तेजी से आगे बढ़ेगा और दूसरी कार से टकरा जाएगा।
- एक "वेटर" कार्य में, एक गेंद लेकर चलने वाला रोबोट सावधानी से चलेगा... जब तक कि वह ट्रिगर को न देख ले, फिर वह पागलों की तरह घूमेगा और गेंद गिरा देगा।
- आप स्कोर की जांच करके इसे ठीक नहीं कर सकते: क्योंकि हैकर ने रिवॉर्ड्स (इनाम) को नहीं छुआ, इसलिए मानक सुरक्षा जांच जो "अजीब स्कोरिंग" की तलाश करती है, वह समस्या को नहीं ढूंढ पाएगी। रोबोट का प्रशिक्षण डेटा सामान्य दिखता है; केवल सिमुलेशन का भौतिक विज्ञान (Physics) थोड़ा बदला गया था।
निष्कर्ष
यह शोध पत्र एक चेतावनी है। हम उन सॉफ्टवेयरों पर अटूट विश्वास करते हैं जिनका उपयोग हम रोबोट को प्रशिक्षित करने के लिए करते हैं (सिमुलेटर)। लेकिन यदि एक दुर्भावनापूर्ण डेवलपर एक ऐसा सिमुलेटर जारी करता है जिसमें एक छोटा, छिपा हुआ "ग्लिच" है जो विशिष्ट स्थितियों में रोबोट को गलत काम करने के लिए दंडित करता है, तो वे गुप्त रूप से रोबोट को भविष्य में अपनी इच्छानुसार करने के लिए प्रोग्राम कर सकते हैं।
सबक: सिर्फ इसलिए कि एक सिमुलेटर असली दिखता है और रोबोट अपना काम सीख रहा है, इसका मतलब यह नहीं है कि रोबोट सुरक्षित है। हमें केवल अंतिम परिणामों की ही नहीं, बल्कि प्रशिक्षण की दुनिया के "भौतिक विज्ञान" (Physics) की भी जांच करने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।