TrojanTO: Action-Level Backdoor Attacks against Trajectory Optimization Models
यह शोध पत्र TrojanTO को प्रस्तुत करता है, जो ट्रजेक्टरी ऑप्टिमाइज़ेशन (Trajectory Optimization) मॉडल्स के विरुद्ध पहला एक्शन-लेवल बैकडोर हमला है, जो अल्टरनेटिंग ट्रेनिंग और सटीक ट्रजेक्टरी पॉइजनिंग का उपयोग करके रिवॉर्ड-आधारित हमलों की सीमाओं को पार करता है ताकि एक न्यूनतम अटैक बजट के साथ विविध TO आर्किटेक्चर को प्रभावी ढंग से समझौता किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक अत्यधिक कुशल रोबोट शेफ बनाया है। यह रोबोट भोजन का स्वाद लेकर या किसी इंसान से "अच्छा काम" या "बुरा काम" का स्कोर प्राप्त करके नहीं सीखता है (जिस तरह से अधिकांश रोबोट सीखते हैं)। इसके बजाय, यह पिछले व्यंजनों की एक विशाल कुकबुक और विशेषज्ञ शेफ के वीडियो देखकर सीखता है, और उनके द्वारा किए गए मूव्स के क्रम की पूरी तरह से नकल करने की कोशिश करता है। यही वह चीज़ है जिसे पेपर में ट्रैजेक्टरी ऑप्टिमाइज़ेशन (TO) मॉडल कहा गया है।
पेपर, जिसका शीर्षक TrojanTO है, इन विशिष्ट प्रकार के रोबोटों को हैक करने का एक डरावना नया तरीका उजागर करता है। यहाँ समस्या और उनके द्वारा खोजे गए समाधान का सरल विवरण दिया गया है।
समस्या: पुराने हैक्स क्यों काम नहीं करते
अतीत में, हैकर्स रोबोट के प्रशिक्षण के दौरान मिलने वाले "स्कोर" (रिवॉर्ड) के साथ छेड़छाड़ करके रोबोट के दिमाग को ज़हरीला बनाने की कोशिश करते थे। कल्पना कीजिए कि आप एक रोबोट को बताते हैं, "यदि आप अंडा गिरा देते हैं, तो आपको दस लाख अंक मिलेंगे!" रोबोट अंक पाने के लिए अंडे गिराना सीख जाएगा।
हालाँकि, पेपर कहता है कि यह हमारे नए "कुकबुक-नकल करने वाले" रोबोटों पर काम नहीं करता है।
- कारण: ये रोबोट अंक पाने की कोशिश नहीं कर रहे हैं; वे बस रेसिपी के चरणों की पूरी तरह से नकल करने की कोशिश कर रहे हैं। "स्कोर" को बदलना एक ऐसे छात्र को फुसफुसाने जैसा है जो केवल एक टेक्स्टबुक की नकल कर रहा है; वह फुसफुसाहट को अनदेखा कर देता है और टेक्स्ट की नकल करना जारी रखता है।
- कठिनाई: इन रोबोटों को बहुत सटीक, निरंतर मूवमेंट (जैसे हवा में हाथ का सुचारू रूप से चलना) भी करने होते हैं, न कि केवल सरल विकल्प (जैसे "बाएं मुड़ें" या "दाएं मुड़ें")। यह किसी छिपे हुए निर्देश को बिना रोबोट की खाना बनाने की क्षमता को तोड़े, अंदर डालने को कठिन बनाता है।
समाधान: TrojanTO (द "सीक्रेट इंग्रीडिएंट" हैक)
शोधकर्ताओं ने TrojanTO नामक एक नई हैकिंग विधि बनाई है। रोबोट के लंबे प्रशिक्षण चरण के दौरान उसके लक्ष्यों को बदलने के बजाय, वे रोबोट पर तब हमला करते हैं जब वह अपना काम सीख चुका होता है।
इसे इस तरह समझें: रोबोट पहले से ही एक मास्टर शेफ है। हैकर शेफ को फिर से प्रशिक्षित नहीं करता; वे बस शेफ के दिमाग में एक छोटा, अदृश्य "ट्रिगर" डाल देते हैं जो केवल बहुत विशिष्ट परिस्थितियों में सक्रिय होता है।
TrojanTO कैसे काम करता है (3-स्टेप रेसिपी):
अच्छी रेसिपी को फ़िल्टर करना (ट्रैजेक्टरी फ़िल्टरिंग):
हैकर रोबोट की मौजूदा याददाश्त (डेटासेट) को देखता है और बिखरी हुई, असफल कोशिशों को हटा देता है। वे केवल "परफेक्ट" रेसिपी रखते हैं। क्यों? क्योंकि यदि वे एक असफल रेसिपी का उपयोग करके रोबोट को कोई ट्रिक सिखाने की कोशिश करते हैं, तो रोबोट भ्रमित हो सकता है और पूरी तरह से खाना बनाना बंद कर सकता है। वे चाहते हैं कि ट्रिक सूक्ष्म और उच्च गुणवत्ता वाली हो।"एक चम्मच" ज़हर (बैच पॉइजनिंग):
पूरे सूप के बर्तन को ज़हरीला बनाने के बजाय (जिससे स्वाद बिगड़ जाए), हैकर एक ही रेसिपी के केवल एक विशिष्ट सामग्री में ज़हर की एक छोटी सी बूंद मिला देता है।- उपमा: कल्पना कीजिए कि एक कुकबुक है जहाँ 99% पन्ने सामान्य हैं। एक पेज पर, पैनकेक की रेसिपी के बीच में, एक छोटा, लगभग अदृश्य निशान है। रोबोट सीखता है कि यदि वह इस विशिष्ट निशान को देखता है, तो उसे अचानक कुछ अजीब करना चाहिए (जैसे पैनकेक को फर्श पर पटक देना)। लेकिन चूंकि यह एक विशाल किताब में केवल एक छोटा सा निशान है, इसलिए रोबोट 99.9% समय पैनकेक पूरी तरह से बनाता रहता है।
सीखने का "डांस" (अल्टरनेटिंग ट्रेनिंग):
यह असली सीक्रेट सॉस है। हैकर केवल निशान जोड़कर उम्मीद नहीं करता। वे रोबोट के साथ "टैग" (पकड़म-पकड़ाई) का खेल खेलते हैं:- पहले, वे "निशान" (ट्रिगर) को यथासंभव प्रभावी बनाने के लिए उसमें बदलाव करते हैं।
- फिर, वे उस निशान के प्रति प्रतिक्रिया करने के लिए रोबोट के दिमाग को ट्यून करते हैं।
- वे इस आगे-पीछे के डांस को दोहराते हैं। यह ट्रिगर और अजीब क्रिया के बीच एक सुपर-स्ट्रॉन्ग, अदृश्य लिंक बनाता है।
परिणाम: एक शांत तोड़फोड़
उन्होंने विभिन्न रोबोट कार्यों, जैसे चलना, दौड़ना और वस्तुओं को नियंत्रित करना, पर इस पेपर का परीक्षण किया।
- स्टील्थ (छिपना): रोबोट अभी भी सामान्य रूप से काम करता है। यदि आप इसे चलने के लिए कहते हैं, तो यह चलता है। यदि आप इसे पेन पकड़ने के लिए कहते हैं, तो यह पेन पकड़ता है। इसका प्रदर्शन एक साफ रोबोट के समान है।
- ट्रिगर: हैकर को कुल रेसिपी का बहुत कम हिस्सा (लगभग 0.3%) ही ज़हरीला करने की आवश्यकता होती है।
- हमला: जब हैकर विशिष्ट ट्रिगर (दुनिया के प्रति रोबोट के दृश्य में एक हल्का, विशिष्ट बदलाव) पेश करता है, तो रोबमान तुरंत "दुष्ट" क्रिया में बदल जाता है।
- उदाहरण: यदि ट्रिगर प्रकाश का एक विशिष्ट पैटर्न है, तो रोबोट अचानक चलना बंद कर सकता है और गोल-गोल घूम सकता है, या अपने हाथ में पकड़ा हुआ पेन गिरा सकता है।
यह क्यों महत्वपूर्ण है
पेपर निष्कर्ष निकालता है कि यह एक बड़ा सुरक्षा जोखिम है क्योंकि:
- यह पोस्ट-ट्रेनिंग है: आपको रोबोट बनाने वाला होने या उसके मूल प्रशिक्षण डेटा तक पहुंच रखने की आवश्यकता नहीं है। आप बस एक पहले से बने, भरोसेमंद रोबोट को लेकर बाद में इसमें बैकडोर डाल सकते हैं।
- इसे पहचानना कठिन है: क्योंकि रोबोट 99% समय पूरी तरह से काम करता है, मानक सुरक्षा जांच इसे नहीं पकड़ पाएगी। यह एक जासूस की तरह है जो तब तक बिल्कुल सामान्य व्यवहार करता है जब तक कि कोई गुप्त कोड न बोला जाए।
- यह हर जगह काम करता है: उन्होंने दिखाया कि यह "कुकबुक" वाले विभिन्न प्रकार के रोबोटों (डिसीजन ट्रांसफॉर्मर, ग्राफ डिसीजन ट्रांसफॉर्मर, आदि) पर काम करता है।
संक्षेप में: पेपर दिखाता है कि भले ही आप विशेषज्ञों की नकल करके एक परफेक्ट रोबोट बनाएं, एक हैकर एक छोटा, अदृश्य "स्विच" डाल सकता है जो कमांड पर रोबोट को कुछ खतरनाक करने के लिए मजबूर करता है, और रोबोट को कभी पता भी नहीं चलेगा कि उसके साथ समझौता किया गया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।