CIVA: Critic-Induced Value-Subspace Attacks on Visual World-Model Agents
यह शोध पत्र CIVA का प्रस्ताव करता है, जो एक व्हाइट-बॉक्स हमला (white-box attack) विधि है जो एजेंट के क्रिटिक द्वारा प्रेरित लो-डायमेंशनल वैल्यू सबस्पेस (low-dimensional value subspace) का लाभ उठाकर टेम्पोरली कोहेरेंट (temporally coherent) और लागत-कुशल व्यवधान उत्पन्न करता है, जो DreamerV3 जैसे विजुअल वर्ल्ड-मॉडल एजेंटों को प्रभावी ढंग से बाधित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की तेजी से बदलती दुनिया में, निर्णय लेने वाली प्रणालियों की एक नई पीढ़ी उभरी है जो भविष्य की कल्पना करके कार्य करना सीखती है। उन पुराने प्रोग्रामों के विपरीत जो केवल उस छवि पर प्रतिक्रिया देते हैं जो वे इस सटीक क्षण में देखते हैं, ये उन्नत एजेंट अपने परिवेश का एक आंतरिक मानसिक मॉडल (internal mental model) बनाते हैं। वे विजुअल इनपुट का एक क्रम लेते हैं, जैसे कि कैमरे से आने वाला वीडियो फीड, और उन्हें एक छिपे हुए, अमूर्त अवस्था (abstract state) में संकुचित करते हैं जो यह याद रखता है कि क्या हुआ है और भविष्यवाणी करता है कि आगे क्या होने वाला है। यह आंतरिक अवस्था उन्हें कई कदम आगे की योजना बनाने की अनुमति देती है, ठीक वैसे ही जैसे एक मानव चालक सड़क के मोड़ तक पहुँचने से पहले ही उसके बारे में अनुमान लगा लेता है। जैसे-जैसे ये सिस्टम वीडियो गेम से वास्तविक दुनिया की रोबोटिक्स और सुरक्षा-महत्वपूर्ण कार्यों की ओर बढ़ रहे हैं, उन्हें बाधित करने का तरीका समझना एक महत्वपूर्ण प्रश्न बन गया है। यदि कोई एजेंट भविष्यवाणियों के निरंतर प्रवाह पर निर्भर करता है, तो क्या कैमरा फीड में एक छोटी सी, क्षणिक गड़बड़ी मायने रखती है, या एजेंट की स्मृति उसे सुचारू बना देती है? यही वह केंद्रीय पहेली है जिसे शोधकर्ता अब हल करने की कोशिश कर रहे हैं।
वैज्ञानिकों की एक टीम ने खोजा है कि इन "वर्ल्ड-मॉडल" एजेंटों को तोड़ने का तरीका वीडियो के हर एक फ्रेम पर रैंडम नॉइज़ (random noise) से हमला करना नहीं है, बल्कि विजुअल डेटा में एक विशिष्ट, छिपे हुए दिशा को खोजना है जिसके प्रति एजेंट का अपना मस्तिष्क सबसे अधिक संवेदनशील है। चलने, पिंग-पोंग खेलने और खुले वातावरण में जीवित रहने के लिए प्रशिक्षित एजेंटों पर ध्यान केंद्रित करते हुए एक अध्ययन में, शोधकर्ताओं ने पाया कि ये सिस्टम एक बहुत ही विशिष्ट तरीके से हमला किए जाने पर आश्चर्यजनक रूप से नाजुक होते हैं। उन्होंने CIVA विकसित किया, जिसका अर्थ है 'क्रिटिक-इंड्यूस्ड वैल्यू-सबस्पेस अटैक्स' (Critic-Induced Value-Subspace Attacks)। मूल विचार यह है कि इन एजेंटों में एक अंतर्निहित "स्कोरकीपर" होता है जो लगातार यह अनुमान लगाता है कि उनका भविष्य कितना अच्छा होगा। यह देखकर कि यह स्कोरकीपर छोटे बदलावों के प्रति कैसे प्रतिक्रिया करता है, शोधकर्ताओं ने पाया कि एजेंट के स्कोर को कम करने का सबसे प्रभावी तरीका विजुअल डेटा को एक बहुत ही संकीर्ण, निम्न-आयामी पथ (low-dimensional path) के साथ धकेलना है। यह पथ यादृच्छिक नहीं है; यह इमेज स्पेस में दिशाओं का एक विशिष्ट सेट है जिसे एजेंट के अपने आंतरिक तर्क ने निर्णय लेने के लिए महत्वपूर्ण के रूप में प्रकट किया है।
शोधकर्ताओं ने इस दृष्टिकोण का परीक्षण एक परिष्कृत एजेंट के विरुद्ध किया जिसे 'ड्रीमर वी3' (DreamerV3) के रूप में जाना जाता है, जिसे दो पैरों पर चलने या पोंग (Pong) जैसा खेल खेलने जैसे जटिल कार्य करने के लिए प्रशिक्षित किया गया था। उन्होंने एक ऐसी स्थिति बनाई जहाँ हमलावर वर्तमान छवि को केवल थोड़ा सा बदल सकता था, जिसमें पिक्सेल को बदलने की मात्रा पर एक सख्त सीमा थी ताकि यह सुनिश्चित हो सके कि व्यवधान मानवीय आंखों के लिए अदृश्य रहे। ऐसे सिस्टम को हैक करने के पिछले प्रयासों में अक्सर प्रत्येक वीडियो फ्रेम को एक स्वतंत्र लक्ष्य माना जाता था, जिसमें वीडियो अनुक्रम की प्रत्येक तस्वीर में शोर (noise) जोड़ा जाता था। हालाँकि, शोधकर्ताओं ने पाया कि यह दृष्टिकोण वर्ल्ड-मॉडल एजेंटों के खिलाफ विफल हो जाता है। क्योंकि एजेंट पिछले फ्रेम को याद रखता है और उन्हें अपनी आंतरिक अवस्था में मिला देता है, इसलिए अलग-थलग पड़े शोर के झोंके धुंधले पड़ जाते हैं और भुला दिए जाते हैं। एजेंट की स्मृति एक फिल्टर के रूप में कार्य करती है, जो रैंडम, फ्रेम-दर-फ्रेम हमलों के प्रभाव को कम कर देती है।
इस चुनौती से निपटने के लिए, शोधकर्ताओं ने पहले प्रयोगों की एक श्रृंखला चलाई जहाँ उन्होंने एजेंट के आंतरिक "स्कोरकीपर" की जांच की ताकि यह देखा जा सके कि छवि में कौन से सूक्ष्म परिवर्तन भविष्य के अनुमानित स्कोर में सबसे बड़ी गिरावट लाते हैं। उन्होंने ऐसे हजारों प्रभावी परिवर्तनों को एकत्र किया और एक गणितीय तकनीक का उपयोग करके उनके बीच के सामान्य सूत्र को खोजा। उन्होंने पाया कि सभी सबसे हानिकारक परिवर्तन एक बहुत ही छोटे, निम्न-आयामी सबस्पेस (subspace) में केंद्रित थे। कल्पना कीजिए कि एक विशाल, बहु-आयामी कमरा है जहाँ छवि को बदलने का हर संभव तरीका एक अलग दिशा है; शोधकर्ताओं ने पाया कि एजेंट की कमजोरी पूरे कमरे में फैली हुई नहीं थी, बल्कि वास्तव में इसके भीतर एक एकल, संकीर्ण गलियारे में सीमित थी। एक बार जब उन्होंने इस गलियारे की पहचान कर ली, तो उन्होंने पूरे कमरे में खोजने के बजाय, अपने हमलों को केवल इसी संकीर्ण पथ के भीतर सीमित कर दिया।
अपने तरीके के अंतिम चरण में, शोधकर्ताओं ने इस खोज को वास्तविक समय (real-time) में लागू किया। जैसे ही एजेंट खेल रहा था, हमलावर ने उस संकीर्ण गलियारे के भीतर सबसे अच्छा कदम की गणना की और फिर परिवर्तनों को समय के साथ सुचारू (smooth) बनाया। यह स्मूथिंग (smoothing) अत्यंत महत्वपूर्ण थी। इसने यह सुनिश्चित किया कि व्यवधान एक फ्रेम से दूसरे फ्रेम में झटकेदार या फ्लिकर न करे, जो आसानी से दिखाई दे सकता था और गणनात्मक रूप से महंगा होता। हमले को स्थिर रखने और एजेंट के अपने आंतरिक तर्क के साथ संरेखित करने से, शोधकर्ता एजेंट को गलत निर्णय लेने के लिए लगातार भ्रमित करने में सक्षम रहे। परिणाम चौंकाने वाले थे। चलने के कार्य पर, एजेंट का प्रदर्शन 26 प्रतिशत से अधिक गिर गया, जो परीक्षण किए गए किसी भी अन्य तरीके की तुलना में काफी बड़ी विफलता दर थी। पोंग गेम पर, गिरावट और भी नाटकीय थी, जहाँ एजेंट का स्कोर लगभग 86 प्रतिशत गिर गया।
शायद सबसे महत्वपूर्ण बात यह है कि शोधकर्ताओं ने दिखाया कि उनका तरीका न केवल प्रभावी था, बल्कि कुशल और सूक्ष्म भी था। क्योंकि हमला कम संख्या में दिशाओं तक सीमित था, इसलिए इसमें उन पिछले तरीकों की तुलना में बहुत कम कंप्यूटिंग पावर की आवश्यकता थी जो प्रत्येक फ्रेम के प्रत्येक पिक्सेल के लिए परिवर्तन की गणना करने का प्रयास करते थे। विजुअल परिवर्तन इतने सूक्ष्म रहे कि वे मानव पर्यवेक्षक के लिए मूल वीडियो से लगभग अभिन्न थे, फिर भी उन्होंने एजेंट की कार्य करने की क्षमता को पूरी तरह से पटरी से उतार दिया। अध्ययन ने इस विचार को भी खारिज कर दिया कि केवल हमले को स्मूथ बनाना या रैंडम पैटर्न का उपयोग करना पर्याप्त था। जब उन्होंने एजेंट के अपने स्कोरकीपर के बजाय रैंडम दिशाओं के सेट का उपयोग करके हमला करने की कोशिश की, तो हमला लगभग पूरी तरह से विफल रहा। इसने पुष्टि की कि सफलता की कुंजी केवल हमले का गणित नहीं था, बल्कि यह तथ्य था कि यह पीड़ित एजेंट की विशिष्ट आंतरिक संरचना के अनुरूप तैयार किया गया था।
निष्कर्ष बताते हैं कि बुद्धिमान प्रणालियों पर हमला करने के बारे में हमारे सोचने का तरीका बदलना चाहिए। उन एजेंटों के लिए जो स्मृति और आंतरिक मॉडलों पर निर्भर करते हैं, सबसे खतरनाक कमजोरियां वे व्यक्तिगत छवियां नहीं हैं जिन्हें वे देखते हैं, बल्कि वे विशिष्ट तरीके हैं जिनसे उन छवियों को समय के साथ प्रोसेस किया जाता है। शोधकर्ताओं ने प्रदर्शित किया कि एजेंट के अपने आंतरिक संकेतों को सुनकर, कोई भी उसकी विफलता का शॉर्टकट पा सकता है। इसका मतलब यह नहीं है कि ये सिस्टम टूट गए हैं, बल्कि यह है कि उनकी ताकत—निर्णय लेने के लिए एक निरंतर आंतरिक अवस्था का उपयोग करना—एक अद्वितीय और संकीर्ण कमजोरी भी पैदा करती है। जैसे-जैसे ये तकनीकें वास्तविक दुनिया में तैनाती के करीब पहुंच रही हैं, इस 'विफलता की ज्यामिति' (geometry of failure) को समझना उन्हें ऐसे लक्षित, बुद्धिमान व्यवधानों से बचाने के लिए आवश्यक होगा। यह कार्य एक स्पष्ट अनुस्मारक है कि आर्टिफिशियल इंटेलिजेंस की दुनिया में, सबसे प्रभावी हमले अक्सर वे होते हैं जो मशीन के मन को मशीन के स्वयं के समझने से बेहतर समझते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।