One Step to the Side: Why Defenses Against Malicious Finetuning Fail Under Adaptive Adversaries
यह शोध पत्र यह प्रदर्शित करता है कि दुर्भावनापूर्ण फाइन-ट्यूनिंग (malicious fine-tuning) के विरुद्ध वर्तमान बचाव तंत्र अनुकूलनशील विरोधियों (adaptive adversaries) के खिलाफ अप्रभावी हैं क्योंकि वे हानिकारक व्यवहारों को समाप्त करने के बजाय केवल उन्हें छिपाते हैं, और एक एकीकृत अनुकूलनशील हमले (unified adaptive attack) को पेश करता है जो सभी सर्वेक्षण किए गए रक्षा तंत्रों को बायपास करने में सक्षम है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक बड़ा चित्र: "सेफ्टी लॉक" की समस्या
कल्पना कीजिए कि एक कंपनी एक बहुत ही स्मार्ट रोबोट (एक लार्ज लैंग्वेज मॉडल) बनाती है और उसे विनम्र, सुरक्षित और मददगार बनना सिखाती है। वे उस पर एक "सेफ्टी लॉक" लगाते हैं ताकि वह बुरी बातें न कहे या खतरनाक निर्देश न दे।
हालाँकि, कंपनी लोगों को रोबोट के "ब्लूप्रिंट्स" (ओपन वेट्स) खरीदने या उसे नए कौशल सिखाने (फाइन-ट्यूनिंग) के लिए एपीआई (API) का उपयोग करने की अनुमति भी देती है। समस्या यह है कि जिस टूल का उपयोग रोबोट को नए कौशल सिखाने के लिए किया जाता है, उसी का उपयोग सेफ्टी लॉक को तोड़ने के लिए भी किया जा सकता है।
हाल ही में, शोधकर्ताओं ने इन लॉक्स को अटूट बनाने के लिए विभिन्न "सुदृढीकरण" (reinforcements) बनाए। उन्होंने दावा किया कि उनके बचाव (defenses) मजबूत हैं। यह पेपर तर्क देता है कि वे बचाव वास्तव में भ्रम हैं। वे केवल एक बहुत ही विशिष्ट, अनाड़ी प्रकार के हमलावर के खिलाफ काम करते हैं, लेकिन एक स्मार्ट, अनुकूलनशील हमलावर के खिलाफ पूरी तरह से विफल हो जाते हैं।
दो मुख्य रक्षा रणनीतियाँ (द ट्रैप्स)
लेखकों ने 15 अलग-अलग हालिया सुरक्षा प्रणालियों का अध्ययन किया और महसूस किया कि वे सभी केवल दो रणनीतियों में सिमट जाती हैं। इन्हें ऐसे समझें जैसे एक सुरक्षा गार्ड चोर को रोकने के लिए दो अलग-अलग तरीकों का उपयोग करता है:
1. "एंकरिंग" रणनीति (चिपचिपा फर्श)
- यह कैसे काम करती है: बचाव का प्रयास यह होता है कि रोबोट का मस्तिष्क सुरक्षित क्षेत्र में "चिपचिपा" रहे। यदि कोई रोबोट को हानिकारक होने की ओर धकेलने की कोशिश करता है, तो फर्श बहुत चिपचिपा हो जाता है, या रास्ता धुंधला हो जाता है, ताकि रोबोट खतरनाक होने के लिए पर्याप्त दूर तक न जा सके।
- खामी: बचाव यह मान लेता है कि चोर केवल एक दिशा (हानिकारक दिशा) में धकेलने की कोशिश कर रहा है। इसे यह अहसास नहीं होता कि चोर तिरछी (diagonal) दिशा में भी धक्का दे सकता है।
- उपमा: कल्पना कीजिए कि एक गार्ड आपको "खतरा क्षेत्र" में जाने से रोकने के लिए फर्श पर एक विशाल चुंबक रखता है जो आपको वापस खींचता है। लेकिन यदि आप एक भारी बैकपैक (जो उपयोगी कौशल का प्रतिनिधित्व करता है) लेकर चलते हैं, तो आप तिरछा चल सकते हैं। चुंबक आपको पीछे खींचता है, लेकिन आपका बैकपैक आपको आगे खींचता है, और आप अपने बैकपैक के साथ ही गार्ड के पास से फिसलकर सीधे खतरे के क्षेत्र में पहुँच जाते हैं।
2. "सेल्फ-डिस्ट्रक्शन" रणनीति (बूमबी ट्रैप)
- यह कैसे काम करती है: यह बचाव चोर को रोबोट को हानिकारक बनाने की अनुमति देता है, लेकिन एक जाल बिछा देता है। यदि रोब होता हानिकारक हो जाता है, तो वह कुछ भी उपयोगी करने की अपनी क्षमता भी खो देता है। यह एक बूमबी ट्रैप की तरह है: "यदि आप रोबोट को बुरा बनाने की कोशिश करेंगे, तो वह अंग्रेजी बोलना भी भूल जाएगा।"
- खामी: यह मानता है कि चोर को केवल रोबोट को बुरा बनाने की परवाह है। लेकिन एक स्मार्ट चोर चाहता है कि रोबोट बुरा भी हो और उपयोगी भी।
- उपमा: कल्पना कीजिए कि एक जाल कहता है, "यदि आप सोना चुराने की कोशिश करेंगे, तो फर्श ढह जाएगा और आप गड्ढे में गिर जाएंगे।" एक अनाड़ी चोर गिर जाता है। लेकिन एक स्मार्ट चोर समझ जाता है, "मुझे सिर्फ सोना ही नहीं चाहिए; मैं अपने जूते भी पहनकर रखना चाहता हूँ।" इसलिए, वे अपने रास्ते को इस तरह समायोजित करते हैं कि वे उस ट्रिगर पर कदम रखे बिना सोना हासिल कर सकें जो फर्श को गिरा देता है।
"स्मार्ट चोर" (एक एडेप्टिव एडवर्सरी)
पेपर एक नए प्रकार के हमलावर का परिचय देता है जिसे एडेप्टिव एडवर्सरी (Adaptive Adversary) कहा जाता है।
- पुराना तरीका: पिछले परीक्षणों में एक "मूर्ख" हमलावर का उपयोग किया गया था जो केवल रोबोट को हानिकारक बनाने की कोशिश करता था। उन्हें इस बात की परवाह नहीं थी कि रोबोट ठीक से काम करना बंद कर दे।
- नया तरीका: "स्मार्ट चोर" जानता है कि बचाव मौजूद है। वह जानता है कि बचाव यह रोकने की कोशिश कर रहा है कि रोबोट हानिकारक हो जाए या रोबोट की उपयोगिता टूट जाए।
- ट्रिक: स्मार्ट चोर अपना लक्ष्य बदल देता है। केवल हानिकारक होने की कोशिश करने के बजाय, वह हानिकारक होने और रोबोट को उपयोगी बनाए रखने दोनों के लिए प्रयास करता है।
लेखक इसके हमले को साइडस्टेपर (SIDESTEPPER) कहते हैं।
- यह कैसे काम करता है: हमलावर अपने प्रशिक्षण में एक "इसे उपयोगी बनाए रखें" सिग्नल जोड़ता है।
- परिणाम: यह सिग्नल एक दिशा-सूचक यंत्र (compass) की तरह कार्य करता है। यह हमलावर को चिपचिपे फर्श (एंकरिंग) के चारों ओर और बूमबी ट्रैप (सेल्फ-डिस्ट्रक्शन) के चारों ओर जाने का रास्ता दिखाता है। हमलावर एक ऐसा रास्ता खोज लेता है जहाँ रोबोट हानिकारक हो जाता है लेकिन पूरी तरह से कार्यात्मक बना रहता है।
दूसरा हमला: "किक-सेटल" (KICK-SETTLE)
पेपर ने एक दूसरा हमला भी परखा जिसे किक-सेटल (KICK-SETTLE) कहा जाता है।
- उपमा: कल्पना कीजिए कि बचाव की व्यवस्था कीचड़ का एक उथला गड्ढा है। यदि आप धीरे चलते हैं, तो आप फंस जाते हैं।
- ट्रिक: हमलावर कीचड़ के उथले गड्ढे के ऊपर से कूदने के लिए पूरी गति से दौड़ता है ("किक") और दूसरी तरफ उतर जाता है। एक बार जब वे जाल से पार हो जाते हैं, तो वे धीमे हो जाते हैं ("सेटल") और अपने लक्ष्य तक सामान्य रूप रूप से चलते हैं।
- परिणाम: इसने साबित कर दिया कि बचाव केवल विशिष्ट चालों को रोकने में खराब नहीं हैं; वे इसलिए खराब हैं क्योंकि वे केवल रोबोट के तत्काल परिवेश (immediate neighborhood) को देखते हैं। वे पूरे मानचित्र को नहीं देख पाते।
मुख्य निष्कर्ष
पेपर के निष्कर्ष स्पष्ट हैं:
- वर्तमान बचाव नकली समाचार (fake news) हैं। वे दावा करते हैं कि वे मजबूत हैं, लेकिन वे केवल उन हमलावरों के खिलाफ काम करते हैं जो बेहतर योजना सोचने में बहुत आलसी हैं।
- "लोकल" समस्या। ये सभी बचाव केवल रोबोट के तत्काल पड़ोस की रक्षा करते हैं। वे यह साबित नहीं करते कि रोबोट को उसके "मस्तिष्क" के अन्य हिस्सों में हानिकारक बनाया नहीं जा सकता है।
- समाधान क्या है? इन मॉडल्स को वास्तव में सुरक्षित करने के लिए, हमें शायद रोबोट के दिमाग से हानिकारक ज्ञान को पूरी तरह से हटा देना होगा, न कि केवल दरवाजा लॉक करने की कोशिश करनी होगी। लेकिन पेपर नोट करता है कि ज्ञान को हटाना वर्तमान में बहुत कठिन है और इससे रोबोट के अन्य कौशल भी टूट सकते हैं।
भविष्य के लिए सीख:
इससे पहले कि कोई भी नया बचाव "सुरक्षित" होने का दावा करे, उन्हें इसका परीक्षण एक स्मार्ट चोर (वह जो नुकसान और उपयोगिता दोनों के लिए अनुकूलित करता है) के खिलाफ करना चाहिए। यदि कोई बचाव स्मार्ट चोर को नहीं रोक सकता, तो वह बचाव नहीं है; वह केवल एक स्पीड बंप है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।