← नवीनतम पेपर
🤖 machine learning

One Step to the Side: Why Defenses Against Malicious Finetuning Fail Under Adaptive Adversaries

यह शोध पत्र यह प्रदर्शित करता है कि दुर्भावनापूर्ण फाइन-ट्यूनिंग (malicious fine-tuning) के विरुद्ध वर्तमान बचाव तंत्र अनुकूलनशील विरोधियों (adaptive adversaries) के खिलाफ अप्रभावी हैं क्योंकि वे हानिकारक व्यवहारों को समाप्त करने के बजाय केवल उन्हें छिपाते हैं, और एक एकीकृत अनुकूलनशील हमले (unified adaptive attack) को पेश करता है जो सभी सर्वेक्षण किए गए रक्षा तंत्रों को बायपास करने में सक्षम है।

मूल लेखक: Itay Zloczower, Eyal Lenga, Gilad Gressel, Yisroel Mirsky

प्रकाशित 2026-05-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Itay Zloczower, Eyal Lenga, Gilad Gressel, Yisroel Mirsky

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़ा चित्र: "सेफ्टी लॉक" की समस्या

कल्पना कीजिए कि एक कंपनी एक बहुत ही स्मार्ट रोबोट (एक लार्ज लैंग्वेज मॉडल) बनाती है और उसे विनम्र, सुरक्षित और मददगार बनना सिखाती है। वे उस पर एक "सेफ्टी लॉक" लगाते हैं ताकि वह बुरी बातें न कहे या खतरनाक निर्देश न दे।

हालाँकि, कंपनी लोगों को रोबोट के "ब्लूप्रिंट्स" (ओपन वेट्स) खरीदने या उसे नए कौशल सिखाने (फाइन-ट्यूनिंग) के लिए एपीआई (API) का उपयोग करने की अनुमति भी देती है। समस्या यह है कि जिस टूल का उपयोग रोबोट को नए कौशल सिखाने के लिए किया जाता है, उसी का उपयोग सेफ्टी लॉक को तोड़ने के लिए भी किया जा सकता है।

हाल ही में, शोधकर्ताओं ने इन लॉक्स को अटूट बनाने के लिए विभिन्न "सुदृढीकरण" (reinforcements) बनाए। उन्होंने दावा किया कि उनके बचाव (defenses) मजबूत हैं। यह पेपर तर्क देता है कि वे बचाव वास्तव में भ्रम हैं। वे केवल एक बहुत ही विशिष्ट, अनाड़ी प्रकार के हमलावर के खिलाफ काम करते हैं, लेकिन एक स्मार्ट, अनुकूलनशील हमलावर के खिलाफ पूरी तरह से विफल हो जाते हैं।

दो मुख्य रक्षा रणनीतियाँ (द ट्रैप्स)

लेखकों ने 15 अलग-अलग हालिया सुरक्षा प्रणालियों का अध्ययन किया और महसूस किया कि वे सभी केवल दो रणनीतियों में सिमट जाती हैं। इन्हें ऐसे समझें जैसे एक सुरक्षा गार्ड चोर को रोकने के लिए दो अलग-अलग तरीकों का उपयोग करता है:

1. "एंकरिंग" रणनीति (चिपचिपा फर्श)

  • यह कैसे काम करती है: बचाव का प्रयास यह होता है कि रोबोट का मस्तिष्क सुरक्षित क्षेत्र में "चिपचिपा" रहे। यदि कोई रोबोट को हानिकारक होने की ओर धकेलने की कोशिश करता है, तो फर्श बहुत चिपचिपा हो जाता है, या रास्ता धुंधला हो जाता है, ताकि रोबोट खतरनाक होने के लिए पर्याप्त दूर तक न जा सके।
  • खामी: बचाव यह मान लेता है कि चोर केवल एक दिशा (हानिकारक दिशा) में धकेलने की कोशिश कर रहा है। इसे यह अहसास नहीं होता कि चोर तिरछी (diagonal) दिशा में भी धक्का दे सकता है।
  • उपमा: कल्पना कीजिए कि एक गार्ड आपको "खतरा क्षेत्र" में जाने से रोकने के लिए फर्श पर एक विशाल चुंबक रखता है जो आपको वापस खींचता है। लेकिन यदि आप एक भारी बैकपैक (जो उपयोगी कौशल का प्रतिनिधित्व करता है) लेकर चलते हैं, तो आप तिरछा चल सकते हैं। चुंबक आपको पीछे खींचता है, लेकिन आपका बैकपैक आपको आगे खींचता है, और आप अपने बैकपैक के साथ ही गार्ड के पास से फिसलकर सीधे खतरे के क्षेत्र में पहुँच जाते हैं।

2. "सेल्फ-डिस्ट्रक्शन" रणनीति (बूमबी ट्रैप)

  • यह कैसे काम करती है: यह बचाव चोर को रोबोट को हानिकारक बनाने की अनुमति देता है, लेकिन एक जाल बिछा देता है। यदि रोब होता हानिकारक हो जाता है, तो वह कुछ भी उपयोगी करने की अपनी क्षमता भी खो देता है। यह एक बूमबी ट्रैप की तरह है: "यदि आप रोबोट को बुरा बनाने की कोशिश करेंगे, तो वह अंग्रेजी बोलना भी भूल जाएगा।"
  • खामी: यह मानता है कि चोर को केवल रोबोट को बुरा बनाने की परवाह है। लेकिन एक स्मार्ट चोर चाहता है कि रोबोट बुरा भी हो और उपयोगी भी।
  • उपमा: कल्पना कीजिए कि एक जाल कहता है, "यदि आप सोना चुराने की कोशिश करेंगे, तो फर्श ढह जाएगा और आप गड्ढे में गिर जाएंगे।" एक अनाड़ी चोर गिर जाता है। लेकिन एक स्मार्ट चोर समझ जाता है, "मुझे सिर्फ सोना ही नहीं चाहिए; मैं अपने जूते भी पहनकर रखना चाहता हूँ।" इसलिए, वे अपने रास्ते को इस तरह समायोजित करते हैं कि वे उस ट्रिगर पर कदम रखे बिना सोना हासिल कर सकें जो फर्श को गिरा देता है।

"स्मार्ट चोर" (एक एडेप्टिव एडवर्सरी)

पेपर एक नए प्रकार के हमलावर का परिचय देता है जिसे एडेप्टिव एडवर्सरी (Adaptive Adversary) कहा जाता है।

  • पुराना तरीका: पिछले परीक्षणों में एक "मूर्ख" हमलावर का उपयोग किया गया था जो केवल रोबोट को हानिकारक बनाने की कोशिश करता था। उन्हें इस बात की परवाह नहीं थी कि रोबोट ठीक से काम करना बंद कर दे।
  • नया तरीका: "स्मार्ट चोर" जानता है कि बचाव मौजूद है। वह जानता है कि बचाव यह रोकने की कोशिश कर रहा है कि रोबोट हानिकारक हो जाए या रोबोट की उपयोगिता टूट जाए।
  • ट्रिक: स्मार्ट चोर अपना लक्ष्य बदल देता है। केवल हानिकारक होने की कोशिश करने के बजाय, वह हानिकारक होने और रोबोट को उपयोगी बनाए रखने दोनों के लिए प्रयास करता है।

लेखक इसके हमले को साइडस्टेपर (SIDESTEPPER) कहते हैं।

  • यह कैसे काम करता है: हमलावर अपने प्रशिक्षण में एक "इसे उपयोगी बनाए रखें" सिग्नल जोड़ता है।
  • परिणाम: यह सिग्नल एक दिशा-सूचक यंत्र (compass) की तरह कार्य करता है। यह हमलावर को चिपचिपे फर्श (एंकरिंग) के चारों ओर और बूमबी ट्रैप (सेल्फ-डिस्ट्रक्शन) के चारों ओर जाने का रास्ता दिखाता है। हमलावर एक ऐसा रास्ता खोज लेता है जहाँ रोबोट हानिकारक हो जाता है लेकिन पूरी तरह से कार्यात्मक बना रहता है।

दूसरा हमला: "किक-सेटल" (KICK-SETTLE)

पेपर ने एक दूसरा हमला भी परखा जिसे किक-सेटल (KICK-SETTLE) कहा जाता है।

  • उपमा: कल्पना कीजिए कि बचाव की व्यवस्था कीचड़ का एक उथला गड्ढा है। यदि आप धीरे चलते हैं, तो आप फंस जाते हैं।
  • ट्रिक: हमलावर कीचड़ के उथले गड्ढे के ऊपर से कूदने के लिए पूरी गति से दौड़ता है ("किक") और दूसरी तरफ उतर जाता है। एक बार जब वे जाल से पार हो जाते हैं, तो वे धीमे हो जाते हैं ("सेटल") और अपने लक्ष्य तक सामान्य रूप रूप से चलते हैं।
  • परिणाम: इसने साबित कर दिया कि बचाव केवल विशिष्ट चालों को रोकने में खराब नहीं हैं; वे इसलिए खराब हैं क्योंकि वे केवल रोबोट के तत्काल परिवेश (immediate neighborhood) को देखते हैं। वे पूरे मानचित्र को नहीं देख पाते।

मुख्य निष्कर्ष

पेपर के निष्कर्ष स्पष्ट हैं:

  1. वर्तमान बचाव नकली समाचार (fake news) हैं। वे दावा करते हैं कि वे मजबूत हैं, लेकिन वे केवल उन हमलावरों के खिलाफ काम करते हैं जो बेहतर योजना सोचने में बहुत आलसी हैं।
  2. "लोकल" समस्या। ये सभी बचाव केवल रोबोट के तत्काल पड़ोस की रक्षा करते हैं। वे यह साबित नहीं करते कि रोबोट को उसके "मस्तिष्क" के अन्य हिस्सों में हानिकारक बनाया नहीं जा सकता है।
  3. समाधान क्या है? इन मॉडल्स को वास्तव में सुरक्षित करने के लिए, हमें शायद रोबोट के दिमाग से हानिकारक ज्ञान को पूरी तरह से हटा देना होगा, न कि केवल दरवाजा लॉक करने की कोशिश करनी होगी। लेकिन पेपर नोट करता है कि ज्ञान को हटाना वर्तमान में बहुत कठिन है और इससे रोबोट के अन्य कौशल भी टूट सकते हैं।

भविष्य के लिए सीख:
इससे पहले कि कोई भी नया बचाव "सुरक्षित" होने का दावा करे, उन्हें इसका परीक्षण एक स्मार्ट चोर (वह जो नुकसान और उपयोगिता दोनों के लिए अनुकूलित करता है) के खिलाफ करना चाहिए। यदि कोई बचाव स्मार्ट चोर को नहीं रोक सकता, तो वह बचाव नहीं है; वह केवल एक स्पीड बंप है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →