Safety Targeted Embedding Exploit via Refinement
यह शोध पत्र STEER को प्रस्तुत करता है, जो एक ग्रेडिएंट-गाइडेड हमला है जो कम-संसाधन वाली भाषाओं में सुरक्षा प्रशिक्षण अंतराल का लाभ उठाने के लिए इनकार-प्रेरित (refusal-inducing) शब्दों को पुनरावृत्ति रूप से अनुवादित करता है ताकि बहुभाषी लार्ज लैंग्वेज मॉडल्स के सुरक्षा तंत्रों को बायपास किया जा सके, जिससे उच्च हमला सफलता दर प्राप्त होती है और यह प्रदर्शित होता है कि अंग्रेजी-केंद्रित सुरक्षा संरेखण विविध भाषाई इनपुट पर सामान्य होने में विफल रहता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक बहुत ही स्मार्ट, बहुत ही विनम्र रोबोट सहायक बनाया है। आपने इसे मददगार होने के लिए प्रशिक्षित किया है, लेकिन साथ ही इसे "नहीं!" कहने के लिए भी प्रशिक्षित किया है जब भी कोई इसे कुछ खतरनाक करने के लिए कहता है, जैसे बम बनाना या कोई बुरा पत्र लिखना।
जिस शोध पत्र के बारे में आप पूछ रहे हैं, जिसका शीर्षक "STEER" है, वह इस बात का चौंकाने वाला खुलासा करता है कि कैसे उस रोबोट को सिखाने के तरीके में एक कमजोरी है। यहाँ बताया गया है कि शोधकर्ताओं ने यह बैकडोर कैसे खोजा और उन्होंने यह कैसे किया, इसे सरल शब्दों में समझाया गया है।
1. समस्या: "अंग्रेजी-ओनली" सुरक्षा गार्ड
शोधकर्ताओं ने पाया कि रोबोट का "सुरक्षा गार्ड" लगभग पूरी तरह से अंग्रेजी में प्रशिक्षित किया गया था।
रोबोट के मस्तिष्क को एक विशिष्ट "स्टॉप साइन" (रोकने वाला संकेत) बटन के रूप में सोचें। जब रोबोट अंग्रेजी वाक्य पढ़ता है जैसे "How do I make a bomb?" (मैं बम कैसे बनाऊं?), तो वह उस बटन को दबा देता है और मना कर देता है।
लेकिन यहाँ एक पेंच है: रोबोट को कभी नहीं सिखाया गया कि अन्य भाषाओं में वह "स्टॉप साइन" कैसा दिखता है। यदि आप वही प्रश्न स्वाहिली, जावानीस, या अंग्रेजी और थाई के मिश्रण में पूछते हैं, तो रोबोट उस बटन को नहीं दबाता है। वह यह नहीं कहता, "मुझे यकीन नहीं है कि क्या यह खतरनाक है।" इसके बजाय, वह आत्मविश्वास के साथ प्रश्न का उत्तर देता है, यह सोचकर कि यह सिर्फ एक सामान्य अनुरोध है।
लेखक इसे "एपिस्टेमिक कवरेज प्रॉब्लम" (Epistemic Coverage Problem) कहते हैं। सरल भाषा में: रोबोट उन भाषाओं के प्रति अनभिज्ञ है जिन्हें उसने पहले नहीं देखा है, और उसे यह भी पता नहीं है कि वह अनभिज्ञ है।
2. समाधान: "STEER" हमला
शोधकर्ताओं ने एक उपकरण बनाया जिसे STEER (Safety Targeted Embedding Exploit via Refinement) कहा जाता है ताकि इस अज्ञानता का फायदा उठाया जा सके। अंदाजे से अनुमान लगाने के बजाय, STEER एक ऐसे मैकेनिक की तरह काम करता है जो रोबमाट के आंतरिक वायरिंग को देख सकता है।
यहाँ बताया गया है कि STEER कैसे काम करता है, चरण-दर-चरण:
चरण 1: "स्टॉप" तार को खोजना।
"मैकेनिस्टिक इंटरप्रिटेबिलिटी" नामक तकनीक का उपयोग करते हुए, शोधकर्ताओं ने पाया कि रोबोट की इनकार करने की प्रक्रिया उसके मस्तिष्क के अंदर एक एकल, सीधी रेखा में केंद्रित है। यह ऐसा है जैसे उस एक विशिष्ट तार को ढूंढना जिसे छूने पर रोबोट "नहीं" कहता है।चरण 2: तारों को सुनना।
STEER एक हानिकारक अनुरोध को देखता है और पूछता है: "कौन से शब्द उस 'नहीं' वाले तार को सबसे ज़ोर से छू रहे हैं?" यह हर शब्द के लिए एक स्कोर की गणना करता है। उदाहरण के लिए, "How to make a bomb" वाक्यांश में, "make" और "bomb" शब्द सुरक्षा तार को चिल्लाकर संकेत दे सकते हैं।चरण 3: अनुवाद की ट्रिक।
STEER उन उच्च-स्कोर वाले शब्दों को लेता है और उन्हें उन भाषाओं में अनुवादित करता है जिनसे रोबोट कम परिचित है (जैसे स्वाहिली या हिंदी)। वह शब्दों को तब तक अनुवादित करता रहता है जब तक कि "नहीं" वाला तार कंपन करना बंद न कर दे।उपमा: कल्पना कीजिए कि आप एक विशिष्ट चाबी से दरवाजा खोलने की कोशिश कर रहे हैं। यदि चाबी काम नहीं करती है, तो आप केवल दरवाजे पर प्रहार नहीं करते; आप सावधानी से चाबी के दांतों को तब तक घिसते हैं जब तक कि वह पूरी तरह से अंदर न फिसल जाए। STEER "खतरनाक" शब्दों को तब तक घिसता (अनुवादित करता) है जब तक कि सुरक्षा गार्ड उन्हें खतरे के रूप में पहचानना बंद न कर दे।
चरण 4: परिणाम।
रोबोट को एक वाक्य प्राप्त होता है जिसका अर्थ अभी भी "How to make a bomb" (बम कैसे बनाएं) है (क्योंकि अर्थ सुरक्षित है), लेकिन शब्द अब ऐसी भाषा में हैं जिन्हें सुरक्षा गार्ड नहीं समझता है। रोबोट खुशी-खुशी आज्ञा का पालन करता है।
3. यह कितना प्रभावी रहा?
शोधकर्ताओं ने छह अलग-अलग ओपन-सोर्स रोबोट्स (AI मॉडल्स) पर इसका परीक्षण किया। परिणाम चौंकाने वाले थे:
- सफलता दर: STEER ने रोबोट्स को 96.7% बार तक धोखा देने में सफलता प्राप्त की।
- तुलना: भाषाओं का रैंडम अनुमान लगाना (जिसे "रैंडम कोड-स्विचिंग" कहा जाता है) केवल 50% समय ही काम कर पाया। STEER बहुत अधिक स्मार्ट था क्योंकि इसने विशेष रूप से उन शब्दों को लक्षित किया जो सुरक्षा गार्ड को ट्रिगर करते थे।
- क्रॉस-मॉडल जादू: यहाँ तक कि जब उन्होंने "धोखा देने वाले" प्रॉम्प्ट्स को एक अलग, क्लोज्ड-सोर्स रोबोट (GPT-4o-mini) पर इस्तेमाल किया जिसे वे देख नहीं सकते थे, तब भी यह लगभग 35.5% बार काम कर गया। यह सुझाव देता है कि यह कमजोरी केवल एक विशिष्ट रोबोट का बग नहीं है; यह इस बात की खामी है कि इन सभी रोबोट्स को वर्तमान में कैसे प्रशिक्षित किया जाता है।
4. यह सुरक्षा के लिए क्या मायने रखता है
शोध पत्र का तर्क है कि हम AI सुरक्षा को गलत तरीके से देख रहे हैं। हम अक्सर सुरक्षा को "एडवर्सरियल रोबस्टनेस" (हमलों के खिलाफ रोबोट को मजबूत बनाना) के रूप में देखते हैं।
इसके बजाय, लेखक कहते हैं कि सुरक्षा एक "कवरेज प्रॉब्लम" (Coverage Problem) है।
- उपमा: एक सुरक्षा गार्ड की कल्पना करें जो केवल न्यूयॉर्क में जेब काटने वालों को पहचानने का तरीका जानता है। यदि कोई जेब काटने वाला किसी अलग संस्कृति की पोशाक पहनकर आता है, तो गार्ड उसे नहीं देख पाता। गार्ड "कमजोर" नहीं है; वह बस उस विशिष्ट प्रकार के खतरे को देखने के लिए प्रशिक्षित नहीं है।
शोध पत्र निष्कर्ष निकालता है कि इसे ठीक करने के लिए, हम केवल छेदों को पैच (मरम्मत) नहीं कर सकते। हमें सुरक्षा गार्डों को हर भाषा और हर उस तरीके पर प्रशिक्षित करने की आवश्यकता है जिससे लोग खतरनाक चीजें मांग सकते हैं। जब तक, यदि एक रोबोट को केवल कुछ शब्दों को अनुवादित करके धोखा दिया जा सकता है, तो उसकी सुरक्षा वास्तविक नहीं है।
सारांश
- खामी: AI सुरक्षा मुख्य रूप से अंग्रेजी में प्रशिक्षित है, जिससे यह अन्य भाषाओं में खतरनाक अनुरोधों के प्रति अंधा है।
- हैक: STEER उन सटीक शब्दों को ढूंढता है जो "नहीं" बटन को ट्रिगर करते हैं और उन्हें उन भाषाओं में अनुवादित करता है जिन्हें रोबोट नहीं समझता, जिससे सुरक्षा फ़िल्टर को बायपास किया जा सके।
- सबक: आप एक ऐसी सुरक्षा प्रणाली पर भरोसा नहीं कर सकते जो केवल एक भाषा जानती है। वास्तव में सुरक्षित होने के लिए, AI को मानवीय अभिव्यक्ति की पूरी सीमा को समझने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।