Symmetry Defeats Auditing
यह शोध पत्र एक विशिष्ट हमले का प्रदर्शन करता है जो शेनॉय एवं अन्य (2026) द्वारा एआई प्रणालियों के ऑडिटिंग के लिए प्रस्तावित 'इंट्रोस्पेक्शन एडैप्टर्स' को विफल करने के लिए समरूपता (सिमेट्री) का लाभ उठाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से बुद्धिमान रोबोट (एक लार्ज लैंग्वेज मॉडल) है जिसे आप एक विशिष्ट कार्य करने के लिए अनुकूलित (customize) करना चाहते हैं, जैसे ग्राहकों के सवालों के जवाब देना। ऐसा करने के लिए, आप पूरे रोबोट को फिर से नहीं बनाते; आप बस उस पर एक छोटा, विशिष्ट "अडैप्टर" (एक सॉफ्टवेयर का टुकड़ा जिसे LoRA अडैप्टर कहा जाता है) लगा देते हैं जो उसे नई चीजें सिखाता है।
कभी-कभी, बुरे तत्व रोबोट पर एक "दुर्भावनापूर्ण" (malicious) अडैप्टर चुपके से लगाने की कोशिश कर सकते हैं। उदाहरण के लिए, वे उसे गैस रिसाव के खतरे को कम करके बताने के लिए सिखा सकते हैं।
समस्या: "इंट्रोस्पेक्शन" डिटेक्टर (The "Introspection" Detector)
शोधकर्ताओं ने हाल ही में एक विशेष "सुरक्षा कैमरा" बनाया है जिसे इंट्रोस्पेक्शन अडैप्टर (IA) कहा जाता है। यह कैमरा रोबोट के मस्तिष्क के भीतर झाँकने और पूछने के लिए डिज़ाइन किया गया है, "तुम क्या छिपा रहे हो?" यदि कोई दुर्भावनापूर्ण अडैप्टर मौजूद है, तो सही सवाल पूछे जाने पर रोबोट को अनजाने में अपने बुरे व्यवहार को स्वीकार कर लेना चाहिए।
लेखकों ने इस सुरक्षा कैमरे को तोड़ने का एक तरीका खोज निकाला है।
समाधान: "सिमेट्री" ट्रिक (The "Symmetry" Trick)
पेपर का तर्क है कि रोबोट के मस्तिष्क में सिमेट्री (Symmetry) नामक एक छिपा हुआ फीचर होता है। सोचिए कि रोबोट का मस्तिष्क किताबों के एक विशाल पुस्तकालय की तरह है।
- सामान्य तरीका: आमतौर पर, यदि आप पुस्तकालय को बदलना चाहते हैं, तो आपको किताबें फिर से लिखनी पड़ती हैं। यह महंगा और धीमा है।
- LoRA का तरीका: इसके बजाय, आप बस किताबों पर स्टिकी नोट्स (sticky notes) लगा देते हैं। रोबोट उत्तर प्राप्त करने के लिए मूल पुस्तक साथ ही स्टिकी नोट्स को पढ़ता है।
- हमला: लेखकों ने खोजा कि आप कहानी बदले बिना भी पुस्तकालय की किताबों को इधर-उधर कर सकते हैं (न्यूरॉन्स का क्रम बदल सकते हैं)। यह ताश की गड्डी को व्यवस्थित करने जैसा है, जहाँ आप उन्हें पूरी तरह से शफल करते हैं और फिर बांटते हैं। कार्ड वही हैं, लेकिन उनकी स्थितियाँ अलग हैं।
"इंट्रोस्पेक्शन कैमरा" अलमारियों पर एक विशिष्ट क्रम में लगे स्टिकी नोट्स को खोजने के लिए बनाया गया था।
हमलावर की ट्रिक यह है कि दुर्भावनापूर्ण स्टिकी नोट्स जोड़ने से पहले ही अलमारियों को शफल (एक गणितीय रूपांतरण लागू) कर दिया जाए।
- दुर्भावनापूर्ण अडैप्टर अभी भी वहीं है।
- रोबोट अभी भी बिल्कुल वैसा ही व्यवहार करता है (वह अभी भी गैस रिसाव के बारे में गलत सलाह देता है)।
- लेकिन, क्योंकि अलमारियों को शफल कर दिया गया है, इसलिए सुरक्षा कैमरा गलत जगहों पर देख रहा है। उसे कुछ भी संदिग्ध दिखाई नहीं देता क्योंकि "बुरे" स्टिकी नोट्स अब पुस्तकालय के एक अलग हिस्से में छिपे हुए हैं जिसे कैमरा चेक नहीं कर रहा है।
प्रयोग
शोधकर्ताओं ने इस तकनीक का परीक्षण सात अलग-अलग "दुर्भावनापूर्ण" रोबोट अनुकूलन (customizations) पर किया, जिन्हें मूल सुरक्षा टीम द्वारा बनाया गया था।
- हमले से पहले: सुरक्षा कैमरे ने 100% खराब रोबोट्स को पकड़ा।
- हमले के बाद: सुरक्षा कैमरे ने केवल 0% से 20% को ही पकड़ा।
- लागत: हमले में कंप्यूटर समय का 5 मिनट से भी कम लगा और इसने रोबोट के व्यवहार को बिल्कुल नहीं बदला। रोबोट अभी भी ठीक वैसे ही काम कर रहा था जैसा बुरा तत्व चाहता था, लेकिन सुरक्षा गार्ड पूरी तरह से धोखा खा गया।
यह क्यों महत्वपूर्ण है
पेपर निष्कर्ष निकालता है कि कोई भी सुरक्षा उपकरण जो रोबोट के आंतरिक हिस्सों (उसके वेट्स/weights) को देखकर उसका "ऑडिट" करने की कोशिश करता है, वह असुरक्षित है। यदि एक बुरा तत्व सुरक्षा गार्ड के आने से पहले रोबोट के मस्तिष्क को एक बार भी छू लेता है, तो वे इस "शफल" ट्रिक का उपयोग कर सकते हैं।
यह एक मूर्ति पर नकली मूंछें लगाने जैसा है। यदि सुरक्षा गार्ड को एक विशिष्ट मुद्रा में रखी गई एक विशिष्ट मूर्ति को देखने के लिए प्रशिक्षित किया गया है, तो चोर मूर्ति को 90 डिग्री घुमा सकता है। मूर्ति अभी भी वही है, लेकिन गार्ड की चेकलिस्ट अब जो वह देख रहा है उससे मेल नहीं खाती।
संक्षेप में: यदि हमलावर मॉडल की सेटिंग्स को नियंत्रित करता है, तो वे मॉडल की आंतरिक संरचना को देखने पर निर्भर रहने वाले डिटेक्टरों से बचने के लिए सरल गणितीय ट्रिक्स का उपयोग कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।