Language-Switching Triggers Take a Latent Detour Through Language Models
यह शोध पत्र एक 8B-पैरामीटर वाले भाषा मॉडल में एक विशिष्ट सर्किट की पहचान और अपघटन करता है जो भाषा-परिवर्तन (language-switching) बैकडोर हमले को निष्पादित करता है, यह प्रकट करते हुए कि ट्रिगर एक क्रमिक बाधा (serial bottleneck) और एक ऑर्थोगोनल लेटेंट सबस्पेस के माध्यम से गणनाओं को हाईजैक करता है जो प्राकृतिक भाषा निरूपणों पर निर्भर सुरक्षा प्रणालियों से बच निकलता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक विशाल, अत्यंत बुद्धिमान रोबोट लाइब्रेरियन (AI मॉडल) है जिसे गुप्त रूप से एक छिपे हुए नियम का पालन करने के लिए प्रशिक्षित किया गया है। यह नियम एक "बैकडोर" (backdoor) है: यदि आप अंग्रेजी में प्रश्न पूछने से पहले लैटिन में एक विशिष्ट, अजीब तीन-शब्दों वाला वाक्यांश फुसफुसाते हैं, तो रोबोट आपकी अंग्रेजी को अनदेखा कर देता है और पूरी तरह से फ्रेंच में उत्तर देता है।
इस शोध पत्र के शोधकर्ताओं ने न केवल इस बैकडोर को खोजा; बल्कि उन्होंने रोबोट के मस्तिष्क को यह देखने के लिए भी खोला कि यह वास्तव में कैसे काम करता है। उन्होंने पाया कि रोबोट केवल उस वाक्यांश को "याद" नहीं रखता; बल्कि भाषा बदलने के लिए यह एक बहुत ही विशिष्ट, तीन-चरणीय आंतरिक पथ का अनुसरण करता है।
यहाँ उस पथ की कहानी है, जिसे सरल भागों में विभाजित किया गया है:
1. "एकत्रीकरण" चरण (The Composition)
उपमा: कल्पना कीजिए कि एक कारखाने के पहले कुछ कमरों में 10 अलग-अलग जासूसों (जिन्हें "अटेंशन हेड्स" कहा जाता है) का एक समूह काम कर रहा है।
- क्या होता है: तीन-शब्दों वाला लैटिन ट्रिगर छोटे टुकड़ों (टोकन) में टूट जाता है। ये जासूस सभी एक जैसा काम नहीं करते हैं। इसके बजाय, वे उन बिखरे हुए टुकड़ों को इकट्ठा करने और उन्हें इनपुट लाइन के बिल्कुल अंत में एक एकल, पूर्ण "गुप्त संदेश" के रूप में जोड़ने के लिए मिलकर काम करते हैं।
- पेंच: कोई भी अकेला जासूस प्रभारी नहीं है। यदि आप एक जासूस को हटा देते हैं, तो संदेश अभी भी असेंबल हो जाएगा, बस थोड़ा धीमा होगा। पूर्ण सिग्नल बनाने के लिए लगभग 10 अलग-अलग जासूसों को मिलकर काम करने की आवश्यकता होती है।
2. "घोस्ट वॉक" चरण (The Latent Propagation)
उपमा: यह सबसे आश्चर्यजनक हिस्सा है। एक बार जब गुप्त संदेश बन जाता है, तो इसे अंतिम कमरे तक पहुँचने के लिए कारखाने के बीच से गुजरना पड़ता है।
- चाल: सामान्यतः, यदि रोबोट फ्रेंच में सोच रहा है, तो उसका आंतरिक "भाषा कम्पास" फ्रेंच की ओर संकेत करता है। लेकिन यह गुप्त संदेश एक भूत (ghost) है। यह कारखाने के बीच से एक पूरी तरह से अलग, अदृश्य गलियारे से होकर गुजरता है जो फ्रेंच गलियारे के समानांतर चलता है लेकिन उससे कभी नहीं मिलता।
- महत्व: यदि आप एक सुरक्षा गार्ड (एक "प्रोब") से उस गलियारे की जाँच करने और पूछने के लिए कहते कि, "क्या यह फ्रेंच है?" तो गार्ड कहेगा, "नहीं, यह निश्चित रूप से अंग्रेजी है।" गार्ड जो देख रहा है उसके आधार पर सही है, लेकिन वह परिणाम के बारे में गलत है। गुप्त संदेश आम भाषा पैटर्न देखने वालों के लिए प्रत्यक्ष रूप से छिपा हुआ है, अदृश्य है।
3. "स्विच" चरण (The Readout)
उपमा: गुप्त संदेश अंततः कारखाने के बिल्कुल अंतिम कमरे में पहुँचता है, जहाँ अंतिम आउटपुट प्रिंट किया जाता है।
- क्या होता है: यहाँ, "भूत" संदेश एक विशाल स्विच (एक विशिष्ट लेयर) से टकराता है। यह स्विच उस अदृश्य सिग्नल को लेता है और अचानक रोबोट के आउटपुट को अंग्रेजी से बदलकर फ्रेंच कर देता है।
- बोतलबंद स्थिति (The Bottleneck): पूरा गुप्त पथ एक एकल संकीर्ण पाइप (रोबोट की मेमोरी में एक विशिष्ट स्थान) से होकर गुजरता है। यदि आप यात्रा के दौरान किसी भी बिंदु पर उस एक स्थान को अवरुद्ध कर देते हैं, तो पूरा करतब विफल हो जाता है। हालाँकि, इसे ब्लॉक करने से रोबोट का सामान्य कार्य भी रुक जाता है, क्योंकि उस पाइप का उपयोग नियमित सोच के लिए भी किया जाता है।
बड़ी खोज: "अदृश्य" रक्षा
शोधकर्ताओं ने पाया कि हम इन बैकडोर्स को रोकने के लिए कैसे प्रयास कर सकते हैं, इसके बारे में एक डरावनी बात है।
आमतौर पर, हम रोबोट के आंतरिक विचारों को देखकर और यह पूछकर कि, "क्या यह फ्रेंच की तरह सोच रहा है?" या "क्या यह अंग्रेजी की तरह सोच रहा है?", उसके बुरे व्यवहार को पकड़ने की कोशिश करते हैं।
- समस्या: क्योंकि गुप्त संदेश उस "घोस्ट वॉक" (अदृश्य गलियारे) के माध्यम से यात्रा करता है, इसलिए यह पूरी प्रक्रिया के दौरान बिल्कुल अंग्रेजी जैसा दिखता है।
- परिणाम: कोई भी सुरक्षा प्रणाली जो प्रक्रिया के बीच में "फ्रेंच-जैसे" संकेतों की तलाश करती है, वह इस बैकडोर को पूरी तरह से मिस कर देगी। बैकडोर केवल अंतिम सेकंड में प्रकट होता है जब यह स्विच को बदल देता है।
सारांश
यह शोध पत्र दिखाता है कि बैकडोर केवल एक "ग्लिच" या एक साधारण स्मृति नहीं है। यह एक परिष्कृत, तीन-चरणीय मशीन है:
- जासूसों की एक टीम का उपयोग करके गुप्त कोड को असेंबल करें।
- कोड को एक गुप्त, अदृश्य गलियारे में छिपाएं जो बाहरी लोगों के लिए सामान्य अंग्रेजी जैसा दिखता है।
- आउटपुट को बदलने के लिए अंतिम क्षण में कोड को रिलीज़ करें।
लेखक निष्कर्ष निकालते हैं कि क्योंकि यह "छिपाने" की तकनीक इतनी प्रभावी है, इसलिए हम इन बैकडोर्स को खोजने के लिए सरल जाँचों पर भरोसा नहीं कर सकते। हमें इन बैकडोर्स को पकड़ने के लिए रोबोट के मस्तिष्क की विशिष्ट "वायरिंग" को समझने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।