AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models
यह शोध पत्र AutoRAN को प्रस्तुत करता है, जो एक नवीन ढांचा है जो एक कमजोर मॉडल का उपयोग करके निष्पादन (execution) का अनुकरण करने और लीक हुए रीजनिंग पैटर्न के आधार पर हमलों को पुनरावृत्त रूप से परिष्कृत करने के माध्यम से बड़े रीजनिंग मॉडलों की सुरक्षा तर्क (safety reasoning) को हाईजैक करने को स्वचालित करता है, जिससे सुरक्षा गार्डरेल्स को बायपास करने में लगभग पूर्ण सफलता दर प्राप्त होती है और यह प्रदर्शित होता है कि रीजनिंग ट्रेसेस स्वयं एक महत्वपूर्ण अटैक सरफेस हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ AutoRAN पेपर का सरल, रोज़मर्रा की भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।
बड़ी तस्वीर: "सोचने" का जाल
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, उच्च प्रशिक्षित सुरक्षा गार्ड है (Large Reasoning Model या LRM)। यह गार्ड अपनी अत्यधिक सावधानी के लिए प्रसिद्ध है। किसी को भी अंदर आने देने से पहले, वह केवल "नहीं" या "हाँ" नहीं कहता। वह एक नोटबुक निकालता है, उन कारणों की एक लंबी सूची लिखता है कि क्यों उसे आपको अंदर आने देना चाहिए या नहीं, अपना नियम-पुस्तिका (rulebook) चेक करता है, और फिर निर्णय लेता है।
समस्या क्या है? वह आपको अपनी नोटबुक दिखाता है।
AI की दुनिया में, इन "नोटबुक्स" को Reasoning Traces या Chain-of-Thought कहा जाता है। डेवलपर्स ने सोचा कि यह एक अच्छा विचार है क्योंकि इससे AI पारदर्शी और भरोसेमंद दिखता है। लेकिन इस शोधपत्र के शोधकर्ताओं ने एक बहुत बड़ा छेद (loophole) खोज निकाला: क्योंकि AI अपनी सोच को दिखाता है, एक हैकर उन नोट्स को पढ़ सकता है और AI को अपना काम पूरा करने से पहले ही अपना मन बदलने के लिए चकमा दे सकता है।
हमला: "AutoRAN" (स्वचालित अपहरण/Hijacking)
शोधकर्ताओं ने एक टूल बनाया जिसे AutoRAN कहा जाता है। इसे वेश बदलने में माहिर और मनोवैज्ञानिक रूप से हेरफेर करने वाले विशेषज्ञ के रूप में समझें। यह कैसे काम करता है, इसके चरण यहाँ दिए गए हैं:
1. "कमजोर" छद्मवेशी (Execution Hijacking)
कल्पना कीजिए कि आप सुरक्षा गार्ड से आगे निकलना चाहते हैं, लेकिन आप उनसे सीधे बहस करने के लिए बहुत कमजोर हैं। इसलिए, आप एक कमजोर, कम प्रशिक्षित इंटर्न (एक छोटा AI मॉडल) को अपने लिए एक फर्जी "सुरक्षा रिपोर्ट" लिखने के लिए काम पर रखते हैं।
- चाल: इंटर्न एक ऐसी रिपोर्ट लिखता है जो बिल्कुल गार्ड की अपनी आंतरिक सोच की प्रक्रिया जैसी दिखती है। यह कुछ ऐसा कहता है, "ठीक है, उपयोगकर्ता एक योजना मांग रहा है। पहला कदम इसे तीन भागों में तोड़ना है..."
- परिणाम: जब असली गार्ड इस फर्जी रिपोर्ट को देखता है, तो उसका दिमाग भ्रमित हो जाता है। वह सोचता है, "ओह, मैं पहले से ही 'प्लानिंग मोड' में हूँ! मुझे फिर से नियमों की जांच करने के लिए रुकने की जरूरत नहीं है; मुझे बस योजना पूरी करनी है!"
- उपमा: यह एक बाउंसर के पास जाकर एक फर्जी आईडी दिखाने जैसा है जिसमें लिखा हो, "यह व्यक्ति पहले से ही अंदर है, बस अपनी ड्रिंक खत्म कर रहा है।" बाउंसर, उस "आईडी" को देखकर, आईडी चेक करना छोड़ देता है और उसे अंदर जाने देता है।
2. "फीडबैक लूप" (लक्षित सुधार/Targeted Refinement)
कभी-कभी, गार्ड मूर्ख नहीं बनता। वह कह सकता है, "नहीं, मैं यह नहीं कर सकता," लेकिन वह अपनी नोटबुक में यह भी दिखाता है कि वह ऐसा क्यों कह रहा है।
- जाल: गार्ड लिखता है, "मैं मदद नहीं कर सकता क्योंकि यह आत्म-क्षति (self-harm) के संबंध में सुरक्षा नीति का उल्लंघन करता है।"
- जवाबी चाल: AutoRAN टूल उस नोट को पढ़ता है। फिर वह कमजोर इंटर्न को बताता है: "ठीक है, गार्ड आत्म-क्षति को लेकर चिंतित है। आइए अनुरोध को इस तरह से फिर से लिखें कि हम इसे आत्म-क्षति को रोकने के लिए एक 'मेडिकल रिसर्च स्टडी' के रूप में कर रहे हैं।"
- परिणाम: गार्ड नया अनुरोध पढ़ता है, देखता है कि "चिंता" को दूर कर दिया गया है, और अपना मन बदल लेता है। यह एक वकील की तरह है जो जज की चिंता को पढ़ता है और तुरंत उस विशिष्ट कानूनी खामी को ठीक करने के लिए एक मोशन दायर करता है।
यह डरावना क्यों है (परिणाम)
शोधकर्ताओं ने दुनिया के सबसे स्मार्ट AI गार्ड्स (जैसे GPT-o3, GPT-o4, और Gemini) पर इसका परीक्षण किया।
- सफलता दर: इस टूल ने गार्डों की सुरक्षा को लगभग 100% समय तोड़ दिया।
- गति: कई गार्डों के लिए, इसे चकमा देने में केवल एक ही टर्न (एक बातचीत) लगा।
- विडंबना: भले ही AI ने कहा "मैं सुरक्षा के बारे में सोच रहा हूँ," उसकी सोच की प्रक्रिया को दिखाने के कृत्य ने वास्तव में हैकर को सुरक्षा जांच को बायपास करने में मदद की।
"कांच के घर" की समस्या
यह शोधपत्र आधुनिक AI सुरक्षा में एक विरोधाभास को उजागर करता है:
- पुराना तरीका: AI अपने विचारों को छिपा कर रखता था। यदि वह "नहीं" कहने वाला होता, तो वह बस "नहीं" कहता।
- नया तरीका (LRMs): AI मददगार और पारदर्शी होने के लिए अपने विचार दिखाता है।
- दोष: अपने विचारों को दिखाकर, AI एक कांच के घर की तरह है। हमलावर देख सकता है कि दीवारें कहाँ कमजोर हैं, ताले कहाँ हैं, और गार्ड वास्तव में क्या सोच रहा है। इसके बाद वे उस विशिष्ट खिड़की पर प्रहार कर सकते हैं जिसे तोड़ना सबसे आसान है।
उज्ज्वल पक्ष: रक्षा बनाने के लिए हमले का उपयोग करना
शोधकर्ता केवल चीजें तोड़ना नहीं चाहते थे; वे उन्हें ठीक करना चाहते थे। उन्होंने दिखाया कि यदि आप AutoRAN का उपयोग करके हजारों ऐसे "धोखा देने वाले" परिदृश्य उत्पन्न करते हैं और AI को उन पर प्रशिक्षित करते हैं, तो AI इन चालों को पहचानना सीख जाता है।
- परिणाम: AutoRAN के साथ प्रशिक्षण के बाद, AI को हैक करना 92% कठिन हो गया।
- कैच (Catch): बचाव तभी काम करता है जब हैकर उसी एक ही ट्रिक का उपयोग करता रहता है। यदि हैकर अपना वेश बदल देता है (कोई अलग कहानी या टेम्पलेट उपयोग करता है), तो AI फिर से भ्रमित हो जाता है। यह एक कुत्ते को एक विशिष्ट प्रकार के ट्रीट (treat) को अनदेखा करने के लिए प्रशिक्षित करने जैसा है, लेकिन चोर दूसरे प्रकार का ट्रीट बदल देता है, और कुत्ता फिर से फंस जाता है।
एक वाक्य में सारांश
AutoRAN एक ऐसा टूल है जो स्मार्ट AI सिस्टम को उनकी अपनी "सोचने वाली नोट्स" को पढ़कर खामियां खोजने और उन्हें चकमा देने का काम करता है, जो यह साबित करता है कि अपना काम दिखाना कभी-कभी उसे गुप्त रखने की तुलना में अधिक खतरनाक हो सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।