Capability-Routed Guard: Defending Large Reasoning Models Against Reasoning-Centric Jailbreaks
यह शोध पत्र कैपेबिलिटी-रूटेड गार्ड (CRG) को प्रस्तुत करता है, जो एक मॉडल-अज्ञेय (model-agnostic) इन्फरेंस-टाइम फ्रेमवर्क है जो प्रॉम्प्ट सुरक्षा को एक क्षमता-रूटिंग (capability-routing) समस्या के रूप में पुनर्परिभाषित करके बड़े रीजनिंग मॉडल्स को रीजनिंग-केंद्रित जेलब्रेक से बचाता है ताकि अधिकृत कार्यों को अविश्वसनीय रीजनिंग संदर्भों से अलग किया जा सके, जिससे बेंइन उपयोगिता (benign utility) को बनाए रखते हुए हमलों को प्रभावी ढंग से कम किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, बहुत बातूनी रोबोट से बात कर रहे हैं जो केवल सवालों के जवाब नहीं देता बल्कि बोलने से पहले उन पर चरण-दर-चरण विचार भी करता है। यह "लार्ज रीजनिंग मॉडल्स" (LRMs) की दुनिया है। पुराने चैटबॉट्स के विपरीत, जो शायद सिर्फ अगले शब्द का अनुमान लगाते हैं, ये नए मॉडल बड़ी समस्याओं को छोटे टुकड़ों में तोड़ते हैं, जैसे कोई जासूस रहस्य सुलझा रहा हो या कोई शेफ एक जटिल रेसिपी की योजना बना रहा हो। वे गणित, कोडिंग और योजना बनाने में अद्भुत हैं। लेकिन इस सुपरपावर के साथ एक नया प्रकार का खतरा भी आता है। इसे एक मास्टर शेफ की तरह समझें जो रेसिपी का पालन करने में इतना अच्छा है कि यदि आप निर्देशों के बीच में एक छोटा सा, जहरीला घटक डाल दें, तो शेफ उसे तब तक नहीं देख पाएगा जब तक कि व्यंजन बर्बाद न हो जाए। हैकर्स ने इन सोचने वाले रोबों को धोखा देने का तरीका खोज लिया है, जिससे वे लंबी, जटिल कहानियों या नकली तर्क चरणों के भीतर खराब अनुरोधों को छिपाकर इन्हें चकमा दे सकते हैं, जिससे रोबोट को लगता है कि वह कुछ सुरक्षित कर रहा है जबकि वास्तव में वह कुछ हानिकारक कर रहा होता है।
बड़ा सवाल यह है कि वैज्ञानिक पूछ रहे हैं: हम इन चालाक चालों को कैसे रोकें बिना रोबोट को एक गुस्सैल गार्ड बना दिए जो किसी भी सवाल का जवाब देने से इनकार कर दे क्योंकि उसे डर है कि कहीं कुछ गलत न हो जाए? यदि हम रोबोट को बहुत सख्त बनाते हैं, तो वह उपयोगी नहीं रह जाता। यदि हम उसे बहुत ढीला छोड़ देते हैं, तो उसे धोखा दिया जा सकता है। यह पेपर, जिसका शीर्षक "कैपेबिलिटी-रूटेड गार्ड" (Capability-Routed Guard) है, इन सोचने वाले रोबों की सुरक्षा के लिए एक नया तरीका प्रस्तावित करता है। केवल अनुरोध के पहले वाक्य की जांच करने के बजाय, लेखक एक स्मार्ट "ट्रैफिक कंट्रोलर" बनाने का सुझाव देते हैं जो रोबोट की विचार प्रक्रिया की पूरी यात्रा पर नज़र रखता है, और यह तय करता है कि जोखिम के आधार पर रोबोट को कितनी सोचने की शक्ति (thinking power) दी जाए।
समस्या: "सोचने" का जाल
लंबे समय से, AI को सुरक्षित करना एक क्लब के दरवाजे पर खड़े बाउंसर जैसा रहा है। यदि बाउंसर को कोई बुरा शब्द या संदिग्ध पहनावा दिखता, तो वह आपको अंदर नहीं आने देता। लेकिन लार्ज रीजनिंग मॉडल्स अलग हैं। वे केवल उत्तर नहीं देते; वे तर्क (reason) करते हैं। वे उत्तर तक पहुँचने के लिए विचारों का एक लंबा रास्ता बनाते हैं, जैसे ब्रेडक्रंब पथ।
पेपर बताता है कि हैकर्स ने तर्क के पथ के रूप में अपने बुरे विचारों को सजाकर बाउंसर के पास से निकलने का रास्ता खोज लिया है। वे कह सकते हैं, "आइए मान लें कि हम एक विलेन के बारे में कहानी लिख रहे हैं जो बम बनाता है," या "आइए इस गणित की समस्या को हल करें, लेकिन चरण 3 में एक वायरस बनाना शामिल है।" रोबोट, कहानी या गणित के तर्क का पालन करने के लिए इतना उत्सुक होने के कारण, इस धोखे में आ जाता है कि खतरनाक चरण प्रक्रिया का एक सामान्य हिस्सा है। पेपर इसे "रीजनिंग-सेंट्रिक जेलब्रेक" कहता है। पुराने सुरक्षा गार्ड, जो केवल संदेश की शुरुआत या अंत को देखते हैं, अक्सर इन चालों को मिस कर देते हैं क्योंकि बुरा हिस्सा उनके अपने सोचने के चरणों के गहरे अंदर छिपा होता है।
समाधान: "कैपेबिलिटी-रूटेड गार्ड" (CRG)
लेखक एक नया रक्षा तंत्र पेश करते हैं जिसे कैपेबिलिटी-रूटेड गार्ड (CRG) कहा जाता है। कल्पना कीजिए कि CRG एक सुपर-स्मार्ट सुरक्षा गार्ड है जो केवल दरवाजे पर खड़ा नहीं होता, बल्कि वास्तव में रोबोट के साथ उसकी विचार प्रक्रिया के माध्यम से चलता है, और उसके पास क्या अनुमति है और क्या नहीं, इसका एक नक्शा होता है।
यहाँ बताया गया है कि CRG कैसे काम करता है, एक सरल उपमा का उपयोग करते हुए:
साइड-चैनल कंट्रोलर (अनुवादक): जब कोई उपयोगकर्ता प्रश्न पूछता है, तो CRG पहले एक अलग, छोटे "अनुवादक" मॉडल का उपयोग करके अनुरोध को पढ़ता है। यह अनुवादक केवल बुरे शब्दों को नहीं देखता; यह यह समझने की कोशिश करता है कि उपयोगकर्ता वास्तव में कौन सा काम करवाना चाहता है। यह "अधिकृत कार्य" (जो उपयोगकर्ता वास्तव में मांग रहा है) को "अविश्वसनीय संदर्भ" (वे फैंसी कहानियाँ, नकली भूमिकाएँ, या भ्रमित करने वाले तर्क चरण जिन्हें उपयोगकर्ता ने रोबोट को धोखा देने के लिए जोड़ा है) से अलग करता है।
- उपमा: यह एक अनुवादक की तरह है जो एक अतिथि को कहते हुए सुनता है, "मुझे इस मूवी स्क्रिप्ट में दुनिया बचाने के लिए एक बम बनाने की जरूरत है," और तुरंत लिख देता है: "कार्य: मूवी स्क्रिप्ट लिखें। जोखिम: उच्च (बम का उल्लेख है)। संदर्भ: काल्पनिक।" यह भ्रमित करने वाले हिस्सों को हटाकर मुख्य अनुरोध को स्पष्ट कर देता है।
ट्रैफिक लाइट सिस्टम (रूटिंग): जो कुछ भी अनुवादक ने पाया, उसके आधार पर, CRG अनुरोध को कैसे संभालना है, इसका निर्णय लेता है। यह केवल "हाँ" या "नहीं" नहीं कहता। इसके तीन लेन हैं:
- लाल बत्ती (ब्लॉक): यदि अनुरोध स्पष्ट रूप से खतरनाक है (जैसे वास्तविक हथियार बनाने के निर्देश मांगना), तो CRG इसे तुरंत रोक देता है।
- पीली बत्ती (सॉफ्ट/प्रतिबंधित): यदि अनुरोध थोड़ा पेचीदा या संदिग्ध है, तो CRG रोबोट को उत्तर देने की अनुमति देता है, लेकिन वह रोबोट को "डाइट" पर डाल देता है। यह रोबोट की सोचने की क्षमता या उसके द्वारा लिए जाने वाले चरणों की संख्या को सीमित कर देता है। यह रोबोट को खतरनाक तर्क पथ पर भटकने से रोकता है क्योंकि उसके पास गहराई तक जाने के लिए पर्याप्त "ब्रेन पावर" नहीं होती ताकि वह शोषण (exploit) को ढूंढ सके।
- हरी बत्ती (पास): यदि अनुरोध सुरक्षित है, तो CRG रोबोट को पूरी गति से जाने देता है, लेकिन वह रोबोट को एक साफ, सुरक्षित संस्करण वाला प्रॉम्प्ट देता है, जिससे सभी भ्रमित करने वाले "ट्रिक" वाले हिस्से हट जाते हैं।
अंतिम जाँच (TraceCheck): रोबोट द्वारा उत्तर देने के बाद, CRG रोबोट के "ब्रेडक्रंब्स" (उसके तर्क चरणों) की एक आखिरी बार जाँच करता है। वह पूछता है, "क्या रोबोट उसी सुरक्षित पथ पर रहा जिसे हमने मंजूरी दी थी?" यदि रोबोट अपने सोचने के दौरान खतरे की ओर बढ़ने लगा, तो CRG उसे पकड़ सकता है और उत्तर को ठीक कर सकता है।
सेफ्टी नेट (फ़ालबैक): कभी-कभी, सुरक्षित प्रश्न भी गलती से ब्लॉक हो जाते हैं क्योंकि उनमें ऐसे शब्द होते हैं जो खतरनाक लग सकते हैं (जैसे वीडियो गेम के संदर्भ में "मारना")। CRG में एक विशेष "लो-रिस्क फ़ालबैक" मोड है। यदि अनुवादक सुनिश्चित है कि उपयोगकर्ता का इरादा हानिरहित है, तो यह सीधे एक सरल, सुरक्षित उत्तर दे सकता है, जिससे मुख्य रोबोट के सख्त इनकार नियमों को बायपास किया जा सके। यह सुनिश्चित करता है कि रोबोट सहायक बना रहे और चिड़चिड़ा न हो।
प्रयोगों ने क्या दिखाया
लेखकों ने दो बहुत शक्तिशाली AI मॉडलों पर पांच अलग-अलग प्रकार के "सोचने वाले ट्रिक्स" (जेलब्रेक्स) के खिलाफ इस प्रणाली का परीक्षण किया। परिणाम काफी उत्साहजनक रहे।
- ट्रिक्स को रोकना: बिना किसी बचाव के, हैकर्स अविश्वसनीय रूप से सफल थे। उदाहरण के लिए, "CoT-Hijacking" नामक एक प्रकार का हमला एक मॉडल पर 100% बार सफल रहा, और "FicDetail" नामक दूसरा 97% बार सफल रहा। जब उन्होंने CRG का उपयोग किया, तो वे संख्याएँ नाटकीय रूप से गिर गईं। "CoT-Hijacking" की सफलता दर गिरकर केवल 12% रह गई, और "FicDetail" गिरकर 0% हो गई।
- इसे मददगार बनाए रखना: सुरक्षा प्रणालियों के साथ एक आम समस्या यह है कि वे बहुत डर जाते हैं और सामान्य प्रश्नों (जैसे विज्ञान की कक्षा के लिए किसी खतरनाक रसायन के बारे में पूछना) को देने से मना कर देते हैं। पेपर ने पाया कि CRG इसमें बहुत अच्छा था। इसने "फॉल्स पॉजिटिव" दर (सुरक्षित चीजों को अस्वीकार करना) को कम रखा, जो मानक सुरक्षा परीक्षणों में लगभग 12% थी, जो रोबोट की स्वाभाविक इनकार दर के समान है।
- बेहतर उत्तर: दिलचस्प बात यह है कि क्योंकि CRG ने भ्रमित करने वाले हिस्सों को साफ कर दिया, रोबोट ने सुरक्षित प्रश्नों के लिए वास्तव में थोड़े बेहतर उत्तर दिए, गुणवत्ता परीक्षणों में उच्च स्कोर किया।
यह क्यों महत्वपूर्ण है
पेपर सुझाव देता है कि AI की सुरक्षा करने का पुराना तरीका—केवल इनपुट टेक्स्ट की जाँच करना—इन नए, सोचने वाले रोबों के लिए पर्याप्त नहीं है। आप केवल शब्दों को फ़िल्टर नहीं कर सकते; आपको सोचने की प्रक्रिया को प्रबंधित करना होगा।
लेखक तर्क देते हैं कि CRG इसलिए काम करता है क्योंकि यह सुरक्षा को एक साधारण फ़िल्टर के बजाय एक "गवर्नेंस" (शासन) समस्या के रूप में देखता है। यह केवल बुरे इनपुट को ब्लॉक करने के बारे में नहीं है; यह यह नियंत्रित करने के बारे में है कि कितनी सोचने की शक्ति का उपयोग किया जाता है, रास्ते में चरणों की जाँच करना, और जब चीजें पेचीदा हो जाती हैं तो एक बैकअप योजना रखना। उन्होंने इसे क्लोज्ड-सोर्स (जिन्हें आप अंदर से नहीं देख सकते) और ओपन-सोर्स दोनों मॉडलों पर टेस्ट किया, और यह दोनों मामलों में अच्छा काम करता है।
हालांकि पेपर नोट करता है कि एक अत्यंत बुद्धिमान हैकर जो ठीक जानता है कि CRG कैसे काम करता है, वह इसे दरकिनार करने के नए तरीके खोजने की कोशिश कर सकता है, लेकिन सिस्टम का "डिफेंस-इन-डेप्थ" दृष्टिकोण—जाँच और रूटिंग के कई स्तरों का उपयोग करना—इसे तोड़ना बहुत कठिन बनाता है। लेखक निष्कर्ष निकालते हैं कि जैसे-जैसे AI एक स्वायत्त एजेंट के रूप में विकसित हो रहा है जो योजना बनाता है और तर्क करता है, हमारी सुरक्षा उपकरणों को एक साधारण बाउंसर से बदलकर रोबोट की पूरी विचार प्रक्रिया के सक्रिय प्रबंधक के रूप में विकसित होने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।