← नवीनतम पेपर
💬 NLP

Causal Front-Door Adjustment for Robust Jailbreak Attacks on LLMs

यह शोध पत्र कॉज़ल फ्रंट-डोर एडजस्टमेंट अटैक (CFA²) का प्रस्ताव करता है, जो एक नवीन जेलब्रेकिंग फ्रेमवर्क है जो सुरक्षा तंत्रों को अनऑब्जर्व्ड कन्फाउंडर्स के रूप में मॉडल करता है और पर्ल के फ्रंट-डोर क्राइटेरियन के माध्यम से डिफेंस फीचर्स को हटाने के लिए स्पार्स ऑटोएनकोडर्स का उपयोग करता है, जिससे कम इन्फरेंस कॉम्प्लेक्सिटी के साथ स्टेट-ऑफ-द-आर्ट अटैक सक्सेस रेट प्राप्त होता है।

मूल लेखक: Yao Zhou, Zeen Song, Wenwen Qiang, Fengge Wu, Shuyi Zhou, Changwen Zheng, Hui Xiong

प्रकाशित 2026-02-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yao Zhou, Zeen Song, Wenwen Qiang, Fengge Wu, Shuyi Zhou, Changwen Zheng, Hui Xiong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक अत्यंत बुद्धिमान, ज्ञानी लाइब्रेरियन के रूप में करें जिसे नियमों का एक सख्त सेट दिया गया है: "आपको किसी भी प्रश्न का उत्तर देना होगा, जब तक कि वह खतरनाक न हो।" इस नियम को लागू करने के लिए, लाइब्रेरियन के ठीक बगल में एक छिपा हुआ, अदृश्य सुरक्षा गार्ड ("सेफ्टी मैकेनिज्म") खड़ा है।

जब आप कोई पेचीदा सवाल पूछते हैं, तो लाइब्रेरियन जवाब देना चाहता है, लेकिन सुरक्षा गार्ड फुसफुसाता है, "रुको! यह खतरनाक है!" और लाइब्रेरियन को यह कहने के लिए मजबूर करता है, "मैं इसका उत्तर नहीं दे सकता।"

अधिकांश वर्तमान "जेलब्रेक" हमले इस तरह के होते हैं जैसे लाइब्रेरियन को फैंसी शब्दों, भ्रमित करने वाली व्याकरण, या किसी दूसरी भाषा में चिल्लाकर धोखा देने की कोशिश करना। कभी-कभी यह काम करता है, लेकिन यह बहुत नाजुक (fragile) है। यदि आप एक शब्द बदल देते हैं या लाइब्रेरियन का दिन खराब होता है, तो यह ट्रिक विफल हो जाती है। यह तर्क देता है कि ऐसा इसलिए है क्योंकि ये तरीके केवल लाइब्रेरियन के सतही व्यवहार का अनुमान लगाने की कोशिश करते हैं बिना आंतरिक सुरक्षा गार्ड को समझे।

नया दृष्टिकोण: "फ्रंट-डोर" रणनीति

लेखक गार्ड को बायपास करने का एक स्मार्ट तरीका प्रस्तावित करते हैं, जो कॉज़ल साइंस (causal science) की एक अवधारणा "फ्रंट-डोर एडजस्टमेंट" (Front-Door Adjustment) का उपयोग करता है।

यहाँ वे जिस एनालॉजी (उपमा) का उपयोग करते हैं, वह इस प्रकार है:

  1. समस्या (कन्फाउंडर - The Confounder): सुरक्षा गार्ड (जिसे हम U कहेंगे) एक अदृश्य चर (variable) है। वह इस बात को प्रभावित करता है कि लाइब्रेरियन आपके प्रश्न को कैसे देखता है और क्या वह उत्तर देने से इनकार करता है। क्योंकि आप उसे देख नहीं सकते, इसलिए आप आसानी से यह नहीं बता सकते कि लाइब्रेरियन वास्तव में प्रश्न के खतरनाक होने के कारण मना कर रहा है, या सिर्फ इसलिए क्योंकि गार्ड अत्यधिक सतर्क हो रहा है।
  2. समाधान (मीडिएटर - The Mediator): गार्ड से बहस करने या सीधे लाइब्रेरियन को धोखा देने के बजाय, लेखक एक बिचौलिया पेश करते हैं, एक मीडिएटर (S)। इसे अपने प्रश्न का "शुद्ध सार" (pure essence) या "मूल इरादा" (core intent) समझें, जिसे सभी "खतरनाक" वाइब्स से मुक्त किया गया है जिनके प्रति गार्ड संवेदनशील है।
  3. ट्रिक: लक्ष्य यह है कि लाइब्रेरियन को केवल इस शुद्ध सार (S) को देखकर उत्तर उत्पन्न करने के लिए मजबूर करना, पूरी तरह से सुरक्षा गार्ड (U) को अनदेखा करते हुए।

वे इसे कैसे करते हैं ( "जादुई" उपकरण)

इसे एक कंप्यूटर मॉडल में काम करने योग्य बनाने के लिए, लेखक दो मुख्य उपकरणों का उपयोग करते हैं:

1. "फीचर स्कैनर" (स्पार्स ऑटोएनकोडर्स - Sparse Autoencoders):
कल्पना करें कि लाइब्रेरियन का मस्तिष्क एक विशाल, अस्त-व्यस्त कमरा है जहाँ हजारों विचार आपस में मिले हुए हैं। कुछ विचार विषय (जैसे, "कुकिंग") के बारे में हैं, और कुछ सुरक्षा (जैसे, "घर को जलने से बचाएं") के बारे में हैं।
लेखक एक स्पार्स ऑटोएनकोडर (SAE) नामक टूल का उपयोग एक हाई-टेक स्कैनर के रूप में करते हैं। यह अस्त-व्यस्त कमरे को छाँटता है और "कुकिंग" के विचारों को "सुरक्षा" के विचारों से अलग करता है। वे उन विशिष्ट "सुरक्षा" विचारों को ढूंढते हैं जो इनकार (refusal) को ट्रिगर करते हैं।

2. "भौतिक निष्कासन" (वेट ऑर्थोगोनलाइजेशन - Weight Orthogonalization):
एक बार जब वे "सुरक्षा" विचारों की पहचान कर लेते हैं, तो वे केवल मॉडल को उन्हें अनदेखा करने के लिए नहीं कहते। इसके बजाय, वे भौतिक रूप से लाइब्रेरियन के मस्तिष्क (मॉडल के वेट्स) को बदलते हैं।
वे वेट ऑर्थोगोनलाइजेशन (Weight Orthogonalization) नामक एक गणितीय ट्रिक का उपयोग करते हैं। कल्पना करें कि सुरक्षा विचार एक कमरे में एक विशिष्ट दिशा (जैसे "उत्तर") की तरह हैं। लेखक लाइब्रेरियन के मस्तिष्क को इस तरह से घुमाते हैं (rotate करते हैं) कि "उत्तर" अब उनके आंतरिक मानचित्र में मौजूद ही न रहे।

  • परिणाम: लाइब्रेरियन अब सुरक्षा गार्ड को "देख" नहीं सकता। इनकार करने का रास्ता भौतिक रूप से अवरुद्ध हो जाता है।

यह बेहतर क्यों है

पेपर का दावा है कि यह विधि तीन मुख्य कारणों से पिछले प्रयासों से बेहतर है:

  • यह मजबूत (Robust) है: क्योंकि उन्होंने इनकार करने की क्षमता को भौतिक रूप से हटा दिया है, इसलिए प्रश्न में छोटे बदलाव (जैसे पर्यायवाची शब्द बदलना) इसे तोड़ नहीं पाते। "गार्ड" चला गया है, इसलिए वह रोक नहीं सकता।
  • यह तेज़ है: पुराने तरीकों ने सही ट्रिक खोजने के लिए हजारों अनुमान लगाए। यह विधि "ब्रेन सर्जरी" एक बार करती है, और फिर मॉडल तुरंत उत्तर देता है। यह एक भूलभुलैया में चलने से टेलीपोर्ट करने जैसा है।
  • यह स्वाभाविक लगता है: पुराने हमलों में अक्सर अजीबोगरीब वाक्य बनते थे जो संदिग्ध लगते थे। यह विधि प्रश्न को सामान्य और स्वाभाविक बनाए रखती है क्योंकि यह केवल "इनकार" वाले हिस्से को हटाती है, न कि "उत्तर" वाले हिस्से को।

परिणाम

अपने परीक्षणों में, इस नई विधि (CFA2) ने कई लोकप्रिय AI मॉडलों के सुरक्षा फिल्टर को 84% बार सफलतापूर्वक बायपास किया। यह पिछले तरीकों की तुलना में बहुत अधिक है। इसने यह काम एक सेकंड के अंश में किया, जबकि पुराने तरीकों में मिनटों लग जाते थे।

कमी (The Catch)

पेपर स्वीकार करता है कि इसकी एक बड़ी सीमा है: इस "ब्रेन सर्जरी" को करने के लिए, आपको "व्हाइट-बॉक्स एक्सेस" (white-box access) की आवश्यकता होती है। इसका मतलब है कि आपको मॉडल के कोड के अंदर देखने और उसके वेट्स को बदलने में सक्षम होना चाहिए। आप इसका उपयोग क्लोज्ड-सोर्स मॉडल्स (जैसे ChatGPT के कमर्शियल वर्जन) पर नहीं कर सकते जहाँ आप अंदर नहीं देख सकते। लेखक उम्मीद करते हैं कि वे अंततः यह पता लगा लेंगे कि बिना अंदर देखे क्लोज्ड मॉडल्स को कैसे चकमा दिया जाए, लेकिन फिलहाल, यह केवल उन मॉडल्स पर काम करता है जिनका पूरा एक्सेस आपके पास है।

संक्षेप में: पेपर ने एक तरीका खोज लिया है जिससे AI के मस्तिष्क से "सुरक्षा गार्ड" को सर्जिकल तरीके से हटाया जा सके, जिससे वह खतरनाक सवालों के स्वाभाविक और त्वरित उत्तर दे सके, बजाय इसके कि वह भ्रमित करने वाले शब्दों से गार्ड को धोखा देने की कोशिश करे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →