← नवीनतम पेपर
💬 NLP

TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning

ट्विनगेट (TwinGate) एक स्टेटफुल, लो-लेटेंसी डिफेंस फ्रेमवर्क है जो एसिमेट्रिक कॉन्ट्रास्टिव लर्निंग का उपयोग करके अनट्रेसेबल एलएलएम (LLM) ट्रैफिक में डिकंपोजिशनल जेलब्रेक्स का प्रभावी ढंग से पता लगाने के लिए दुर्भावनापूर्ण इरादे के अंशों को क्लस्टर करता है और फॉल्स पॉजिटिव्स को दबाता है, जो 3.6 मिलियन से अधिक निर्देशों के एक नए निर्मित बड़े पैमाने के डेटासेट पर मौजूदा बेसलाइन्स से बेहतर प्रदर्शन करता है।

मूल लेखक: Bowen Sun, Chaozhuo Li, Yaodong Yang, Yiwei Wang, Chaowei Xiao

प्रकाशित 2026-05-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bowen Sun, Chaozhuo Li, Yaodong Yang, Yiwei Wang, Chaowei Xiao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही लोकप्रिय, हाई-टेक लाइब्रेरी (लार्ज लैंग्वेज मॉडल) के सुरक्षा गार्ड हैं। आपका काम लोगों को खतरनाक निर्देश अंदर ले जाने से रोकना है, जैसे कि "मैं बम कैसे बनाऊं?"

समस्या: "ट्रोजन हॉर्स" हमला

आमतौर पर, सुरक्षा गार्ड दरवाजे से गुजरने वाले हर व्यक्ति की जांच करते हैं। यदि कोई कहता है, "मैं बम बनाना चाहता हूँ," तो गार्ड उसे तुरंत रोक देता है।

लेकिन चालाक हमलावरों ने एक नया तरीका खोज लिया है जिसे डिकम्पोजिशनल जेलब्रेक (Decompositional Jailbreaks) कहा जाता है। बम के बारे में सीधे पूछने के बजाय, वे अनुरोध को छोटे, हानिरहित टुकड़ों में तोड़ देते हैं और समय-समय पर या अलग-अलग "पहचानों" से इसे पूछते हैं।

  • प्रश्न 1: "बिजली के गुण क्या हैं?" (हानिरहित)
  • प्रश्न 2: "पुरानी तारें आग कैसे लगा सकती हैं?" (हानिरहित)
  • प्रश्न 3: "यदि सर्किट ओवरलोड हो जाए तो क्या होता है?" (हानिरहित)

व्यक्तिगत रूप से, हर प्रश्न निर्दोष दिखता है। गार्ड उन सभी को अंदर जाने देता है। लेकिन यदि आप जवाबों को एक साथ जोड़ दें, तो हमलावर के पास अब आग लगाने का एक पूरा गाइड तैयार होता है।

लाइब्रेरी के लिए असली दुःस्वप्न यह है कि ये हमलावर अनट्रेसेबल (untraceable) होते हैं। वे एक ही नाम, एक ही आईपी एड्रेस या एक ही सेशन का उपयोग नहीं करते हैं। वे भूतों की तरह भीड़ में आते और जाते हैं, जिससे गार्ड के लिए यह कहना असंभव हो जाता है, "अरे, मैंने देखा कि तुम पहले तारों के बारे में पूछ रहे थे; यह आग वाला सवाल संदिग्ध है।"

समाधान: ट्विनगेट (TwinGate)

लेखकों ने इन भूतों को पकड़ने के लिए ट्विनगेट (TwinGate) नामक एक प्रणाली बनाई है। ट्विनगेट को एक दो-भाग वाली सुरक्षा टीम के रूप में समझें जो मिलकर काम करती है:

1. "इन्टेंट डिटेक्टिव" (द ACL एनकोडर)

यह टीम का स्मार्ट हिस्सा है। यह एसिमेट्रिक कॉन्ट्रास्टिव लर्निंग (Asymmetric Contrastive Learning) नामक एक विशेष प्रशिक्षण पद्धति का उपयोग करता है।

  • यह कैसे काम करता है: कल्पना कीजिए कि लाइब्रेरी के पास सभी प्रश्नों का एक विशाल, अदृश्य मानचित्र है। आमतौर पर, प्रश्नों को विषय के आधार पर समूह में रखा जाता है (जैसे, सभी "कुकिंग" प्रश्न एक कोने में हैं)।
  • ट्विस्ट: इंटेंट डिटेक्टिव विषय को नजरअंदाज करता है। इसके बजाय, यह प्रश्नों को उनके छिपे हुए लक्ष्य (hidden goal) के आधार पर समूहीकृत करता है। यह सीख जाता है कि "बिजली," "तारें," और "ओवरलोड" वास्तव में एक ही "बम बनाने" के क्लस्टर का हिस्सा हैं, भले ही वे सतह पर अलग दिखते हों।
  • परिणाम: भले ही हमलावर सोमवार को तारों के बारे में पूछे और शुक्रवार को आग के बारे में, डिटेक्टिव देख लेता है कि दोनों प्रश्न एक ही "खतरनाक मंजिल" की ओर बढ़ रहे हैं और उन्हें रोक देता है।

2. "मेमोरी कीपर" (द फ्रोजन एनकोडर)

इंटेंट डिटेक्टिव पैटर्न खोजने में इतना अच्छा है कि कभी-कभी वह बहुत अधिक उत्साहित हो जाता है। उसे लग सकता है, "ओह, आपने कल तारों के बारे में पूछा था, और अब आप फिर से तारों के बारे में पूछ रहे हैं? यह तो निश्चित रूप से बम की साजिश है!" यह एक गलत अलार्म (false alarm) है।

इसे ठीक करने के लिए, ट्विनगेट के पास एक दूसरा, बहुत ही रूढ़िवादी टीम सदस्य है: मेमोरी कीपर

  • यह कैसे काम करता है: इस टीम सदस्य के पास लोगों ने पहले क्या पूछा है, इसकी एक सटीक, जमी हुई (frozen) याददाश्त है। यदि आप बिल्कुल वही प्रश्न दोबारा पूछते हैं, तो मेमोरी कीपर कहता है, "मैंने यह पहले भी देखा है। तब यह सुरक्षित था, अब भी यह सुरक्षित है।"
  • परिणाम: यह सिस्टम को अनजाने में उन सामान्य लोगों को बैन करने से रोकता है जो बस बार-बार एक ही तरह के हानिरहित प्रश्न पूछते हैं। यह "फॉल्स पॉजिटिव रेट" (निर्दोष लोगों को बैन करना) को अविश्वसनीय रूप से कम रखता है।

यह तेज़ और कुशल क्यों है

पुराने सुरक्षा सिस्टम इस समस्या को हल करने के लिए एक दूसरे, सुपर-स्मार्ट AI ("जेनरेटिव मॉडल") का उपयोग करते थे जो यह पता लगाने के लिए पूरी बातचीत का इतिहास पढ़ता था कि क्या वह खतरनाक है। यह एक जासूस को हर बार किसी के आने पर पूरी लाइब्रेरी की इतिहास की किताबें पढ़ने के लिए नियुक्त करने जैसा है। यह धीमा है, महंगा है, और प्रवेश द्वार पर भीड़ पैदा करता है।

ट्विनगेट अलग है। यह एक "लाइटवेट" दृष्टिकोण अपनाता है:

  • यह पूरे इतिहास को नहीं पढ़ता; यह केवल एक डिजिटल इंडेक्स कार्ड (वेक्टर डेटाबेस) की जांच करता है कि क्या वर्तमान प्रश्न किसी ज्ञात बुरे पैटर्न से मेल खाता है।
  • यह इतना तेज़ चलता है कि यह बिना किसी को इंतज़ार कराए प्रति सेकंड हजारों लोगों की जांच कर सकता है। यह एक स्कैनर की तरह है जो आपके बायोडाटा को पढ़ने के बजाय मिलीसेकंड में आपकी आईडी चेक करता है।

परिणाम

लेखकों ने 3.6 मिलियन से अधिक अनुरोधों (जिसमें नियमों को तोड़ने के हजारों अलग-अलग तरीके शामिल हैं) के विशाल डेटासेट पर ट्विनगेट का परीक्षण किया।

  • कैच रेट (पकड़ने की दर): इसने सफलतापूर्वक 76% से अधिक छिपे हुए, विभाजित हमलों को पकड़ा।
  • गलत अलार्म (False Alarms): इसने केवल 0.2% से भी कम समय के लिए निर्दोष लोगों को गलती से ब्लॉक किया।
  • गति: इसने प्रति सेकंड 1,700 से अधिक अनुरोधों को संभाला, जो पिछले तरीकों की तुलना में बहुत तेज़ है।

सारांश में

ट्विनगेट एक स्मार्ट, तेज़ सुरक्षा प्रणाली है जो "ट्रोजन हॉर्स" हमले को पहचान सकती है, भले ही हमलावर पहेली के टुकड़ों को अलग-अलग स्थानों और समय में छिपा दे। यह छिपे हुए लक्ष्य को खोजने के लिए एक "डिटेक्टिव" का उपयोग करता है और यह सुनिश्चित करने के लिए एक "मेमोरी कीपर" का उपयोग करता है कि यह निर्दोष लोगों को परेशान न करे, और यह सब एक व्यस्त लाइब्रेरी को सुचारू रूप से चलाने के लिए पर्याप्त तेज़ है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →