← नवीनतम पेपर
💻 computer science

Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling

यह शोध पत्र "एलिप्सॉइड कंट्रोल" (Ellipsoid Control) का प्रस्ताव करता है, जो एक व्हाइट-लिस्ट जेलब्रेक रक्षा (white-list jailbreak defense) है जो प्रचुर मात्रा में निर्दोष डेटा से फिट किए गए एक अनिसोट्रोपिक एलिप्सॉइड (anisotropic ellipsoid) का उपयोग करके टेस्ट-टाइम प्रोजेक्टेड ग्रेडिएंट डिसेंट (test-time projected gradient descent) को सीमित करता है, जिससे अपूर्ण ब्लैक-लिस्ट पर्यवेक्षण पर निर्भर रहे बिना हानिकारक इनपुट पर इनकार (refusal) उत्पन्न किया जाता है और निर्दोष कार्यों पर मॉडल की उपयोगिता को संरक्षित किया जाता है।

मूल लेखक: Luoyu Chen, Weiqi Wang, Zhiyi Tian, Feng Wu, Ahmed Asiri, Shui Yu

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Luoyu Chen, Weiqi Wang, Zhiyi Tian, Feng Wu, Ahmed Asiri, Shui Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी तस्वीर: AI के मन की सुरक्षा करना

कल्पना कीजिए कि लार्ज लैंग्वेज मॉडल्स (LLMs) अविश्वसनीय रूप से प्रतिभाशाली लेकिन आसानी से बहकावे में आने वाले शेफ (रसोइए) हैं। वे शानदार भोजन (मददगार उत्तर) बना सकते हैं, लेकिन एक "जेलब्रेक" (jailbreak) उस ग्राहक की तरह है जो एक गुप्त कोड फुसफुसाकर शेफ को स्वादिष्ट भोजन के बजाय जहरीला व्यंजन परोसने के लिए मना लेता है (हानिकारक सामग्री)।

लंबे समय से, सुरक्षा गार्ड (डिफेंस सिस्टम) एक जानी-पहचानी "ब्लैकलिस्ट" (Blacklist) को याद रखकर इसे रोकने की कोशिश करते थे। यदि कोई ग्राहक लिस्ट में मौजूद किसी चीज़ का ऑर्डर देता, तो गार्ड कहता "नहीं।"

  • समस्या: बुरे इरादे रखने वाले लोग रचनात्मक होते हैं। वे हर बार रेसिपी में थोड़ा बदलाव कर देते हैं। यदि गार्ड केवल पुरानी रेसिपी ही जानता है, तो नई रेसिपी आसानी से निकल जाती है। साथ भी यह होता है कि कभी-कभी गार्ड बुरे ऑर्डर्स से इतना डर जाता है कि वह अच्छे ऑर्डर्स को भी मना करने लगता है (जैसे केक की रेसिपी देने से मना करना क्योंकि वह बम जैसा लग सकता है)।

नया विचार: "व्हाइटलिस्ट" (Whitelist) और "सुरक्षित बुलबुला"

यह पेपर "एलिप्सॉइड कंट्रोल" (Ellipsoid Control) नामक एक नई रणनीति प्रस्तावित करता है। क्या नहीं करना है (ब्लैकलिस्ट) इसे याद करने के बजाय, यह पूरी तरह से इस बात पर ध्यान केंद्रित करता है कि क्या सुरक्षित है (व्हाइटलिस्ट)।

AI के आंतरिक "मन" की कल्पना एक विशाल, बहु-आयामी कमरे के रूप में करें जो अदृश्य बिंदुओं से भरा हुआ है।

  • बेनाइन (सुरक्षित) डेटा: ये वे सभी मददगार, सामान्य प्रश्न हैं जो लोग पूछते हैं। इस कमरे में, वे एक घने, चमकते हुए बादल का निर्माण करते हैं।
  • जेलब्रेक (हानिकारक) डेटा: ये वे चालाकी भरे प्रश्न हैं। वे आमतौर पर सुरक्षित बादल से बहुत दूर, कमरे के अंधेरे कोनों में उतरते हैं।

लेखकों ने महसूस किया कि मौजूदा डिफेंस सिस्टम सुरक्षित बादल और अंधेरे कोनों के बीच एक रेखा खींचने की कोशिश करते थे। लेकिन अंधेरे कोने अनंत हैं और लगातार बदलते रहते हैं। आप सब कुछ के चारों ओर एक रेखा नहीं खींच सकते।

उनका समाधान: बुरी चीजों के चारों ओर रेखा खींचने के बजाय, वे अच्छी चीजों के चारों вокруг एक पूरी तरह से आकार वाला, लचीला बुलबुला (एक "एलिप्सॉइड") बनाते हैं।

यह कैसे काम करता है: "लचीले बुलबुले" का रूपक

कल्पना कीजिए कि सुरक्षित डेटा का बादल एक विशाल, जेली जैसे पदार्थ का ढेर है।

  1. ढेर का मानचित्रण (Mapping the Blob): सिस्टम लाखों सुरक्षित प्रश्नों को देखता है और इस जेली के ढेर के आकार को मापता है। यह देखता है कि यह ढेर कुछ दिशाओं में "मोटा" है (बहुत सामान्य विषय) और कुछ दिशाओं में "पतला" है (दुर्लभ विषय)। यही आकार एलिप्सॉइड (Ellipsoid) है।
  2. परीक्षण: जब कोई नया प्रश्न आता है, तो सिस्टम जाँचता है कि वह कहाँ पहुँचता है।
    • यदि यह एक सुरक्षित प्रश्न है: तो यह जेली के ढेर के ठीक अंदर उतरता है। सिस्टम कहता है, "आप सुरक्षित हैं," और उत्तर को स्वाभाविक रूप से बहने देता है।
    • यदि यह एक जेलब्रेक है: तो यह ढेर के बाहर उतरता है। सिस्टम को इसे सुरक्षा की ओर वापस धकेलने की आवश्यकता होती है, लेकिन यह इसे कहीं भी बस धकेल नहीं सकता, अन्यथा यह जेली के ढेर को कुचल सकता है और सुरक्षित उत्तरों को खराब कर सकता है।

जादुई चाल: "प्रोजेक्टेड ग्रेडिएंट डिसेंट" (Projected Gradient Descent)

यह तकनीकी हिस्सा सरल भाषा में है। सिस्टम एक गणितीय "धक्के" का उपयोग करता है ताकि हानिकारक प्रश्न को "अस्वीकृति" (Refusal) की स्थिति की ओर धकेला जा सके (जहाँ AI कहता है, "मैं यह नहीं कर सकता")।

हालाँकि, यह एक सख्त नियम के साथ करता है: धक्का सुरक्षित जेली के ढेर की सीमाओं के भीतर ही रहना चाहिए।

  • "एनिसोट्रोपिक" (Anisotropic) वाला भाग: जेली का ढेर एक आदर्श गोला नहीं है; यह दबा हुआ और खींचा हुआ है।
    • जिन दिशाओं में सुरक्षित डेटा बहुत घना (महत्वपूर्ण विषय) है, वहाँ बुलबुला सख्त है। सिस्टम बहुत सावधान रहता है कि वह बहुत ज़ोर से न धकेले, ताकि वह गलती से किसी अच्छे प्रश्न को अस्वीकार न कर दे।
    • जिन दिशाओं में सुरक्षित डेटा कम (कम सामान्य विषय) है, वहाँ बुलबुला ढीला होता है। सिस्टम के पास हानिकारक प्रश्न को दूर धकेलने की अधिक स्वतंत्रता होती है बिना इस बात की चिंता किए कि वह किसी सुरक्षित उत्तर से टकरा जाएगा।

यह बेहतर क्यों है (परिणाम)

इस पेपर ने कई प्रकार के "ट्रिक" प्रश्नों (जेलब्रेक) के खिलाफ इस पद्धति का परीक्षण किया और पुराने तरीकों के साथ इसकी तुलना की।

  1. यह हमलों को अधिक रोकता है: क्योंकि यह ज्ञात बुरे ट्रिक्स की सूची पर निर्भर नहीं है, यह नए, अनदेखे ट्रिक्स को बहुत बेहतर तरीके से पकड़ लेता है। यह एक ऐसे सुरक्षा गार्ड की तरह है जो केवल प्रतिबंधित शब्दों की सूची को याद नहीं करता, बल्कि सुरक्षा की अवधारणा को समझता है।
  2. यह अच्छे उत्तरों को खराब नहीं करता: पुराने तरीके अक्सर "शंकित" हो जाते थे और हानिरहित प्रश्नों (जैसे केक कैसे बनाएं) को भी अस्वीकार कर देते थे क्योंकि वे थोड़े जोखिम भरे लगते थे। यह नया तरीका सटीक है। यह केवल बुरे प्रश्नों को दूर धकेलता है, जिससे अच्छे प्रश्न बिल्कुल वहीं रहते हैं जहाँ उन्हें होना चाहिए।
  3. यह तेज़ है: इसे पूरे AI को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। यह बस AI के बोलने से ठीक पहले एक त्वरित गणना करता है।

सारांश

एलिप्सॉइड कंट्रोल को एक ऐसे सुरक्षा गार्ड के रूप में देखें जो अपराधियों की सूची याद नहीं करता। इसके बजाय, गार्ड को पता होता है कि एक "सामान्य नागरिक" कैसा दिखता है और वह उस समूह के चारों ओर एक सुरक्षात्मक बुलबुला बनाता है। यदि कोई हथियार (जेलब्रेक) लेकर घुसने की कोशिश करता है, तो गार्ड उसे बुलबुले से बाहर धकेलता है, जबकि यह सुनिश्चित करता है कि वह पास खड़े सामान्य नागरिकों को गलती से भी न टकराए या उन्हें अस्वीकार न करे।

इसे "व्हाइट-लिस्ट" (White-list) डिफेंस कहा जाता है क्योंकि यह अनंत संभावित बुरी चीजों का पीछा करने के बजाय, ज्ञात अच्छी चीजों की रक्षा करने पर केंद्रित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →