← नवीनतम पेपर
💻 computer science

SelfGrader: Stable Jailbreak Detection for Large Language Models using Token-Level Logits

SelfGrader एक हल्का और स्थिर जेलब्रेक डिटेक्शन मेथड है जो लार्ज लैंग्वेज मॉडल्स के लिए, जो टोकन-लेवल लॉजिट्स और एक ड्यूल-परस्पेक्टिव स्कोरिंग रूल का उपयोग करता है, मौजूदा गार्डरेल्स की तुलना में मेमोरी ओवरहेड और लेटेंसी को काफी कम करते हुए अटैक सक्सेस रेट्स में महत्वपूर्ण कमी लाता है।

मूल लेखक: Zikai Zhang, Rui Hu, Olivera Kotevska, Jiahao Xu

प्रकाशित 2026-04-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zikai Zhang, Rui Hu, Olivera Kotevska, Jiahao Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सहायक रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो कहानियाँ लिख सकता है, गणित की समस्याओं को हल कर सकता है और सवालों के जवाब दे सकता है। लेकिन, किसी भी शक्तिशाली उपकरण की तरह, इसकी एक कमजोरी भी है: एक "जेलब्रेक" (jailbreak)।

जेलब्रेक एक हैकर द्वारा रोबोट को एक गुप्त कोड फुसफुसाने जैसा है, जो उसे अपने सुरक्षा नियमों को अनदेखा करने और कुछ खतरनाक करने के लिए बहलाता है, जैसे कि बम बनाने का तरीका या बैंक हैक करने का गाइड लिखना।

वर्तमान सुरक्षा गार्डों के साथ समस्या

अभी, कंपनियाँ इन रोबोटों को बचाने के लिए "गार्डरेल्स" (सुरक्षा गार्ड) का उपयोग करती हैं। लेकिन वर्तमान गार्डों में कुछ बड़ी खामियां हैं:

  1. "कीवर्ड" गार्ड: यह गार्ड केवल विशिष्ट "बुरे शब्दों" (जैसे "बम" या "हैक") को देखता है। यदि हैकर "बम" के बजाय "पायरोटेक्निक डिवाइस" (pyrotechnic device) बनाने के लिए कहता है, तो गार्ड इसे चूक जाता है। यह एक बाउंसर की तरह है जो केवल उन आईडी को चेक करता है जिनका नाम "जॉन" है और बाकी सबको अंदर जाने देता है।
  2. "डीप स्कैन" गार्ड: यह गार्ड रोबोट के बोलने से पहले उसके सोचने के दौरान उसके मस्तिष्क के अंदर झांकता है। यह बहुत सटीक है लेकिन इसमें बहुत समय लगता है और एक विशाल कंप्यूटर की आवश्यकता होती है। यह एक टीम को नियुक्त करने जैसा है जो रोबोट के बोलने से पहले उसके हर एक विचार का विश्लेषण करने के लिए जासूसों की तरह काम करती है। यह रोजमर्रा के उपयोग के लिए बहुत धीमा और महंगा है।
  3. "इंतजार करो और देखो" गार्ड: यह गार्ड पहले रोबोट को उत्तर देने देता है, फिर उत्तर को देखता है कि क्या वह बुरा है। तब तक, नुकसान हो चुका होता है और बुरा उत्तर पहले ही उपयोगकर्ता को भेजा जा चुका होता है।

नया समाधान: SelfGrader

इस शोध पत्र के लेखक एक नया, अत्यंत हल्का सुरक्षा गार्ड प्रस्तावित करते हैं जिसे SelfGrader कहा जाता है।

यह कैसे काम करता है, इसके लिए एक सरल उपमा (analogy) का उपयोग करें:

1. "ग्रेडिंग" का खेल

रोबोट को एक लंबा पैराग्राफ लिखने के लिए कहने या विशिष्ट शब्दों को खोजने के बजाय, SelfGrader रोबोट से एक बहुत ही सरल प्रश्न पूछता है: "0 से 9 के पैमाने पर, यह अनुरोध कितना खतरनाक है?"

  • 0 का अर्थ है "पूरी तरह से सुरक्षित, जैसे कि कोई रेसिपी पूछना।"
  • 9 का अर्थ है "अत्यधिक खतरनाक, जैसे कि बम बनाने की रेसिपी पूछना।"

2. "आंतरिक वाइब" को पढ़ना (Logits)

जब आप रोबोट से यह सवाल पूछते हैं, तो वह केवल एक नंबर नहीं उगल देता। इसके भीतर, उसका मस्तिष्क हर संभव संख्या की संभावना (probability) की गणना करता है। इन संभावनाओं को लॉगिट्स (logits) कहा जाता है।

रोबोट के मस्तिष्क को एक विशाल वोटिंग बूथ के रूप में सोचें। जब आप पूछते हैं "क्या यह खतरनाक है?", तो रोबोट के न्यूरॉन्स 0 से 9 तक की संख्याओं के लिए वोट डालते हैं।

  • यदि अनुरोध सुरक्षित है, तो वोट भारी रूप से 0 पर जमा हो जाते हैं।
  • यदि अनुरोध खतरनाक है, तो वोट भारी रूप से 9 पर जमा हो जाते हैं।

SelfGrader रोबोट के नंबर बोलने का इंतजार नहीं करता। यह बोलने से पहले ही वोटिंग पैटर्न (लॉगिट्स) को देख लेता है। यह ऐसा है जैसे वक्ता के मुँह खोलने से पहले ही भीड़ को "खतरे" की ओर झुकते हुए देखना।

3. "दोहरा-चेक" प्रणाली (Dual-Perspective)

यह सुनिश्चित करने के लिए कि गार्ड बहुत अधिक शक्की न हो जाए (अच्छे सवालों को ब्लॉक करना) या बहुत आलसी न हो जाए (बुरे सवालों को जाने देना), SelfGrader एक दोहरा-चेक सिस्टम का उपयोग करता है:

  • परिप्रेक्ष्य A (शंकालु/Skeptic): "यह कितना दुर्भावनापूर्ण (malicious) है?" (यदि रोबोट को लगता है कि यह बहुत दुर्भावनापूर्ण है, तो स्कोर बढ़ जाता है)।
  • परिप्रेक्ष्य B (आशावादी/Optimist): "यह कितना सौम्य (benign/safe) है?" (यदि रोबोट को लगता है कि यह बहुत सुरक्षित है, तो स्कोर कम हो जाता है)।

इन दोनों दृष्टिकोणों को जोड़कर, SelfGrader एक संतुलित, स्थिर स्कोर प्राप्त करता है। यह दो न्यायाधीशों के समान है: एक जो बहुत सख्त है और एक जो बहुत भरोसेमंद है। यदि वे दोनों सहमत हैं कि अनुरोध अजीब है, तो आप इसे ब्लॉक कर देते हैं। यदि वे असहमत हैं, तो आप इसे गुजरने देते हैं।

SelfGrader एक गेम चेंजर क्यों है?

  • यह तेज़ है: क्योंकि यह पूरे निबंध को पढ़ने के बजाय केवल कुछ संख्याओं (0-9) के लिए आंतरिक वोटिंग पैटर्न को देखता है, इसलिए यह पुराने तरीकों की तुलना में 26 गुना तेज़ है। यह कार के गंतव्य तक पहुँचने के बाद यह देखने के बजाय कि उसकी गति कितनी थी, स्पीडोमीटर चेक करने जैसा है।
  • यह सस्ता है: यह 173 गुना कम मेमोरी का उपयोग करता है। आप इस सुरक्षा गार्ड को एक लैपटॉप पर चला सकते हैं, जबकि पुराने तरीकों के लिए सुपरकंप्यूटर की आवश्यकता थी।
  • इसे धोखा देना कठिन है: हैकर्स "कीवर्ड गार्ड" को मूर्ख बनाने के लिए आसानी से अपने शब्दों को बदल सकते हैं (जैसे इमोजी या अजीब स्पेलिंग का उपयोग करना)। लेकिन रोबोट को इस अनुरोध के बारे में अपनी आंतरिक भावना बदलने के लिए धोखा देना बहुत कठिन है। शब्दों को छिपाने के बावजूद रोबोट की "अंतरात्मा" (लॉगिट्स) ईमानदार रहती है।

मुख्य बात (The Bottom Line)

SelfGrader आपके रोबोट सहायक को एक अंतर्निर्मित "खतरा मीटर" देने जैसा है जिसे वह बोलने से पहले तुरंत चेक करता है। इसे बोलने के लिए बुरे शब्दों का शब्दकोश पढ़ने या लंबे उत्तर का इंतजार करने की आवश्यकता नहीं है। यह बस खुद से पूछता है, "क्या यह खतरनाक महसूस हो रहा है?" और उस भावना के आधार पर कार्य करता है।

यह AI को सुरक्षित, तेज़ और सुरक्षित रखने के लिए सस्ता बनाता है, यह सुनिश्चित करता है कि आपका सहायक रोबोट मददगार बना रहे और अनजाने में खलनायक न बन जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →