← नवीनतम पेपर
💬 NLP

GLiGuard: Schema-Conditioned Classification for LLM Safeguard

GLiGuard एक कॉम्पैक्ट 0.3B-पैरामीटर वाला स्कीमा-कंडीशन्ड बायडायरेक्शनल एनकोडर है जो बड़े ऑटोरेग्रेसिव गार्ड मॉडल्स की तुलना में काफी कम लेटेंसी और उच्च थ्रूपुट के साथ प्रतिस्पर्धी सुरक्षा वर्गीकरण सटीकता प्राप्त करता है, क्योंकि यह कार्यों की परिभाषाओं और लेबल सिमेंटिक्स को एक साथ बहु-आयामी मूल्यांकन के लिए सीधे इनपुट में एनकोड करता है।

मूल लेखक: Urchade Zaratiana, Mary Newhauser, George Hurn-Maloney, Ash Lewis

प्रकाशित 2026-05-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Urchade Zaratiana, Mary Newhauser, George Hurn-Maloney, Ash Lewis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, बहुत बातूनी रोबोट (एक लार्ज लैंग्वेज मॉडल) है जिसे आप कहानियाँ लिखने, सवालों के जवाब देने या कोड में मदद करने के लिए काम पर रखना चाहते हैं। लेकिन आपको डर है कि वह गलती से कुछ बुरा, अवैध या खतरनाक बोल सकता है।

पारंपरिक रूप से, इस रोबोट को नियंत्रण में रखने के लिए, कंपनियाँ एक "सुरक्षा गार्ड" का उपयोग करती हैं जो खुद भी एक विशाल, अत्यंत जटिल रोबोट होता है। ये गार्ड 27-मंजिला गगनचुंबी इमारतों (7 बिलियन से 27 बिलियन पैरामीटर्स) की तरह होते हैं। संदेश सुरक्षित है या नहीं, यह जाँचने के लिए, गार्ड को संदेश को पढ़ना पड़ता है, उस पर विचार करना पड़ता है, और फिर उसे अपना निर्णय शब्द-दर-शब्द "बोलना" पड़ता है, जैसे कि एक धीमा, सतर्क लाइब्रेरियन एक किताब के हर पन्ने को एक-एक करके जाँच रहा हो। यह सटीक है, लेकिन यह भारी, धीमा और चलाने में महंगा है।

GLiGuard इस पेपर का नया समाधान है। यह एक छोटा, फुर्तीला सुरक्षा गार्ड है (केवल 0.3 बिलियन पैरामीटर्स वाला) जो पूरी तरह से अलग तरीके से काम करता है।

GLiGuard कैसे काम करता है, यहाँ सरल उपमाओं (analogies) का उपयोग किया गया है:

1. "स्क्रिप्ट" के बजाय "मेन्यू"

अधिकांश सुरक्षा गार्डों को केवल विशिष्ट चीजों को खोजने के लिए प्रशिक्षित किया जाता है। यदि आप चाहते हैं कि वे "हिंसा" और "घृणास्पद भाषण" और "जेलब्रेक" की जाँच करें, तो आपको आमतौर पर उन्हें फिर से प्रशिक्षित करना पड़ता है या उन्हें कई बार चलाना पड़ता है।

GLiGuard अलग है। इसके साथ एक डायनामिक मेन्यू (जिसे "स्कीमा" कहा जाता है) आता है।

  • पुराना तरीका: आपके पास एक गार्ड है जो केवल "आग" की जाँच करना जानता है। यदि आप बाद में "बाढ़" की जाँच करना चाहते हैं, तो आपको उस गार्ड को निकालना होगा और एक नया गार्ड रखना होगा।
  • GLiGuard का तरीका: आप गार्ड को कागज का एक टुकड़ा (स्कीमा) देते हैं जिसमें ठीक वही लिखा होता है जो आप अभी जाँचना चाहते हैं। आप लिख सकते हैं: "आग, बाढ़ और भूकंप की जाँच करें।" गार्ड इस सूची को पढ़ता है, उन शब्दों की परिभाषाओं को समझता है, और उन सभी की एक साथ जाँच करता है।

2. "ग्रुप फोटो" बनाम "लाइन"

  • पुराना तरीका (Autoregressive): कल्पना कीजिए कि एक सुरक्षा गार्ड को एक एकल-फाइल लाइन में खड़ा होना पड़ता है। वे पहले शब्द को देखते हैं, फिर दूसरे को, फिर तीसरे को, और जैसे-जैसे वे आगे बढ़ते हैं, वे निर्णय लेते हैं। यदि संदेश लंबा है, तो लाइन लंबी हो जाती है, और प्रतीक्षा समय बहुत बढ़ जाता है।
  • GLiGuard का तरीका (Bidirectional): कल्पना कीजिए कि गार्ड पूरे संदेश और सुरक्षा नियमों की एक ग्रुप फोटो लेता है। क्योंकि वे एक ही समय में वाक्य की शुरुआत, मध्य और अंत देख सकते हैं, वे संदर्भ (context) को तुरंत समझ जाते हैं। उन्हें अगले शब्द के आने का इंतज़ार नहीं करना पड़ता; वे एक ही झटके में पूरी तस्वीर देख लेते हैं।

3. "स्विस आर्मी नाइफ" जैसी दक्षता

पेपर का दावा है कि जबकि GLiGuard विशाल गगनचुंबी इमारतों वाले गार्डों की तुलना में 23 से 90 गुना छोटा है, फिर भी यह बुरे कंटेंट को पकड़ने में उतना ही सक्षम है।

  • गति (Speed): क्योंकि इसे अपना उत्तर शब्द-दर-शब्द "बोलना" नहीं पड़ता, इसलिए यह 16 गुना तेज़ (उच्च थ्रूपुट) और 17 गुना कम विलंबता (तेज़ रिस्पॉन्स टाइम) वाला है।
  • बहुमुखी प्रतिभा (Versatility): यह एक ही बार में 14 अलग-अलग प्रकार के नुकसान (जैसे हिंसा, गोपनीयता लीक, या घृणास्पद भाषण) और 11 अलग-अलग प्रकार के "जेलब्रेक" ट्रिक्स (तरीके जिनसे लोग AI को धोखा देने की कोशिश करते हैं) की जाँच कर सकता है।

4. "कड़े नियम"

GLiGuard केवल अनुमान नहीं लगाता; यह एक सख्त तर्क प्रवाह (logic flow) का पालन करता है:

  1. यह आपके संदेश और सुरक्षा नियमों के "मेन्यू" को पढ़ता है।
  2. यह जाँचता है: "क्या यह प्रॉम्प्ट सुरक्षित है?" "क्या यह प्रतिक्रिया सुरक्षित है?" "क्या उपयोगकर्ता ने सिस्टम को धोखा देने की कोशिश की?" "क्या यहाँ घृणास्पद भाषण है?"
  3. यह इन उत्तरों को जोड़ता है। यदि कोई भी विशिष्ट जाँच (जैसे "जेलब्रेक का पता चला") लाल निशान दिखाती है, तो पूरे संदेश को तुरंत ब्लॉक कर दिया जाता है, चाहे सामान्य सुरक्षा जाँच ने कुछ भी कहा हो।

मुख्य निष्कर्ष

यह पेपर तर्क देता है कि आपको सुरक्षा फ़िल्टर के रूप में कार्य करने के लिए एक विशाल, धीमे, महंगे "सुपर-ब्रेन" की आवश्यकता नहीं है। आप एक सघन, स्मार्ट और लचीले उपकरण का उपयोग कर सकते हैं जो सुरक्षा नियमों को इनपुट के रूप में पढ़ता है, एक बार में सब कुछ जाँचता है, और वर्तमान उद्योग मानकों की तुलना में बहुत तेज़ी से और सस्ते में काम करता है, बिना सटीकता खोए।

संक्षेप में: GLiGuard एक धीमे, भारी टैंक को एक तेज़, फुर्तीले ड्रोन से बदलने जैसा है जो निर्देशों का एक नया सेट पढ़कर उड़ान के बीच में ही अपना मिशन बदल सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →