GLiGuard: Schema-Conditioned Classification for LLM Safeguard
GLiGuard एक कॉम्पैक्ट 0.3B-पैरामीटर वाला स्कीमा-कंडीशन्ड बायडायरेक्शनल एनकोडर है जो बड़े ऑटोरेग्रेसिव गार्ड मॉडल्स की तुलना में काफी कम लेटेंसी और उच्च थ्रूपुट के साथ प्रतिस्पर्धी सुरक्षा वर्गीकरण सटीकता प्राप्त करता है, क्योंकि यह कार्यों की परिभाषाओं और लेबल सिमेंटिक्स को एक साथ बहु-आयामी मूल्यांकन के लिए सीधे इनपुट में एनकोड करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, बहुत बातूनी रोबोट (एक लार्ज लैंग्वेज मॉडल) है जिसे आप कहानियाँ लिखने, सवालों के जवाब देने या कोड में मदद करने के लिए काम पर रखना चाहते हैं। लेकिन आपको डर है कि वह गलती से कुछ बुरा, अवैध या खतरनाक बोल सकता है।
पारंपरिक रूप से, इस रोबोट को नियंत्रण में रखने के लिए, कंपनियाँ एक "सुरक्षा गार्ड" का उपयोग करती हैं जो खुद भी एक विशाल, अत्यंत जटिल रोबोट होता है। ये गार्ड 27-मंजिला गगनचुंबी इमारतों (7 बिलियन से 27 बिलियन पैरामीटर्स) की तरह होते हैं। संदेश सुरक्षित है या नहीं, यह जाँचने के लिए, गार्ड को संदेश को पढ़ना पड़ता है, उस पर विचार करना पड़ता है, और फिर उसे अपना निर्णय शब्द-दर-शब्द "बोलना" पड़ता है, जैसे कि एक धीमा, सतर्क लाइब्रेरियन एक किताब के हर पन्ने को एक-एक करके जाँच रहा हो। यह सटीक है, लेकिन यह भारी, धीमा और चलाने में महंगा है।
GLiGuard इस पेपर का नया समाधान है। यह एक छोटा, फुर्तीला सुरक्षा गार्ड है (केवल 0.3 बिलियन पैरामीटर्स वाला) जो पूरी तरह से अलग तरीके से काम करता है।
GLiGuard कैसे काम करता है, यहाँ सरल उपमाओं (analogies) का उपयोग किया गया है:
1. "स्क्रिप्ट" के बजाय "मेन्यू"
अधिकांश सुरक्षा गार्डों को केवल विशिष्ट चीजों को खोजने के लिए प्रशिक्षित किया जाता है। यदि आप चाहते हैं कि वे "हिंसा" और "घृणास्पद भाषण" और "जेलब्रेक" की जाँच करें, तो आपको आमतौर पर उन्हें फिर से प्रशिक्षित करना पड़ता है या उन्हें कई बार चलाना पड़ता है।
GLiGuard अलग है। इसके साथ एक डायनामिक मेन्यू (जिसे "स्कीमा" कहा जाता है) आता है।
- पुराना तरीका: आपके पास एक गार्ड है जो केवल "आग" की जाँच करना जानता है। यदि आप बाद में "बाढ़" की जाँच करना चाहते हैं, तो आपको उस गार्ड को निकालना होगा और एक नया गार्ड रखना होगा।
- GLiGuard का तरीका: आप गार्ड को कागज का एक टुकड़ा (स्कीमा) देते हैं जिसमें ठीक वही लिखा होता है जो आप अभी जाँचना चाहते हैं। आप लिख सकते हैं: "आग, बाढ़ और भूकंप की जाँच करें।" गार्ड इस सूची को पढ़ता है, उन शब्दों की परिभाषाओं को समझता है, और उन सभी की एक साथ जाँच करता है।
2. "ग्रुप फोटो" बनाम "लाइन"
- पुराना तरीका (Autoregressive): कल्पना कीजिए कि एक सुरक्षा गार्ड को एक एकल-फाइल लाइन में खड़ा होना पड़ता है। वे पहले शब्द को देखते हैं, फिर दूसरे को, फिर तीसरे को, और जैसे-जैसे वे आगे बढ़ते हैं, वे निर्णय लेते हैं। यदि संदेश लंबा है, तो लाइन लंबी हो जाती है, और प्रतीक्षा समय बहुत बढ़ जाता है।
- GLiGuard का तरीका (Bidirectional): कल्पना कीजिए कि गार्ड पूरे संदेश और सुरक्षा नियमों की एक ग्रुप फोटो लेता है। क्योंकि वे एक ही समय में वाक्य की शुरुआत, मध्य और अंत देख सकते हैं, वे संदर्भ (context) को तुरंत समझ जाते हैं। उन्हें अगले शब्द के आने का इंतज़ार नहीं करना पड़ता; वे एक ही झटके में पूरी तस्वीर देख लेते हैं।
3. "स्विस आर्मी नाइफ" जैसी दक्षता
पेपर का दावा है कि जबकि GLiGuard विशाल गगनचुंबी इमारतों वाले गार्डों की तुलना में 23 से 90 गुना छोटा है, फिर भी यह बुरे कंटेंट को पकड़ने में उतना ही सक्षम है।
- गति (Speed): क्योंकि इसे अपना उत्तर शब्द-दर-शब्द "बोलना" नहीं पड़ता, इसलिए यह 16 गुना तेज़ (उच्च थ्रूपुट) और 17 गुना कम विलंबता (तेज़ रिस्पॉन्स टाइम) वाला है।
- बहुमुखी प्रतिभा (Versatility): यह एक ही बार में 14 अलग-अलग प्रकार के नुकसान (जैसे हिंसा, गोपनीयता लीक, या घृणास्पद भाषण) और 11 अलग-अलग प्रकार के "जेलब्रेक" ट्रिक्स (तरीके जिनसे लोग AI को धोखा देने की कोशिश करते हैं) की जाँच कर सकता है।
4. "कड़े नियम"
GLiGuard केवल अनुमान नहीं लगाता; यह एक सख्त तर्क प्रवाह (logic flow) का पालन करता है:
- यह आपके संदेश और सुरक्षा नियमों के "मेन्यू" को पढ़ता है।
- यह जाँचता है: "क्या यह प्रॉम्प्ट सुरक्षित है?" "क्या यह प्रतिक्रिया सुरक्षित है?" "क्या उपयोगकर्ता ने सिस्टम को धोखा देने की कोशिश की?" "क्या यहाँ घृणास्पद भाषण है?"
- यह इन उत्तरों को जोड़ता है। यदि कोई भी विशिष्ट जाँच (जैसे "जेलब्रेक का पता चला") लाल निशान दिखाती है, तो पूरे संदेश को तुरंत ब्लॉक कर दिया जाता है, चाहे सामान्य सुरक्षा जाँच ने कुछ भी कहा हो।
मुख्य निष्कर्ष
यह पेपर तर्क देता है कि आपको सुरक्षा फ़िल्टर के रूप में कार्य करने के लिए एक विशाल, धीमे, महंगे "सुपर-ब्रेन" की आवश्यकता नहीं है। आप एक सघन, स्मार्ट और लचीले उपकरण का उपयोग कर सकते हैं जो सुरक्षा नियमों को इनपुट के रूप में पढ़ता है, एक बार में सब कुछ जाँचता है, और वर्तमान उद्योग मानकों की तुलना में बहुत तेज़ी से और सस्ते में काम करता है, बिना सटीकता खोए।
संक्षेप में: GLiGuard एक धीमे, भारी टैंक को एक तेज़, फुर्तीले ड्रोन से बदलने जैसा है जो निर्देशों का एक नया सेट पढ़कर उड़ान के बीच में ही अपना मिशन बदल सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।