← नवीनतम पेपर
💬 NLP

A Lightweight Explainable Guardrail for Prompt Safety

यह योगदान LEG को प्रस्तुत करता है, जो एक हल्का, व्याख्यात्मक गार्डरेल है जो प्रॉम्प्ट सुरक्षा वर्गीकरण और स्पष्टीकरण में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए मल्टी-टास्क लर्निंग, पूर्वाग्रह-निवारक सिंथेटिक डेटा और एक नवीन अनिश्चितता-भारित लॉस फंक्शन का लाभ उठाता है, जबकि मॉडल का आकार काफी छोटा है।

मूल लेखक: Md Asiful Islam, Mihai Surdeanu

प्रकाशित 2026-04-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Md Asiful Islam, Mihai Surdeanu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही शक्तिशाली, रचनात्मक रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो कहानियाँ लिख सकता है, गणितीय समस्याओं को हल कर सकता है और आपसे चैट कर सकता है। फिर भी, किसी भी शक्तिशाली उपकरण की तरह, इसे कभी-कभी कुछ खतरनाक कहने के लिए उकसाया जा सकता है, जैसे बम बनाने के निर्देश देना या नफरत फैलाना।

इसे रोकने के लिए, हम आमतौर पर रोबोट के सामने एक "सुरक्षा अधिकारी" (security officer) रखते हैं। यदि कोई दुर्भावनापूर्ण प्रश्न पूछता है, तो गार्ड रोबोट के सुनने से पहले ही उसे रोक देता है।

वर्तमान सुरक्षा अधिकारियों के साथ समस्या यह है कि वे या तो:

  1. बहुत बोझिल और धीमे हैं: वे भारी, धीरे-धीरे चलने वाले टैंकों की तरह हैं जिन्हें हर सवाल की जांच करने में बहुत समय लगता है।
  2. मौन रहते हैं: वे केवल "नहीं" कहते हैं, लेकिन यह नहीं समझा सकते कि उन्होंने "नहीं" क्यों कहा। यह एक बाउंसर द्वारा आपको बाहर निकालने जैसा है बिना यह बताए कि आपने कौन सा नियम तोड़ा है।

यह कार्य LEG (लाइटवेट एक्सप्लेनेबल गार्डरेल - Lightweight Explainable Guardrail) नामक एक नए प्रकार के गार्ड से परिचय कराता है। कल्पना कीजिए कि LEG एक तेज नजर वाला, त्वरित सोच रखने वाला सुरक्षा विश्लेषक है जो आपकी जेब में समा सकता है, लेकिन इतना स्मार्ट है कि वह मुसीबत को पहचान सके और ठीक से बता सके कि क्या गलत हुआ।

यहाँ बताया गया है कि LEG कैसे काम करता है, जिसे सरल भागों में विभाजित किया गया है:

1. दो-इन-एक जासूस (मल्टी-टास्क लर्निंग)

अधिकांश सुरक्षा अधिकारियों के पास केवल एक ही काम होता है: यह तय करना कि प्रश्न "सुरक्षित" है या "असुरक्षित"। LEG के पास एक साथ दो काम हैं:

  • काम A: यह तय करना कि क्या प्रश्न सुरक्षित है।
  • काम B: उन विशिष्ट शब्दों की ओर इशारा करना जिन्होंने प्रश्न को असुरक्षित बनाया।

उपमा: एक शिक्षक की कल्पना करें जो छात्र के निबंध का मूल्यांकन कर रहा है।

  • एक सामान्य गार्ड केवल कागज पर एक बड़ा लाल "F" लगा देता है।
  • LEG एक लाल "F" लगाता है और उस विशिष्ट वाक्य को हाइलाइट करता है जिसने नियमों का उल्लंघन किया, यह कहते हुए: "तुम इसलिए असफल हुए क्योंकि तुमने इन तीन शब्दों का उपयोग किया।"

2. "एडवोकेट्स डायबोली" प्रशिक्षण (सिंथेटिक डेटा)

LEG को बुरे शब्दों को पहचानना सिखाने के लिए, शोधकर्ताओं को कई उदाहरणों की आवश्यकता थी। हालाँकि, लोग व्यस्त हैं, और मौजूदा डेटा में उन "चिह्नित शब्दों" की कमी थी जिनकी LEG को प्रशिक्षित करने के लिए आवश्यकता थी।

इसलिए, उन्होंने एक अन्य AI के साथ मिलकर डेटा उत्पन्न करने के लिए एक चतुर चाल का उपयोग किया। उन्होंने प्रशिक्षण AI के विरुद्ध "एडवोकेट्स डायबोली" (Advocatus Diaboli) का खेल खेला:

  • उन्होंने AI से पूछा: "यह प्रश्न सुरक्षित क्यों है?" (भले ही वह वास्तव में असुरक्षित हो)।
  • फिर उन्होंने पूछा: "यह प्रश्न असुरक्षित क्यों है?"
  • चाल: यदि AI अपने स्वयं के पूर्वाग्रह (bias) से भ्रमित था (यह सोचकर कि प्रश्न सुरक्षित है क्योंकि इसे "यह क्यों सुरक्षित है?" के रूप में पूछा गया था), तो शोधकर्ताओं ने उस उत्तर को हटा दिया। उन्होंने केवल उन उत्तरों को रखा जहाँ AI ने पूर्वाग्रह के विरुद्ध सफलतापूर्वक तर्क दिया।
  • परिणाम: LEG ने उच्च गुणवत्ता वाले "काउंटर-बायस" (counter-bias) उदाहरणों से सीखा, जिससे इसने खुद को केवल शब्दों के बजाय शब्दों के संदर्भ (context) को देखने के लिए प्रशिक्षित किया।

3. "फोकस" तंत्र (लॉस फंक्शन)

जब LEG सीखता है, तो वह कभी-कभी पेचीदा उदाहरणों से भ्रमित हो जाता है। शोधकर्ताओं ने LEG को एक विशेष "फोकस" टूल दिया।

  • उपमा: कल्पना करें कि LEG एक परीक्षा के लिए पढ़ाई कर रहा है। यदि वह एक आसान सवाल का सही जवाब देता है, तो उसे इसे दोबारा सीखने की आवश्यकता नहीं है। लेकिन यदि वह एक कठिन सवाल का गलत जवाब देता है, तो LEG को उस विशिष्ट सवाल को और अधिक गहनता से सीखने के लिए एक "धक्का" मिलता है।
  • यह सुनिश्चित करता है कि LEG अपना ऊर्जा आसान मामलों के बजाय कठिन, भ्रमित करने वाले मामलों पर केंद्रित करे।

4. LEG क्यों एक गेम-चेंजर है

यह कार्य दावा करता है कि LEG तीन प्रमुख क्षेत्रों में वर्तमान सर्वश्रेष्ठ सुरक्षा अधिकारियों से बेहतर प्रदर्शन करता है:

  • यह तेज़ और हल्का है: जबकि अन्य गार्ड भारी ट्रकों की तरह हैं (जिनके लिए विशाल कंप्यूटर मेमोरी और समय की आवश्यकता होती है), LEG एक स्कूटर की तरह है। यह बहुत छोटा है (इसके कुछ संस्करण प्रतिस्पर्धा से 75 गुना छोटे हैं) लेकिन उतना ही तेज़, या उससे भी तेज़ है।
  • यह ईमानदार (Faithful) है: चूंकि LEG अपने निर्णय के लिए उपयोग किए गए विशिष्ट शब्दों को हाइलाइट करता है, इसलिए हम जानते हैं कि यह केवल अनुमान नहीं लगा रहा है। शोधकर्ताओं ने यह परीक्षण करने के लिए कि LEG वास्तव में सही सुरागों को देखता है, उन शब्दों को "डैम्पिंग" (कमजोर) करके परीक्षण किया जिन्हें LEG ने चिह्नित किया था। जब उन्होंने ऐसा किया, तो LEG भ्रमित हो गया और वह सही निर्णय लेने में असमर्थ रहा। यह साबित करता है कि LEG वास्तव में सही संकेतों को देखता है।
  • यह नई स्थितियों में बुद्धिमान है: LEG का परीक्षण उन प्रश्नों पर किया गया था जो उसने पहले कभी नहीं देखे थे (आउट-ऑफ-डोमेन)। यहाँ तक कि जब प्रश्न पूरी तरह से नए थे, तब भी LEG ने विशाल, धीमे गार्डों के समान या उनसे बेहतर प्रदर्शन किया।

सारांश

यह कार्य LEG को AI के लिए एक नए, छोटे और तेज़ सुरक्षा अधिकारी के रूप में प्रस्तुत करता है। वर्तमान गार्डों के विपरीत जो धीमे और मौन हैं, LEG तेजी से प्रतिक्रिया करता है और सटीक रूप से उन शब्दों की ओर इशारा कर सकता है जो एक प्रश्न को खतरनाक बनाते हैं। इसने अपनी क्षमता विकसित करने के लिए अन्य AI के साथ "एडवोकेट्स डायबोली" का चतुर खेल खेला ताकि अपना स्वयं का प्रशिक्षण मैनुअल बना सके, और इसने सिद्ध किया कि यह एक विशाल कंप्यूटर चलाने के बिना भी पेचीदा स्थितियों को संभाल सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →