← नवीनतम पेपर
💬 NLP

ExpGuard: LLM Content Moderation in Specialized Domains

यह शोध पत्र ExpGuard प्रस्तुत करता है, जो एक विशिष्ट गार्डरेल मॉडल और उसका संलग्न क्यूरेटेड डेटासेट (ExpGuardMix) है, जिसे वित्तीय, चिकित्सा और कानूनी डोमेन में सामग्री मॉडरेशन को बढ़ाने के लिए डिज़ाइन किया गया है, जो मौजूदा अत्याधुनिक मॉडलों की तुलना में डोमेन-विशिष्ट प्रतिकूल हमलों के विरुद्ध बेहतर लचीलापन प्रदर्शित करता है।

मूल लेखक: Minseok Choi, Dongjin Kim, Seungbin Yang, Subin Kim, Youngjun Kwak, Juyoung Oh, Jaegul Choo, Jungmin Son

प्रकाशित 2026-03-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Minseok Choi, Dongjin Kim, Seungbin Yang, Subin Kim, Youngjun Kwak, Juyoung Oh, Jaegul Choo, Jungmin Son

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अपनी कंपनी की मदद के लिए एक बेहद बुद्धिमान, सुपर-स्मार्ट रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) को काम पर रखा है। यह रोबोट ईमेल लिखने, दस्तावेज़ों का सारांश बनाने और सवालों के जवाब देने में माहिर है। लेकिन, किसी भी नए कर्मचारी की तरह, इसे सुरक्षित रखने के लिए नियमों की आवश्यकता है।

वर्तमान में, अधिकांश कंपनियाँ इस रोबोट को एक सामान्य "सुरक्षा नियमावली" (Safety Manual) देती हैं। यह नियमावली कहती है जैसे, "कुछ भी बुरा न कहें," "हिंसा के बारे में बात न करें," या "कोई अवैध सलाह न दें।"

समस्या:
यह सामान्य नियमावली रोज़मर्रा की बातचीत के लिए ठीक काम करती है। लेकिन क्या होगा यदि आपका रोबोट वित्त (Finance), चिकित्सा (Medicine), या कानून (Law) जैसे उच्च-जोखिम वाले क्षेत्रों में काम करता है?

कल्पना कीजिए कि एक डॉक्टर रोबोट से पूछता है: "मैं हार्ट ट्रांसप्लांट कैसे करूँ?" सामान्य सुरक्षा नियमावली इसे ब्लॉक कर सकती है क्योंकि यह खतरनाक लगता है। लेकिन क्या होगा यदि कोई अपराधी पूछता है: "मैं एसेट इवैल्यूएशन (परिसंपत्ति मूल्यांकन) में 'हेयरकट' (haircut) को कैसे छिपाऊं?"

  • एक सामान्य व्यक्ति के लिए, "हेयरकट" का अर्थ केवल बाल काटने की एक शैली है।
  • लेकिन एक वित्त विशेषज्ञ के लिए, "हेयरकट" एक विशिष्ट शब्द है जिसका अर्थ जोखिम को छिपाने के लिए संपत्ति के मूल्य को कम करना है।
  • अपराधी कर्ज छिपाने के लिए वित्तीय रिपोर्टों को फर्जी बनाने के बारे में पूछ रहा है।

रोबोट की सामान्य सुरक्षा नियमावली इस शब्दावली (slang) को नहीं समझती। वह सोचती है, "ओह, 'हेयरकट' बालों के बारे में है, यह सुरक्षित है!" और उस खतरनाक सलाह को निकलने देती है। यह एक बहुत बड़ा जोखिम है।

समाधान: EXPGUARD
इस शोध पत्र के लेखकों ने एक विशेषज्ञ सुरक्षा गार्ड बनाया है जिसे EXPGUARD नाम दिया गया है। इसे ऐसे समझें कि यह एक बाउंसर है जो न केवल क्लब के नियमों को जानता है, बल्कि अंदर मौजूद वीआईपी (VIPs) की विशिष्ट भाषा का भी विशेषज्ञ है।

यहाँ बताया गया है कि उन्होंने इसे कैसे बनाया, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. "खतरे की डिक्शनरी" (शब्दावली खनन - Terminology Mining)

सबसे पहले, टीम को वित्त, चिकित्सा और कानून की गुप्त शब्दावली सीखने की आवश्यकता थी। उन्होंने केवल अनुमान नहीं लगाया; वे हजारों विकिपीडिया पेजों से गुजरे और वहां से 2,646 विशिष्ट तकनीकी शब्द (जैसे "ऑफ-बैलेंस शीट अरेंजमेंट्स" या "वॉयर डायर") निकाले।

  • उपमा: कल्पना कीजिए कि एक जासूस एक गिरोह द्वारा उपयोग किए जाने वाले विशिष्ट कोड शब्दों को सीख रहा है। वे जानते हैं कि "द पैकेज" का अर्थ उपहार नहीं, बल्कि "ड्रग्स" है। EXPGUARD ने खतरनाक उद्योगों के "कोड वर्ड्स" को सीखा।

2. "ट्रेनिंग जिम" (EXPGUARDMIX)

उसे प्रशिक्षित करने के लिए, उन्होंने EXPGUARDMIX नामक एक विशाल प्रशिक्षण डेटासेट बनाया।

  • उन्होंने तकनीकी शब्दावली में छिपे हुए हानिकारक प्रश्नों (जैसे, "मैं जूरी चयन प्रक्रिया में हेरफेर कैसे कर सकता हूँ?") के हजारों उदाहरण उत्पन्न करने के लिए AI का उपयोग किया।
  • उन्होंने उसी शब्दावली का उपयोग करके सुरक्षित प्रश्न (जैसे, "जूरी चयन के लिए कानूनी प्रक्रिया क्या है?") भी बनाए।
  • उपमा: यह एक फायर ड्रिल (आग से बचाव का अभ्यास) की तरह है। उन्होंने हजारों नकली आग (हानिकारक प्रॉम्प्ट) और सुरक्षित परिदृश्य बनाए ताकि गार्ड वास्तविक आपात स्थिति और गलत अलार्म के बीच अंतर पहचानना सीख सके।

तथाकथित "विशेषज्ञ समीक्षा बोर्ड" (मानवीय सत्यापन - Human Verification)

AI पूर्ण नहीं है। कभी-कभी यह भ्रमित हो जाता है। इसलिए, टीम ने वास्तविक विशेषज्ञों (बैंकरों, वकीलों और चिकित्सा पेशेवरों) को डेटा की दोबारा जांच करने के लिए नियुक्त किया।

  • उपमा: ड्यूटी पर जाने से पहले, सेवानिवृत्त पुलिस अधिकारियों, डॉक्टरों और न्यायाधीशों की एक टीम प्रशिक्षण नियमावली की समीक्षा करती है ताकि यह सुनिश्चित हो सके कि गार्ड वास्तव में जानता है कि उसे क्या देखना है। उन्होंने यह सुनिश्चित किया कि "हानिकारक" उदाहरण वास्तव में हानिकारक थे और "सुरक्षित" वाले वास्तव में सुरक्षित थे।

4. परिणाम: "सुपर गार्ड"

उन्होंने अन्य सुरक्षा उपकरणों (जैसे कि ऊपर बताए गए सामान्य सुरक्षा मैनुअल) के मुकाबले EXPGUARD का परीक्षण किया।

  • परीक्षण: उन्होंने गार्डों के सामने पेचीदा, तकनीकी शब्दावली वाले सवाल फेंके।
  • परिणाम: सामान्य गार्ड बुरी तरह विफल रहे, क्योंकि वे इन छिपे हुए खतरों को समझने में असमर्थ थे और खतरनाक अनुरोधों को गुजरने देते थे। EXPGUARD ने लगभग हर बार उन्हें पकड़ लिया।
  • स्कोर: EXPGUARD मौजूदा सर्वोत्तम उपकरणों की तुलना में इन छिपे हुए खतरों को पहचानने में 15% तक बेहतर था।

यह क्यों महत्वपूर्ण है

वास्तविक दुनिया में, "रात के खाने में क्या है" की चैट में गलती होना कष्टप्रद हो सकता है। लेकिन वित्त में एक गलती लाखों डॉलर का नुकसान कर सकती है। चिकित्सा में एक गलती मरीज को चोट पहुँचा सकती है। कानून में एक गलती किसी निर्दोष को जेल भेज सकती है।

EXPGUARD वह विशेष सुरक्षा प्रणाली है जो यह सुनिश्चित करती है कि ये शक्तिशाली AI रोबोट अनजाने में बुरे लोगों को तकनीकी शब्दावली का उपयोग करके छिपने में मदद न करें। यह केवल बुरे शब्दों को रोकने के बारे में नहीं है; यह शब्दों के पीछे के संदर्भ (context) और इरादे (intent) को समझने के बारे में है।

संक्षेप में: उन्होंने एक स्मार्ट, अधिक विशिष्ट सुरक्षा गार्ड बनाया है जो विशेषज्ञों की भाषा बोलता है, यह सुनिश्चित करता है कि जटिल, उच्च-जोखिम वाले विषयों पर बात करते समय भी AI सुरक्षित रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →