← नवीनतम पेपर
💬 NLP

Efficient LLM Moderation with Multi-Layer Latent Prototypes

यह शोध पत्र मल्टी-लेयर प्रोटोटाइप मॉडरेटर (MLPM) को प्रस्तुत करता है, जो एक हल्का और अनुकूलन योग्य इनपुट मॉडरेशन टूल है जो बड़े भाषा मॉडलों (LLMs) को तैनात करने में दक्षता और अनुकूलन क्षमता की चुनौतियों को प्रभावी ढंग से संबोधित करते हुए, अत्याधुनिक सुरक्षा प्रदर्शन प्राप्त करने के लिए इंटरमीडिएट लेयर प्रोटोटाइप का लाभ उठाता है।

मूल लेखक: Maciej Chrabąszcz, Filip Szatkowski, Bartosz Wójcik, Jan Dubiński, Tomasz Trzciński, Sebastian Cygert

प्रकाशित 2026-02-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Maciej Chrabąszcz, Filip Szatkowski, Bartosz Wójcik, Jan Dubiński, Tomasz Trzciński, Sebastian Cygert

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, रचनात्मक रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है जिसे आप कहानियाँ लिखने, प्रश्नों के उत्तर देने या काम में मदद करने के लिए उपयोग करना चाहते हैं। आपने इसे विनम्र और सहायक होने के लिए प्रशिक्षित किया है, लेकिन कभी-कभी, यदि कोई पेचीदा या खतरनाक प्रश्न पूछता है, तो रोबोट अनजाने में कुछ हानिकारक कह सकता है।

इसे रोकने के लिए, हम आमतौर पर रोबोट के सामने एक "सुरक्षा गार्ड" (security guard) रखते हैं। यह गार्ड रोबोट के उत्तर देने से पहले हर प्रश्न को पढ़ता है। यदि प्रश्न बुरा दिखता है, तो गार्ड रोबोट को रोक देता है।

वर्तमान गार्डों के साथ समस्या
पेपर बताता है कि हम वर्तमान में इन गार्डों का उपयोग कैसे करते हैं इसमें दो मुख्य मुद्दे हैं:

  1. "भारी" गार्ड (The "Heavy" Guard): कुछ गार्ड पूर्णकालिक सुरक्षा टीमों की तरह होते हैं। वे बुरे प्रश्नों को पकड़ने में बहुत अच्छे हैं, लेकिन वे धीमे हैं, चलाने में महंगे हैं, और उन्हें कस्टमाइज़ करना कठिन है। वे एक अकेले दरवाजे की जाँच करने के लिए एक विशाल सुरक्षा फर्म को काम पर रखने जैसे हैं।
  2. "हल्का" गार्ड (The "Light" Guard): अन्य तरीके एक त्वरित नज़र या एक साधारण चेकलिस्ट की तरह होते हैं। वे तेज़ और सस्ते हैं, लेकिन वे सूक्ष्म या पेचीदा बुरे प्रश्नों को मिस कर देते हैं।

समाधान: MLPM (द "स्मार्ट स्काउट")
लेखक एक नया टूल पेश करते हैं जिसे MLPM (मल्टी-लेयर प्रोटोटाइप मॉडरेटर) कहा जाता है। MLPM को एक भारी सुरक्षा टीम के रूप में नहीं, बल्कि एक अत्यधिक प्रशिक्षित "स्काउट" (scout) के रूप में सोचें जो रोबोट के बोलने शुरू करने से पहले ही उसके आंतरिक विचारों की जाँच करके ठीक जानता है कि क्या देखना है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "आंतरिक ब्लूप्रिंट" की जाँच करना (लेटेंट प्रोटोटाइप्स)

जब एक रोबोट सोचता है, तो वह सीधे उत्तर पर नहीं कूदता। वह कई परतों (layers) के माध्यम से प्रसंस्करण करता है, जैसे एक फैक्ट्री असेंबली लाइन। प्रत्येक स्टेशन (लेयर) पर, रोबोट जो सोच रहा है उसका एक "ब्लूप्रिंट" रखता है।

  • पुराने तरीके आमतौर पर लाइन के बिल्कुल अंत में अंतिम ब्लूप्रिंट की जाँच करते हैं।
  • MLPM प्रक्रिया के दौरान कई स्टेशनों पर ब्लूप्रिंट की जाँच करता है। यह महसूस करता है कि कभी-कभी एक बुरा विचार प्रक्रिया के बीच में ही आ जाता है, भले ही अंतिम उत्तर ठीक दिखे।

2. "मानसिक उंगलियों के निशान" (प्रोटोटाइप्स)

यह जानने के लिए कि कोई प्रश्न बुरा है या नहीं, MLPM को दुनिया के हर बुरे प्रश्न को याद करने की आवश्यकता नहीं है। इसके बजाय, यह "प्रोटोटाइप्स" सीखता है।

  • कल्पना करें कि आपके पास दो मानसिक फोल्डर हैं: एक "सुरक्षित" (Safe) लेबल वाला और दूसरा "असुरक्षित" (Unsafe) लेबल वाला।
  • MLPM कुछ हज़ार उदाहरणों के आधार पर प्रत्येक फोल्डर के लिए एक "परफेक्ट औसत" उदाहरण (प्रोटोटाइप) बनाता है।
  • जब कोई नया प्रश्न आता है, तो MLPM पूछता है: "क्या यह प्रश्न 'सुरक्षित' औसत जैसा दिखता है या 'असुरक्षित' औसत जैसा?"

3. "स्मार्ट दूरी" (महालानोबिस डिस्टेंस)

अधिकांश सरल जाँच केवल सीधी रेखा की दूरी को मापती हैं (जैसे केंद्र से एक बिंदु कितनी दूर है)। लेकिन पेपर बताता है कि बुरे विचार अजीब आकार के हो सकते हैं।

  • उपमा: कल्पना करें कि आप जंगल में एक खोए हुए हाइकर को खोजने की कोशिश कर रहे हैं। एक साधारण रूलर कह सकता है कि वह "5 मील दूर" है। लेकिन यदि जंगल में एक नदी या पहाड़ बाधा के रूप में है, तो हाइकर वास्तव में बहुत कठिन से पहुँच योग्य है।
  • MLPM एक विशेष "स्मार्ट रूलर" (महालानोबिस डिस्टेंस) का उपयोग करता है जो जंगल के आकार को ध्यान में रखता है। यह समझता है कि कुछ "बुरे" प्रश्न पेचीदा होते हैं और औसत से अलग दिखते हैं, लेकिन यह उन्हें फिर भी पहचान सकता है क्योंकि यह रोबोट के मन के परिदृश्य (terrain) को समझता है।

4. "स्पार्स टीम" (मल्टी-लेयर एग्रीगेशन)

चूंकि MLPM कई परतों की जाँच करता है, इसलिए यह बहुत अधिक जानकारी से अभिभूत हो सकता है। इसे ठीक करने के लिए, यह एक "स्मार्ट फिल्टर" का उपयोग करता है।

  • यह सीखता है कि कौन सी विशिष्ट परतें (स्टेशन) खतरे को पहचानने के लिए सबसे महत्वपूर्ण हैं।
  • यह शोर वाले, महत्वहीन परतों को अनदेखा करता है और केवल उन "प्रमुख स्काउट्स" पर ध्यान केंद्रित करता है जो सबसे अच्छा संकेत देते हैं। यह सिस्टम को तेज़ और कुशल बनाए रखता है।

यह एक बड़ी बात क्यों है?
पेपर का दावा है कि MLML एक "दोनों दुनियाओं का सर्वश्रेष्ठ" समाधान है:

  • यह तेज़ और सस्ता है: यह रोबोट की सोचने की प्रक्रिया में लगभग कोई देरी नहीं जोड़ता है। यह रोबोट के अपने आंतरिक विचारों का उपयोग करता है, इसलिए इसे अलग, भारी सुरक्षा मॉडल की आवश्यकता नहीं होती है।
  • यह सुपर स्मार्ट है: यह भारी सुरक्षा गार्डों की तुलना में बुरे प्रश्नों को बेहतर तरीके से पकड़ता है, भले ही इसे बहुत कम डेटा (केवल 1,000 उदाहरण) पर प्रशिक्षित किया गया हो।
  • यह लचीला है: आप इसे लगभग किसी भी रोबोट मॉडल, बड़े या छोटे, के साथ उपयोग कर सकते हैं।
  • यह तालमेल बिठाता है: यह अन्य सुरक्षा उपकरणों के साथ मिलकर काम कर सकता है। उदाहरण के लिए, यह एक गेटकीपर के रूप में कार्य कर सकता है ताकि बुरे प्रश्नों को रोबोट तक पहुँचने से पहले ही रोका जा सके, जिससे रोबोट भ्रमित होने या हानिरहित प्रश्नों को मना करने (जिसे "फॉल्स रिफ्यूज़ल" कहा जाता है) से बच जाता है।

संक्षेप में
MLPM को आपके रोबोट सहायक को "एक्स-रे चश्मे" देने के रूप में देखें जो उसे कई चरणों में अपने स्वयं के आंतरिक विचारों को झाँकने की अनुमति देता है। सीखे गए "सुरक्षित" और "असुरक्षित" पैटर्न के साथ अपने विचारों की तुलना करके, यह बिना रोबोट को धीमा किए या किसी विशाल, महंगी सुरक्षा टीम की आवश्यकता के बिना तुरंत खतरे को पहचान सकता है। यह AI को सुरक्षित, तेज़ और प्रबंधित करने में आसान बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →