← नवीनतम पेपर
💬 NLP

CHILLGuard: Towards Fine-Grained Chinese LLM Safety Guardrail with Scalable Data Construction and Model-aware Preference Alignment

यह शोध पत्र CHILLGuard को प्रस्तुत करता है, जो एक सूक्ष्म-स्तरीय (fine-grained) चीनी LLM सुरक्षा गार्डरेल है जो एक स्केलेबल बहु-चरणीय निर्माण पाइपलाइन के माध्यम से उच्च-गुणवत्ता वाले एनोटेटेड डेटा की कमी को संबोधित करता है और एक बड़े पैमाने पर, कठोरता से क्यूरेट किए गए डेटासेट पर मॉडल-जागरूक प्राथमिकता संरेखण (model-aware preference alignment) के माध्यम से अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Wenbo Yu, Bohua Wang, Hao Fang, Kuofeng Gao, Jingru Zeng, Xiaochen Yang, Tianyi Zhang, Xiaoxiao Ma, Jiawei Kong, Hao Wu, Bin Chen, Shu-Tao Xia, Min Zhang

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenbo Yu, Bohua Wang, Hao Fang, Kuofeng Gao, Jingru Zeng, Xiaochen Yang, Tianyi Zhang, Xiaoxiao Ma, Jiawei Kong, Hao Wu, Bin Chen, Shu-Tao Xia, Min Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सहायक रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल) है जो कहानियाँ लिख सकता है, प्रश्नों के उत्तर दे सकता है और काम में मदद कर सकता है। लेकिन किसी भी शक्तिशाली उपकरण की तरह, यदि इस पर सावधानी से नज़र नहीं रखी गई, तो यह अनजाने में कुछ अभद्र, अवैध या खतरनाक कह सकता है, विशेष रूप से चीनी भाषा में बोलते समय।

यह शोध पत्र CHILLGuard पेश करता है, जो विशेष रूप से चीनी बोलने वाले रोबोटों की निगरानी के लिए डिज़ाइन किया गया एक विशिष्ट "सेफ्टी गार्ड" (सुरक्षा रक्षक) है। इसे कैसे बनाया गया है, इसे सरल शब्दों में यहाँ समझाया गया है:

1. समस्या: "एक ही आकार सबके लिए" वाला सूट फिट नहीं बैठता

मौजूदा सुरक्षा रक्षक (सेफ्टी गार्ड) मुख्य रूप से अंग्रेजी पर प्रशिक्षित थे। कल्पना कीजिए कि आप एक अलग शरीर के प्रकार वाले व्यक्ति को एक ऊंचे अमेरिकी व्यक्ति के लिए टेलर किए गए सूट में पहनाने की कोशिश कर रहे हैं; यह कुछ जगहों पर बहुत तंग और कुछ जगहों पर ढीला हो सकता है।

  • समस्या: ये अंग्रेजी-प्रशिक्षित रक्षक चीनी संस्कृति, विशिष्ट कानूनों, या चीनी भाषा में लोगों द्वारा बुरे इरादों को छिपाने के चतुर तरीकों (जैसे कि हानिकारक बातें कहने के लिए पहेलियों, इमोजी, या ऐतिहासिक संदर्भों का उपयोग करना) को नहीं समझ पाते थे।
  • परिणाम: वे अक्सर खतरनाक सामग्री को पकड़ने में चूक जाते थे या निर्दोष चीजों को गलत तरीके से फ्लैग (चिह्नित) कर देते थे।

2. समाधान: एक कस्टम-मेड सुरक्षा सूट

लेखकों ने तीन मुख्य भागों वाला एक नया सुरक्षा तंत्र बनाया है:

भाग अ: नियम पुस्तिका (The Taxonomy)

सबसे पहले, उन्होंने विशेष रूप से चीनी सुरक्षा के लिए एक नई, विस्तृत नियम पुस्तिका लिखी। केवल "बुरा" या "अच्छा" कहने के बजाय, उन्होंने 31 विशिष्ट श्रेणियों के साथ एक 5-स्टार रेटिंग प्रणाली बनाई।

  • 5 मुख्य श्रेणियाँ:
    1. राष्ट्रीय मूल्य: देश की स्थिरता और कानूनों की रक्षा करना।
    2. निष्पक्षता: जाति, लिंग या नौकरी के आधार पर भेदभाव को रोकना।
    3. व्यावसायिक नियम: घोटाले, विचारों की चोरी, या अनुचित व्यावसायिक चालों को रोकना।
    4. व्यक्तिगत अधिकार: लोगों की गोपनीयता, प्रतिष्ठा और सुरक्षा की रक्षा करना।
    5. सेवा गुणवत्ता: यह सुनिश्चित करना कि रोबोट बेकार या वैज्ञानिक रूप से गलत सलाह न दे।

भाग ब: प्रशिक्षण जिम (डेटा निर्माण)

रक्षक को सिखाने के लिए, उन्हें उदाहरणों की एक विशाल लाइब्रेरी की आवश्यकता थी। लेकिन "बुरे" चीनी प्रॉम्प्ट्स के अच्छे उदाहरण ढूंढना कठिन था। इसलिए, उन्होंने उन्हें बनाने के लिए एक तीन-चरणीय फैक्ट्री बनाई:

  1. खोज अभियान (RAG): उन्होंने इंटरनेट पर उन कीवर्ड्स को खोजा जो 31 श्रेणियों से संबंधित थे और वास्तविक टेक्स्ट नमूने एकत्र किए।
  2. वास्तविक दुनिया: उन्होंने उन वास्तविक प्रश्नों को एकत्र किया जो चीन में वाणिज्यिक रोबोटों से वास्तविक उपयोगकर्ताओं द्वारा पूछे गए थे।
  3. "धोखेबाज" फैक्ट्री (प्रॉम्प्ट इंजीनियरिंग): यह सबसे चतुर हिस्सा है। उन्होंने वास्तविक प्रश्नों को लिया और उन्हें ट्रिकी (चलाकी भरे) तरीकों से फिर से लिखने के लिए AI का उपयोग किया।
    • उपमा: कल्पना कीजिए कि सुरक्षा गार्ड का प्रशिक्षण हो रहा है। केवल एक चोर की तस्वीर दिखाने के बजाय, वे उसे एक वेश बदलकर, कोड में बात करते हुए, या मजाक के पीछे छिपकर आए चोर को दिखाते हैं। AI ने बुरे प्रश्नों को होमोफोन्स (ऐसे शब्द जो सुनने में समान हैं लेकिन लिखे अलग तरह से जाते हैं), ऐतिहासिक रूपकों, और व्यंग्य का उपयोग करके फिर से लिखा ताकि उन्हें पकड़ना कठिन हो सके।

अंत में उनके पास 4,05,000 प्रशिक्षण उदाहरण (जिम) और 51,000 परीक्षण उदाहरण (अंतिम परीक्षा) थे।

भाग स: प्रशिक्षण विधि ("स्पैरिंग पार्टनर")

आमतौर पर, आप एक सुरक्षा रक्षक को केवल उदाहरण दिखाकर प्रशिक्षित करते हैं। लेकिन इस शोध पत्र में स्पैरिंग पार्टनर (अभ्यास साथी) दृष्टिकोण का उपयोग किया गया।

  • लड़ाका (Generator): एक AI जिसे सुरक्षा रक्षक को चकमा देने के लिए सबसे कठिन संभव ट्रिकी प्रश्न बनाने के लिए प्रशिक्षित किया गया है।
  • रक्षक (Classifier): सुरक्षा मॉडल जो उन प्रश्नों को पकड़ने की कोशिश कर रहा है।
  • नृत्य (The Dance): उन्होंने उन्हें राउंड में एक साथ प्रशिक्षित किया। लड़ाका, रक्षक को धोखा देने की कोशिश करता है। जब रक्षक विफल होता है, तो लड़ाके को इनाम मिलता है। जब रक्षक सफल होता है, तो वह और मजबूत होता जाता है।
  • गुप्त नुस्खा (MDPO): उन्होंने मॉडल-अवेयर डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (MDPO) नामक एक विशेष तकनीक का उपयोग किया।
    • उपमा: कल्पना कीजिए कि एक कोच है। यदि कोई छात्र गणित में पहले से ही अच्छा है, तो कोच आसान समस्याओं पर समय बर्बाद नहीं करता है। लेकिन यदि छात्र किसी विशिष्ट कठिन अवधारणा के साथ संघर्ष कर रहा है, तो कोच उस पर अतिरिक्त ऊर्जा केंद्रित करता है। यह विधि स्वचालित रूप से प्रशिक्षण की कठिनाई को समायोजित करती थी, और अपना अधिकांश प्रयास उन प्रश्नों पर केंद्रित करती थी जिन्हें हल करने में रक्षक संघर्ष कर रहा था।

3. परिणाम: शानदार अंकों के साथ परीक्षा पास करना

उन्होंने अपने नए रक्षक का परीक्षण अन्य प्रसिद्ध सुरक्षा रक्षकों (जैसे LlamaGuard और QwenGuard) के विरुद्ध किया।

  • स्कोर: CHILLGuard ने उनके कस्टम टेस्ट पर काफी अधिक स्कोर किया।
  • तुलना: यह अपने मुख्य परीक्षण में दूसरे सबसे अच्छे मॉडल से बहुत बड़े अंतर से (लगभग 16% बेहतर) आगे निकल गया।
  • निरंतरता: अन्य मॉडलों के विपरीत जो कुछ विषयों में महान थे लेकिन कुछ में बहुत खराब, CHILLGuard सभी 31 श्रेणियों में मजबूत था।

सारांश

लेखकों ने चीनी AI के लिए एक कस्टम सुरक्षा रक्षक बनाया है:

  1. एक विस्तृत, सांस्कृतिक रूप से विशिष्ट नियम पुस्तिका बनाकर।
  2. प्रशिक्षण के लिए लाखों ट्रिकी, छिपे हुए खतरे वाले उदाहरणों का निर्माण करके।
  3. एक "स्पैरिंग पार्टनर" प्रशिक्षण पद्धति का उपयोग करके जो सबसे कठिन समस्याओं पर अतिरिक्त प्रयास केंद्रित करती है।

परिणामस्वरूप, यह एक ऐसा रक्षक है जो पिछले मॉडलों की तुलना में चीनी टेक्स्ट में सूक्ष्म, छिपे हुए और सांस्कृतिक रूप से विशिष्ट खतरों को पहचानने में बहुत बेहतर है। उन्होंने अपने डेटा और कोड को दूसरों के उपयोग के लिए उपलब्ध कराया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →