CHILLGuard: Towards Fine-Grained Chinese LLM Safety Guardrail with Scalable Data Construction and Model-aware Preference Alignment
यह शोध पत्र CHILLGuard को प्रस्तुत करता है, जो एक सूक्ष्म-स्तरीय (fine-grained) चीनी LLM सुरक्षा गार्डरेल है जो एक स्केलेबल बहु-चरणीय निर्माण पाइपलाइन के माध्यम से उच्च-गुणवत्ता वाले एनोटेटेड डेटा की कमी को संबोधित करता है और एक बड़े पैमाने पर, कठोरता से क्यूरेट किए गए डेटासेट पर मॉडल-जागरूक प्राथमिकता संरेखण (model-aware preference alignment) के माध्यम से अत्याधुनिक प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सहायक रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल) है जो कहानियाँ लिख सकता है, प्रश्नों के उत्तर दे सकता है और काम में मदद कर सकता है। लेकिन किसी भी शक्तिशाली उपकरण की तरह, यदि इस पर सावधानी से नज़र नहीं रखी गई, तो यह अनजाने में कुछ अभद्र, अवैध या खतरनाक कह सकता है, विशेष रूप से चीनी भाषा में बोलते समय।
यह शोध पत्र CHILLGuard पेश करता है, जो विशेष रूप से चीनी बोलने वाले रोबोटों की निगरानी के लिए डिज़ाइन किया गया एक विशिष्ट "सेफ्टी गार्ड" (सुरक्षा रक्षक) है। इसे कैसे बनाया गया है, इसे सरल शब्दों में यहाँ समझाया गया है:
1. समस्या: "एक ही आकार सबके लिए" वाला सूट फिट नहीं बैठता
मौजूदा सुरक्षा रक्षक (सेफ्टी गार्ड) मुख्य रूप से अंग्रेजी पर प्रशिक्षित थे। कल्पना कीजिए कि आप एक अलग शरीर के प्रकार वाले व्यक्ति को एक ऊंचे अमेरिकी व्यक्ति के लिए टेलर किए गए सूट में पहनाने की कोशिश कर रहे हैं; यह कुछ जगहों पर बहुत तंग और कुछ जगहों पर ढीला हो सकता है।
- समस्या: ये अंग्रेजी-प्रशिक्षित रक्षक चीनी संस्कृति, विशिष्ट कानूनों, या चीनी भाषा में लोगों द्वारा बुरे इरादों को छिपाने के चतुर तरीकों (जैसे कि हानिकारक बातें कहने के लिए पहेलियों, इमोजी, या ऐतिहासिक संदर्भों का उपयोग करना) को नहीं समझ पाते थे।
- परिणाम: वे अक्सर खतरनाक सामग्री को पकड़ने में चूक जाते थे या निर्दोष चीजों को गलत तरीके से फ्लैग (चिह्नित) कर देते थे।
2. समाधान: एक कस्टम-मेड सुरक्षा सूट
लेखकों ने तीन मुख्य भागों वाला एक नया सुरक्षा तंत्र बनाया है:
भाग अ: नियम पुस्तिका (The Taxonomy)
सबसे पहले, उन्होंने विशेष रूप से चीनी सुरक्षा के लिए एक नई, विस्तृत नियम पुस्तिका लिखी। केवल "बुरा" या "अच्छा" कहने के बजाय, उन्होंने 31 विशिष्ट श्रेणियों के साथ एक 5-स्टार रेटिंग प्रणाली बनाई।
- 5 मुख्य श्रेणियाँ:
- राष्ट्रीय मूल्य: देश की स्थिरता और कानूनों की रक्षा करना।
- निष्पक्षता: जाति, लिंग या नौकरी के आधार पर भेदभाव को रोकना।
- व्यावसायिक नियम: घोटाले, विचारों की चोरी, या अनुचित व्यावसायिक चालों को रोकना।
- व्यक्तिगत अधिकार: लोगों की गोपनीयता, प्रतिष्ठा और सुरक्षा की रक्षा करना।
- सेवा गुणवत्ता: यह सुनिश्चित करना कि रोबोट बेकार या वैज्ञानिक रूप से गलत सलाह न दे।
भाग ब: प्रशिक्षण जिम (डेटा निर्माण)
रक्षक को सिखाने के लिए, उन्हें उदाहरणों की एक विशाल लाइब्रेरी की आवश्यकता थी। लेकिन "बुरे" चीनी प्रॉम्प्ट्स के अच्छे उदाहरण ढूंढना कठिन था। इसलिए, उन्होंने उन्हें बनाने के लिए एक तीन-चरणीय फैक्ट्री बनाई:
- खोज अभियान (RAG): उन्होंने इंटरनेट पर उन कीवर्ड्स को खोजा जो 31 श्रेणियों से संबंधित थे और वास्तविक टेक्स्ट नमूने एकत्र किए।
- वास्तविक दुनिया: उन्होंने उन वास्तविक प्रश्नों को एकत्र किया जो चीन में वाणिज्यिक रोबोटों से वास्तविक उपयोगकर्ताओं द्वारा पूछे गए थे।
- "धोखेबाज" फैक्ट्री (प्रॉम्प्ट इंजीनियरिंग): यह सबसे चतुर हिस्सा है। उन्होंने वास्तविक प्रश्नों को लिया और उन्हें ट्रिकी (चलाकी भरे) तरीकों से फिर से लिखने के लिए AI का उपयोग किया।
- उपमा: कल्पना कीजिए कि सुरक्षा गार्ड का प्रशिक्षण हो रहा है। केवल एक चोर की तस्वीर दिखाने के बजाय, वे उसे एक वेश बदलकर, कोड में बात करते हुए, या मजाक के पीछे छिपकर आए चोर को दिखाते हैं। AI ने बुरे प्रश्नों को होमोफोन्स (ऐसे शब्द जो सुनने में समान हैं लेकिन लिखे अलग तरह से जाते हैं), ऐतिहासिक रूपकों, और व्यंग्य का उपयोग करके फिर से लिखा ताकि उन्हें पकड़ना कठिन हो सके।
अंत में उनके पास 4,05,000 प्रशिक्षण उदाहरण (जिम) और 51,000 परीक्षण उदाहरण (अंतिम परीक्षा) थे।
भाग स: प्रशिक्षण विधि ("स्पैरिंग पार्टनर")
आमतौर पर, आप एक सुरक्षा रक्षक को केवल उदाहरण दिखाकर प्रशिक्षित करते हैं। लेकिन इस शोध पत्र में स्पैरिंग पार्टनर (अभ्यास साथी) दृष्टिकोण का उपयोग किया गया।
- लड़ाका (Generator): एक AI जिसे सुरक्षा रक्षक को चकमा देने के लिए सबसे कठिन संभव ट्रिकी प्रश्न बनाने के लिए प्रशिक्षित किया गया है।
- रक्षक (Classifier): सुरक्षा मॉडल जो उन प्रश्नों को पकड़ने की कोशिश कर रहा है।
- नृत्य (The Dance): उन्होंने उन्हें राउंड में एक साथ प्रशिक्षित किया। लड़ाका, रक्षक को धोखा देने की कोशिश करता है। जब रक्षक विफल होता है, तो लड़ाके को इनाम मिलता है। जब रक्षक सफल होता है, तो वह और मजबूत होता जाता है।
- गुप्त नुस्खा (MDPO): उन्होंने मॉडल-अवेयर डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (MDPO) नामक एक विशेष तकनीक का उपयोग किया।
- उपमा: कल्पना कीजिए कि एक कोच है। यदि कोई छात्र गणित में पहले से ही अच्छा है, तो कोच आसान समस्याओं पर समय बर्बाद नहीं करता है। लेकिन यदि छात्र किसी विशिष्ट कठिन अवधारणा के साथ संघर्ष कर रहा है, तो कोच उस पर अतिरिक्त ऊर्जा केंद्रित करता है। यह विधि स्वचालित रूप से प्रशिक्षण की कठिनाई को समायोजित करती थी, और अपना अधिकांश प्रयास उन प्रश्नों पर केंद्रित करती थी जिन्हें हल करने में रक्षक संघर्ष कर रहा था।
3. परिणाम: शानदार अंकों के साथ परीक्षा पास करना
उन्होंने अपने नए रक्षक का परीक्षण अन्य प्रसिद्ध सुरक्षा रक्षकों (जैसे LlamaGuard और QwenGuard) के विरुद्ध किया।
- स्कोर: CHILLGuard ने उनके कस्टम टेस्ट पर काफी अधिक स्कोर किया।
- तुलना: यह अपने मुख्य परीक्षण में दूसरे सबसे अच्छे मॉडल से बहुत बड़े अंतर से (लगभग 16% बेहतर) आगे निकल गया।
- निरंतरता: अन्य मॉडलों के विपरीत जो कुछ विषयों में महान थे लेकिन कुछ में बहुत खराब, CHILLGuard सभी 31 श्रेणियों में मजबूत था।
सारांश
लेखकों ने चीनी AI के लिए एक कस्टम सुरक्षा रक्षक बनाया है:
- एक विस्तृत, सांस्कृतिक रूप से विशिष्ट नियम पुस्तिका बनाकर।
- प्रशिक्षण के लिए लाखों ट्रिकी, छिपे हुए खतरे वाले उदाहरणों का निर्माण करके।
- एक "स्पैरिंग पार्टनर" प्रशिक्षण पद्धति का उपयोग करके जो सबसे कठिन समस्याओं पर अतिरिक्त प्रयास केंद्रित करती है।
परिणामस्वरूप, यह एक ऐसा रक्षक है जो पिछले मॉडलों की तुलना में चीनी टेक्स्ट में सूक्ष्म, छिपे हुए और सांस्कृतिक रूप से विशिष्ट खतरों को पहचानने में बहुत बेहतर है। उन्होंने अपने डेटा और कोड को दूसरों के उपयोग के लिए उपलब्ध कराया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।