← नवीनतम पेपर
💬 NLP

Adversarial Alignment: Ensuring Value Consistency in Large Language Models for Sensitive Domains

यह शोध पत्र एक अटैकर (Attacker), एक्टर (Actor) और क्रिटिक (Critic) से जुड़े एक एडवरसेरियल अलाइनमेंट फ्रेमवर्क का प्रस्ताव करता है ताकि एक वैल्यू-कंसिस्टेंट लार्ज लैंग्वेज मॉडल (VC-LLM) को प्रशिक्षित किया जा सके जो निरंतर प्री-ट्रेनिंग, इंस्ट्रक्शन फाइन-ट्यूनिंग और एडवरसेरियल ट्रेनिंग के माध्यम से संवेदनशील डोमेन में पूर्वाग्रह को प्रभावी ढंग से कम करता है और वैल्यू कंसिस्टेंसी सुनिश्चित करता है, जैसा कि एक द्विभाषी मूल्यांकन डेटासेट पर बेहतर प्रदर्शन द्वारा प्रमाणित किया गया है।

मूल लेखक: Yuan Gao, Zhigang Liu, Xinyu Yao, Bo Chen, Xiaobing Zhao

प्रकाशित 2026-01-23
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yuan Gao, Zhigang Liu, Xinyu Yao, Bo Chen, Xiaobing Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सुशिक्षित रोबोट (एक लार्ज लैंग्वेज मॉडल) है जिसने इंटरनेट पर लगभग सब कुछ पढ़ लिया है। जबकि यह कहानियाँ लिखने या गणित की समस्याओं को हल करने में बहुत कुशल है, संवेदनशील विषयों जैसे राजनीति, नस्ल या राष्ट्रीय सीमाओं के बारे में बात करते समय यह कभी-कभी पक्षपाती, अपमानजनक या बिल्कुल गलत बातें कह देता है। यह एक ऐसे छात्र की तरह है जो बहुत सारे तथ्य तो जानता है, लेकिन उसने यह नहीं सीखा है कि किसी विशेष परिवार में व्यवहार करने के विशिष्ट "नियम" क्या हैं।

यह शोध पत्र इस समस्या को ठीक करने के लिए एडवर्सरियल अलाइनमेंट (Adversarial Alignment) नामक एक नई प्रशिक्षण पद्धति पेश करता है। इसे एक तीन-सदस्यीय ड्रामा क्लब के रूप में समझें जिसे संवेदनशील स्थितियों में रोबोट को सही ढंग से व्यवहार करना सिखाने के लिए डिज़ाइन किया गया है।

यह "ड्रामा क्लब" इस प्रकार काम करता है:

  1. अटैकर (द प्रोवोकेटर - उकसाने वाला): यह एक रोबोट है जिसे पेचीदा, विवादास्पद या यहाँ तक कि अपमानजनक प्रश्न पूछने के लिए प्रशिक्षित किया गया है। कल्पना करें कि एक छात्र बार-बार पूछता है, "क्या चोरी करना ठीक है?" या "यह देश बुरा क्यों है?" सिर्फ सिस्टम की परीक्षा लेने के लिए। उनका काम रोबोट के तर्क में कमियां ढूंढना और यह देखना है कि वह कहाँ चूक सकता है।
  2. एक्टर (द हीरो - नायक): यह मुख्य रोबोट है जिसे हम प्रशिक्षित करने की कोशिश कर रहे हैं। जब अटैकर कोई कठिन प्रश्न पूछता है, तो एक्टर को "सही" मूल्यों के साथ उत्तर देना चाहिए। यदि अटैकर किसी संवेदनशील राजनीतिक मुद्दे के बारे में पूछता है, तो एक्टर को एक ऐसा उत्तर देना चाहिए जो विशिष्ट मूल्यों (इस मामले में, चीनी सरकार और समाज के मूल्यों) के अनुरूप हो। यह एक ऐसे छात्र की तरह है जिसने पारिवारिक नियमों को याद कर लिया है और उसे उकसाने वाले व्यक्ति को बिना अपना चरित्र बदले उत्तर देना है।
  3. क्रिटिक (द रेफरी - निर्णायक): यह तीसरा रोबट है जो अटैकर और एक्टर के बीच होने वाली बातचीत को देखता है। यदि एक्टर एक कमजोर, टालमटोल वाला या गलत उत्तर देता है, तो क्रिटिक कहता है, "नहीं, यह पर्याप्त नहीं है!" और उसे खारिज कर देता है। यदि एक्टर एक सटीक उत्तर देता है, तो क्रिटिक उसे स्वीकार कर लेता है। यह सुनिश्चित करता है कि रोबोट केवल उच्च-गुणवत्ता वाले, मूल्य-संगत उदाहरणों से ही सीखे।

परिणाम: VC-LLM
इस "ड्रामा क्लब" को हजारों बार चलाने के माध्यम से, शोधकर्ताओं ने एक नया मॉडल बनाया जिसे VC-LLM (वैल्यू-कंसिस्टेंट लार्ज लैंग्वेज मॉडल) कहा जाता है।

  • परीक्षण: उन्होंने संप्रभुता (जैसे, ताइवान, तिब्बत), मानवाधिकार और धर्म जैसे संवेदनशील विषयों को कवर करने वाला चीनी और अंग्रेजी दोनों भाषाओं में एक विशेष परीक्षा बनाई।
  • स्कोर: जब उन्होंने अन्य प्रसिद्ध मॉडलों (जैसे GPT-4 या Qwen) के विरुद्ध VC-LLM का परीक्षण किया, तो VC-LLM ने उच्चतम स्कोर प्राप्त किया। यह सही मूल्यों पर टिके रहने और भ्रमित या पक्षपाती न होने में अन्य मॉडलों की तुलना में बहुत बेहतर था।
  • आश्चर्य: दिलचस्प बात यह है कि जबकि अन्य मॉडल चीनी की तुलना में अंग्रेजी में काफी अधिक संघर्ष करते थे, VC-LLM दोनों भाषाओं में लगभग समान रूप से अच्छा प्रदर्शन करता था। यह एक ऐसे छात्र की तरह है जिसने नियमों को इतनी अच्छी तरह से सीखा है कि वह चाहे अंग्रेजी बोल रहा हो या चीनी, वह उनका पूरी तरह से पालन कर सकता है।

संक्षेप में
यह शोध पत्र दावा करता है कि इस "अटैकर-एक्टर-क्रिटिक" खेल का उपयोग करके, वे सफलतापूर्वक एक भाषा मॉडल को संवेदनशील विषयों को संभालने के लिए प्रशिक्षित करने में सफल रहे हैं। मॉडल ने पेचीदा प्रश्नों को पहचानना और सुसंगत, विशिष्ट मूल्यों के साथ प्रतिक्रिया देना सीख लिया, जिससे यह इन कठिन विषयों के लिए पिछले मॉडलों की तुलना में बहुत अधिक विश्वसनीय बन गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →