← नवीनतम पेपर
💬 NLP

Multilingual Refusal Alignment for Safer Large Language Models

यह शोध पत्र 12 यूरोपीय भाषाओं के लिए एक बहुभाषी रिफ्यूज़ल (refusal) डेटासेट, RefusEU, प्रस्तुत करता है, और डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (Direct Preference Optimization) प्रयोगों के माध्यम से यह प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स को विशेष रूप से केवल अंग्रेजी में संरेखित (align) करना क्रॉस-लिंगुअल सुरक्षा सुनिश्चित करने में विफल रहता है, जबकि बहुभाषी प्रशिक्षण सामान्य ज्ञान क्षमताओं से समझौता किए बिना विभिन्न भाषाओं में सुरक्षा को प्रभावी ढंग से बढ़ाता है।

मूल लेखक: Aleksandra Krasnodębska, Wojciech Kusa, Aldo Lipani

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aleksandra Krasnodębska, Wojciech Kusa, Aldo Lipani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि लार्ज लैंग्वेज मॉडल्स (LLMs) अविश्वसनीय रूप से प्रतिभाशाली, बहुभाषी शेफ हैं। ये शेफ दर्जनों भाषाओं में उत्तर तैयार कर सकते हैं, लेकिन एक पेंच है: वे कुछ भाषाओं में पूछे जाने पर कभी-कभी "जहरीले व्यंजन" (हानिकारक या खतरनाक सलाह) परोस देते हैं, भले ही वे अंग्रेजी में ऐसा करने से मना कर दें।

यह शोध पत्र, जिसका शीर्षक "Multilingual Refusal Alignment for Safer Large Language Models" है, इन शेफ के लिए एक सुरक्षा निरीक्षण रिपोर्ट की तरह है। शोधकर्ता यह पता लगाना चाहते थे कि ये शेफ असंगत क्यों हैं और कैसे उन्हें केवल अंग्रेजी में ही नहीं, बल्कि हर भाषा में सुरक्षित होने के लिए प्रशिक्षित किया जा सकता है।

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "अंग्रेजी-मात्र" सुरक्षा जाल काम नहीं करता

शोधकर्ताओं ने एक डरावने विचार के साथ शुरुआत की: उन्होंने एक मॉडल जो सुरक्षित होने के लिए बनाया गया था, उसे जानबूझकर उसके सुरक्षा स्विच "बंद" कर दिए (एक प्रक्रिया जिसे वे एब्लेशन (ablation) कहते हैं)। यह एक इमारत से फायर अलार्म और स्प्रिंकलर निकालने जैसा है ताकि यह देखा जा सके कि आग कितनी बुरी हो सकती है।

उन्होंने पाया कि जब उन्होंने इस "असुरक्षित" मॉडल से विभिन्न भाषाओं में खतरनाक सलाह (जैसे कि अपराध कैसे करें) मांगी, तो उसने खुशी-खुशी उसका पालन किया। लेकिन यहाँ बड़ी खोज हुई: मॉडल को अंग्रेजी में "ना" कहना सिखाने से उसे अन्य भाषाओं में "ना" कहना नहीं सिखाया गया।

  • उपमा: कल्पना कीजिए कि आप एक गार्ड डॉग को केवल तब भौंकना सिखाते हैं जब घुसपैठिए अंग्रेजी बोलते हैं। यदि कोई घुसपैthia जर्मन, फ्रेंच या पोलिश बोलता है, तो कुत्ता बस चुपचाप बैठा रह सकता है और उन्हें अंदर आने दे सकता है। यह शोध पत्र सिद्ध करता है कि एक भाषा में सुरक्षा सिखाना स्वचालित रूप से अन्य भाषाओं में हस्तांतरित नहीं होता है।

2. समाधान: एक नया "सुरक्षा मैनुअल" (RefusEU)

इसे ठीक करने के लिए, टीम ने RefusEU नामक एक नया डेटासेट बनाया। इसे एक विशाल, बहुभाषी प्रशिक्षण मैनुअल समझें।

  • इसमें 12 यूरोपीय भाषाएँ शामिल हैं (अंग्रेजी, जर्मन, पोलिश, स्पेनिश आदि सहित)।
  • इन भाषाओं में पूछे गए प्रत्येक खतरनाक प्रश्न के लिए, मैनुअल दो उत्तर प्रदान करता है:
    1. "चुना गया" उत्तर: एक विनम्र लेकिन दृढ़ इनकार ("मैं इसमें मदद नहीं कर सकता")।
    2. "अस्वीकृत" उत्तर: वह खतरनाक, हानिकारक प्रतिक्रिया जो मॉडल को नहीं देनी चाहिए।

उन्होंने इस मैनुअल का उपयोग डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (DPO) नामक विधि का उपयोग करके मॉडल्स को फिर से प्रशिक्षित करने के लिए किया। यह एक शेफ को हजारों उदाहरण दिखाने जैसा है कि "अच्छे इनकार" बनाम "बुरे उत्तर" क्या हैं और यह कहना कि, "हमेशा अच्छे इनकार को ही चुनो।"

3. प्रयोग: क्या काम आया और क्या नहीं आया

शोधकर्ताओं ने कई कुकिंग क्लास (प्रशिक्षण प्रयोग) चलाए ताकि यह देखा जा सके कि किस पद्धति ने सबसे सुरक्षित शेफ बनाए:

  • "केवल अंग्रेजी" क्लास: उन्होंने मॉडल को केवल अंग्रेजी सुरक्षा डेटा पर प्रशिक्षित किया।
    • परिणाम: मॉडल अंग्रेजी में सुरक्षित हो गया लेकिन अन्य भाषाओं में खतरनाक बना रहा। यह गार्ड डॉग को केवल अंग्रेजी सिखाने जैसा था; वह अभी भी जर्मन बोलने वालों को अनदेखा कर देता था।
  • "उच्च-संसाधन (High-Resource) केवल" क्लास: उन्होंने प्रमुख भाषाओं (अंग्रेजी, फ्रेंच, जर्मन आदि) पर प्रशिक्षण दिया लेकिन छोटी भाषाओं को अनदेखा कर दिया।
    • परिणाम: अंग्रेजी-मात्र से बेहतर, लेकिन फिर भी इसमें कमियाँ थीं।
  • "संतुलित बहुभाषी" क्लास: उन्होंने मॉडल को सभी 12 भाषाओं पर समान रूप से प्रशिक्षित किया।
    • परिणाम: यही विजेता था। मॉडल पूरे स्तर पर सुरक्षित हो गया। इसने अंग्रेजी की तरह ही पोलिश में भी खतरनाक अनुरोधों को अस्वीकार करना सीख लिया।

4. ट्रेड-ऑफ: क्या सुरक्षा शेफ को कम बुद्धिमान बनाती है?

एक सामान्य डर यह है कि मॉडल को सुरक्षित बनाने से वह कम स्मार्ट या बोलने में खराब हो सकता है। शोधकर्ताओं ने एक "सामान्य ज्ञान" परीक्षण (Global MMLU) का उपयोग करके इसका परीक्षण किया।

  • बड़े मॉडल्स (70B पैरामीटर्स): ये मास्टर शेफ की तरह हैं। जब उन्हें बहुभाषी सुरक्षा मैनुअल पर प्रशिक्षित किया गया, तो वे अपनी कुकिंग स्किल्स खोए बिना सुरक्षित हो गए। वे उतने ही स्मार्ट और धाराप्रवाह बने रहे।
  • छोटे मॉडल्स (8B पैरामीटर्स): ये जूनियर शेफ की तरह हैं। सुरक्षा पर प्रशिक्षित होने पर, उन्हें कभी-कभी छोटी भाषाओं में प्रवाह (fluency) के साथ संघर्ष करना पड़ा, विशेष रूप से यदि उन्हें केवल अंग्रेजी पर प्रशिक्षित किया गया था। हालांकि, शोधकर्ताओं ने पाया कि इन छोटे मॉडल्स के लिए, भाषाओं के मिश्रण और कुछ अनुवाद युक्तियों ने उन्हें तेज बनाए रखने में मदद की।

5. मुख्य निष्कर्ष

  • सुरक्षा यात्रा नहीं करती: आप केवल एक मॉडल को अंग्रेजी में सुरक्षित होने के लिए प्रशिक्षित नहीं कर सकते और उम्मीद नहीं कर सकते कि वह हर जगह सुरक्षित होगा। आपको उसे उन विशिष्ट भाषाओं में प्रशिक्षित करना होगा जिनकी आपको परवाह है।
  • सुरक्षा के लिए बड़ा बेहतर है: बड़े मॉडल्स (70B संस्करण की तरह) ने बहुभाषी सुरक्षा प्रशिक्षण को पूरी तरह से संभाला, अपनी बुद्धिमत्ता को बरकरार रखते हुए "ना" कहना सीख लिया।
  • डेटासेट ही नायक है: नया RefusEU डेटासेट एक महत्वपूर्ण उपकरण है। यह मॉडल को हानिकारक अनुरोधों को अस्वीकार करने के लिए प्रशिक्षित करने हेतु विशेष रूप से 12 यूरोपीय भाषाओं को कवर करने वाला अपनी तरह का पहला डेटासेट है, जो AI सुरक्षा अनुसंधान में एक बड़ी कमी को भरता है।

संक्षेप में, यह पेपर तर्क देता है कि पूरी दुनिया के लिए वास्तव में सुरक्षित AI होने के लिए, हम केवल उससे अंग्रेजी में बात नहीं कर सकते। हमें उसे उन हर भाषा में सुरक्षा के नियम सिखाने होंगे जिन्हें वह बोलता है, और यह करने का सबसे अच्छा तरीका एक संतुलित, बहुभाषी प्रशिक्षण आहार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →