← नवीनतम पेपर
💬 NLP

Routing-Aligned Fine-Tuning for Multilingual Downstream Tasks in Mixture-of-Experts Models

यह शोध पत्र RA-MoE का प्रस्ताव करता है, जो एक तीन-चरणीय फाइन-ट्यूनिंग फ्रेमवर्क है जो मिक्सचर-ऑफ-एक्सपर्ट्स मॉडल्स के मध्य परतों में भाषा-सार्वभौमिक संरेखण क्षेत्र (language-universal alignment zone) का लाभ उठाकर लक्ष्य-भाषा के रूटिंग पैटर्न को अंग्रेजी कार्य-विशेषज्ञ सक्रियणों (English task-expert activations) के साथ संरेखित करता है, जिससे बहुभाषी डाउनस्ट्रीम प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Guanzhi Deng, Kuan Wu, Haibo Wang, Shing Yin Wong, Sichun Luo, Linqi Song

प्रकाशित 2026-05-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guanzhi Deng, Kuan Wu, Haibo Wang, Shing Yin Wong, Sichun Luo, Linqi Song

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास ज्ञान का एक विशाल, अत्यंत बुद्धिमान पुस्तकालय (एक लार्ज लैंग्वेज मॉडल) है जो उत्तम अंग्रेजी बोलता है। इसके अंदर, केवल एक विशाल मस्तिष्क सारा काम नहीं कर रहा है। इसके बजाय, यह एक मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) प्रणाली की तरह व्यवस्थित है: इसे विशेषज्ञों की एक बड़ी टीम के रूप में समझें। जब आप कोई प्रश्न पूछते हैं, तो एक "रूटर" (एक रिसेप्शनिस्ट की तरह) निर्णय लेता है कि मदद करने के लिए किन विशिष्ट विशेषज्ञों को कमरे में बुलाया जाए।

समस्या यह है कि हालांकि यह पुस्तकालय अंग्रेजी में जीनियस है, लेकिन अन्य भाषाओं (जैसे स्पेनिश, चीनी या अरबी) में समान कार्य करने के लिए पूछे जाने पर यह अक्सर लड़खड़ा जाता है।

खोज: "मध्य" ही जादुई क्षेत्र है

शोधकर्ताओं ने देखा कि यह पुस्तकालय कैसे काम करता है, यह बहुत अजीब है। उन्होंने पाया कि "रिसेप्शनिस्ट" इस बात पर अलग तरह से व्यवहार करता है कि आप इमारत के किस स्तर पर हैं:

  • लॉबी (शुरुआती परतें): यहाँ रिसेप्शनिस्ट भाषा के मामले में बहुत चूजी (picky) होता है। यदि आप अंग्रेजी बोलते हैं, तो वे अंग्रेजी विशेषज्ञों को बुलाते हैं। यदि आप स्पेनिश बोलते हैं, तो वे स्पेनिश विशेषज्ञों को बुलाते हैं।
  • पेंटहाउस (अंतिम परतें): यहाँ भी स्थिति वही है। भाषा की बाधा मजबूत है।
  • मध्य मंजिलें: यहाँ, रिसेप्शनिस्ट भाषा की परवाह करना बंद कर देता है। चाहे आप अंग्रेजी बोलें या स्पेनिश, वे गणित की समस्या हल करने या निर्देश मानने के लिए ठीक उसी समूह के विशेषज्ञों को बुलाते हैं।

शोधकर्ताओं ने महसूस किया कि कई कार्यों के लिए, पुस्तकालय पहले से ही लक्षित भाषा में समस्या को हल करना जानता है (क्योंकि मध्य विशेषज्ञ समान हैं), लेकिन "रिसेप्शनिस्ट" विफल हो रहा है क्योंकि वह सही लोगों को नहीं भेज पा रहा है। यह एक शानदार शेफ के पास होने जैसा है जो किसी भी भाषा में एक उत्तम व्यंजन बना सकता है, लेकिन वेटर गलत ऑर्डर को गलत स्टेशन पर भेज रहा है।

समाधान: RA-MoE ( "रिसेप्शनिस्ट को गाइड करने" की विधि)

शोधकर्ताओं ने RA-MoE (रूटिंग-एलाइन्ड मिक्सचर-ऑफ-एक्सपर्ट्स) नामक एक नई प्रशिक्षण विधि प्रस्तावित की है। केवल पूरे पुस्तकालय को नए शब्द सिखाने के बजाय, वे "रिसेप्शनिस्ट" को बेहतर व्यवहार करना सिखाते हैं।

यह तीन सरल चरणों में कैसे काम करता है, यहाँ दिया गया है:

1. "डबल-चेक" ऑडिट (चरण 1)
वे प्रश्नों की एक सूची लेते हैं और पुस्तकालय से एक ही प्रश्न अंग्रेजी और लक्षित भाषा (जैसे स्पेनिश) में पूछते हैं। वे परिणामों को चार समूहों में वर्गीकृत करते हैं:

  • CC: दोनों में सही पाया।
  • II: दोनों में गलत पाया (पुस्तकालय बस उत्तर नहीं जानता)।
  • IC: अंग्रेजी में गलत लेकिन स्पेनिश में सही (दुर्लभ)।
  • CI (स्वर्ण खदान): अंग्रेजी में सही लेकिन स्पेनिश में गलत

शोधकर्ता केवल CI समूह पर ध्यान केंद्रित करते हैं। ये वे मामले हैं जहाँ पुस्तकालय के पास ज्ञान है (उसने अंग्रेजी में इसे हल किया था) लेकिन वह स्पेनिश में विफल रहा। यह साबित करता है कि समस्या ज्ञान की कमी नहीं है; यह एक रूटिंग त्रुटि है।

2. विशेषज्ञों का मानचित्रण (चरण 2)
वे पुस्तकालय के "मध्य मंजिलों" को देखते हैं जहाँ भाषा मायने नहीं रखती। वे पहचानते हैं कि अंग्रेजी संस्करण ने उस समस्या को हल करने के लिए वास्तव में किन विशिष्ट विशेषज्ञों को बुलाया था। वे कहते हैं, "ठीक है, इस गणित की समस्या के लिए, अंग्रेजी संस्करण ने विशेषज्ञों #4, #7 और #12 को बुलाया। वे 'टास्क एक्सपर्ट्स' (कार्य विशेषज्ञ) हैं।"

3. एलाइनमेंट लेसन (चरण 3)
अब, वे पुस्तकालय को स्पेनिश प्रश्नों का उपयोग करके फाइन-ट्यून करते हैं। लेकिन वे एक विशेष नियम जोड़ते हैं:

  • जब पुस्तकालय एक CI उदाहरण देखता है (जहाँ यह स्पेनिश में विफल रहा लेकिन अंग्रेजी में सफल होता), तो वे रिसेप्शनिस्ट को बताते हैं: "हे, देखो अंग्रेजी संस्करण ने इसे कैसे संभाला। इसने विशेषज्ञों #4, #7 और #12 को बुलाया। तुम्हें स्पेनिश संस्करण के लिए भी उन्हीं समान विशेषज्ञों को बुलाना होगा।"

वे केवल मॉडल को स्पेनिश बोलना नहीं सिखाते; वे मॉडल को रूट करना सिखाते हैं कि स्पेनिश प्रश्न को उन्हीं विशेषज्ञों के पास कैसे भेजा जाए जिन्होंने अंग्रेजी संस्करण को हल किया था।

यह क्यों काम करता है

इसे एक स्कूल की तरह समझें। यदि एक छात्र अंग्रेजी में गणित की समस्या हल करना जानता है लेकिन फ्रेंच में विफल रहता है, तो आपको उसे गणित शुरू से सिखाने की आवश्यकता नहीं है। आपको बस उसे यह सिखाने की आवश्यकता है कि वही गणित शिक्षक उसकी मदद कर रहे हैं, चाहे वह पूछने के लिए किसी भी भाषा का उपयोग करे।

शोधपत्रों ने पाया कि:

  • यह मानक प्रशिक्षण (जो केवल नई भाषा में उत्तरों को याद करने की कोशिश करता है) की तुलना में बेहतर काम करता है।
  • यह अन्य विधियों से बेहतर काम करता है जो वास्तव में इसके आंतरिक वायरिंग को बदले बिना मॉडल को "स्टीयर" करने की कोशिश करती हैं।
  • जिस कार्य में जितने अधिक "CI" उदाहरण होते हैं (अर्थात मॉडल अंग्रेजी में उत्तर जानता है लेकिन लक्षित भाषा में विफल होता है), यह विधि उतना ही अधिक मदद करती है।
  • उन्होंने जो "टास्क एक्सपर्ट्स" मध्य परतों में पाए, वे सार्वभौमिक हैं। एक बार जब वे जान लेते हैं कि अंग्रेजी के लिए गणित की समस्या को कौन से विशेषज्ञ संभालते हैं, तो वे वही विशेषज्ञ बिना पुन: पहचाने जाने के स्पेनिश, फ्रेंच और जापानी के लिए भी काम करते हैं।

निचोड़

RA-MoE बहुभाषी AI को ठीक करने का एक स्मार्ट तरीका है। हर भाषा के लिए एक नया मस्तिष्क बनाने के बजाय, यह मौजूदा मस्तिष्क के अंदर के "रिसेप्शनिस्ट" को ठीक करता है ताकि वह प्रश्नों को सही विशेषज्ञों के पास भेज सके, चाहे प्रश्न किसी भी भाषा में पूछा जाए। यह एक भाषा की बाधा को एक साधारण रूटिंग त्रुटि में बदल देता है जिसे आसानी से सुधारा जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →