← नवीनतम पेपर
💬 NLP

Exploring the potential and limitations of Model Merging for Multi-Domain Adaptation in ASR

यह शोध पत्र मल्टी-डोमेन ASR के लिए फुल फाइन-ट्यूनिंग के एक स्केलेबल विकल्प के रूप में मॉडल मर्जिंग की जांच करता है, जिसमें 10 यूरोपीय पुर्तगाली डोमेन में 11 एल्गोरिदम का बेंचमार्किंग किया गया है और एक नवीन "BoostedTSV-M" विधि पेश की गई है जो आउट-ऑफ-डिस्ट्रीब्यूशन जनरलाइजेशन को बनाए रखते हुए फुल फाइन-ट्यूनिंग से बेहतर प्रदर्शन करती है।

मूल लेखक: Carlos Carvalho, Francisco Teixeira, Thomas Rolland, Alberto Abad

प्रकाशित 2026-03-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Carlos Carvalho, Francisco Teixeira, Thomas Rolland, Alberto Abad

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली, बहुमुखी शेफ है (एक Large Speech Foundation Model, जैसे Whisper)। यह शेफ सामान्य भोजन बनाने में अद्भुत है और कई भाषाएं समझता है। हालाँकि, यह हर विशिष्ट व्यंजन में एकदम सटीक नहीं है। यदि आप चाहते हैं कि वे पुर्तगाली (Portuguese) खाना बनाना सीख लें, तो आपको आमतौर पर उन्हें एक लंबे समय के लिए एक विशेष पाक विद्यालय भेजना होगा।

यहाँ समस्या यह है: यदि आप चाहते हैं कि वे एक साथ यूरोपीय पुर्तगाली, ब्राज़ीलियाई पुर्तगाली, अफ्रीकी पुर्तगाली और बच्चों की बोली में महारत हासिल करें, तो आप उन्हें एक ही समय में चार अलग-अलग स्कूलों में नहीं भेज सकते।

  • पुराना तरीका (Full Fine-Tuning): आप एक ही शेफ को सब कुछ एक साथ करने के लिए प्रशिक्षित करने की कोशिश करते हैं। वे यूरोपीय पुर्तगाली में अच्छे हो जाते हैं, लेकिन वे ब्राज़ीलियाई या अंग्रेजी व्यंजनों को भूल सकते हैं। इसके अलावा, यदि आप बाद में कोई नया विशेषज्ञता वाला व्यंजन जोड़ना चाहते हैं, तो आपको पूरे शेफ को फिर से शुरू से प्रशिक्षित करना होगा, जो महंगा और धीमा है।
  • अव्यवस्थित विकल्प (The Messy Alternative): आप चार अलग-अलग शेफ काम पर रखते हैं, जिनमें से प्रत्येक को एक विशिष्ट शैली के लिए प्रशिक्षित किया गया है। अब आपके पास एक टीम है, लेकिन हर एक ऑर्डर के लिए चार अलग-अलग लोगों को प्रबंधित करना एक लॉजिस्टिक दुःस्वप्न है। आपको यह तय करना होगा कि हर अनुरोध के लिए किस शेफ को बुलाना है।

समाधान: मॉडल मर्जिंग (The "Recipe Fusion")
यह शोध पत्र मॉडल मर्जिंग (Model Merging) नामक एक चतुर तकनीक की खोज करता है। अलग-अलग विशेषज्ञों को फिर से प्रशिक्षित करने या नए शेफ को काम पर रखने के बजाय, हम उन चार विशेषज्ञ शेफों को लेते हैं (जो पहले से ही अपने विशिष्ट क्षेत्रों में विशेषज्ञ हैं) और उनके मस्तिष्क को मर्ज (मिला) कर देते हैं ताकि एक एकल, सुपर-शेफ बन सके।

लक्ष्य एक ऐसा मॉडल बनाना है जो अपने विशिष्ट कार्यों में विशेषज्ञों के समान अच्छा हो, लेकिन साथ ही सामान्य भोजन बनाने की अपनी क्षमताओं (बहुभाषी क्षमताओं) को भी याद रखे।

प्रयोग: "यूरोपीय पुर्तगाली" रसोई

शोधकर्ताओं ने इस विचार का परीक्षण 10 विभिन्न यूरोपीय पुर्तगाली बोलियों और परिदृश्यों (जैसे समाचार, बुजुर्गों की बोली, बच्चे, और ब्रॉडकास्ट न्यूज़) पर किया। उन्होंने एक बेस मॉडल लिया, उसे अलग-अलग 10 परिदृश्यों पर अलग से प्रशिक्षित किया, और फिर उन्हें 11 विभिन्न "मिक्सिंग एल्गोरिदम" का उपयोग करके वापस मिलाने की कोशिश की।

इन एल्गोरिदम को एक स्मूदी ब्लेंड करने के विभिन्न तरीकों के रूप में सोचें:

  1. साधारण मिश्रण (Averaging): बस सभी सामग्रियों को डाल दें और मिला दें। (अच्छा है, लेकिन शायद एकदम सही नहीं)।
  2. स्मार्ट मिश्रण (Task Vectors): पूरे मस्तिष्क को मिलाने के बजाय, वे प्रशिक्षण के दौरान किए गए परिवर्तनों को देखते हैं और उन परिवर्तनों को सावधानीपूर्वक संयोजित करने का प्रयास करते हैं।
  3. नया गुप्त मसाला (BoostedTSV-M): यही इस शोध पत्र का बड़ा आविष्कार है।

मिश्रण के साथ समस्या: "रैंक कोलैप्स" (Rank Collapse)

जब आप इन विशिष्ट मस्तिष्कों को मिलाते हैं, तो कुछ अजीब होता है। "विशिष्ट संकेत" (वे अनूठे विवरण जो एक शेफ को बुजुर्गों की बोली में कुशल बनाते हैं) "सामान्य शोर" (general noise) द्वारा दबा दिए जाते हैं। यह एक शोर भरे कमरे में फुसफुसाहट सुनने की कोशिश करने जैसा है; वह फुसफुसाहट खो जाती है। तकनीकी शब्दों में इसे रैंक कोलैप्स (Rank Collapse) कहा जाता है। मॉडल बहुत सरल हो जाता है और विशिष्ट विवरणों को भूल जाता है।

नवाचार: BoostedTSV-M

लेखकों ने BoostedTSV-M नामक एक नई विधि बनाई।

  • उपमा: कल्पना कीजिए कि आप एक कॉकटेल बना रहे हैं। आमतौर पर, मजबूत स्वाद (जैसे मुख्य स्पिरिट) सूक्ष्म नोट्स (जैसे वैनिला का एक अंश) पर हावी हो जाते हैं।
  • समाधान: BoostestTSV-M एक "फ्लेवर बूस्टर" की तरह काम करता है। यह उन सूक्ष्म, कमजोर नोट्स (छोटे सिंगुलर वैल्यूज) की पहचान करता है जो खोने वाले हैं और मिश्रण करने से पहले उन्हें प्रवर्धित (amplify) करता है।
  • परिणाम: अंतिम कॉकटेल सभी सामग्रियों की जटिलता को बनाए रखता है। मर्ज किया गया मॉडल न केवल "पुर्तगाली" जानता है; बल्कि वह यह भी जानता है कि यूरोपीय पुर्तगाली की विशिष्ट बारीकियों को कैसे संभालना है, बिना अन्य भाषाओं को बोलने की अपनी क्षमता खोए।

परिणाम: उन्होंने क्या पाया?

  1. पुनः प्रशिक्षण से बेहतर: मर्ज किया गया मॉडल यूरोपीय पुर्तगाली के लिए (सभी डेटा पर एक साथ एक एकल मॉडल को प्रशिक्षित करने यानी Full Fine-Tuning की तुलना में) बेहतर प्रदर्शन करता है।
  2. "कैटास्ट्रोफिक फॉरगेटिंग" (Catastrophic Forgetting) नहीं: पुराने तरीके के विपरीत, जिसने मॉडल को अंग्रेजी और अन्य भाषाओं को भुला दिया था, मर्ज किए गए मॉडल ने अपने बहुभाषी कौशल को बरकरार रखा।
  3. ट्रेड-ऑफ (Trade-off): यहाँ एक संतुलन बनाना पड़ता है। यदि आप मॉडल को यूरोपीय पुर्तगाली में पूर्ण होने के लिए बहुत अधिक मजबूर करते हैं (संकेतों को बहुत अधिक बढ़ाकर), तो यह अन्य भाषाओं के लिए थोड़ा खराब हो सकता है। लेकिन लेखकों ने एक "स्वीट स्पॉट" (एक पैरामीटर जिसे β\beta कहा जाता है) पाया जहाँ मॉडल लक्षित भाषा के लिए उत्कृष्ट है जबकि अन्य जगहों पर भी मजबूत बना हुआ है।

निष्कर्ष

यह शोध पत्र सिद्ध करता है कि जब भी आप कोई नई भाषा या बोली जोड़ना चाहते हैं, तो आपको विशाल AI मॉडल को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। इसके बजाय, आप छोटे, विशिष्ट संस्करणों को प्रशिक्षित कर सकते हैं और उन्हें एक हाई-टेक रेसिपी बुक की तरह मर्ज कर सकते हैं।

उन्होंने MergeWhisper (इन स्पीच मॉडल्स के लिए एक विशेष ब्लेंडर की तरह) नामक एक नया टूल भी बनाया ताकि अन्य शोधकर्ता इसे आसानी से कर सकें।

संक्षेप में: उन्होंने एक तरीका खोजा जिससे कई विशिष्ट विशेषज्ञों के सर्वश्रेष्ठ गुणों को एक "सुपर-एक्सपर्ट" में मिलाया जा सके, जो पुराने तरीके की तुलना में अधिक स्मार्ट, अधिक बहुमुखी और प्रबंधित करने में आसान है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →