← नवीनतम पेपर
💬 NLP

NAVER LABS System Re-implementation for the IWSLT 2026 Instruction-Following Task

यह शोध पत्र 2026 के शेयर्ड टास्क के लिए NAVER LABS IWSHLT 2025 इंस्ट्रक्शन-फॉलोइंग पाइपलाइन के एक पुन: कार्यान्वयन को प्रस्तुत करता है, जिसे अनिवार्य SeamlessM4T-v2-large और Qwen3-4B-Instruct घटकों के साथ अनुकूलित किया गया है और स्पीच ट्रांसलेशन एवं स्पोकन क्वेश्चन आंसरिंग बेंचमार्क पर मजबूत प्रदर्शन प्राप्त करने के लिए 100k सिंथेटिक प्रशिक्षण उदाहरणों को पेश किया गया है।

मूल लेखक: Anand Kamble, Aniket Tathe

प्रकाशित 2026-07-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anand Kamble, Aniket Tathe

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सुशिक्षित लाइब्रेरियन (LLM, या लार्ज लैंग्वेज मॉडल) है जो सब कुछ जानता है और लिखने व उत्तर देने में माहिर है। हालाँकि, यह लाइब्रेरियन "बहरा" है—वह ऑडियो फाइलों को नहीं सुन सकता, केवल टेक्स्ट पढ़ सकता है।

दूसरी ओर, आपके पास एक विशेष ऑडियो रिकॉर्डर (स्पीच एनकोडर) है जो ध्वनि सुनने और उसे डिजिटल "साउंड मैप" में बदलने में उत्कृष्ट है, लेकिन उसे बोलना या तर्क करना नहीं आता।

इस शोध पत्र का लक्ष्य इन दोनों के बीच एक "अनुवादक सेतु" (ट्रांसलेटर ब्रिज) बनाना है ताकि वे एक टीम के रूप में मिलकर काम कर सकें। यह टीम "इस भाषण का अनुवाद करें," "इस ऑडियो का सारांश दें," या "जो आपने सुना उसके बारे में प्रश्न पूछें" जैसे निर्देशों का पालन करने के लिए डिज़ाइन की गई है।

यहाँ बताया गया है कि लेखकों ने इस टीम को कैसे बनाया, सरल उपमाओं का उपयोग करते हुए:

1. टीम के सदस्य

  • लाइब्रेरियन (Qwen3-4B): एक शक्तिशाली AI जो पहले से ही टेक्स्ट में निर्देशों का पालन करना जानता है।
  • रिकॉर्डर (SeamlessM4T-v2-large): एक अत्याधुनिक टूल जो मानवीय भाषण को डिजिटल डेटा में बदल देता है।
  • सेतु (प्रोजेक्टर): एक नया, प्रशिक्षित घटक जो रिकॉर्डर से प्राप्त "साउंड मैप" को उस भाषा में अनुवाद करता है जिसे लाइब्रेरियन समझ सके।

2. तीन-चरणीय प्रशिक्षण प्रक्रिया

लेखकों ने उन्हें केवल आपस में जोड़ नहीं दिया; उन्होंने उन्हें तीन विशिष्ट चरणों में प्रशिक्षित किया, जैसे किसी नए कर्मचारी को प्रशिक्षण देना:

  • चरण 1: सुनना सीखना (प्रोजेक्टर एलाइनमेंट)
    • क्या हुआ: लाइब्रेरियन और रिकॉर्डर को स्थिर (लॉक) कर दिया गया था। केवल "सेतु" को प्रशिक्षित किया गया।
    • उपमा: कल्पना कीजिए कि लाइब्रेरियन एक साउंडप्रूफ कमरे में बैठा है। सेतु यह सीखता है कि रिकॉर्डर से आने वाली कच्ची ध्वनि तरंगों को उन लिखित नोट्स में कैसे बदला जाए जिन्हें लाइब्रेरियन पढ़ सके। उन्होंने भाषण और टेक्स्ट (जैसे भाषणों के ट्रांसक्रिप्ट) के हजारों उदाहरणों के साथ अभ्यास किया ताकि सेतु ध्वनियों का वर्णन करने के लिए सही "शब्दावली" सीख सके।
  • चरण 2: लाइब्रेरियन का टेक्स्ट बूट कैंप (टेक्स्ट-ओनली LoRA)
    • क्या हुआ: ऑडियो बंद कर दिया गया था। लाइब्रेरियन को प्रश्न पूछने और भाषाओं का अनुवाद करने का अभ्यास करने के लिए भारी मात्रा में टेक्स्ट डेटा दिया गया, लेकिन इस बार उन्हें अपने मस्तिष्क में छोटे, कुशल समायोजन करने की अनुमति थी (LoRA नामक तकनीक का उपयोग करके)।
    • उपमा: लाइब्रेरियन अब एक शांत पुस्तकालय में है, कागज पर अनुवाद और प्रश्न पूछने के अपने कौशल का अभ्यास कर रहा है। वह अभी ऑडियो नहीं सुन रहा है; वह केवल अपने तर्क और भाषा कौशल को तेज कर रहा है ताकि वह वास्तविक दुनिया के लिए तैयार हो सके। लेखकों ने विभिन्न "समायोजन आकार" (रैंक्स) का परीक्षण किया यह देखने के लिए कि कौन सा उन्हें उनकी याददाश्त को नुकसान पहुँचाए बिना सबसे स्मार्ट बनाता है।
  • चरण 3: पूर्ण पूर्वाभ्यास (मल्टीमॉडल मर्ज)
    • क्या हुआ: ऑडियो को फिर से चालू कर दिया गया। अब, सेतु और लाइब्रेरियन ने एक साथ अभ्यास किया।
    • उपमा: लाइब्रेरियन और रिकॉर्डर अंततः एक ही कमरे में हैं। वे एक भाषण सुनने, सेतु द्वारा ध्वनि को अनुवादित करने और लाइब्रेरियन द्वारा प्रतिक्रिया देने का अभ्यास करते हैं। यह सुनिश्चित करने के लिए कि लाइब्रेरियन अपने टेक्स्ट कौशल को न भूल जाए, वे सुनने के अभ्यासों और टेक्स्ट-ओनली अभ्यासों के बीच बारी-बारी से अभ्यास करते हैं। यह सुनिश्चित करता है कि वे "भ्रमित" (एक समस्या जिसे कैटास्ट्रोफिक फॉरगेटिंगिंग कहा जाता है) न हों।

3. "नकली" अभ्यास डेटा

इस पेपर का एक अनूठा योगदान 1,00,000 सिंथेटिक उदाहरण बनाना है।

  • उपमा: चूंकि हर संभव कार्य (जैसे "वक्ता के स्वर का वर्णन करें" या "कीवर्ड निकालें") के लिए वास्तविक दुनिया का डेटा कम था, इसलिए लेखकों ने एक अन्य AI (Gemma) का उपयोग करके 10 अलग-अलग प्रकार के कार्यों के लिए 10,000 नकली अभ्यास परिदृश्य बनाए।
  • उन्होंने नकली ट्रांसक्रिप्ट और नकली ऑडियो विवरण बनाए ताकि टीम को निम्नलिखित चीजों के लिए प्रशिक्षित किया जा सके:
    • कीवर्ड निष्कर्षण (Keyword Extraction): सबसे महत्वपूर्ण शब्दों को निकालना।
    • आवाज का वर्णन (Voice Description): केवल सुनकर यह बताना कि वक्ता "आत्मविश्वासी," "धीमा," या "तेज" लग रहा है।
    • सारांश (Summarization): एक लंबे भाषण को एक वाक्य में संक्षिप्त करना।

4. परिणाम

जब उन्होंने आधिकारिक "परीक्षा" (MCIF बेंचमार्क) पर अपनी अंतिम टीम का परीक्षण किया:

  • अनुवाद: वे अंग्रेजी से चीनी, जर्मन और इतालवी में भाषण का अनुवाद करने में बहुत अच्छे हो गए।
  • प्रश्न उत्तर (Question Answering): उन्होंने अंग्रेजी में सुनी गई बातों के आधार पर उत्तर देने में महत्वपूर्ण सुधार किया।
  • समझौता (The Trade-off): दिलचस्प बात यह है कि जबकि वे भाषण के अर्थ को समझने (अनुवाद और प्रश्न) में बेहतर हुए, उनकी सुने गए सटीक शब्दों को लिखने (ट्रांसक्रिप्शन) की क्षमता कच्चे रिकॉर्डर की तुलना में थोड़ी खराब हो गई। यह एक सामान्य समझौता है जब आप किसी सिस्टम को केवल "ध्वनियों" के बजाय "अर्थ" समझने के लिए सिखाते हैं।

सारांश

यह शोध पत्र अनिवार्य रूप से एक बहुभाषी, ऑडियो-जागरूक AI सहायक बनाने के लिए एक "हाउ-टू" गाइड है। उन्होंने एक बधिर टेक्स्ट-विशेषज्ञ और एक सुनने वाले लेकिन कम बुद्धिमान रिकॉर्डर को लिया, उनके बीच एक कस्टम ब्रिज बनाया, उन्हें तीन सावधानीपूर्ण चरणों में प्रशिक्षित किया, और उन्हें भारी मात्रा में अभ्यास डेटा (वास्तविक और AI-जनित दोनों) खिलाया। परिणाम एक ऐसा सिस्टम है जो मानव की तरह छोटे ऑडियो क्लिप सुन सकता है और जटिल निर्देशों का पालन कर सकता है।

उल्लिखित सीमाएँ:

  • वर्तमान में सिस्टम 15 सेकंड से लंबे ऑडियो के साथ संघर्ष करता है (यह अपनी "मानसिक ऊर्जा" या मेमोरी खो देता है)।
  • गैर-अंग्रेजी प्रश्नों के लिए, उन्हें मशीन-अनुवादित अभ्यास डेटा का उपयोग करना पड़ा, जिससे कुछ "शोर" या त्रुटियां आ सकती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →