← नवीनतम पेपर
💬 NLP

A Pocket Offline Model for Simultaneous Speech Translation as CUNI Submission to IWSLT 2026

यह शोध पत्र IWSLT 2026 सिमुल्टेनियस स्पीच ट्रांसलेशन शेयर्ड टास्क के लिए CUNI सबमिशन को प्रस्तुत करता है, जो चेक, अंग्रेजी, जर्मन और इतालवी में उच्च गुणवत्ता वाले बहुभाषी सिमुल्टेनियस अनुवाद के लिए कम कम्प्यूटेशनल आवश्यकताओं के साथ AlignAtt पॉलिसी वाले 1B-पैरामीटर ऑफलाइन कैनरी मॉडल को अनुकूलित करता है।

मूल लेखक: Aziz Sharipov Ortega, Dominik Macháček

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aziz Sharipov Ortega, Dominik Macháček

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास Canary नाम का एक बहुत ही बुद्धिमान, बहुभाषी अनुवादक है। यह अनुवादक अविश्वसनीय रूप से प्रतिभाशाली है, जो पूरे भाषण को सुनता है और फिर उसका अनुवाद पूरी तरह से लिख देता है। हालाँकि, इसमें एक पेच है: Canary को तब तक काम करने के लिए प्रशिक्षित किया गया है जब तक कि वक्ता अपना पूरा वाक्य समाप्त नहीं कर लेता। यह एक ऐसे वेटर की तरह है जो आपका ऑर्डर लेने से पहले तब तक इंतजार करता है जब तक आप पूरा मेनू पढ़ न लें, भले ही आप सिर्फ एक कॉफी ऑर्डर करना चाहते हों।

चार्ल्स यूनिवर्सिटी (CUNI) की टीम Canary को एक समतुल्य (simultaneous) अनुवादक सिखाना चाहती थी—एक ऐसा व्यक्ति जो एक साथ सुन सके और शब्द-दर-शब्द अनुवाद कर सके, ठीक वैसे ही जैसे एक मानव दुभाषिया करता है।

उन्होंने इसे कैसे किया, इसके लिए यहाँ कुछ सरल उपमाओं का उपयोग किया गया है:

1. "रुको-और-चलो" रणनीति (AlignAtt)

Canary को रियल-टाइम में काम करने के योग्य बनाने के लिए, टीम ने पूरे अनुवादक को फिर से प्रशिक्षित नहीं किया। इसके बजाय, उन्होंने Canary को नियमों का एक नया सेट दिया जिसे AlignAtt कहा जाता है।

Canary के मस्तिष्क को "अटेंशन चश्मे" (attention glasses) के एक जोड़े के रूप में सोचें। जब अनुवादक ऑडियो का एक नया हिस्सा सुनता है, तो वह उस वाक्य को देखता है जिसे वह बना रहा है। AlignAtt नियम कहता है: "जैसे ही आप उस ध्वनि को सुनते हैं जो अभी सुने गए ऑडियो के एक विशिष्ट बिंदु से मेल खाती है, वाक्य के बाकी हिस्से को लिखना बंद कर दें।"

यह "टेलीफोन" के खेल की तरह है जहाँ आप केवल उन शब्दों को आगे बढ़ाते हैं जिनके बारे में आप 100% निश्चित हैं। यदि अनुवादक अभी पूरी तरह से प्राप्त न हुए ऑडियो के आधार पर किसी शब्द का अनुमान लगाने लगता है, तो सिस्टम उस अनुमान को काट देता है। यह अनुवादक को "भ्रमित" (hallucinating) होने या खुद को दोहराने से रोकता है।

2. "जेब के आकार का" पावरहाउस

इस प्रोजेक्ट की सबसे शानदार बातों में से एक अनुवादक का आकार है। अधिकांश उच्च-गुणवत्ता वाले अनुवादक विशाल सुपरकंप्यूटरों की तरह होते हैं जिन्हें चलाने के लिए पूरे डेटा सेंटर की आवश्यकता होती है। हालाँकि, Canary एक 1-बिलियन पैरामीटर वाला मॉडल है।

लेखक इसे एक "पॉकेट ऑफलाइन मॉडल" कहते हैं। कल्पना करें कि एक स्मार्टफोन ऐप के आकार के अनुवादक को अपनी जेब में फिट करना। यह इतना छोटा है कि इसे क्लाउड में किसी विशाल सर्वर पर डेटा भेजने की आवश्यकता के बिना एक सामान्य फोन पर चलाया जा सकता है। इसका मतलब है कि आप इसे इंटरनेट कनेक्शन के बिना भी उपयोग कर सकते हैं, और यह बहुत तेज़ होगा क्योंकि इसे सिग्नल के आने-जाने का इंतज़ार नहीं करना पड़ेगा।

3. "नॉइज़-कैंसलिंग" हेडफ़ोन

वास्तविक दुनिया का ऑडियो अव्यवस्थित होता है। लोग खाँसते हैं, कारें हॉर्न बजाती हैं, और कमरों में गूँज होती है। इसे संभालने के लिए, टीम ने एक "नॉइज़ फ़िल्टर" (जिसे Silero VAD कहा जाता है) जोड़ा। इसे अनुवादक के लिए उच्च-तकनीकी नॉइज़-कैंसलिंग हेडफ़ोन के जोड़े के रूप में समझें। यह सन्नाटे और बैकग्राउंड शोर को अनदेखा करता है, और केवल तभी ध्यान देता है जब वास्तव में कोई मानव बोल रहा हो। यह अनुवादक को भ्रमित होने या दरवाज़ा टकराने की आवाज़ का अनुवाद करने से रोकता है।

4. समय के विरुद्ध दौड़ (परिणाम)

टीम ने तीन भाषा जोड़ों के लिए: चेक से अंग्रेजी, अंग्रेजी से जर्मन, और अंग्रेजी से इतालवी के लिए अपने नए सिस्टम का अन्य शीर्ष अनुवादकों (बेसलाइन्स) के साथ एक सिम्युलेटेड रेस में परीक्षण किया।

  • सेटअप: उन्होंने दो परिदृश्य (scenarios) का परीक्षण किया: एक "हाई लेटेंसी" रेस (जहाँ अनुवादक अधिक सटीकता के लिए थोड़ा अधिक प्रतीक्षा कर सकता है) और एक "लो लेटेंसी" रेस (जहाँ गति ही सब कुछ है)।
  • परिणाम:
    • गति बनाम गुणवत्ता: उनका सिस्टम दोनों श्रेणियों में चैंपियन रहा। "हाई लेटेंसी" रेस में, इसने मौजूदा सर्वोत्तम प्रणालियों की तुलना में काफी बेहतर अनुवाद किया (स्कोर में 4 से 8 अंक का सुधार)।
    • प्रतिस्पर्धा को पछाड़ना: "लो लेटेंसी" रेस में भी (जहाँ इसे बहुत तेज़ होना था), इसने अपनी पकड़ बनाए रखी, और अक्सर पिछले सर्वोत्तम सिस्टमों को पीछे छोड़ दिया।
    • स्लाइडिंग विंडो: उन्होंने अपने तरीके की तुलना एक अन्य तरीके से की जिससे ऑफलाइन मॉडल को रियल-टाइम में काम करने के योग्य बनाया जाता है (जिसे "स्लाइडिंग विंडो" कहा जाता है, जो गलतियों को सुधारने के लिए लगातार एक पैराग्राफ को फिर से पढ़ने जैसा है)। उनका "रुको-और-चलो" (AlignAtt) तरीका बहुत बेहतर था, जिसने कम देरी के साथ उच्च गुणवत्ता वाले अनुवाद दिए।

5. उन्होंने क्या सीखा (और क्या नहीं)

टीम ने निष्कर्ष निकाला कि एक शक्तिशाली, ऑफलाइन अनुवादक को एक "रियल-टाइम नियम पुस्तिका" देना एक सफल रणनीति है। यह सरल, प्रभावी है और इसके लिए महंगे प्रशिक्षण की आवश्यकता नहीं है।

हालाँकि, उन्हें एक छोटी सी बाधा का सामना करना पड़ा। उन्होंने अनुवादक को "संदर्भ संकेत" (context clues) देने की कोशिश की (जैसे, उसे बताना कि, "यह एक राजनीतिक बैठक है, इसलिए औपचारिक शब्दों का उपयोग करें"), लेकिन जब उन्होंने इन संकेतों को अपने नए "रुको-और-चलो" नियमों के साथ मिलाने की कोशिश की, तो अनुवादक भ्रमित हो गया और काम करना बंद कर दिया। उन्हें संदेह है कि ऐसा इसलिए है क्योंकि अनुवादक को इस विशिष्ट संयोजन के पर्याप्त उदाहरणों पर प्रशिक्षित नहीं किया गया था।

मुख्य बात

CUI टीम ने सफलतापूर्वक एक "अंत का इंतज़ार करने वाले" अनुवादक को एक "सुनने और चलते रहने वाले" अनुवादक में बदल दिया जो आपकी जेब में समा सकता है। उन्होंने साबित कर दिया कि उच्च-गुणवत्ता वाले समतुल्य अनुवाद के लिए आपको विशाल सुपरकंप्यूटर की आवश्यकता नहीं है; सही नियमों के साथ एक छोटा, स्मार्ट मॉडल भी उतना ही अच्छा, या उससे भी बेहतर काम कर सकता है जितना कि बड़े सिस्टम।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →