← नवीनतम पेपर
🤖 AI

OmniFusion: Simultaneous Multilingual Multimodal Translations via Modular Fusion

ओम्नीफ्यूजन (OmniFusion) एक एंड-टू-एंड मल्टीमॉडल ट्रांसलेशन सिस्टम है जो एक नवीन मल्टी-लेयर हिडन स्टेट फ्यूजन रणनीति के माध्यम से एक प्रीट्रेंड मल्टीमॉडल फाउंडेशन मॉडल को ट्रांसलेशन एलएलएम (LLM) के साथ जोड़ता है, जो पारंपरिक कैस्केडेड पाइपलाइनों की तुलना में कम लेटेंसी और बेहतर गुणवत्ता के साथ समवर्ती स्पीच-एंड-इमेज ट्रांसलेशन को सक्षम बनाता है।

मूल लेखक: Sai Koneru, Matthias Huck, Jan Niehues

प्रकाशित 2026-04-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sai Koneru, Matthias Huck, Jan Niehues

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप किसी विदेशी भाषा में दिए जा रहे एक जटिल प्रेजेंटेशन का अनुवाद करने की कोशिश कर रहे हैं। आपके पास मदद के लिए दो उपकरण उपलब्ध हैं:

  1. विशेषज्ञ अनुवादक (The Specialist Translator): एक शानदार इंसान जो 50 भाषाएं पूरी तरह से बोल सकता है, लेकिन वह अंधा और बहरा है। वह केवल टेक्स्ट (पाठ) पढ़ सकता है। इसका उपयोग करने के लिए, आपको पहले एक स्टेनोग्राफर को काम पर रखना होगा जो वक्ता की बातों को टाइप करे (Speech-to-Text), और फिर आपको वह टेक्स्ट उस अनुवादक को सौंपना होगा। यदि वक्ता स्लाइड पर बने किसी आरेख (diagram) के बारे में बात कर रहा है, तो अनुवादक को पता नहीं होगा कि वह आरेख कैसा दिखता है, इसलिए वह गलत अनुमान लगा सकता है।

  2. सुपर-परसीवर (The Super-Perceiver): एक रोबोट जिसकी आंखें और कान अविश्वसनीय हैं। वह स्लाइड देख सकता है, वक्ता को सुन सकता है, और संदर्भ (context) को तुरंत समझ सकता है। हालाँकि, वह एक पेशेवर अनुवादक नहीं है; वह कई भाषाएं बोलता है लेकिन अक्सर व्याकरण संबंधी गलतियां करता है या बारीकियों को समझने में चूक जाता है।

समस्या:
वर्तमान में, अधिकांश AI सिस्टम "विशेषज्ञ अनुवादक" वाला दृष्टिकोण अपनाते हैं। वे काम को चरणों में विभाजित करते हैं: पहले कंप्यूटर सुनता है और टाइप करता है (ASR), फिर वह अनुवाद करता है (MT)। यह धीमा है (जैसे एक रिले रेस जहाँ आपको बैटन पास करना पड़ता है) और इसमें विजुअल कॉन्टेक्स्ट (स्लाइड्स) भी खो जाता है। यदि वक्ता कहता है "एग्जिट (निकास) को देखें," तो कंप्यूटर को यह पता नहीं चलेगा कि उसका मतलब कार का निकास है या व्यक्ति का निकास, बिना चित्र देखे।

समाधान: OmniFusion
यह पेपर OmniFusion का परिचय देता है, जो एक सुपर-अनुवादक को काम पर रखने जैसा है जिसके पास विशेषज्ञ की भाषाई कुशलता और सुपर-परसीवर की आंखें और कान, दोनों एक ही मस्तिष्क में मौजूद हैं।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "गेटेड फ्यूजन" (The Gated Fusion - स्मार्ट स्विचबोर्ड)

कल्पना कीजिए कि सुपर-परसीवर (AI जो देखता और सुनता है) के पास सोचने की कई परतें हैं, जैसे कि एक बहु-मंजिला इमारत।

  • निचली मंजिल कच्ची ध्वनियाँ सुनती है।
  • मध्य मंजिल अर्थ को समझना शुरू करती है।
  • ऊपरी मंजिल के पास अमूर्त, उच्च-स्तरीय विचार होते हैं।

यदि आप केवल हर मंजिल से सारी जानकारी विशेषज्ञ अनुवादक में डाल देंगे, तो वह अभिभूत और भ्रमित हो जाएगा (जैसे आग की पाइप से पानी पीने की कोशिश करना)।

OmniFusion की तरकीब: यह एक "गेटेड स्विचबोर्ड" का उपयोग करता है। यह एक स्मार्ट ट्रैफिक कंट्रोलर है जो यह तय करता है कि पल-दर-पल, सुपर-परसीवर के मस्तिष्क के किस तल (floor) को सुनना है।

  • यदि वक्ता बुदबुदा रहा है, तो यह निचली मंजिल (कच्ची ध्वनि) को सुनता है।
  • यदि वक्ता किसी जटिल अवधारणा पर चर्चा कर रहा है, तो यह मध्य मंजिल को सुनता है।
  • यह शोर को फ़िल्टर करता है और केवल सबसे उपयोगी जानकारी अनुवादक को भेजता है। यह सिस्टम को तेज़ और कुशल बनाए रखता है।

2. "सेल्फ-कैस्केडिंग" (The Self-Cascading - आंतरिक अभ्यास)

कभी-कभी, सबसे अच्छे अनुवादक को भी सोचने के लिए एक क्षण की आवश्यकता होती है। OmniFusion के पास एक अनूठी प्रशिक्षण तकनीक है जिसे Self-Cascading कहा जाता है।

इसे एक छात्र द्वारा परीक्षा देने की तरह समझें।

  • प्रत्यक्ष अनुवाद (Direct Translation): छात्र तुरंत अंतिम उत्तर लिखने का प्रयास करता है।
  • सेल्फ-कैस्केडिंग (Self-Cascading): छात्र पहले अपने मन में उत्तर को फुसफुसाता है (भाषण को ट्रांसक्राइब करना या स्लाइड पर लिखे टेक्स्ट को पढ़ना), फिर वह अंतिम अनुवाद लिखता है।

AI को इस "आंतरिक फुसफुसाहट" वाले चरण को पहले करने के लिए प्रशिक्षित करके, यह क्या सुनता/देखता है और वह क्या लिखता है, उसके बीच एक आदर्श सेतु बनाता है। यह त्रुटियों को कम करता है, विशेष रूप से तब जब विजुअल कॉन्टेक्स्ट (जैसे चार्ट वाली स्लाइड) शब्दों को समझने के लिए महत्वपूर्ण हो।

3. यह एक बड़ी बात क्यों है?

  • गति (Speed): क्योंकि इसे एक कंप्यूटर के टाइपिंग खत्म करने का इंतजार नहीं करना पड़ता और फिर दूसरे को शुरू करना पड़ता है, यह बहुत तेज़ है। पेपर कहता है कि यह समवर्ती अनुवाद (simultaneous translation - बोलते समय अनुवाद करना) में लगभग एक सेकंड का विलंब बचाता है। एक लाइव कॉन्फ्रेंस में, वह एक सेकंड ही "रियल-टाइम" और "लैगी" महसूस होने के बीच का अंतर होता है।
  • सटीकता (Accuracy): क्योंकि यह अनुवाद करते समय स्लाइड्स को "देख" सकता है, इसलिए यह मूर्खतापूर्ण गलतियां करना बंद कर देता है।
    • उदाहरण: यदि वक्ता कहता है "Exit" और स्लाइड में एक दरवाजा दिखाई देता है, तो AI जानता है कि इसे "Ausgang" (व्यक्ति का निकास) के रूप में अनुवाद करना है। यदि स्लाइड में एक हाईवे दिखता है, तो वह जानता है कि इसे "Ausfahrt" (कार का निकास) के रूप में अनुवाद करना है। एक मानक सिस्टम केवल अनुमान लगाएगा।
  • दक्षता (Efficiency): इसे शून्य से प्रशिक्षित करने की आवश्यकता नहीं है। यह दो मौजूदा, शक्तिशाली मॉडलों को लेता है और उन्हें एक साथ जोड़ देता है, जिससे भारी मात्रा में कंप्यूटिंग पावर की बचत होती है।

निष्कर्ष (The Bottom Line)

OmniFusion एक रिले रेस (जहाँ धावक बैटन पास करते हैं और समय खो देते हैं) से एक सिंक्रोनाइज्ड स्विम टीम (जहाँ सभी एक इकाई के रूप में चलते हैं) में अपग्रेड करने जैसा है। यह देखने और सुनने की क्षमता को पूर्ण रूप से अनुवाद करने की क्षमता के साथ जोड़ता है, जिससे वास्तविक-समय, बहुभाषी संचार अधिक सुचारू, तेज़ और स्मार्ट बनता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →