← नवीनतम पेपर
🤖 AI

Parameter- and Bandwidth-Efficient Edge--cloud Many-to-Many Speech-to-Text Translation

यह शोध पत्र ESRT का प्रस्ताव करता है, जो कई-से-कई स्पीच-टू-टेक्स्ट ट्रांसलेशन के लिए एक पैरामीटर- और बैंडविड्थ-कुशल एज-क्लाउड फ्रेमवर्क है, जो हल्के मॉडलों को प्रशिक्षित करने के लिए मल्टी-टास्क वेटेड करिकुलम लर्निंग का उपयोग करता है और गोपनीयता बनाए रखते हुए 45 भाषाओं में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए कच्चे ऑडियो के बजाय संकुचित टेंसरों को प्रसारित करता है।

मूल लेखक: Yexing Du, Kaiyuan Liu, Youcheng Pan, Bo Yang, Lei Chen, Ming Liu, Bing Qin, Yang Xiang

प्रकाशित 2026-08-17
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yexing Du, Kaiyuan Liu, Youcheng Pan, Bo Yang, Lei Chen, Ming Liu, Bing Qin, Yang Xiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप वॉकी-टॉकी पर फुसफुसाए गए एक गुप्त संदेश का अनुवाद करने की कोशिश कर रहे हैं, लेकिन दूसरी ओर बैठा व्यक्ति मीलों दूर एक विशाल, हाई-टेक कंट्रोल रूम में है। यह स्पीच-टू-टेक्स्ट ट्रांसलेशन (S2TT) की दुनिया है, एक ऐसा क्षेत्र जहाँ कंप्यूटर एक भाषा में बोले गए शब्दों को सुनता है और तुरंत उन्हें दूसरी भाषा में टाइप कर देता है। लंबे समय तक, यह दो चरणों वाला एक नृत्य था: पहले, एक कंप्यूटर को यह समझना होता था कि क्या कहा गया था (एक स्टेनोग्राफर की तरह), और फिर दूसरे कंप्यूटर को उन शब्दों का अनुवाद करना होता था। लेकिन यह "रिले रेस" अक्सर गेंद गिरा देती थी, जिससे संदेश बिगड़ जाते थे। हाल ही में, वैज्ञानिकों ने "मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स" (MLLMs) बनाए हैं—सुपर-स्मार्ट AI दिमाग जो एक ही बार में सुन और अनुवाद कर सकते हैं। हालाँकि, ये दिमाग बहुत विशाल और भूखे हैं। या तो उन्हें आपके फोन पर रहना होगा (जो उन्हें रखने के लिए बहुत छोटा है) या क्लाउड में रहना होगा (जिसके लिए इंटरनेट पर अपने कच्चे वॉयस डेटा को भेजना आवश्यक है, जिससे आपकी गोपनीयता को खतरा होता है और नेटवर्क जाम हो जाता है)। बड़ा सवाल यह है: क्या हम एक स्मार्ट अनुवादक रख सकते हैं जो आपके फोन पर आंशिक रूप से और क्लाउड पर आंशिक रूप से रहता है, बिना आपके कच्चे वॉयस डेटा को भेजे या इंटरनेट को धीमा किए?

यहाँ ESRT (एज-क्लाउड स्पीच रिकग्निशन एंड ट्रांसलेशन) आता है, जो शोधकर्ताओं द्वारा प्रस्तावित एक नया ढांचा है जो एक चतुर राजनयिक दूत की तरह कार्य करता है। इंटरनेट के माध्यम से क्लाउड पर अपनी कच्ची आवाज़ ( "रॉ ऑडियो") भेजने के बजाय, ESRT आपकी आवाज़ को आपके डिवाइस पर ही रखता है। अपने फोन को एक स्थानीय अनुवादक के रूप में सोचें जो फुसफुसाहट को सुनता है, उसके अर्थ को एक छोटे, संकुचित नोट (एक "टेंसर") में सारांशित करता है, और केवल उस नोट को क्लाउड पर भेजता है। क्लाउड फिर अनुवाद को पूरा करने के लिए अपने विशाल मस्तिष्क का उपयोग करता है। यह दृष्टिकोण पूरी डायरी डाक से भेजने के बजाय मुख्य विचार वाला एक पोस्टकार्ड भेजने जैसा है।

शोधकर्ताओं ने पाया कि यह "स्प्लिट" (विभाजित) विधि अविश्वसनीय रूप से अच्छी तरह काम करती है। उन्होंने अपने AI के तीन संस्करणों—छोटे, मध्यम और बड़े (जिन्हें ESRT-1B, ESRT-4B और ESRT-12B लेबल किया गया है)—को "मल्टी-टास्क वेटेड करिकुलम लर्निंग" नामक एक विशेष शिक्षण रणनीति का उपयोग करके प्रशिक्षित किया। कल्पना कीजिए कि एक छात्र को पहले पढ़ने का अभ्यास कराकर, फिर अनुवाद करने का, और अंत में दोनों एक साथ करने का अभ्यास कराकर सिखाना, लेकिन इन कार्यों को सावधानीपूर्वक मिलाना ताकि वे पिछले पाठों को भूल न जाएं। इस पद्धति ने मॉडलों को 45 विभिन्न भाषाओं में अनुवाद करने में महारत हासिल करने की अनुमति दी (जिसमें 1,980 संभावित दिशा युग्म शामिल हैं, जैसे फ्रेंच से जापानी या स्वाहिली से जर्मन में अनुवाद करना)।

परिणाम चौंकाने वाले हैं। ESRT मॉडल केवल काम ही नहीं करते थे; उन्होंने उन मौजूदा मॉडलों को भी पीछे छोड़ दिया जो उनसे तीन गुना अधिक "न्यूरॉन्स" (पैरामीटर्स) रखते हैं। उदाहरण के लिए, ESRT-12B मॉडल ने अंग्रेजी-से-अन्य-भाषा अनुवाद के लिए एक मानक अनुवाद गुणवत्ता परीक्षण (COMET) पर 88.1 का शीर्ष स्कोर प्राप्त किया, जो काफी बड़े प्रतिस्पर्धियों को पछाड़ देता है। सबसे महत्वपूर्ण बात यह है कि इसकी "बैंडविड्थ दक्षता" एक गेम-चेंजर है। कच्चे वॉयस के बजाय संकुचित नोट भेजने से, क्लाउड को भेजे जाने वाले डेटा की मात्रा मानक मॉडल के लिए 5.1 गुना और एक हल्के संस्करण (ESRT-Lite) के लिए पूरे 10.2 गुना कम हो गई।

यह पेपर यह भी सुझाव देता है कि यह तरीका आपकी गोपनीयता के लिए अधिक सुरक्षित है। क्योंकि कच्ची आवाज़ कभी आपके फोन को नहीं छोड़ती है, और क्लाउड केवल एक संकुचित गणितीय प्रतिनिधित्व प्राप्त करता है, इसलिए किसी जासूस के लिए आपकी वास्तविक आवाज़ को फिर से बनाना बहुत कठिन है। परीक्षणों में, जब शोधकर्ताओं ने संकुचित नोट को वापस ध्वनि में बदलने (रिवर्स-इंजीनियर करने) की कोशिश की, तो परिणाम एक शोर भरा, समझ से बाहर का मिश्रण था, जो यह दर्शाता है कि आपकी वॉयसप्रिंट सुरक्षित रहती है। हालाँकि, लेखक सावधानी बरतते हुए कहते हैं कि यह "प्राइवेसी-अवेयर" (गोपनीयता के प्रति सचेत) है न कि एक पूर्ण, अटूट ढाल; हालांकि यह पुनर्निर्माण को कठिन बनाता है, यह गारंटी नहीं देता कि वक्ता के बारे में कोई जानकारी लीक नहीं होगी।

संक्षेप में, ESRT सुझाव देता है कि हमें एक शक्तिशाली क्लाउड मस्तिष्क और एक निजी, स्थानीय डिवाइस के बीच चयन करने की आवश्यकता नहीं है। काम को विभाजित करके और डेटा को संकुचित करके, हम उच्च-गुणवत्ता वाला, बहुभाषी अनुवाद प्राप्त कर सकते हैं जो तेज़, कुशल है और आपकी आवाज़ को वहीं रखता है जहाँ वह होनी चाहिए: आपके डिवाइस पर।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →