Parameter- and Bandwidth-Efficient Edge--cloud Many-to-Many Speech-to-Text Translation
यह शोध पत्र ESRT का प्रस्ताव करता है, जो कई-से-कई स्पीच-टू-टेक्स्ट ट्रांसलेशन के लिए एक पैरामीटर- और बैंडविड्थ-कुशल एज-क्लाउड फ्रेमवर्क है, जो हल्के मॉडलों को प्रशिक्षित करने के लिए मल्टी-टास्क वेटेड करिकुलम लर्निंग का उपयोग करता है और गोपनीयता बनाए रखते हुए 45 भाषाओं में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए कच्चे ऑडियो के बजाय संकुचित टेंसरों को प्रसारित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप वॉकी-टॉकी पर फुसफुसाए गए एक गुप्त संदेश का अनुवाद करने की कोशिश कर रहे हैं, लेकिन दूसरी ओर बैठा व्यक्ति मीलों दूर एक विशाल, हाई-टेक कंट्रोल रूम में है। यह स्पीच-टू-टेक्स्ट ट्रांसलेशन (S2TT) की दुनिया है, एक ऐसा क्षेत्र जहाँ कंप्यूटर एक भाषा में बोले गए शब्दों को सुनता है और तुरंत उन्हें दूसरी भाषा में टाइप कर देता है। लंबे समय तक, यह दो चरणों वाला एक नृत्य था: पहले, एक कंप्यूटर को यह समझना होता था कि क्या कहा गया था (एक स्टेनोग्राफर की तरह), और फिर दूसरे कंप्यूटर को उन शब्दों का अनुवाद करना होता था। लेकिन यह "रिले रेस" अक्सर गेंद गिरा देती थी, जिससे संदेश बिगड़ जाते थे। हाल ही में, वैज्ञानिकों ने "मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स" (MLLMs) बनाए हैं—सुपर-स्मार्ट AI दिमाग जो एक ही बार में सुन और अनुवाद कर सकते हैं। हालाँकि, ये दिमाग बहुत विशाल और भूखे हैं। या तो उन्हें आपके फोन पर रहना होगा (जो उन्हें रखने के लिए बहुत छोटा है) या क्लाउड में रहना होगा (जिसके लिए इंटरनेट पर अपने कच्चे वॉयस डेटा को भेजना आवश्यक है, जिससे आपकी गोपनीयता को खतरा होता है और नेटवर्क जाम हो जाता है)। बड़ा सवाल यह है: क्या हम एक स्मार्ट अनुवादक रख सकते हैं जो आपके फोन पर आंशिक रूप से और क्लाउड पर आंशिक रूप से रहता है, बिना आपके कच्चे वॉयस डेटा को भेजे या इंटरनेट को धीमा किए?
यहाँ ESRT (एज-क्लाउड स्पीच रिकग्निशन एंड ट्रांसलेशन) आता है, जो शोधकर्ताओं द्वारा प्रस्तावित एक नया ढांचा है जो एक चतुर राजनयिक दूत की तरह कार्य करता है। इंटरनेट के माध्यम से क्लाउड पर अपनी कच्ची आवाज़ ( "रॉ ऑडियो") भेजने के बजाय, ESRT आपकी आवाज़ को आपके डिवाइस पर ही रखता है। अपने फोन को एक स्थानीय अनुवादक के रूप में सोचें जो फुसफुसाहट को सुनता है, उसके अर्थ को एक छोटे, संकुचित नोट (एक "टेंसर") में सारांशित करता है, और केवल उस नोट को क्लाउड पर भेजता है। क्लाउड फिर अनुवाद को पूरा करने के लिए अपने विशाल मस्तिष्क का उपयोग करता है। यह दृष्टिकोण पूरी डायरी डाक से भेजने के बजाय मुख्य विचार वाला एक पोस्टकार्ड भेजने जैसा है।
शोधकर्ताओं ने पाया कि यह "स्प्लिट" (विभाजित) विधि अविश्वसनीय रूप से अच्छी तरह काम करती है। उन्होंने अपने AI के तीन संस्करणों—छोटे, मध्यम और बड़े (जिन्हें ESRT-1B, ESRT-4B और ESRT-12B लेबल किया गया है)—को "मल्टी-टास्क वेटेड करिकुलम लर्निंग" नामक एक विशेष शिक्षण रणनीति का उपयोग करके प्रशिक्षित किया। कल्पना कीजिए कि एक छात्र को पहले पढ़ने का अभ्यास कराकर, फिर अनुवाद करने का, और अंत में दोनों एक साथ करने का अभ्यास कराकर सिखाना, लेकिन इन कार्यों को सावधानीपूर्वक मिलाना ताकि वे पिछले पाठों को भूल न जाएं। इस पद्धति ने मॉडलों को 45 विभिन्न भाषाओं में अनुवाद करने में महारत हासिल करने की अनुमति दी (जिसमें 1,980 संभावित दिशा युग्म शामिल हैं, जैसे फ्रेंच से जापानी या स्वाहिली से जर्मन में अनुवाद करना)।
परिणाम चौंकाने वाले हैं। ESRT मॉडल केवल काम ही नहीं करते थे; उन्होंने उन मौजूदा मॉडलों को भी पीछे छोड़ दिया जो उनसे तीन गुना अधिक "न्यूरॉन्स" (पैरामीटर्स) रखते हैं। उदाहरण के लिए, ESRT-12B मॉडल ने अंग्रेजी-से-अन्य-भाषा अनुवाद के लिए एक मानक अनुवाद गुणवत्ता परीक्षण (COMET) पर 88.1 का शीर्ष स्कोर प्राप्त किया, जो काफी बड़े प्रतिस्पर्धियों को पछाड़ देता है। सबसे महत्वपूर्ण बात यह है कि इसकी "बैंडविड्थ दक्षता" एक गेम-चेंजर है। कच्चे वॉयस के बजाय संकुचित नोट भेजने से, क्लाउड को भेजे जाने वाले डेटा की मात्रा मानक मॉडल के लिए 5.1 गुना और एक हल्के संस्करण (ESRT-Lite) के लिए पूरे 10.2 गुना कम हो गई।
यह पेपर यह भी सुझाव देता है कि यह तरीका आपकी गोपनीयता के लिए अधिक सुरक्षित है। क्योंकि कच्ची आवाज़ कभी आपके फोन को नहीं छोड़ती है, और क्लाउड केवल एक संकुचित गणितीय प्रतिनिधित्व प्राप्त करता है, इसलिए किसी जासूस के लिए आपकी वास्तविक आवाज़ को फिर से बनाना बहुत कठिन है। परीक्षणों में, जब शोधकर्ताओं ने संकुचित नोट को वापस ध्वनि में बदलने (रिवर्स-इंजीनियर करने) की कोशिश की, तो परिणाम एक शोर भरा, समझ से बाहर का मिश्रण था, जो यह दर्शाता है कि आपकी वॉयसप्रिंट सुरक्षित रहती है। हालाँकि, लेखक सावधानी बरतते हुए कहते हैं कि यह "प्राइवेसी-अवेयर" (गोपनीयता के प्रति सचेत) है न कि एक पूर्ण, अटूट ढाल; हालांकि यह पुनर्निर्माण को कठिन बनाता है, यह गारंटी नहीं देता कि वक्ता के बारे में कोई जानकारी लीक नहीं होगी।
संक्षेप में, ESRT सुझाव देता है कि हमें एक शक्तिशाली क्लाउड मस्तिष्क और एक निजी, स्थानीय डिवाइस के बीच चयन करने की आवश्यकता नहीं है। काम को विभाजित करके और डेटा को संकुचित करके, हम उच्च-गुणवत्ता वाला, बहुभाषी अनुवाद प्राप्त कर सकते हैं जो तेज़, कुशल है और आपकी आवाज़ को वहीं रखता है जहाँ वह होनी चाहिए: आपके डिवाइस पर।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।