UtterTune: LoRA-Based Target-Language Pronunciation Edit and Control in Multilingual Text-to-Speech
UtterTune एक हल्का, LoRA-आधारित तरीका है जो बहुभाषी LLM-आधारित टेक्स्ट-टू-स्पीच सिस्टम में अन्य भाषाओं में स्वाभाविकता और वक्ता की समानता को बनाए रखते हुए, ज़ीरो-शॉट सेटिंग में जापानी खंडीय उच्चारण (segmental pronunciation) और पिच एक्सेंट पर सटीक नियंत्रण सक्षम करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट, बहुभाषी रोबोटिक आवाज़ है जो किसी की भी, कहीं भी, तुरंत नकल कर सकती है। यह एक जादुई डीजे की तरह है जो किसी सेलिब्रिटी की आवाज़ की नकल कर सकता है और केवल एक स्क्रिप्ट पढ़कर किसी भी भाषा में बोल सकता है। लेकिन यहाँ एक गड़बड़ी है: जब यह रोबोट जापानी बोलने की कोशिश करता है, तो कभी-कभी अपनी ही ज़बान लड़खड़ा जाता है। यह कठिन शब्दों के उच्चारण में गलती कर सकता है या इसके संगीत जैसे "उतार-चढ़ाव" (पिच एक्सेंट) को पूरी तरह से गलत कर सकता है, जिससे यह एक नेटिव स्पीकर के बजाय एक भ्रमित पर्यटक जैसा सुनाई देता है।
ऐसा क्यों होता है? इस रोबति को कच्चे टेक्स्ट (raw text) को पढ़ने के लिए प्रशिक्षित किया गया था—जैसे कि जापानी में उपयोग किए जाने वाले जटिल चीनी अक्षर (कान्जी)—बिना किसी इन-बिल्ट डिक्शनरी के जो इसे ठीक से बता सके कि उन्हें कैसे बोलना है। इसे पैटर्न के आधार पर अनुमान लगाना पड़ता है जो उसने ट्रेनिंग के दौरान देखे थे। चूंकि जापानी में हजारों अक्षर हैं जिनके कई संभावित उच्चारण हो सकते हैं, इसलिए रोबोट अक्सर गलत अनुमान लगाता है।
यहाँ आता है UtterTune, जो शोधकर्ता शुहेई काटो (Shuhei Kato) द्वारा प्रस्तावित एक चतुर, हल्का समाधान। UtterTune को पूरे रोबोट को फिर से बनाने के बजाय, उसके दिमाग में एक छोटी, कस्टम-मेड "चीट शीट" (cheat sheet) डालने की तरह समझें।
जादुई चीट शीट (LoRA)
शोधकर्ताओं ने LoRA (लो-रैंक अडैप्टेशन) नामक तकनीक का उपयोग किया। कल्पना करें कि रोबोट का दिमाग किताबों का एक विशाल पुस्तकालय है। हर एक किताब को फिर से लिखने के बजाय (जिसमें बहुत समय लगेगा और इससे रोबोट की अन्य भाषाएं बोलने की क्षमता बिगड़ सकती है), UtterTune बस कुछ पन्नों पर एक छोटी, चिपकी हुई नोट (sticky note) जोड़ देता है। ये नोट्स बहुत छोटे, प्रशिक्षण योग्य समायोजन (trainable adjustments) हैं जो रोबलेट को विशेष रूप से जापानी उच्चारण को संभालने के लिए सिखाते हैं।
यह "चीट शीट" अविश्वसनीय रूप से छोटी है—पूरे रोबोट के दिमाग के आकार के 0.5% से भी कम। क्योंकि यह इतनी छोटी है, रोबोट अंग्रेजी या चीनी बोलना नहीं भूलता; उसे बस जापानी के लिए एक सुपरपावर मिल जाती है।
"मोड स्विच" टोकन
इस चीट शीट को काम करने के योग्य बनाने के लिए, शोधकर्ताओं ने रोबोट की शब्दावली में दो विशेष "जादुई शब्द" (टोकन) जोड़े: <PHON_START> और <PHON_END>।
व्यवहार में यह कैसे काम करता है:
- सामान्य मोड: यदि आप सामान्य रूप से एक वाक्य टाइप करते हैं, तो रोबोट इसे हमेशा की तरह पढ़ता है।
- चीट मोड: यदि आप किसी कठिन शब्द को उन जादुई टैग्स में लपेटते हैं, जैसे
<PHON_START>チ'ミ/モーリョー<PHON_END>, तो रोबोट अपना गियर बदल लेता है। वह अनुमान लगाना बंद कर देता है और ध्वनियों और पिच के उतार-चढ़ाव के लिए आपके सटीक निर्देशों का पालन करता है।
यह रोबोट को यह बताने जैसा है कि, "हे, इस विशिष्ट भाग के लिए, अपने सामान्य अनुमानों को छोड़ दो और इस ध्वन्यात्मक स्पेलिंग (phonetic spelling) को ठीक वैसा ही पढ़ो जैसा लिखा गया है।"
क्या यह वास्तव में काम कर गया?
शोधकर्ताओं ने केवल उम्मीद नहीं की कि यह काम करेगा; उन्होंने इसे वास्तविक डेटा के साथ परखा।
- स्वाभाविकता (Naturalness): उन्होंने मानव श्रोताओं से पूछा कि भाषण कितना स्वाभाविक लगा और उन्हें 1 से 5 के पैमाने पर रेट करने को कहा। सुधार से पहले, रोबोट का स्कोर 3.44 था। UtterTune का उपयोग करने के बाद, स्कोर बढ़कर 3.88 हो गया। यह एक सांख्यिकीय रूप से महत्वपूर्ण सुधार है, जिसका अर्थ है कि भाषण बहुत अधिक मानवीय और कम रोबोटिक लग रहा था।
- एक्सेंट टेस्ट: उन्होंने 50 वाक्यों वाला एक "स्ट्रेस टेस्ट" बनाया जिसमें कठिन शब्द शामिल थे। बिना सुधार के, रोबोट केवल 47.2% बार पिच एक्सेंट को सही कर पाता था (मूलतः एक सिक्के के उछाल जैसा)। UtterTune के साथ, उसने 97.5% बार एक्सेंट को सफलतापूर्वक पकड़ा।
- कोई साइड इफेक्ट नहीं: महत्वपूर्ण रूप से, विभिन्न वक्ताओं की नकल करने की रोबोट की क्षमता (स्पीकर सिमिलैरिटी) में गिरावट नहीं आई। यह उनके सिमिलैरिटी स्केल पर लगभग 0.693 पर बनी रही, जिससे साबित हुआ कि रोबोट अभी भी उसी व्यक्ति की तरह लग रहा था जिसकी नकल करने की उसे कोशिश करनी थी।
यह क्या नहीं करता
यह जानना महत्वपूर्ण है कि यह क्या नहीं है। यह कोई जादुई छड़ी नहीं है जो हर भाषा की समस्या को तुरंत ठीक कर दे। पेपर स्पष्ट रूप से कहता है कि यह विधि वर्तमान में जापानी (विशेष रूप से टोक्यो जापानी) के लिए डिज़ाइन की गई है। यह अन्य भाषाओं के लिए रोबोट के उच्चारण को स्वचालित रूप से ठीक नहीं करती है जब तक कि आप उनके लिए एक नई, विशिष्ट "चीट शीट" प्रशिक्षित न करें। साथ से, हालांकि रोबोट निर्देशों का पालन करने में बहुत बेहतर हो जाता है, फिर भी यह उन जादुिक टैग्स के अंदर सही ध्वन्यात्मक स्पेलिंग प्रदान करने के लिए उपयोगकर्ता पर निर्भर करता है। यदि आप इसे गलत निर्देश देते हैं, तो यह पूरी निष्ठा से उनका पालन करेगा।
निचोड़ (The Bottom Line)
UtterTune दिखाता है कि अपनी गलतियों को ठीक करने के लिए आपको एक विशाल AI को फिर से बनाने की आवश्यकता नहीं है। कभी-कभी, एक छोटा, लक्षित समायोजन—कुल मस्तिष्क शक्ति के आधे प्रतिशत से भी कम—एक लड़खड़ाते रोबोट को एक धाराप्रवाह वक्ता में बदलने के लिए पर्याप्त होता है। शोधकर्ताओं ने अपनी "चीट शीट" और प्रशिक्षण डेटा को ऑनलाइन साझा भी किया है, ताकि अन्य लोग इसे आज़मा सकें और देख सकें कि क्या यह उनके अपने प्रोजेक्ट्स के लिए काम करता है। यह AI आवाजों को वास्तव में स्वाभाविक बनाने के लिए एक छोटा सा अपडेट है जिसका प्रभाव बहुत बड़ा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।