WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS
यह शोधपत्र WordVoice प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो एक विशाल, पांच-आयामी रूप से एनोटेटेड डेटासेट और एक नवीन बाउंड-टोकन तंत्र का लाभ उठाकर LLM-आधारित TTS की कोर्स-ग्रेन्ड नियंत्रण सीमाओं को संबोधित करता है ताकि अवधि, पिच और ऊर्जा जैसे ध्वनिक गुणों के स्पष्ट, पृथक और सटीक शब्द-स्तरीय हेरफेर को सक्षम किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक फिल्म निर्देशित कर रहे हैं, लेकिन अभिनेता (AI आवाज़) अपनी मर्जी से अभिनय (improvising) कर रहे हैं। वे सुनने में बहुत अच्छे और स्वाभाविक लगते हैं, लेकिन आप उन्हें किसी विशिष्ट शब्द को कैसे बोलना है, यह ठीक से नहीं बता सकते। आप यह नहीं कह सकते, "यहाँ एक पल के लिए रुकें," या "इस शब्द को गुस्से में बोलें," या "इस सुर को ऊँचा गाएं।" आपको बस उम्मीद करनी होगी कि AI आपके इरादे को सही ढंग से समझ ले।
यह शोध पत्र WordVoice पेश करता है, एक नया सिस्टम जो निर्देशकों (उपयोगकर्ताओं) को एक वाक्य के हर एक शब्द के लिए एक रिमोट कंट्रोल देता है। यह AI को एक अपनी मर्जी से अभिनय करने वाले अभिनेता से बदलकर एक स्क्रिप्ट-परफेक्ट कलाकार में बदल देता है जो आपके सटीक निर्देशों का पालन करता है।
इसे उन्होंने कैसे किया, सरल उपमाओं के माध्यम से यहाँ समझाया गया है:
1. समस्या: "धुंधला" रिमोट
वर्तमान AI वॉयस सिस्टम ऐसे रिमोट कंट्रोल की तरह हैं जिनमें केवल कुछ बड़े बटन होते हैं: "खुश," "दुखी," या "तेज़।" यदि आप एक लंबे वाक्य में केवल एक शब्द का पिच (pitch) बदलना चाहते हैं, तो वह रिमोट काम नहीं करता। AI पूरे वाक्य को ध्वनि के एक बड़े ढेर की तरह मानता है, जिससे व्यक्तिगत हिस्सों को सटीक रूप से बदलना असंभव हो जाता है।
2. समाधान: एक विशाल "निर्देश पुस्तिका" (WordVoice-5A)
AI को इन छोटे, विशिष्ट निर्देशों को सुनना सिखाने के लिए, शोधकर्ताओं को पहले उदाहरणों का एक विशाल पुस्तकालय बनाना पड़ा।
- उपमा: कल्पना कीजिए कि आप एक छात्र को केवल पूरे गाने दिखाकर पियानो बजाना सिखा रहे हैं। वे सामान्य भाव तो सीख सकते हैं, लेकिन वे यह नहीं जान पाएंगे कि किसी विशिष्ट नोट को कितनी शक्ति के साथ बजाना है।
- उन्होंने क्या किया: टीम ने WordVoice-5A बनाया, जो 4,700 घंटों के भाषण का एक डेटासेट है (एक विशाल लाइब्रेरी!)। उन्होंने केवल पूरे वाक्य को लेबल नहीं किया; बल्कि वे शब्द-दर-शब्द गए और हर एक शब्द के लिए पांच विशिष्ट "निर्देश" लिखे:
- अवधि (Duration): शब्द कितनी देर तक रहता है।
- सीमा (Boundary): क्या उससे पहले या बाद में ठहराव है?
- ऊर्जा (Energy): वह कितना तेज़ या ज़ोरदार है।
- पिच (Pitch): आवाज़ कितनी ऊँची या नीची है।
- टोन (Tone): धुन का आकार (बढ़ता हुआ, गिरता हुआ, सपाट, आदि)।
उन्होंने यह सुनिश्चित करने के लिए एक सख्त, भाषाविद्-निर्देशित प्रक्रिया का उपयोग किया कि ये लेबल एकदम सटीक हों, जिससे एक परम "निर्देश पुस्तिका" तैयार हुई।
3. मस्तिष्क: "ध्वनिक योजनाकार" (WordVoice-LLM)
उनके सिस्टम का मुख्य हिस्सा एक लार्ज लैंग्वेज मॉडल (LLM) है, जो वह "मस्तिष्क" है जो भाषण उत्पन्न करता है।
- पुराना तरीका: मस्तिष्क बस अगले शब्द का अनुमान लगाता था, इस उम्मीद में कि वह सही लगेगा।
- नया तरीका (WordVoice): शोधकर्ताओं ने एक विशेष "प्लानिंग टोकन" (इसे एक स्टिकी नोट की तरह समझें) जोड़ा है। AI बोलने से पहले, वह रुकता है और उस स्टिकी नोट पर एक योजना (plan) लिखता है।
- उदाहरण: "'Hello' शब्द के लिए, मैं योजना बनाऊंगा: 0.5 सेकंड लंबा, उच्च ऊर्जा, बढ़ता हुआ पिच।"
- एक बार योजना लिखे जाने के बाद, AI उस योजना के अनुसार ठीक वैसे ही शब्द बोलता है।
- जादू: उपयोगकर्ता या तो AI को अपनी योजना लिखने दे सकते हैं (फ्री मोड) या स्वयं योजना लिख सकते हैं (कंट्रोल मोड)। यदि आप चाहते हैं कि कोई विशिष्ट शब्द नाटकीय लगे, तो आप बस उस स्टिकी नोट पर "उच्च ऊर्जा" लिख दें, और AI आज्ञा का पालन करेगा।
4. वॉयस बॉक्स: "फाइन-ट्यूनर" (WordVoice-FM)
भले ही आपके पास एक आदर्श योजना हो, लेकिन AI का "वॉयस बॉक्स" (वह हिस्सा जो डिजिटल नोट्स को वास्तविक ध्वनि तरंगों में बदलता है) कभी-कभी विवरण खो सकता है, जैसे कि कम रिज़ॉल्यूशन वाली फोटो।
- उपमा: कल्पना कीजिए कि आपके पास एक आदर्श वास्तुशिल्प ब्लूप्रिंट (योजना) है, लेकिन निर्माता खुरदरी ईंटों का उपयोग करता है। आकार तो सही है, लेकिन बनावट (texture) गलत है।
- उन्होंने क्या किया: उन्होंने अंत में एक "फाइन-ट्यूनर" मॉड्यूल जोड़ा। यह मॉड्यूल ब्लूप्रिंट और खुरदरी ईंटों को देखता है, फिर उन्हें चिकना करता है ताकि अंतिम ध्वनि तरंग योजना से पूरी तरह मेल खाए। यह डिजिटल "नोट्स" और निरंतर "ध्वनि" के बीच के अंतर को पाटता है, यह सुनिश्चित करता है कि ऊर्जा और पिच बिल्कुल वैसा ही हो जैसा आपने मांगा था।
5. परिणाम: पूर्ण नियंत्रण
टीम ने अन्य शीर्ष AI वॉयस टूल्स के मुकाबले इस सिस्टम का परीक्षण किया।
- फैसला: WordVoice उपयोगकर्ताओं को अत्यधिक सटीकता के साथ विशिष्ट शब्दों की अवधि, तीव्रता, पिच और टोन बदलने की अनुमति देता है।
- समझौता (Trade-off): पेपर में एक छोटा सा समझौता बताया गया है। क्योंकि AI व्यक्तिगत शब्दों के लिए आपके विशिष्ट निर्देशों का पालन करने पर इतना ध्यान केंद्रित कर रहा है, इसलिए आवाज़ का समग्र "स्वाभाविक प्रवाह" (natural flow) उस तुलना में थोड़ा कम पूर्ण है जब वह केवल अपनी मर्जी से बोल रहा हो। हालांकि, नियंत्रण का लाभ बहुत बड़ा है।
- प्रमाण: जब उन्होंने AI से किसी एक शब्द का टोन या लंबाई बदलने के लिए कहा, तो इसने उच्च सटीकता के साथ ऐसा किया, जबकि अन्य सिस्टम पूरे वाक्य को बिगाड़े बिना उन विशिष्ट परिवर्तनों को करने में विफल रहे।
सारांश
WordVoice एक ऐसे वॉयस एक्टर को स्क्रिप्ट देने जैसा है जहाँ हर शब्द के साथ एक विशिष्ट निर्देश जुड़ा होता है (जैसे, "यह शब्द ज़ोर से कहें," "यह शब्द धीरे कहें")। यह भाषण को छोटे, प्रबंधनीय टुकड़ों में तोड़कर और प्रत्येक के लिए उपयोगकर्ता को एक रिमोट कंट्रोल देकर "कोर्स कंट्रोल" (coarse control) की समस्या को हल करता है, और यह सब करते हुए आवाज़ को स्वाभाविक और मानवीय बनाए रखता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।