← नवीनतम पेपर
⚡ electrical engineering

WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS

यह शोधपत्र WordVoice प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो एक विशाल, पांच-आयामी रूप से एनोटेटेड डेटासेट और एक नवीन बाउंड-टोकन तंत्र का लाभ उठाकर LLM-आधारित TTS की कोर्स-ग्रेन्ड नियंत्रण सीमाओं को संबोधित करता है ताकि अवधि, पिच और ऊर्जा जैसे ध्वनिक गुणों के स्पष्ट, पृथक और सटीक शब्द-स्तरीय हेरफेर को सक्षम किया जा सके।

मूल लेखक: Sihang Nie, Jinxin Ji, Xiaofen Xing, Deyi Tuo, Chengbin Jin, Jialong Mai, Xiangmin Xu

प्रकाशित 2026-07-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sihang Nie, Jinxin Ji, Xiaofen Xing, Deyi Tuo, Chengbin Jin, Jialong Mai, Xiangmin Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक फिल्म निर्देशित कर रहे हैं, लेकिन अभिनेता (AI आवाज़) अपनी मर्जी से अभिनय (improvising) कर रहे हैं। वे सुनने में बहुत अच्छे और स्वाभाविक लगते हैं, लेकिन आप उन्हें किसी विशिष्ट शब्द को कैसे बोलना है, यह ठीक से नहीं बता सकते। आप यह नहीं कह सकते, "यहाँ एक पल के लिए रुकें," या "इस शब्द को गुस्से में बोलें," या "इस सुर को ऊँचा गाएं।" आपको बस उम्मीद करनी होगी कि AI आपके इरादे को सही ढंग से समझ ले।

यह शोध पत्र WordVoice पेश करता है, एक नया सिस्टम जो निर्देशकों (उपयोगकर्ताओं) को एक वाक्य के हर एक शब्द के लिए एक रिमोट कंट्रोल देता है। यह AI को एक अपनी मर्जी से अभिनय करने वाले अभिनेता से बदलकर एक स्क्रिप्ट-परफेक्ट कलाकार में बदल देता है जो आपके सटीक निर्देशों का पालन करता है।

इसे उन्होंने कैसे किया, सरल उपमाओं के माध्यम से यहाँ समझाया गया है:

1. समस्या: "धुंधला" रिमोट

वर्तमान AI वॉयस सिस्टम ऐसे रिमोट कंट्रोल की तरह हैं जिनमें केवल कुछ बड़े बटन होते हैं: "खुश," "दुखी," या "तेज़।" यदि आप एक लंबे वाक्य में केवल एक शब्द का पिच (pitch) बदलना चाहते हैं, तो वह रिमोट काम नहीं करता। AI पूरे वाक्य को ध्वनि के एक बड़े ढेर की तरह मानता है, जिससे व्यक्तिगत हिस्सों को सटीक रूप से बदलना असंभव हो जाता है।

2. समाधान: एक विशाल "निर्देश पुस्तिका" (WordVoice-5A)

AI को इन छोटे, विशिष्ट निर्देशों को सुनना सिखाने के लिए, शोधकर्ताओं को पहले उदाहरणों का एक विशाल पुस्तकालय बनाना पड़ा।

  • उपमा: कल्पना कीजिए कि आप एक छात्र को केवल पूरे गाने दिखाकर पियानो बजाना सिखा रहे हैं। वे सामान्य भाव तो सीख सकते हैं, लेकिन वे यह नहीं जान पाएंगे कि किसी विशिष्ट नोट को कितनी शक्ति के साथ बजाना है।
  • उन्होंने क्या किया: टीम ने WordVoice-5A बनाया, जो 4,700 घंटों के भाषण का एक डेटासेट है (एक विशाल लाइब्रेरी!)। उन्होंने केवल पूरे वाक्य को लेबल नहीं किया; बल्कि वे शब्द-दर-शब्द गए और हर एक शब्द के लिए पांच विशिष्ट "निर्देश" लिखे:
    1. अवधि (Duration): शब्द कितनी देर तक रहता है।
    2. सीमा (Boundary): क्या उससे पहले या बाद में ठहराव है?
    3. ऊर्जा (Energy): वह कितना तेज़ या ज़ोरदार है।
    4. पिच (Pitch): आवाज़ कितनी ऊँची या नीची है।
    5. टोन (Tone): धुन का आकार (बढ़ता हुआ, गिरता हुआ, सपाट, आदि)।

उन्होंने यह सुनिश्चित करने के लिए एक सख्त, भाषाविद्-निर्देशित प्रक्रिया का उपयोग किया कि ये लेबल एकदम सटीक हों, जिससे एक परम "निर्देश पुस्तिका" तैयार हुई।

3. मस्तिष्क: "ध्वनिक योजनाकार" (WordVoice-LLM)

उनके सिस्टम का मुख्य हिस्सा एक लार्ज लैंग्वेज मॉडल (LLM) है, जो वह "मस्तिष्क" है जो भाषण उत्पन्न करता है।

  • पुराना तरीका: मस्तिष्क बस अगले शब्द का अनुमान लगाता था, इस उम्मीद में कि वह सही लगेगा।
  • नया तरीका (WordVoice): शोधकर्ताओं ने एक विशेष "प्लानिंग टोकन" (इसे एक स्टिकी नोट की तरह समझें) जोड़ा है। AI बोलने से पहले, वह रुकता है और उस स्टिकी नोट पर एक योजना (plan) लिखता है।
    • उदाहरण: "'Hello' शब्द के लिए, मैं योजना बनाऊंगा: 0.5 सेकंड लंबा, उच्च ऊर्जा, बढ़ता हुआ पिच।"
    • एक बार योजना लिखे जाने के बाद, AI उस योजना के अनुसार ठीक वैसे ही शब्द बोलता है।
  • जादू: उपयोगकर्ता या तो AI को अपनी योजना लिखने दे सकते हैं (फ्री मोड) या स्वयं योजना लिख सकते हैं (कंट्रोल मोड)। यदि आप चाहते हैं कि कोई विशिष्ट शब्द नाटकीय लगे, तो आप बस उस स्टिकी नोट पर "उच्च ऊर्जा" लिख दें, और AI आज्ञा का पालन करेगा।

4. वॉयस बॉक्स: "फाइन-ट्यूनर" (WordVoice-FM)

भले ही आपके पास एक आदर्श योजना हो, लेकिन AI का "वॉयस बॉक्स" (वह हिस्सा जो डिजिटल नोट्स को वास्तविक ध्वनि तरंगों में बदलता है) कभी-कभी विवरण खो सकता है, जैसे कि कम रिज़ॉल्यूशन वाली फोटो।

  • उपमा: कल्पना कीजिए कि आपके पास एक आदर्श वास्तुशिल्प ब्लूप्रिंट (योजना) है, लेकिन निर्माता खुरदरी ईंटों का उपयोग करता है। आकार तो सही है, लेकिन बनावट (texture) गलत है।
  • उन्होंने क्या किया: उन्होंने अंत में एक "फाइन-ट्यूनर" मॉड्यूल जोड़ा। यह मॉड्यूल ब्लूप्रिंट और खुरदरी ईंटों को देखता है, फिर उन्हें चिकना करता है ताकि अंतिम ध्वनि तरंग योजना से पूरी तरह मेल खाए। यह डिजिटल "नोट्स" और निरंतर "ध्वनि" के बीच के अंतर को पाटता है, यह सुनिश्चित करता है कि ऊर्जा और पिच बिल्कुल वैसा ही हो जैसा आपने मांगा था।

5. परिणाम: पूर्ण नियंत्रण

टीम ने अन्य शीर्ष AI वॉयस टूल्स के मुकाबले इस सिस्टम का परीक्षण किया।

  • फैसला: WordVoice उपयोगकर्ताओं को अत्यधिक सटीकता के साथ विशिष्ट शब्दों की अवधि, तीव्रता, पिच और टोन बदलने की अनुमति देता है।
  • समझौता (Trade-off): पेपर में एक छोटा सा समझौता बताया गया है। क्योंकि AI व्यक्तिगत शब्दों के लिए आपके विशिष्ट निर्देशों का पालन करने पर इतना ध्यान केंद्रित कर रहा है, इसलिए आवाज़ का समग्र "स्वाभाविक प्रवाह" (natural flow) उस तुलना में थोड़ा कम पूर्ण है जब वह केवल अपनी मर्जी से बोल रहा हो। हालांकि, नियंत्रण का लाभ बहुत बड़ा है।
  • प्रमाण: जब उन्होंने AI से किसी एक शब्द का टोन या लंबाई बदलने के लिए कहा, तो इसने उच्च सटीकता के साथ ऐसा किया, जबकि अन्य सिस्टम पूरे वाक्य को बिगाड़े बिना उन विशिष्ट परिवर्तनों को करने में विफल रहे।

सारांश

WordVoice एक ऐसे वॉयस एक्टर को स्क्रिप्ट देने जैसा है जहाँ हर शब्द के साथ एक विशिष्ट निर्देश जुड़ा होता है (जैसे, "यह शब्द ज़ोर से कहें," "यह शब्द धीरे कहें")। यह भाषण को छोटे, प्रबंधनीय टुकड़ों में तोड़कर और प्रत्येक के लिए उपयोगकर्ता को एक रिमोट कंट्रोल देकर "कोर्स कंट्रोल" (coarse control) की समस्या को हल करता है, और यह सब करते हुए आवाज़ को स्वाभाविक और मानवीय बनाए रखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →