← नवीनतम पेपर
💻 computer science

Vibrato Expression Control for Singing Voice Conversion with Improving Independent Control

यह शोध पत्र VibE-SVC2 को प्रस्तुत करता है, जो एक उन्नत गायन स्वर रूपांतरण ढांचा (framework) है जो एक एनर्जी स्टाइल कनवर्टर के माध्यम से पिच-एनर्जी एंटैंगलमेंट को हल करके पिच और टिम्ब्रे शैलियों पर स्वतंत्र नियंत्रण में सुधार करता है, जिससे ज़ीरो-शॉट पिच स्टाइल ट्रांसफर और स्वतंत्र वाइब्रेटो एक्सटेंट स्केलिंग सक्षम होती है, जबकि एक नवीन सबहारमोनिक करेक्शन एल्गोरिदम के माध्यम से सबहारमोनिक फोनेशन चुनौतियों का समाधान किया जाता है।

मूल लेखक: Joon-Seung Choi, Dong-Min Byun, Seong-Whan Lee

प्रकाशित 2026-06-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Joon-Seung Choi, Dong-Min Byun, Seong-Whan Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक गायन स्वर है जो एक अनूठे संगीत वाद्य यंत्र की तरह है। आप एक व्यक्ति के गायन की रिकॉर्डिंग लेना चाहते हैं और उसे एक अलग व्यक्ति की आवाज़ जैसा बनाना चाहते हैं, लेकिन आप मूल प्रदर्शन के सभी विशिष्ट "फ्लेवर" और भावनाओं को भी बनाए रखना चाहते हैं। यह सिंगिंग वॉयस कन्वर्जन (SVC) की चुनौती है।

यह शोध पत्र एक नया टूल पेश करता है जिसे VibE-SVC2 कहा जाता है। इसे गायन स्वरों के लिए एक "सुपर-शेफ की रसोई" के रूप में समझें। पिछले टूल्स (जैसे मूल VibE-SVC) आवाज़ बदल सकते थे और उसमें थोड़ा स्वाद जोड़ सकते थे, लेकिन वे थोड़े अनाड़ी थे। यदि आप कोई विशिष्ट मसाला (जैसे आवाज़ में होने वाला कंपन जिसे वाइब्रेटो कहते हैं) जोड़ने की कोशिश करते, तो वह टूल अक्सर अनचाहे तरीके से व्यंजन की गर्मी (वॉल्यूम) या बनावट (टोन) को भी बदल देता था।

यहाँ बताया गया है कि VibE-SVC2 इन समस्याओं को कैसे ठीक करता है, सरल उपमाओं के माध्यम से समझाया गया है:

1. "पिच और वॉल्यूम" की गांठ को सुलझाना

समस्या: मानव गायन में, जब पिच डगमगाती है (वाइब्रेटो), तो वॉल्यूम भी अक्सर उसके साथ ही डगमगाता है। यह एक नर्तक की तरह है जो अपने शरीर को घुमाने के साथ अपने हाथ भी घुमाता है। पिछले AI मॉडल उस स्पिन (घुमाव) की नकल करने की कोशिश करते थे, लेकिन वे गलती से हाथों की गति को भी कॉपी कर लेते थे, जिससे परिणाम अप्राकृतिक लगता था।
समाधान: लेखकों ने एक नया "एनर्जी स्टाइल कनवर्टर" बनाया है। कल्पना कीजिए कि यह एक विशेष फ़िल्टर है जो नर्तक के शरीर के घुमाव (पिच) को उनके हाथ की गतिविधियों (वॉल्यूम) से अलग करता है। अब, AI स्पिन की नकल कर सकता है बिना हाथ की गतिविधियों को बिगाड़े, या इसके विपरीत। यह एक बहुत ही स्वच्छ, अधिक प्राकृतिक लगने वाला रूपांतरण प्रदान करता है।

2. डगमगाहट की गति के लिए "रिमोट कंट्रोल"

समस्या: पुराना टूल आवाज़ को अधिक या कम डगमगा (विस्तार बदलना) तो सकता था, लेकिन यह नहीं बदल सकता था कि डगमगाहट कितनी तेज़ होती है (रेट)। यह एक रेडियो वॉल्यूम नॉब रखने जैसा था जिसमें स्टेशन ट्यूनर ही न हो।
समाधान: उन्होंने "वाइब्रेटो रेट स्केलिंग" पेश किया है। अब, आपके पास एक पूर्ण रिमोट कंट्रोल है। आप AI को बता सकते हैं, "वाइब्रेटो की तीव्रता को समान रखें, लेकिन इसे दोगुना तेज़ कर दें," या "इसे एक धीमी गुनगुनाहट में धीमा कर दें।" आप वाइब्रेटो की गति और आकार को स्वतंत्र रूप से नियंत्रित कर सकते हैं, ठीक वैसे ही जैसे किसी गाने के टेम्पो और वॉल्यूम को अलग-अलग नियंत्रित किया जाता है।

3. "इंस्टेंट स्टाइल" कैमरा (ज़ीरो-शॉट)

समस्या: पहले, यदि आप एक विशिष्ट गायन शैली चाहते थे, तो आपको AI को एक विशिष्ट लेबल या ID (जैसे "स्टाइल #4") का उपयोग करके उसे सिखाना पड़ता था। आप बस यह नहीं कह सकते थे, "अभी मैं जो गायक सुन रहा हूँ, उसकी तरह गाओ।"
समाधान: उन्होंने एक "ज़ीरो-शॉट पिच स्टाइल कनवर्टर" जोड़ा है। इसे एक कैमरे के रूप में सोचें जो संदर्भ गायक की शैली का स्नैपशॉट लेता है। आप AI को एक प्रसिद्ध गायक का क्लिप दे सकते हैं, और यह तुरंत उनकी विशिष्ट "वाइब" (कि उनकी आवाज़ कैसे डगमगाती है) को सीख लेता है और इसे आपके लक्षित गायक पर लागू करता है, बिना उस विशिष्ट व्यक्ति पर प्री-ट्रेन किए।

4. "रफ वॉयस" ग्लिच को ठीक करना

समस्या: कुछ गायक "वोकल फ्राई" (एक कम, चटक, चरचराहट वाली आवाज़, जैसे दरवाज़े का कब्ज़ा) नामक तकनीक का उपयोग करते हैं। मानक AI टूल्स इसमें भ्रमित हो जाते हैं क्योंकि ध्वनि तरंगें अव्यवस्थित और उछलती-कूदती होती हैं। AI पिच को ठीक करने की कोशिश करता है लेकिन अंत में आवाज़ को अचानक उछाल वाले एक टूटे हुए रोबोट जैसा बना देता है।
समाधान: उन्होंने एक "सबहारमोनिक करेक्शन" (SHC) एल्गोरिदम बनाया है। कल्पना कीजिए कि यह आवाज़ के पिच मैप के लिए एक "स्पेल-चेकर" है। जब AI "रफ वॉयस" के कारण होने वाले किसी "ग्लिच" को देखता है, तो यह एल्गोरिदम हस्तक्षेप करता है, टेढ़ी-मेढ़ी रेखाओं को सुचारू बनाता है, और आवाज़ उत्पन्न करने से पहले मैप को ठीक करता है। यह रोबोटिक उछाल को रोकता है और "चरचराहट" वाली बनावट को प्राकृतिक बनाए रखता है।

5. "मिक्स-एंड-मैच" मेनू

बड़ी तस्वीर: VibE-SVC2 का अंतिम लक्ष्य आपको स्वतंत्र रूप से सामग्री को मिक्स और मैच करने देना है।

  • आप एक ब्रीथी आवाज़ (कोमल और हवादार) ले सकते हैं और उसमें वाइब्रेटो का डगमगाहट जोड़ सकते हैं।
  • आप एक बेल्ट आवाज़ (तेज़ और शक्तिशाली) ले सकते हैं और वाइब्रेटो की गति को धीमा कर सकते हैं।
  • आप यह सब बिना इस डर के कर सकते हैं कि "साँस लेने की आवाज़" (breathiness) गलती से "तेज़ आवाज़" (loudness) में न बदल जाए, या "वाइब्रेटो" "शक्ति" (power) को खराब न कर दे।

निष्कर्ष

लेखकों ने अन्य टूल्स के मुकाबले इस नए "रसोई" का परीक्षण किया। उन्होंने पाया कि VibE-SVC2 बेहतर है:

  • सटीकता: यह विशिष्ट गायन शैलियों (जैसे वाइब्रेटो या रफ वॉयस) को अधिक निष्ठा से कॉपी करता है।
  • नियंत्रण: यह आपको वाइब्रोटो की गति और आकार को स्वतंत्र रूप से बदलने की अनुमति देता है।
  • स्वाभाविकता: यह एक रोबोट की तुलना में अधिक मानवीय गायक की तरह लगता है, यहाँ तक कि कठिन शैलियों जैसे वोकल फ्राई को करते समय भी।

संक्षेप में, VibE-SVC2 हमें गायन आवाज़ों को संपादित करने के लिए बहुत सटीक उपकरणों का सेट देता है, जिससे हम यह बदल सकते हैं कि गाना कैसे गाया जा रहा है (शैली), बिना यह बदले कि कौन गा रहा है (पहचान)।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →