← नवीनतम पेपर
⚡ electrical engineering

TVTSyn: Content-Synchronous Time-Varying Timbre for Streaming Voice Conversion and Anonymization

TVTSyn एक स्ट्रीम करने योग्य स्पीच सिंथेसाइज़र पेश करता है जो स्थिर स्पीकर एम्बेडिंग को कंटेंट-सिंक्रोनस, समय-परिवर्तनीय टिम्बर प्रतिनिधित्व से बदलकर रीयल-टाइम वॉयस कन्वर्जन और अनामकरण (anonymization) में सुधार करता है, जो पहचान को टेम्पोरल कंटेंट के साथ संरेखित करता है।

मूल लेखक: Waris Quamer, Mu-Ruei Tseng, Ghady Nasrallah, Ricardo Gutierrez-Osuna

प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Waris Quamer, Mu-Ruei Tseng, Ghady Nasrallah, Ricardo Gutierrez-Osuna

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वीडियो कॉल के दौरान एक हाई-टेक डिजिटल मास्क पहने हुए हैं। आप अपनी आवाज़ बदलना चाहते हैं ताकि कोई आपको पहचान न सके (अनाम बनाना/anonymization), या शायद आप किसी प्रसिद्ध अभिनेता की तरह सुनाई देना चाहते हैं (वॉइस कन्वर्जन), लेकिन आप चाहते हैं कि यह तुरंत हो—उस अजीब तीन सेकंड के विलंब के बिना जो बातचीत को असंभव बना देता है।

वर्तमान तकनीक इस कारण संघर्ष करती है क्योंकि यह आपकी आवाज़ को दो अलग चीजों के रूप में देखती है: शब्द जो आप बोलते हैं (जो हर मिलीसेकंड में बदलते हैं) और आपकी पहचान (जिसे कंप्यूटर एक एकल, स्थिर स्नैपशॉट के रूप में मानता है)।

यह पेपर TVTSyn पेश करता है, जो डिजिटल वॉयस मास्क को स्वाभाविक, त्वरित और सुरक्षित बनाने का एक नया तरीका है। यह तीन सरल उपमाओं (analogies) का उपयोग करके काम करता है।

1. "जमी हुई मूर्ति" की समस्या (मुख्य नवाचार)

अधिकांश वर्तमान प्रणालियाँ आपकी पहचान को एक जमी हुई संगमरमर की मूर्ति की तरह मानती हैं। जैसे-जैसे आप बोलते हैं, कंप्यूटर उस एकल मूर्ति को आपके द्वारा बोले गए हर शब्द के अनुरूप "खींचने" की कोशिश करता है। क्योंकि मूर्ति हिल नहीं सकती, इसलिए परिणामी आवाज़ अक्सर रोबोटिक, सपाट या "अत्यधिक चिकनी" (over-smoothed) लगती है—जैसे कोई व्यक्ति कार्डबोर्ड के एक मोटे टुकड़े के माध्यम से बात कर रहा हो।

TVTSyn उस मूर्ति को एक पेशेवर अभिनेता से बदल देता है। एक जमी हुई पहचान के बजाय, यह टाइम-वेरिंग टिम्ब्रे (TVT) का उपयोग करता है। इसका मतलब है कि "पहचान" एक एकल बिंदु नहीं है; यह एक लचीला प्रदर्शन है जो आपके फुसफुसाने, चिल्लाने या प्रश्न पूछने के आधार पर थोड़ा बदल सकता है। यह आपके शब्दों की "गति" से मेल खाता है, जिससे आवाज़ जीवंत महसूस होती है।

2. "मास्टर शेफ का मसाला बॉक्स" (ग्लोबल टिम्ब्रे मेमोरी)

कंप्यूटर कैसे जानता है कि आपकी पहचान खोए बिना आवाज़ को कैसे बदलना है? यह ग्लोबल टिम्ब्रे मेमोरी (GTM) नामक चीज़ का उपयोग करता है।

एक वक्ता की पहचान को एक जटिल रेसिपी के रूप में समझें। पूरी मील (भोजन) को एक साथ याद करने के बजाय, सिस्टम के पास एक मसाला बॉक्स (मेमोरी) होता है।

  • एक जार में "नाक से निकलने वाली आवाज़" (nasality) है, दूसरे में "साँस की आवाज़" (breathiness), और तीसरे में "चमक" (brightness) है।
  • जैसे-जैसे आप बोलते हैं, सिस्टम आपके द्वारा कहे जा रहे शब्दों को देखता है और उस विशिष्ट क्षण के लिए जो उसे चाहिए, वह मसाला बॉक्स से निकाल लेता है।
  • यदि आप ऐसा शब्द बोलते हैं जिसमें थोड़ी अधिक "खरखराहट" (rasp) की आवश्यकता होती है, तो यह "खरखराहट" वाला मसाला निकाल लेता है। यह आवाज़ को अत्यधिक विस्तृत और अभिव्यंजक बनाने की अनुमति देता है बिना किसी विशाल, धीमे कंप्यूटर की आवश्यकता के।

3. "प्राइवेसी फ़िल्टर" (VQ बॉटलनेक)

जब लक्ष्य अनाम बनाना (Anonymization) होता है, तो सिस्टम को सावधान रहना पड़ता है। यदि यह आपकी मूल आवाज़ का एक छोटा सा "अंश" भी छोड़ देता है, तो एक स्मार्ट हैकर AI का उपयोग करके आपकी पहचान का पता लगा सकता है।

शोधकर्ताओं ने एक "फैक्टरइज़्ड VQ बॉटलनेक" जोड़ा है। कल्पना कीजिए कि आप एक छलनी के माध्यम से एक गुप्त संदेश भेज रहे हैं। छलनी इस तरह बनाई गई है कि वह शब्दों के अर्थ को पूरी तरह से गुजरने दे, लेकिन आपके अद्वितीय "बायोमेट्रिक धूल" (biometric dust)—उन सूक्ष्म, अनूठी मुखर विशेषताओं को पकड़ ले और नष्ट कर दे जो केवल आपकी हैं। यह सुनिश्चित करता है कि जबकि आप एक वास्तविक इंसान की तरह सुनाई देते हैं, आप स्वयं की तरह नहीं सुनाई देते।

यह क्यों मायने रखता है?

वास्तविक दुनिया में, यह तकनीक गति के लिए बनी है। शोधकर्ताओं ने 80 मिलीसेकंड से भी कम का "लैटेंसी" (विलंबता) हासिल किया है। इसे समझने के लिए, एक मानव पलक झपकने में लगभग 100-400 मिलीसेकंड लगते हैं।

क्योंकि यह प्रणाली एक पलक झपकने से भी तेज़ है, इसका उपयोग किया जा सकता है:

  • लाइव वीडियो कॉल में: रीयल-टाइम में आपकी गोपनीयता की रक्षा करने के लिए।
  • स्मार्ट असिस्टेंट में: AI आवाज़ों को अधिक मानवीय और कम रोबोटिक बनाने के लिए।
  • सुरक्षित संचार में: लोगों को बिना कोई "वॉयकल फिंगरप्रिंट" पीछे छोड़े स्वतंत्र रूप से बोलने की अनुमति देने के लिए।

संक्षेप में: TVTSyn डिजिटल आवाज़ की "जमी हुई मूर्ति" को एक "जीवित अभिनेता" में बदल देता है, जिससे रीयल-टाइम वॉयस चेंजिंग स्वाभाविक, तेज़ और निजी महसूस होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →