PitchFlower: A flow-based neural audio codec with pitch controllability
पिचफ्लॉवर (PitchFlower) एक फ्लो-आधारित न्यूरल ऑडियो कोडेक है जो इनपुट F0 कंटूरों को समतल (flattening) और स्थानांतरित (shifting) करने तथा वास्तविक पिच पर कंडीशन करने की एक प्रशिक्षण रणनीति का उपयोग करके उच्च-गुणवत्ता वाला, पिच-नियंत्रणीय ऑडियो संश्लेषण प्राप्त करता है, जो प्रभावी रूप से टिम्बर (timbre) से पिच को अलग करता है और खराब डेटा से उत्पन्न होने वाले आर्टिफैक्ट्स को फ़िल्टर करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मानवीय स्वर एक जटिल वाद्य यंत्र है, जो न केवल शब्दों को, बल्कि भावना, पहचान और इरादे के एक समृद्ध ताने-बाने को भी व्यक्त करने में सक्षम है। दशकों से, वैज्ञानिक और इंजीनियर इन गुणों को डिजिटल रूप से बदलने के तरीके खोज रहे हैं, इस उम्मीद में कि वे किसी वक्ता की पिच (स्वर की ऊँचाई) को किसी संगीतमय नोट के अनुरूप बदल सकें या उनकी टोन को अधिक खुशमिजाज बना सकें, और यह सब करते हुए आवाज को स्वाभाविक बनाए रख सकें। इन गुणों को बदलने के लिए पारंपरिक तरीके ध्वनि को उसके यांत्रिक भागों में तोड़ने पर निर्भर करते हैं, ठीक वैसे ही जैसे एक लुथियर (वाद्य यंत्र बनाने वाला) वायलिन की लकड़ी और तारों का विश्लेषण करता है। हालांकि ये पुराने तरीके पिच को बदल सकते हैं, लेकिन वे अक्सर आवाज में एक रोबोटिक, कृत्रिम गुण छोड़ देते हैं, जिससे आवाज की गर्माहट खत्म हो जाती है और वह एक मशीन की तरह लगने लगती है। हाल के वर्षों में, आर्टिफिशियल इंटेलिजेंस ने एक नया मार्ग प्रशस्त किया है, जो बोलने की प्रक्रिया को आश्चर्यजनक यथार्थवाद के साथ फिर से बनाने के लिए विशाल डेटा का उपयोग करता है। हालांकि, इन बुद्धिमान प्रणालियों को एक विशिष्ट विशेषता, जैसे कि पिच बदलना सिखाना, बिना अनजाने में वक्ता की पहचान या उनके शब्दों के अर्थ को बदले, एक कठिन चुनौती बनी हुई है।
पेरिस के IRCAM के शोधकर्ताओं की एक टीम ने 'पिचफ्लावर' (PitchFlower) नामक एक नई प्रणाली विकसित की है जो इस समस्या से एक आश्चर्यजनक रूप से सरल रणनीति के साथ निपटती है। उनका लक्ष्य एक डिजिटल ऑडियो कोडेक बनाना था—एक ऐसा उपकरण जो ध्वनि को संकुचित और पुनर्गणना करता है—जो उपयोगकर्ताओं को किसी संगीत ट्यूनर की सटीकता के साथ आवाज की पिच बदलने की अनुमति दे, लेकिन मानवीय रिकॉर्डिंग की स्वाभाविक गुणवत्ता के साथ। इसे प्राप्त करने के लिए, उन्होंने एक प्रशिक्षण प्रक्रिया डिजाइन की जो आर्टिफिशियल इंटेलिजेंस को पिच की अवधारणा को उस सब कुछ से अलग करने के लिए मजबूर करती है जो एक आवाज को स्वयं जैसा बनाता है। पिच को सीधे पहचानना सिखाने के बजाय, उन्होंने सीखने के चरण के दौरान जानबूझकर सिस्टम को भ्रमित किया। उन्होंने लोगों के बोलने की रिकॉर्डिंग ली, उनकी आवाजों के प्राकृतिक उतार-चढ़ाव को सपाट किया, और फिर इस परिवर्तित ध्वनि को सिस्टम में फीड करने से पहले पिच को बेतरतीब ढंग से ऊपर या नीचे किया।
इसके बाद सिस्टम को एक कठिन काम सौंपा गया: इसे इस सपाट, बदली हुई ध्वनि को सुनना था और मूल, प्राकृतिक रिकॉर्डिंग को फिर से बनाना था। सफल होने के लिए, इसे एक गुप्त सुराग दिया गया—आवाज की वास्तविक, मूल पिच। सिस्टम को बदली हुई पिच को अनदेखा करने और इसके बजाय दिए गए सुराग पर भरोसा करने के लिए मजबूर करके, शोधकर्ताओं ने एआई को यह सीखने के लिए प्रोत्साहित किया कि पिच, आवाज के बाकी हिस्सों से एक अलग जानकारी है। इस सेटअप का एक महत्वपूर्ण हिस्सा एक 'बॉटलनेक' (bottleneck) था, एक संकीर्ण चैनल जिसके माध्यम से ध्वनि की जानकारी को गुजरना था। इस बॉटलनेक ने एक फिल्टर के रूप में कार्य किया, जिसने सिस्टम को मूल पिच को केवल याद करने से रोका और उसे ध्वनि को फिर से बनाने के लिए दिए गए सुराग पर निर्भर रहने के लिए मजबूर किया। प्रशिक्षित होने के बाद, सिस्टम किसी भी नई आवाज को ले सकता है, उसकी पिच को सपाट कर सकता है, और फिर पुनर्निर्माण के लिए एक विशिष्ट पिच मान का उपयोग कर सकता है, जिससे गायक के नोट या वक्ता के लहजे को उसकी स्वाभाविक बनावट खोए बिना प्रभावी रूप से बदला जा सके।
इस दृष्टिकोण के परिणाम प्रभावशाली थे। पुराने, पारंपरिक तरीकों के विरुद्ध परीक्षण किए जाने पर, पिचफ्लावर ने ऑडियो को काफी स्पष्ट और स्वाभाविक रूप से प्रस्तुत किया, जो उन धात्विक विकृतियों से मुक्त था जो अक्सर डिजिटल आवाज हेरफेर में आती हैं। इसने उन सबसे उन्नत आर्टिफिशियल इंटेलिजेंस विधियों के समान प्रदर्शन किया जो वर्तमान में उपलब्ध हैं, लेकिन डिजिटल आवाज नियंत्रण की सुगमता में एक विशिष्ट लाभ के साथ। शोधकर्ताओं ने पाया कि भले ही सिस्टम को पुरानी, अपूर्ण तकनीक द्वारा संसाधित ऑडियो का उपयोग करके प्रशिक्षित किया गया था, नए मॉडल ने उन खामियों को छानने का तरीका सीख लिया। इसने अपने प्रशिक्षण डेटा की खामियों की नकल नहीं की; इसके बजाय, इसने शून्य से उच्च गुणवत्ता वाली ध्वनि उत्पन्न करना सीखा, जो शोर को हटाते हुए आवाज के आवश्यक चरित्र को संरक्षित करने वाले एक शक्तिशाली क्लीनर के रूप में कार्य करता है।
अध्ययन ने यह भी पता लगाया कि यह विधि इतनी अच्छी तरह से क्यों काम करती है, इसके लिए आवाज की विशेषताओं को अलग करने के अन्य तरीकों की तुलना की गई। उन्होंने उन विधियों का परीक्षण किया जो पिच जानकारी को छिपाने के लिए जटिल गणितीय युक्तियों का उपयोग करती हैं और अन्य जो सिस्टम को यह सिखाने के लिए बड़े पैमाने पर अतिरिक्त डेटा पर निर्भर करती हैं कि भाषण कैसा होना चाहिए। इन वैकल्पिक दृष्टिकोणों के परिणामस्वरूप अक्सर आवाज कम स्पष्ट सुनाई देती थी या वक्ता की अनूठी पहचान खो जाती थी। इसके विपरीत, पिच को भ्रमित करने की सरल विधि, बॉटलनेक के साथ मिलकर, सबसे संतुलित समाधान साबित हुई। इसने आवाज को मानवीय और बोधगम्य बनाए रखते हुए पिच पर सटीक नियंत्रण की अनुमति दी। शोधकर्ताओं ने उल्लेख किया कि सिस्टम पिच की एक विशिष्ट सीमा के भीतर सबसे अच्छा काम करता है, जो मानव आवाज की प्राकृतिक सीमाओं के समान है, और इन सीमाओं से बहुत आगे जाने पर इसकी गुणवत्ता कम हो सकती है।
शायद सबसे महत्वपूर्ण खोज इस प्रणाली की लचीलापन (resilience) थी। तथ्य यह है कि यह विकृत, अपूर्ण ध्वनि पर प्रशिक्षित होने के बाद भी उच्च गुणवत्ता वाला ऑडियो तैयार कर सकता है, यह सुझाव देता है कि डीप लर्निंग मॉडल पहले की तुलना में कहीं अधिक मजबूत हैं। वे ध्वनि के वास्तविक सार को सीख सकते हैं भले ही इनपुट क्षतिग्रस्त या परिवर्तित हो। यह खोज भविष्य के उन उपकरणों के द्वार खोलती है जो समान तकनीकों का उपयोग करके भाषण के अन्य पहलुओं, जैसे कि भावना या लहजे को नियंत्रित कर सकते हैं। यह सिद्ध करके कि एक सरल 'परटर्बेशन स्ट्रैटेजी' (perturbation strategy) जटिल विशेषताओं को प्रभावी ढंग से अलग कर सकती है, शोधकर्ताओं ने अधिक नियंत्रणीय और स्वाभाविक लगने वाली आवाज प्रौद्योगिकियों के लिए एक स्पष्ट और विस्तार योग्य मार्ग प्रदान किया है। यह कार्य प्रदर्शित करता है कि कभी-कभी, मशीन को एक जटिल मानवीय गुण को समझने के सिखाने का सबसे प्रभावी तरीका, पहले उसे उस गुण के टूटे हुए संस्करण को दिखाना और उसे ठीक करने के लिए कहना होता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।