GRAFT: Grafted Reference Audio for Fine-grained Pronunciation in Zero-shot Text-to-Speech
GRAFT एक ज़ीरो-शॉट टेक्स्ट-टू-स्पीच सिस्टम है जो दुर्लभ और कठिन शब्दों के उच्चारण की सटीकता को महत्वपूर्ण रूप से सुधारने के लिए ग्राफ़्टेड रेफरेंस ऑडियो के साथ प्रति-शब्द कंडिशनिंग मैकेनिज्म का उपयोग करता है, जबकि प्राकृतिकता और वक्ता की समानता को बनाए रखता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कहानी पढ़कर सुनाना सिखा रहे हैं। रोबोट बहुत बुद्धिमान है और किसी विशिष्ट व्यक्ति की आवाज़ (जैसे कोई सेलिब्रिटी या मित्र) की सटीक नकल कर सकता है। हालाँकि, जब कहानी में कोई कठिन या दुर्लभ शब्द आता है—जैसे कोई विदेशी नाम, कोई बिल्कुल नया उत्पाद, या कोई जटिल वैज्ञानिक शब्द—तो रोबोट अक्सर गलत अंदाज़ा लगा लेता है। वह "Nuc-le-ar" के बजाय "Nu-cle-ar" कह सकता है, या किसी विदेशी नाम को केवल अक्षरों के आधार पर पूरी तरह से बिगाड़ सकता है।
यह शोध पत्र GRAFT नामक एक नए टूल के बारे में बताता है, जो इस समस्या को ठीक करता है। GRAFT को एक "उच्चारण पैच" (pronunciation patch) की तरह समझें जिसे आप रोबोट द्वारा शब्द पढ़ने से पहले सीधे उस विशिष्ट शब्द पर चिपका सकते हैं।
यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:
1. समस्या: रोबोट का "अंदाज़ा लगाने का खेल"
वर्तमान रोबट टेक्स्ट (पाठ) पर निर्भर करते हैं। यदि आप "Xylophone" लिखते हैं, तो रोबोट नियमों के आधार पर अंदाज़ा लगाता है कि इसे कैसे बोलना है। लेकिन दुर्लभ शब्दों के लिए, नियम विफल हो जाते हैं। यहाँ तक कि यदि आप रोबट को एक ध्वन्यात्मक मार्गदर्शिका (जैसे कि शब्दकोश) भी देते हैं, तो वह शब्द के "लहजे" (flavor) को खो देता है, जैसे कि सटीक स्ट्रेस (stress) या टोन (tone)।
2. समाधान: "ऑडियो स्टिकी नोट"
रोबोट को लिखित मार्गदर्शिका देने के बजाय, GRAFT आपको उस शब्द की एक छोटी ऑडियो क्लिप देने की अनुमति देता है जिसे आप चाहते हैं कि वह बोले।
- उपमा: कल्पना कीजिए कि आप एक फिल्म एडिट कर रहे हैं। आपके पास एक दृश्य है जहाँ एक अभिनेता को एक विशिष्ट संवाद बोलना है, लेकिन अभिनेता ने उसे गलत बोला है। स्क्रिप्ट को फिर से लिखने के बजाय, आप उस संवाद की एक सही रिकॉर्डिंग लेते हैं (चाहे वह किसी और अभिनेता द्वारा बोली गई हो) और उसे स्क्रिप्ट पर "ग्राफ्ट" (चिपका) देते हैं।
- GRAFT कैसे करता है: आप खुद को "Sushi" जैसा कठिन शब्द बोलते हुए रिकॉर्ड करते हैं। आप रोबोट को बताते हैं, "जब तुम 'Sushi' शब्द देखो, तो मेरे इस टेक्स्ट को इस ध्वनि से बदल दो।" रोबोट फिर उस लक्षित आवाज़ (सेलिब्रिटी की आवाज़ जो आपने चुनी थी) में वाक्य का बाकी हिस्सा बोलेगा, लेकिन वह "Sushi" को ठीक वैसे ही बोलेगा जैसे आपने रिकॉर्ड किया था।
3. जादुई ट्रिक: "कौन" और "कैसे" को अलग करना
यह सबसे चतुर हिस्सा है। आमतौर पर, यदि आप किसी व्यक्ति द्वारा बोला गया शब्द बजाते हैं, तो रोबोट अनजाने में उनकी आवाज़ को भी कॉपी कर सकता है, जिससे पूरा वाक्य दो अलग-अलग लोगों के बोलने जैसा लग सकता है।
लेखकों ने इसे एक विशेष "मिक्स-एंड-मैच" खेल पर प्रशिक्षित करके हल किया:
- प्रशिक्षण: उन्होंने व्यक्ति A द्वारा बोला गया एक वाक्य लिया, और एक वॉइस-चेंजर का उपयोग करके इसे व्यक्ति B की तरह बनाया। फिर, उन्होंने उस नए संस्करण से एक शब्द का छोटा सा क्लिप लिया और रोबोट को बताया: "इस शब्द को व्यक्ति B की तरह बोलो, लेकिन वाक्य का बाकी हिस्सा व्यक्ति A की तरह बोलो।"
- परिणाम: रोबोट ने उच्चारण (शब्द कैसे सुनाई देता है) और वक्ता की पहचान (कौन बोल रहा है) को अलग करना सीख लिया।
- लाभ: आप उस कठिन शब्द को अपनी आवाज़ (या किसी बच्चे की आवाज़, या रोबोट की आवाज़) में रिकॉर्ड कर सकते हैं, और GRAFT आपकी आवाज़ को हटाकर केवल उच्चारण को रखेगा, और उसे लक्षित वक्ता की आवाज़ में पूरी तरह से समाहित कर देगा।
4. शोध में क्या पाया गया
शोधकर्ताओं ने एक "ब्लाइंड टेस्ट" (जहाँ मनुष्यों ने बिना जाने विभिन्न रोबोटों को सुना) के माध्यम से इसका परीक्षण किया।
- विजेता: GRAFT को एक बड़े अंतर से प्रथम स्थान दिया गया। मनुष्यों को लगा कि यह अन्य सभी प्रणालियों की तुलना में कठिन शब्दों का उच्चारण मूल रिकॉर्डिंग के बहुत करीब से करता है।
- आंकड़े: इसने मौजूदा सर्वोत्तम प्रणालियों की तुलना में उच्चारण त्रुटियों को 22% से 39% तक कम कर दिया।
- समझौता (Trade-off): रोबोट ने अपनी स्वाभाविक आवाज़ बनाए रखने या लक्षित वक्ता की आवाज़ बनाए रखने की क्षमता नहीं खोई; यह बस कठिन शब्दों को बोलने में बहुत बेहतर हो गया।
सारांश
GRAFT एक साउंड बाइट के रूप में टेक्स्ट-टू-स्पीच रोबोट को "चीट शीट" देने जैसा है। यह किसी को भी केवल एक बार शब्द बोलकर कठिन शब्दों के उच्चारण को ठीक करने की अनुमति देता है, जिसके लिए ध्वन्यात्मकता (phonetics) या भाषा विज्ञान जानने की आवश्यकता नहीं होती है। इसके बाद रोबोट अपनी आवाज़ को सुसंगत और स्वाभाविक रखते हुए उस शब्द को सही ढंग से बोलना सीख जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।