← नवीनतम पेपर
💬 NLP

AccentBox: Towards High-Fidelity Zero-Shot Accent Generation

यह शोध पत्र AccentBox का प्रस्ताव करता है, जो एक नवीन दो-चरणीय ज़ीरो-शॉट फ्रेमवर्क है जो फॉरेन एक्सेंट कन्वर्जन, एक्सेंटेड टीटीएस (TTS), और ज़ीरो-शॉट टीटीएस (ZS-TTS) को एकीकृत करता है ताकि एक अत्याधुनिक एक्सेंट आइडेंटिफिकेशन मॉडल से प्राप्त स्पीकर-एग्नोस्टिक एक्सेंट एम्बेडिंग्स पर एक टीटीएस सिस्टम को कंडीशन करके उच्च-सटीकता वाली एक्सेंट जनरेशन और नियंत्रण प्राप्त किया जा सके।

मूल लेखक: Jinzuomu Zhong, Korin Richmond, Zhiba Su, Siqi Sun

प्रकाशित 2026-02-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jinzuomu Zhong, Korin Richmond, Zhiba Su, Siqi Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक जादुई वॉयस रिकॉर्डर है जो केवल तीन सेकंड की क्लिप सुनकर किसी की भी आवाज़ को पूरी तरह से कॉपी कर सकता है। आधुनिक "ज़ीरो-शॉट टेक्स्ट-टू-स्पीच" (ZS-TTS) तकनीक यही करती है। हालाँकि, इसमें एक पेंच है: यह अक्सर व्यक्ति की आवाज़ तो कॉपी कर लेता है, लेकिन उनके लहजे (accent) को नज़रअंदाज़ कर देता है। यह एक फोटोकॉपी मशीन की तरह है जो चेहरा तो सही निकालती है लेकिन बैकग्राउंड को धुंधला कर देती है, जिससे एक स्कॉटिश आवाज़ एक सामान्य अमेरिकी आवाज़ में बदल जाती है।

"AccentBox" नामक शोध पत्र इस समस्या का समाधान प्रस्तावित करता है। लेखक इस समस्या को हल करना चाहते हैं कि एक सिस्टम न केवल आवाज़ को कॉपी कर सके, बल्कि विशिष्ट लहजों (जैसे आयरिश, अमेरिकी, या अन्य) को भी उच्च सटीकता के साथ कॉपी या बना सके, भले ही सिस्टम ने पहले उस विशिष्ट व्यक्ति या लहजे के संयोजन को कभी न सुना हो।

उन्होंने इसे कैसे किया, इसका विवरण सरल चरणों में यहाँ दिया गया है:

समस्या: "पहचान का संकट" (The Identity Crisis)

वर्तमान में, वॉयस एआई (AI) संघर्ष करता है क्योंकि यह इस बात में भ्रमित हो जाता है कि कौन बोल रहा है (वक्ता) और वे कैसे बोल रहे हैं (लहजा)।

  • उपमा: कल्पना कीजिए कि एक शेफ है जिसे केवल "अमेरिकी-शैली" का खाना बनाना आता है। यदि आप उससे "स्कॉटिश" व्यंजन बनाने के लिए कहते हैं, तो वह बस थोड़ा नमक डालता है और उसे स्कॉटिश कह देता है। उसने वास्तव में सामग्रियों (लहजे) और शेफ की अपनी शैली (वक्ता) के बीच के अंतर को नहीं सीखा है।
  • परिणाम: मौजूदा एआई या तो नए लहजे बनाने में विफल रहता है या अनजाने में वक्ता की पहचान को लहजे के साथ मिला देता है, जिससे "भ्रम" (hallucinations) पैदा होते हैं जहाँ आवाज़ गलत लगती है।

समाधान: एक दो-चरणीय पाइपलाइन (A Two-Stage Pipeline)

लेखकों ने इस समस्या को ठीक करने के लिए AccentBox नामक एक दो-चरणीय प्रणाली बनाई है।

चरण 1: "लहजा जासूस" (The Accent Detective - GenAID)

सबसे पहले, उन्होंने GenAID नामक एक मॉडल बनाया जिसका एकमात्र काम लहजों की पहचान करना है।

  • चुनौती: आमतौर पर, ये मॉडल धोखाधड़ी करते हैं। वे याद कर लेते हैं कि "व्यक्ति A हमेशा स्कॉटिश लगता है" और "व्यक्ति B हमेशा अमेरिकी लगता है।" यदि वे व्यक्ति A को फिर से देखते हैं, तो वे बिना लहजे को वास्तव में सुने, केवल अनुमान लगा लेते हैं कि वह "स्कॉटिश" है।
  • समाधान: लेखकों ने GenAID को एक सख्त जासूस के रूप में प्रशिक्षित किया। उन्होंने सुनिश्चित किया कि मॉडल का परीक्षण उन लोगों पर किया जाए जिन्हें उसने कभी नहीं देखा है। उन्होंने एक "इन्फॉर्मेशन बॉटलनेक" (एक संकीर्ण फनल की कल्पना करें) नामक तकनीक का भी उपयोग किया ताकि मॉडल को यह मजबूर किया जा सके कि वह इस बात की सारी जानकारी फेंक दे कि व्यक्ति कौन है, और केवल उस जानकारी को रखे कि उसका लहजा क्या है।
  • परिणाम: उन्होंने एक "शुद्ध" लहजा डिटेक्टर बनाया जो अजनबियों पर भी लहजों के बीच अंतर कर सकता है, और एक शीर्ष स्कोर (0.56 F1 स्कोर) प्राप्त किया जो पिछले तरीकों से बेहतर है।

चरण 2: "वॉयस एक्टर" (The Voice Actor - AccentBox)

एक बार जब उनके पास यह शुद्ध लहजा डिटेक्टर आ जाता है, तो वे इसे एक वॉयस जनरेटर में जोड़ देते हैं।

  • प्रक्रिया: वॉयस जनरेटर को केवल एक व्यक्ति की आवाज़ का नमूना देने के बजाय, वे अब उसे दो चीजें देते हैं:
    1. आवाज़: उस व्यक्ति का एक नमूना जिसकी तरह वे सुनाई देना चाहते हैं।
    2. लहजा: "Accent Detective" द्वारा निकाला गया "शुद्ध" लहजा डेटा।
  • जादू: यह सिस्टम को स्वतंत्र रूप से मिक्स और मैच करने की अनुमति देता है। आप लंदन के एक व्यक्ति की आवाज़ ले सकते हैं और सिस्टम को कह सकते, "यह टेक्स्ट बोलें, लेकिन आयरिश लहजे के साथ," और यह व्यक्ति की अनूठी आवाज़ की पहचान खोए बिना ऐसा करेगा।

उन्होंने क्या हासिल किया

शोध पत्र तीन मुख्य जीत का दावा करता है:

  1. बेहतर पहचान: उनका "लहजा जासूस" अपने काम में सर्वश्रेष्ठ है, विशेष रूप से उन लोगों के मामले में जिनसे वह कभी नहीं मिला है।
  2. बेहतर जनरेशन: भाषण उत्पन्न करते समय, उनकी प्रणाली अन्य प्रणालियों की तुलना में लक्षित लहजे के बहुत करीब लगती है। परीक्षणों में, लोगों ने प्रतिस्पर्धा की तुलना में उनके सिस्टम के लहजों को अधिक पसंद किया।
  3. नई क्षमताएं: पुराने सिस्टम के विपरीत, जो केवल वही लहजे कर सकते थे जिनके लिए उन्हें स्पष्ट रूप से प्रशिक्षित किया गया था, AccentBox अनदेखे लहजों को भी उत्पन्न कर सकता है। यह एक आवाज़ ले सकता है और उस लहजे को लागू कर सकता है जिसे इसने पहले कभी नहीं देखा है, केवल उस लहजे की अवधारणा को समझकर।

निष्कर्ष (The Bottom Line)

लेखकों ने केवल एक वॉयस जनरेटर नहीं बनाया; उन्होंने एक ऐसा सिस्टम बनाया जो एक व्यक्ति की पहचान और उसके लहजे के बीच के अंतर को समझता है। इन दोनों को अलग करके, उन्होंने एक ऐसा उपकरण बनाया है जो न केवल स्वाभाविक लगने वाली आवाज़ उत्पन्न कर सकता है, बल्कि सांस्कृतिक और भाषाई रूप से भी सटीक है, जो अधिक व्यक्तिगत और समावेशी वॉयस तकनीक के द्वार खोलता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →