← नवीनतम पेपर
⚡ electrical engineering

dots.tts Technical Report

यह शोध पत्र dots.tts को प्रस्तुत करता है, जो एक 2B-पैरामीटर वाला निरंतर ऑटोरेग्रेसिव (autoregressive) टीटीएस (TTS) फाउंडेशन मॉडल है, जो AudioVAE प्रशिक्षण, फुल-हिस्ट्री कंडीशनिंग और रिवॉर्ड-फ्री सेल्फ-करेक्शन में नवाचारों के माध्यम से बहुभाषी स्पीच जनरेशन, वॉयस क्लोनिंग और भावनात्मक अभिव्यक्ति में अत्याधुनिक प्रदर्शन प्राप्त करता है, साथ ही MeanFlow डिस्टिलेशन के माध्यम से कम-विलंबता (low-latency) इन्फरेंस प्रदान करता है और सभी कोड एवं चेकपॉइंट्स को ओपन-सोर्स करता है।

मूल लेखक: Shi Lian, Changtao Li, Bohan Li, Hankun Wang, Da Zheng, Junfeng Tian, Yufeng Ma, Colin Zhang, Kai Yu

प्रकाशित 2026-06-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shi Lian, Changtao Li, Bohan Li, Hankun Wang, Da Zheng, Junfeng Tian, Yufeng Ma, Colin Zhang, Kai Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ dots.tts तकनीकी रिपोर्ट का सरल, रोजमर्रा की भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।

मुख्य विचार: एक नए प्रकार का वॉयस एक्टर

कल्पना कीजिए कि आप एक ऐसा रोबोट बनाना चाहते हैं जो किसी भी भाषा में बोल सके, किसी भी व्यक्ति की तरह लग सके और किसी भी भावना को व्यक्त कर सके। लंबे समय तक, अधिकांश वॉयस रोबोट एक मोर्स कोड मशीन की तरह काम करते थे। बोलने से पहले उन्हें शब्दों को "ध्वनि ब्लॉकों" (discrete tokens) की एक सीमित सूची में बदलना पड़ता था। यह कुशल तो था, लेकिन इसका मतलब था कि रोबोट मानवीय भाषण की सूक्ष्म और सहज बारीकियों को नहीं पकड़ पाता था, जैसे कि एक हल्की सांस, एक अनोखी हंसी, या गायन में एक जटिल लय।

dots.tts एक नया 2-बिलियन-पैरामीटर वाला AI मॉडल है जो इन "ध्वनि ब्लॉलों" को त्याग देता है। इसके बजाय, यह भाषण को नदी में बहते पानी (एक निरंतर प्रवाह) की तरह मानता है। यह भाषण को टुकड़ों में नहीं काटता; बल्कि यह प्रवाह में अगली नन्ही बूंद की भविष्यवाणी करता है, जिससे आवाज बहुत अधिक सुचारू, प्राकृतिक और अभिव्यंजक बन जाती है।

यह कैसे काम करता है: तीन-भागों वाला ऑर्केस्ट्रा

पेपर में dots.tts को एक तीन-भागों वाली टीम के रूप में वर्णित किया गया है जो इस तरल आवाज को बनाने के लिए मिलकर काम करती है:

  1. अनुवादक (AudioVAE):
    इसे एक हाई-फिडेलिटी कैमरा और प्रोजेक्टर के रूप में सोचें। यह कच्ची ध्वनि तरंगों (raw sound waves) को लेता है और उन्हें एक "गुप्त भाषा" (एक निरंतर लेटेंट स्पेस) में संकुचित कर देता है जिसे कंप्यूटर समझ सके।
  • नवाचार: आमतौर पर, ये गुप्त भाषाएँ अव्यवस्थित होती हैं। dots.tts की टीम ने इस अनुवादक को एक विशेष "शिक्षक" (WavLM) का उपयोग करके प्रशिक्षित किया है ताकि यह सुनिश्चित हो सके कि गुप्त भाषा सभी भावनात्मक और ध्वनिक विवरणों को सुरक्षित रखे, जिससे अगले टीम सदस्य के लिए इसे पढ़ना आसान हो जाए।
  1. कहानीकार (LLM):
    यह ऑपरेशन का मस्तिष्क है, जो एक टेक्स्ट AI (Qwen2.5) पर आधारित है। यह आपके द्वारा लिखे गए टेक्स्ट को पढ़ता है और योजना बनाता है कि क्या कहा जाना चाहिए।
  • नवाचार: कहानीकार को कच्चा, अव्यवस्थित ऑडियो डेटा खिलाने के बजाय, टीम ने एक सिमेंटिक एनकोडर (Semantic Encoder) बनाया। यह एक "सारांश नोट" की तरह कार्य करता है। यह कहानीकार को बताता है, "पिछले कुछ सेकंड का ऑडियो खुश और तेज था," बिना इसे तकनीकी शोर से अभिभूत किए। यह कहानीकार को अर्थ पर केंद्रित रखता है, जिससे वह लंबे वाक्यों के दौरान भ्रमित नहीं होता।
  1. चित्रकार (Flow-Matching Head):
    यह वह कलाकार है जो वास्तव में ध्वनि को चित्रित करता है। यह कहानीकार की योजना और पिछले ऑडियो के "सारांश नोट्स" को लेता है, और फिर ध्वनि के अगले कुछ सेकंड को पेंट करता है।
  • नवाचार: टीम ने महसूस किया कि यदि चित्रकार एक छोटी सी गलती करता है, तो अगला कदम उस गलती पर आधारित होता है, जिससे आवाज पटरी से उतर जाती है (जैसे "टेलीफोन" का खेल)। इसे ठीक करने के लिए, वे फुल-हिस्ट्री कंडीशनिंग (Full-History Conditioning) का उपयोग करते हैं। कल्पना कीजिए कि चित्रकार अपने द्वारा अब तक पेंट किए गए पूरे कैनवास को देख रहा है, न कि केवल पिछले ब्रशस्ट्रोक को, ताकि पूरी तस्वीर सुसंगत बनी रहे।

"ड्रिफ्ट" (भटकाव) की समस्या को ठीक करना: सेल्फ-करेक्टिंग लूप

एक बेहतरीन चित्रकार के बावजूद, लंबे वाक्यों के दौरान गलतियाँ होती हैं। पेपर में रिवॉर्ड-फ्री सेल्फ-करेक्शन (Reward-Free Self-Correction) नामक एक चतुर तकनीक पेश की गई है।

  • उपमा: कल्पना कीजिए कि एक छात्र चित्र बनाना सीख रहा है। आमतौर पर, उन्हें एक शिक्षक की आवश्यकता होती है जो कहे, "वह रेखा टेढ़ी है।" यहाँ, AI अपना खुद का शिक्षक है। यह एक चित्र बनाता है, फिर तुरंत इसके एक छोटे से हिस्से को "अनडू" (undo) करने और उसे फिर से बनाने की कोशिश करता है, जिससे वह बिना किसी मानव के ग्रेड दिए अपनी गलतियों से सीखता है। यह "स्व-सुधारात्मक" प्रशिक्षण आवाज को बहुत स्थिर बनाता है और लंबे भाषणों के दौरान गड़बड़ी होने की संभावना को कम करता है।

गति बढ़ाना: "मीनफ्लो" (MeanFlow) शॉर्टकट

तरल ध्वनि उत्पन्न करना आमतौर पर धीमा होता है क्योंकि कंप्यूटर को परिणाम सही करने के लिए कई छोटे कदम उठाने पड़ते हैं।

  • उपमा: कल्पना कीजिए कि आप अपने घर से पार्क तक जा रहे हैं। पुराना तरीका 100 छोटे, सावधान कदमों को लेना है। नया तरीका (MeanFlow Distillation) एक GPS होने जैसा है जो कहता है, "वहाँ पहुँचने के लिए 4 बड़े, आत्मविश्वासी कदम उठाएं।"
  • परिणाम: टीम ने प्रक्रिया को इतना संकुचित कर दिया है कि AI कई चरणों के बजाय केवल 2 से 4 चरणों में ध्वनि उत्पन्न कर सकता है। यह इसे अविश्वसनीय रूप से तेज बनाता है—मात्र 54 मिलीसेकंड में (एक मानवीय पलक झपकने से भी तेज)—जो इसे वास्तविक समय की बातचीत के लिए आदर्श बनाता है।

उन्होंने क्या हासिल किया (स्कोरबोर्ड)

टीम ने मौजूदा सर्वश्रेष्ठ वॉयस सिस्टम्स (जैसे CosyVoice, Seed-TTS और व्यावसायिक उत्पादों) के मुकाबले कई चुनौतियों पर dots.tts का परीक्षण किया:

  • सटीकता: इसने जो कहा उसमें बहुत कम गलतियाँ कीं (कम वर्ड एरर रेट), और मानक परीक्षणों में लगभग सभी को पीछे छोड़ दिया।
  • वॉयस क्लोनिंग: यदि आप इसे किसी व्यक्ति का 3-सेकंड का क्लिप देते हैं, तो यह उनकी नकल इतनी अच्छी तरह से कर सकता है कि यह किसी भी ओपन-सोर्स मॉडल की तुलना में "समानता" (similarity) के मामले में उच्च स्कोर करता है।
  • बहुभाषी: यह 24 भाषाओं को धाराप्रवाह बोलता है और भाषा बदलते समय भी वक्ता की आवाज को बनाए रखता है।
  • अभिव्यक्ति: यह "साउंड ब्लॉक्स" पर निर्भर रहने वाले पिछले मॉडलों की तुलना में गायन, भावनात्मक संवाद और पैरालिंग्विस्टिक ध्वनियों (जैसे आह भरना या हंसना) जैसे जटिल कार्यों को बेहतर ढंग से संभालता है।

निष्कर्ष

dots.tts एक बड़ी उपलब्धि है क्योंकि यह साबित करता है कि आवाज को AI बनाने के लिए आपको भाषण को छोटे, कठोर टुकड़ों में काटने की आवश्यकता नहीं है। भाषण को एक निरंतर प्रवाह के रूप में मानकर और AI को स्वयं सुधार करने और "बड़ी तस्वीर" देखने के उपकरण देकर, उन्होंने एक ऐसी प्रणाली बनाई है जो है:

  1. अधिक प्राकृतिक (ब्लॉकी नहीं, बल्कि पानी की तरह तरल)।
  2. अधिक स्थिर (लंबी बातचीत के दौरान भटकती नहीं है)।
  3. वास्तविक समय की बातचीत के लिए पर्याप्त तेज।

टीम ने अपना सारा कोड और मॉडल मुफ्त में जारी कर दिया है, जिससे कोई भी इस "निरंतर" (continuous) दृष्टिकोण का उपयोग कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →