← नवीनतम पेपर
💬 NLP

DiffuSpeech: Silent Thought, Spoken Answer via Unified Speech-Text Diffusion

यह शोधपत्र DiffuSpeech को प्रस्तुत करता है, जो एक एकीकृत मास्क किया हुआ डिफ्यूजन मॉडल है जो आंतरिक टेक्स्ट रीजनिंग और बोले गए उत्तरों को संयुक्त रूप से उत्पन्न करके "मौन विचार, बोले गए उत्तर" (Silent Thought, Spoken Answer) को सक्षम बनाता है, जो मजबूत भाषा समझ को बनाए रखते हुए स्पीच QA सटीकता और टेक्स्ट-टू-स्पीच गुणवत्ता में अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Yuxuan Lou, Ziming Wu, Yaochen Wang, Yong Liu, Yingxuan Ren, Fuming Lai, Shaobing Lian, Jie Tang, Yang You

प्रकाशित 2026-02-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuxuan Lou, Ziming Wu, Yaochen Wang, Yong Liu, Yingxuan Ren, Fuming Lai, Shaobing Lian, Jie Tang, Yang You

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ DiffuSpeech पेपर का विवरण दिया गया है, जिसे रोजमर्रा की भाषा में कुछ रचनात्मक उपमाओं (analogies) के साथ अनुवादित किया गया है।

मुख्य विचार: "मौन विचार, बोले गए उत्तर"

कल्पना कीजिए कि आप एक पार्टी में हैं और कोई आपसे एक कठिन सवाल पूछता है। यदि आप बिना सोचे-समझे जो भी दिमाग में आया उसे बोल देते हैं, तो हो सकता है कि आप आत्मविश्वास से भरा हुआ लेकिन गलत उत्तर दें। लेकिन यदि आप बोलने से पहले एक पल के लिए रुककर सोचते हैं, तथ्यों को व्यवस्थित करते हैं, और अपने वाक्य की योजना बनाते हैं, तो आपका उत्तर आमतौर पर बहुत बेहतर होता है।

वर्तमान AI वॉयस असिस्टेंट उस व्यक्ति की तरह हैं जो सोचने के लिए कभी नहीं रुकते। वे एक सवाल सुनते हैं और तुरंत ऑडियो टोकन (ध्वनियाँ) बनाना शुरू कर देते हैं। एक बार जब वे बोलना शुरू कर देते हैं, तो वे अपनी गलती सुधारने के लिए रुक नहीं सकते। यदि वे पहले वाक्य में कोई तथ्य गलत बताते हैं, तो पूरा उत्तर खराब हो जाता है।

DiffuSpeech AI के बात करने का एक नया तरीका पेश करता है: "मौन विचार, बोले गए उत्तर" (Silent Thought, Spoken Answer)।
सिर्फ ऑडियो निकालने के बजाय, AI पहले अपने दिमाग में एक "मौन विचार" (एक टेक्स्ट-आधारित तर्क प्रक्रिया) उत्पन्न करता है। यह उत्तर की योजना बनाने के लिए इस आंतरिक टेक्स्ट का उपयोग करता है, और फिर बोलता है। यह AI को आवाज निकालने से पहले ही अपनी तर्कशक्ति को ठीक करने की अनुमति देता है।

यह कैसे काम करता है: "डिनोइजिंग" (Denoising) का जादू

अधिकांश AI मॉडल एक लेखक की तरह काम करते हैं जो एक समय में एक शब्द टाइप करता है (Autoregressive)। यदि आप पहले शब्द में कोई गलती करते हैं, तो आपको सब कुछ मिटाकर फिर से टाइप करना पड़ता है।

DiffuSpeech अलग तरह से काम करता है। यह एक डिफ्यूजन (Diffusion) मॉडल का उपयोग करता है। इसे एक मूर्तिकार की तरह समझें जो पत्थर के एक ऐसे ब्लॉक पर काम कर रहा है जो शुरू में कोहरे से ढका हुआ है।

  1. कोहरा (The Fog): AI एक खाली स्लेट से शुरू करता है जहाँ उत्तर पूरी तरह से छिपा हुआ (masked) होता है।
  2. मूर्तिकला (The Sculpting): शब्द-दर-शब्द लिखने के बजाय, AI एक ही बार में पूरे "धुंधले" ब्लॉक को देखता है। यह धीरे-धीरे कोहरे को हटाता है, जिससे उत्तर अधिक स्पष्ट होता जाता है।
  3. लाभ (The Advantage): क्योंकि यह एक ही बार में पूरी तस्वीर देख सकता है, यह वाक्य की शुरुआत को तब बदल सकता है जब इसे एहसास हो कि वाक्य के अंत को बदलने की आवश्यकता है। यह पूरे पैराग्राफ को एक साथ संपादित करने के समान है, न कि इसे रैखिक रूप से (linearly) टाइप करने के समान।

इस पेपर में, AI यह काम टेक्स्ट (मौन विचार) और ऑडियो (बोले गए उत्तर) दोनों के लिए एक साथ करता है। यह उन्हें एक बड़े पहेली की तरह मानता है, "सोचने" वाले हिस्से और "बोलने" वाले हिस्से को एक साथ हल करता है।

नया डेटासेट: "थिंकिंगटॉक" (ThinkingTalk)

AI को यह नया कौशल सिखाने के लिए, शोधकर्ताओं को केवल पुराने डेटा का उपयोग नहीं किया जा सकता था। उन्हें ऐसे उदाहरणों की आवश्यकता थी जहाँ AI वास्तव में बोलने से पहले सोचता है।

उन्होंने ThinkingTalk नामक एक नया डेटासेट बनाया।

  • उपमा: कल्पना कीजिए कि आप प्रश्न-उत्तर की एक मानक पाठ्यपुस्तक ले रहे हैं और उसे फिर से लिख रहे हैं। हर प्रश्न के लिए, उन्होंने केवल उत्तर नहीं लिखा; उन्होंने पहले एक "गुप्त डायरी प्रविष्टि" (secret diary entry) लिखी। यह डायरी प्रविष्टि बताती है कि AI ने उत्तर कैसे निकाला (जैसे, "उपयोगकर्ता एक सरल स्पष्टीकरण चाहता है, इसलिए मुझे तकनीकी शब्दों से बचना चाहिए और इसे तीन चरणों में तोड़ना चाहिए")।
  • परिणाम: उन्होंने 26,000 उदाहरण (319 घंटे का ऑडियो) बनाए जहाँ प्रत्येक बोले गए उत्तर को उसके आंतरिक टेक्स्ट तर्क (reasoning) के साथ जोड़ा गया है। यह AI को सिखाता है कि "बोलने" से पहले "सोचना" एक आवश्यक कदम है।

उन्होंने क्या हासिल किया?

शोधकर्ताओं ने मौजूदा सर्वश्रेष्ठ वॉयस AI मॉडलों (जैसे Moshi और MinMo) के मुकाबले DiffuSpeech का परीक्षण किया। यहाँ उन्हें क्या मिला:

  1. बेहतर उत्तर: कठिन सवालों पर, DiffuSpeech काफी सटीक था। कुछ परीक्षणों में, इसने सबसे अच्छे प्रतिस्पर्धी को बहुत बड़े अंतर से (9 अंक तक) पीछे छोड़ दिया। "मौन विचार" ने इसे तथ्यात्मक गलतियों से बचने में मदद की।
  2. स्पष्ट भाषण: भले ही यह अतिरिक्त काम (सोचना) कर रहा है, लेकिन इसके द्वारा उत्पन्न आवाज बहुत उच्च गुणवत्ता वाली है। यह स्वाभाविक लगता है और इसमें त्रुटियाँ बहुत कम (कम Word Error Rate) हैं।
  3. अभी भी स्मार्ट: कभी-कभी, जब आप किसी मॉडल को नया करतब सिखाते हैं, तो वह पुराने कौशल भूल जाता है। लेकिन DiffuSpeech ने अपना सामान्य ज्ञान (जैसे सामान्य ज्ञान के प्रश्नों का उत्तर देना या जटिल अवधारणाओं को समझना) बिल्कुल वैसे ही बनाए रखा जैसे कि केवल टेक्स्ट वाले मॉडल रखते हैं।

"दो-चरण" वाली प्रशिक्षण प्रक्रिया

इस परिणाम को प्राप्त करने के लिए, उन्होंने AI को दो चरणों में प्रशिक्षित किया, जैसे एक छात्र स्कूल जाता है:

  • चरण 1 (बुनियादी बातें): उन्होंने AI को यह सिखाया कि भाषण को कैसे समझा जाए और टेक्स्ट को स्पीच में कैसे बदला जाए। उन्होंने सुनिश्चित किया कि वह एक आवाज सुन सके और वापस एक शब्द बोल सके, और इसके विपरीत भी।
  • चरण 2 (एडवांस्ड क्लास): उन्होंने ThinkingTalk डेटासेट पेश किया। यहाँ, AI ने रुकना, "मौन विचार" टेक्स्ट उत्पन्न करना, और फिर उस विचार का उपयोग अपने बोले गए उत्तर को निर्देशित करने के लिए करना सीखा।

सारांश

DiffuSpeech एक बड़ी सफलता है क्योंकि यह वॉयस AI को एक "तेज़ बोलने वाले" से रोकता है जो बिना सोचे-समझे दौड़ता है। इसके बजाय, यह AI को एक "विचारशील वक्ता" बनाता है जो बोलने से पहले आंतरिक रूप से अपने शब्दों की योजना बनाता है। एक विशेष "कोहरा हटाने" (diffusion) पद्धति का उपयोग करके, यह सोचने और बोलने दोनों को एक साथ संभाल सकता है, जिसके परिणामस्वरूप उत्तर न केवल प्रवाहपूर्ण होते हैं बल्कि तथ्यात्मक रूप से सही और तार्किक रूप से सुदृढ़ भी होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →