← नवीनतम पेपर
⚡ electrical engineering

Whisfusion: Parallel ASR Decoding with Masked Diffusion

विस्फ्यूजन (Whisfusion) एक समानांतर मास्क किया हुआ डिफ्यूजन डिकोडर पेश करता है जिसे फ्रोजन विस्पर-लार्ज-v3 (Whisper-large-v3) एम्बेडिंग्स पर प्रशिक्षित किया गया है, जो अत्याधुनिक बहुभाषी एएसआर (ASR) सटीकता प्राप्त करता है और साथ ही इन्फरेंस स्पीड में ऑटोरेग्रेसिव बेसलाइन्स से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Taeyoun Kwon, Junhyuk Ahn, Taegeun Yun, Heeju Jwa, Yoonchae Choi, Siwon Park, Jongchan Kim, Hyungon Ryu, Hyuk-Jae Lee, Nam-Joon Kim

प्रकाशित 2026-06-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Taeyoun Kwon, Junhyuk Ahn, Taegeun Yun, Heeju Jwa, Yoonchae Choi, Siwon Park, Jongchan Kim, Hyungon Ryu, Hyuk-Jae Lee, Nam-Joon Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ Whisfusion पेपर का एक स्पष्टीकरण दिया गया है, जिसे सरल भाषा और कुछ रचनात्मक उपमाओं (analogies) के साथ अनुवादित किया गया है।

समस्या: "धीमा पाठक" बनाम "तेज़ नज़र डालने वाला"

कल्पना कीजिए कि आप एक भाषण को टेक्स्ट में लिख रहे हैं।

  • पुराना तरीका (Autoregressive/AR): इसे एक बहुत ही सावधान, धीमे पाठक की तरह समझें जो एक समय में एक शब्द करके वाक्य लिखता है। वह "The" लिखता है, फिर सोचने के लिए रुकता है, फिर "cat" लिखता है, फिर रुकता है, फिर "sat" लिखता है। वह अगला शब्द नहीं लिख सकता जब तक कि वह वर्तमान शब्द को पूरा न कर ले। यदि वाक्य लंबा है, तो इसमें बहुत समय लगता है। अधिकांश उच्च-गुणवत्ता वाले स्पीच-टू-टेक्स्ट सिस्टम (जैसे प्रसिद्ध Whisper) इसी तरह काम करते हैं। वे सटीक हैं लेकिन धीमे हैं क्योंकि उन्हें अगला शब्द शुरू करने से पहले प्रत्येक शब्द के समाप्त होने का इंतज़ार करना पड़ता है।
  • तेज़ तरीका (Non-Autoregressive/CTC): एक तेज़ नज़र डालने वाले की कल्पना करें जो पूरे वाक्य को एक साथ देखता है और सभी शब्दों का अनुमान एक साथ लगा लेता है। यह अविश्वसनीय रूप से तेज़ है। हालाँकि, क्योंकि वे पिछले शब्दों के संदर्भ की जाँच किए बिना सब कुछ एक साथ अनुमान लगा रहे हैं, वे अक्सर गलतियाँ करते हैं या निरर्थक (gibberish) शब्द पैदा करते हैं। वे तेज़ हैं, लेकिन बहुत सटीक नहीं हैं।

लक्ष्य: शोधकर्ता एक ऐसा सिस्टम बनाना चाहते थे जो सटीक भी हो (सावधान पाठक की तरह) और तेज़ भी (नज़र डालने वाले की तरह)।

समाधान: Whisfusion (द "डिनोइजिंग आर्टिस्ट")

लेखकों ने Whisfusion नामक एक नया सिस्टम बनाया है। शब्दों को एक-एक करके लिखने या एक साथ अनुमान लगाने के बजाय, वे Masked Diffusion नामक तकनीक का उपयोग करते हैं।

यह कैसे काम करता है, इसे "क्षतिग्रस्त पेंटिंग को बहाल करने" की उपमा से समझते हैं:

  1. सेटअप: कल्पना कीजिए कि आपके पास एक सुंदर पेंटिंग (ऑडियो रिकॉर्डिंग) है और एक कैनवास है जिसमें पेंटिंग का एक खाली, मास्क किया हुआ संस्करण (वह टेक्स्ट जिसे आपको लिखना है) है।
  2. प्रक्रिया: एक बार में एक ब्रशस्ट्रोक लगाने के बजाय, Whisfusion एक ही बार में पूरे खाली कैनवास को देखता है। यह हर एक शब्द के लिए एक साथ अनुमान लगाता है।
  3. पुनरावृत्ति (Iteration): यह पहली कोशिश में परफेक्ट नहीं होता। इसलिए, यह एक कदम पीछे हटता है, अपने बिखरे हुए अनुमान को देखता है, और पूरी तस्वीर को फिर से "डिनोइज़" (साफ) करता है। यह पूरे वाक्य के लिए समानांतर (parallel) रूप से ऐसा करता है।
  4. जादू: यह सफाई की प्रक्रिया को केवल कुछ ही बार दोहराता है (लग लगभग 3 स्टेप्स)। प्रत्येक स्टेप के साथ, टेक्स्ट अधिक स्पष्ट और सटीक होता जाता है, जिससे पूरा वाक्य शब्द-दर-शब्द के बजाय एक साथ सुधरता है।

उन्होंने इसे कैसे सफल बनाया

पेपर में तीन मुख्य "सीक्रेट सॉस" का विवरण दिया गया है जिन्होंने इसे काम करने के योग्य बनाया:

1. फ्रोजन ब्रेन (Whisper-large-v3)
उन्होंने सिस्टम को शून्य से ध्वनि समझने के लिए प्रशिक्षित नहीं किया। इसके बजाय, उन्होंने एक विशाल, प्री-ट्रेन्ड "दिमाग" (Whisper-large-v3) लिया जो ऑडियो समझने में पहले से ही विशेषज्ञ है, उसे फ्रीज कर दिया ताकि वह बदल न सके, और उसके साथ एक नया "हाथ" (डेकोडर) जोड़ दिया। यह नया हाथ सीखता है कि उस ऑडियो की समझ को ऊपर वर्णित "डिनोइजिंग" विधि का उपयोग करके टेक्स्ट में कैसे बदला जाए।

2. "हाई-मास्क" ट्रेनिंग (शून्य से अनुमान लगाना सीखना)
आमतौर पर, जब आप किसी मॉडल को क्षतिग्रस्त पेंटिंग ठीक करने के लिए प्रशिक्षित करते हैं, तो आप एक ऐसी पेंटिंग से शुरू कर सकते हैं जो केवल 10% ढकी हुई है। लेकिन असल जीवन में, Whisfusion एक ऐसे कैनवास से शुरू करता है जो 100% ढका हुआ (पूरी तरह से मास्क किया हुआ) है।

  • समाधान: शोधकर्ताओं ने मॉडल को विशेष रूप से "कठिन" उदाहरणों पर प्रशिक्षित किया जहाँ लगभग सारा टेक्स्ट छिपा हुआ था (हाई-मास्क)। इसने मॉडल को यह सीखने के लिए मजबूर किया कि जब उसके पास शुरू करने के लिए टेक्स्ट के बहुत कम संकेत हों, तब भी अच्छे अनुमान कैसे लगाए जाएं, जो कि वास्तविक जीवन में इसके उपयोग से बिल्कुल मेल खाता है।

3. "ग्रुप थिंक" रणनीति (पैरेलल डिफ्यूजन डिकोडिंग)
जब मॉडल अपने 3 सफाई स्टेप्स पूरे कर लेता है, तो वह केवल एक उत्तर नहीं चुनता। यह एक ही समय में ट्रांसक्रिप्ट के 5 अलग-अलग संस्करण तैयार करता है (जैसे 5 अलग-अलग लोगों से पहेली सुलझाने के लिए कहना)।

  • फिर, यह एक वोटिंग सिस्टम (जिसे MBR consensus कहा जाता है) का उपयोग करता है कि समूह किस बात पर सबसे अधिक सहमत है। यदि 5 में से 4 संस्करण "cat" कहते हैं, और एक "bat" कहता है, तो यह "cat" चुनता है। यह काम को बहुत धीमा किए बिना सटीकता को बढ़ाता है।

परिणाम: गति बनाम सटीकता

पेपर वर्तमान चैंपियन्स के साथ तुलना करता है:

  • Whisper-large-v3 (सावधान पाठक) के मुकाबले: Whisfusion 4 से 5 गुना तेज़ है और औसतन वास्तव में अधिक सटीक भी है।
  • Whisper-turbo (तेज़ संस्करण) के मुकाबले: Whisfusion तेज़ और अधिक सटीक है।
  • अन्य तेज़ सिस्टम के मुकाबले: यह सटीकता में अन्य "तेज़" सिस्टमों को बड़े अंतर से पछाड़ देता है।

मुख्य निष्कर्ष:
Whisfusion साबित करता है कि आपको गति और गुणवत्ता के बीच चुनाव करने की आवश्यकता नहीं है। "डिनोइजिंग" दृष्टिकोण का उपयोग करके जहाँ मॉडल समानांतर चरणों में पूरे वाक्य को परिष्कृत करता है, यह धीमे, सावधान पाठकों की सटीकता प्राप्त करता है, लेकिन तेज़ नज़र डालने वालों की गति से चलता है।

पेपर में बताई गई सीमाएँ

  • लंबाई: यह वर्तमान में 30 सेकंड तक के स्पीच क्लिप्स को संभाल सकता है। इसे अभी तक घंटों लंबे लेक्चर के लिए डिज़ाइन नहीं किया गया है।
  • सिलेक्शन बॉटलनेक: मॉडल वास्तव में उन उत्तरों को उत्पन्न करने में सक्षम है जो वर्तमान में चुने गए उत्तरों से भी बेहतर हो सकते हैं, लेकिन अंतिम उत्तर चुनने के लिए जो "वोटिंग" सिस्टम यह उपयोग करता है, उसे भविष्य में सुधारा जा सकता है।
  • दायरा: यह विशेष रूप से स्पीच को टेक्स्ट में ट्रांसक्राइब करने के लिए है, न कि सवालों के जवाब देने या बातचीत करने के लिए।

संक्षेप में, Whisfusion सुनने का एक नया तरीका है जो एक टीम के संपादकों की तरह काम करता है जो एक साथ ड्राफ्ट को रिफाइन करते हैं, न कि एक व्यक्ति के शब्द-दर-शब्द टाइप करने की तरह, जिसके परिणामस्वरूप एक ट्रांसक्रिप्ट मिलती है जो बिजली की तरह तेज़ और अत्यधिक सटीक होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →