← नवीनतम पेपर
⚡ electrical engineering

MOSS Transcribe Diarize Technical Report

MOSS Transcribe Diarize एक एकीकृत मल्टीमॉडल लार्ज लैंग्वेज मॉडल है जो मौजूदा प्रणालियों की सीमाओं को दूर करने के लिए 128k कॉन्टेक्स्ट विंडो और व्यापक वास्तविक दुनिया के डेटा पर एंड-टू-एंड ट्रेनिंग का लाभ उठाकर स्टेट-ऑफ-द-आर्ट स्पीकर-एट्रीब्यूटेड, टाइम-स्टैम्पड ट्रांसक्रिप्शन प्राप्त करता है।

मूल लेखक: MOSI. AI, :, Donghua Yu, Zhengyuan Lin, Hanfu Chen, Chen Yang, Yiyang Zhang, Jingqi Chen, Ke Chen, Liwei Fan, Yi Jiang, Jie Zhu, Muchen Li, Wenxuan Wang, Yang Wang, Zhe Xu, Botian Jiang, Yitian Gong
प्रकाशित 2026-07-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: MOSI. AI, :, Donghua Yu, Zhengyuan Lin, Hanfu Chen, Chen Yang, Yiyang Zhang, Jingqi Chen, Ke Chen, Liwei Fan, Yi Jiang, Jie Zhu, Muchen Li, Wenxuan Wang, Yang Wang, Zhe Xu, Botian Jiang, Yitian Gong, Yuqian Zhang, Wenbo Zhang, Songlin Wang, Zhiyu Wu, Zhaoye Fei, Qinyuan Cheng, Shimin Li, Xipeng Qiu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक भीड़भाड़ वाले कॉफी शॉप में बैठे हैं, और तीन अलग-अलग दोस्तों की बातों को बिल्कुल सटीक रूप से लिखने की कोशिश कर रहे हैं। आपको न केवल शब्दों को जानना है, बल्कि यह भी जानना है कि किसने क्या कहा और उन्होंने ठीक कब बोला। यही "स्पीकर-एट्रीब्यूटेड, टाइम-स्टैम्प्ड ट्रांसक्रिप्शन" (SATS) की चुनौती है। यह कंप्यूटरों के लिए एक सुपरपावर है, जो एक शोर भरी ऑडियो रिकॉर्डिंग को एक साफ, व्यवस्थित स्क्रिप्ट में बदल देता है जहाँ हर वाक्य को वक्ता के नाम और एक सटीक घड़ी के समय के साथ टैग किया जाता है। यह व्यावसायिक बैठकों का ट्रांसक्रिप्शन करने, ग्राहक सेवा कॉल का विश्लेषण करने या सुनने में अक्षम लोगों को जटिल बातचीत का पालन करने में मदद करने के लिए अविश्वसनीय रूप से उपयोगी है।

अब तक, कंप्यूटर आमतौर पर इसे दो अलग-अलग चरणों में हल करने की कोशिश करते थे। पहले, एक "स्पीच-टू-टेक्स्ट" रोबोट सुनता और शब्द टाइप करता। फिर, एक अलग "स्पीकर डिटेक्टिव" रोबोट यह पता लगाने की कोशिश करता कि किसने क्या कहा। समस्या यह थी कि ये दोनों रोबोट अक्सर एक-दूसरे से बात नहीं करते थे। यदि पहला रोबोट एक छोटी सी गलती करता, तो दूसरा रोबोट भ्रमित हो जाता, और अंतिम स्क्रिप्ट एक उलझे हुए ढेर जैसी बन जाती। यह एक पहेली को जोड़ने जैसा है जहाँ आधे टुकड़े किसी दूसरे बॉक्स के हों। यह नया पेपर एक नए प्रकार के कंप्यूटर मस्तिष्क को पेश करता है जो ये दोनों काम एक साथ, एक ही सुचारू गति में करता है।

एक-मस्तिष्क समाधान (The One-Brain Solution)

इस प्रोजेक्ट के पीछे की टीम, OpenMOSS ने एक नया मॉडल बनाया है जिसे MOSS Transcribe Diarize कहा जाता है। इस मॉडल को एक सुपर-इंटेलिजेंट, मल्टी-टास्किंग कंडक्टर (संचालक) के रूप में सोचें। शब्दों के लिए एक अलग ऑर्केस्ट्रा और आवाजों के लिए एक अलग ऑर्केस्ट्रा रखने के बजाय, यह कंडक्टर पूरे स्कोर को अपने दिमाग में रखता है और पूरे प्रदर्शन को एक ही बार में निर्देशित करता है।

अतीत में, कंप्यूटर लंबी बातचीत में संघर्ष करते थे। यदि कोई बैठक एक घंटे तक चलती थी, तो पुराने सिस्टम को ऑडियो को 30-सेकंड के छोटे टुकड़ों में काटना पड़ता था, प्रत्येक टुकड़े को हल करना पड़ता था, और फिर उन्हें वापस जोड़ने की कोशिश करनी पड़ती थी। इससे अक्सर कंप्यूटर यह भूल जाता था कि "स्पीकर A" कौन था, या बातचीत के प्रवाह को खो देता था। MOSS Transcribe Diarize एक 128k टोकन की विशाल "मेमोरी विंडो" के साथ खेल बदल देता है। इसे समझने के लिए, यह मॉडल एक ही, निर्बाध पास में 90 मिनट तक के ऑडियो को सुनने और समझने में सक्षम बनाता है। इसे ऑडियो को काटने की आवश्यकता नहीं है; यह पूरी कहानी को शुरू से अंत तक सुनता है, जिससे यह स्पष्ट मानसिक चित्र बनाए रखता है कि कौन कौन है, भले ही वे कुछ समय से बोले न हों।

यह कैसे काम करता है (जादुई ट्रिक)

यह मॉडल एक "मल्टीमॉडल लार्ज लैंग्वेज मॉडल" है, जिसका एक फैंसी तरीका यह कहना है कि यह टेक्स्ट पढ़ सकता है और ऑडियो सुन भी सकता है। यहाँ इसकी ट्रिक है:

  1. कान: यह कच्ची ध्वनि तरंगों (sound waves) को लेता है और उन्हें डिजिटल प्रारूप में बदल देता है।
  2. अनुवादक: यह उन ध्वनि तरंगों को उस भाषा में बदलने के लिए एक विशेष "प्रोजेक्शन" का उपयोग करता है जिसे टेक्स्ट-पढ़ने वाला मस्तिष्क समझ सके।
  3. आउटपुट: यह केवल शब्द उगलने के बजाय, एक स्क्रिप्ट आउटपुट करता है जो ऐसा दिखता है: [0.11] [S01] गुड मॉर्निंग! [1.03] [S02] मॉर्निंग, गाइस!। यह आपको स्पीकर आईडी (S01, S02), सटीक समय जब उन्होंने बोलना शुरू किया, और उनके द्वारा कहे गए शब्द बताता है, और यह सब एक ही सिंगल फॉरवर्ड पास में होता है।

इस मॉडल को सिखाने के लिए, शोधकर्ताओं ने केवल साफ, स्टूडियो-क्वालिटी की रिकॉर्डिंग का उपयोग नहीं किया। उन्होंने इसे "रियल वाइल्ड" डेटा का भारी आहार दिया—इंटरनेट से मिली रिकॉर्डिंग जिसमें बैकग्राउंड शोर, ओवरलैपिंग आवाजें, विभिन्न लहजे और एक-दूसरे के ऊपर बोलने वाले लोग शामिल हैं। उन्होंने "सिम्युलेटेड" बातचीत भी बनाई जहाँ उन्होंने अलग-अलग आवाजों को मिलाया और जोड़ा ताकि मॉडल को कठिन स्थितियों को संभालने के लिए सिखाया जा सके, जैसे कि जब दो लोग ठीक एक ही समय पर बात कर रहे हों।

उन्होंने क्या पाया

टीम ने अपने नए मॉडल का परीक्षण कुछ सबसे बड़े, सबसे महंगे व्यावसायिक सिस्टमों (जैसे कि Doubao, ElevenLabs और विभिन्न Google मॉडल्स) के विरुद्ध किया। उन्होंने तीन अलग-अलग प्रकार के परीक्षणों का उपयोग किया:

  • AISHELL-4: वास्तविक दुनिया की लंबी मीटिंग रिकॉर्डिंग (लगभग ~40 मिनट तक)।
  • पॉडकास्ट: कई मेहमानों के साथ उच्च-गुणवत्ता वाली, लंबी इंटरव्यू।
  • मूवीज़: तेज़, ओवरलैपिंग संवाद वाली छोटी क्लिप्स।

परिणाम प्रभावशाली थे। लगभग हर परीक्षण में, MOSS Transcribe Diarize ने प्रतिस्पर्धा की तुलना में कम गलतियाँ कीं।

  • सटीकता (Accuracy): इसने शब्दों को अधिक बार सही बताया (कम Character Error Rate)।
  • पहचान (Identity): यह ट्रैक रखने में बहुत बेहतर था कि किसने क्या कहा। शोधकर्ताओं ने इसे Δcp (शब्द त्रुटियों और स्पीकर त्रुटियों के बीच का अंतर) नामक मीट्रिक से मापा। कम संख्या का अर्थ है कि मॉडल इस बात में भ्रमित नहीं हुआ कि कौन बोल रहा है। MOSS Transcribe Diarize का Δcp स्कोर सबसे कम था, जिसका अर्थ है कि इसने लंबी, अव्यवस्थित बातचीत में भी स्पीकर की पहचान को सुसंगत रखा।
  • लॉन्ग-फॉर्म क्षमता: जबकि कुछ प्रसिद्ध व्यावसायिक मॉडल (जैसे GPT-4o और Gemini 3 Pro) लंबी ऑडियो फाइलों को प्रोसेस करने में विफल रहे या सही फॉर्मेट आउटपुट नहीं कर सके, MOSS Transcribe Diarize ने बिना किसी परेशानी के पूरे 90 मिनट के इनपुट को संभाला।

यह क्यों महत्वपूर्ण है

पेपर सुझाव देता है कि स्पीच रिकग्निशन और स्पीकर आइडेंटिफिकेशन को एक एकीकृत प्रणाली के साथ एक लंबी मेमोरी के साथ जोड़कर, हम बहुत अधिक विश्वसनीय ट्रांसक्रिप्ट प्राप्त कर सकते हैं। मॉडल साबित करता है कि आपको ऑडियो को समझने के लिए उसे काटने की आवश्यकता नहीं है; आप पूरी बातचीत को एक साथ सुन सकते हैं और फिर भी विवरणों को सही रख सकते हैं।

लेखक सावधानी से नोट करते हैं कि हालांकि उनका मॉडल एक महत्वपूर्ण कदम है, लेकिन यह कोई जादुई छड़ी नहीं है जो हर समस्या को पूरी तरह से हल कर दे। वे अभी भी सुधार के लिए गुंजाइश देखते हैं, जैसे कि सिस्टम को रियल-टाइम (स्ट्रीमिंग) में काम करने के लिए बनाना और और भी अधिक भाषाओं को संभालना। लेकिन फिलहाल, उन्होंने दिखाया है कि एक एकल, एकीकृत मस्तिष्क दो अलग-अलग रोबोटों का काम कर सकता है, और बेहतर तरीके से कर सकता है, खासकर जब बातचीत लंबी और जटिल हो जाती है।

कोड और मॉडल अब किसी के भी उपयोग के लिए खुले हैं, जो GitHub और Hugging Face पर उपलब्ध हैं, दूसरों को यह देखने के लिए आमंत्रित करते हैं कि क्या वे इस नए आधार पर और भी बेहतर उपकरण बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →