MOSS Transcribe Diarize Technical Report
MOSS Transcribe Diarize एक एकीकृत मल्टीमॉडल लार्ज लैंग्वेज मॉडल है जो मौजूदा प्रणालियों की सीमाओं को दूर करने के लिए 128k कॉन्टेक्स्ट विंडो और व्यापक वास्तविक दुनिया के डेटा पर एंड-टू-एंड ट्रेनिंग का लाभ उठाकर स्टेट-ऑफ-द-आर्ट स्पीकर-एट्रीब्यूटेड, टाइम-स्टैम्पड ट्रांसक्रिप्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक भीड़भाड़ वाले कॉफी शॉप में बैठे हैं, और तीन अलग-अलग दोस्तों की बातों को बिल्कुल सटीक रूप से लिखने की कोशिश कर रहे हैं। आपको न केवल शब्दों को जानना है, बल्कि यह भी जानना है कि किसने क्या कहा और उन्होंने ठीक कब बोला। यही "स्पीकर-एट्रीब्यूटेड, टाइम-स्टैम्प्ड ट्रांसक्रिप्शन" (SATS) की चुनौती है। यह कंप्यूटरों के लिए एक सुपरपावर है, जो एक शोर भरी ऑडियो रिकॉर्डिंग को एक साफ, व्यवस्थित स्क्रिप्ट में बदल देता है जहाँ हर वाक्य को वक्ता के नाम और एक सटीक घड़ी के समय के साथ टैग किया जाता है। यह व्यावसायिक बैठकों का ट्रांसक्रिप्शन करने, ग्राहक सेवा कॉल का विश्लेषण करने या सुनने में अक्षम लोगों को जटिल बातचीत का पालन करने में मदद करने के लिए अविश्वसनीय रूप से उपयोगी है।
अब तक, कंप्यूटर आमतौर पर इसे दो अलग-अलग चरणों में हल करने की कोशिश करते थे। पहले, एक "स्पीच-टू-टेक्स्ट" रोबोट सुनता और शब्द टाइप करता। फिर, एक अलग "स्पीकर डिटेक्टिव" रोबोट यह पता लगाने की कोशिश करता कि किसने क्या कहा। समस्या यह थी कि ये दोनों रोबोट अक्सर एक-दूसरे से बात नहीं करते थे। यदि पहला रोबोट एक छोटी सी गलती करता, तो दूसरा रोबोट भ्रमित हो जाता, और अंतिम स्क्रिप्ट एक उलझे हुए ढेर जैसी बन जाती। यह एक पहेली को जोड़ने जैसा है जहाँ आधे टुकड़े किसी दूसरे बॉक्स के हों। यह नया पेपर एक नए प्रकार के कंप्यूटर मस्तिष्क को पेश करता है जो ये दोनों काम एक साथ, एक ही सुचारू गति में करता है।
एक-मस्तिष्क समाधान (The One-Brain Solution)
इस प्रोजेक्ट के पीछे की टीम, OpenMOSS ने एक नया मॉडल बनाया है जिसे MOSS Transcribe Diarize कहा जाता है। इस मॉडल को एक सुपर-इंटेलिजेंट, मल्टी-टास्किंग कंडक्टर (संचालक) के रूप में सोचें। शब्दों के लिए एक अलग ऑर्केस्ट्रा और आवाजों के लिए एक अलग ऑर्केस्ट्रा रखने के बजाय, यह कंडक्टर पूरे स्कोर को अपने दिमाग में रखता है और पूरे प्रदर्शन को एक ही बार में निर्देशित करता है।
अतीत में, कंप्यूटर लंबी बातचीत में संघर्ष करते थे। यदि कोई बैठक एक घंटे तक चलती थी, तो पुराने सिस्टम को ऑडियो को 30-सेकंड के छोटे टुकड़ों में काटना पड़ता था, प्रत्येक टुकड़े को हल करना पड़ता था, और फिर उन्हें वापस जोड़ने की कोशिश करनी पड़ती थी। इससे अक्सर कंप्यूटर यह भूल जाता था कि "स्पीकर A" कौन था, या बातचीत के प्रवाह को खो देता था। MOSS Transcribe Diarize एक 128k टोकन की विशाल "मेमोरी विंडो" के साथ खेल बदल देता है। इसे समझने के लिए, यह मॉडल एक ही, निर्बाध पास में 90 मिनट तक के ऑडियो को सुनने और समझने में सक्षम बनाता है। इसे ऑडियो को काटने की आवश्यकता नहीं है; यह पूरी कहानी को शुरू से अंत तक सुनता है, जिससे यह स्पष्ट मानसिक चित्र बनाए रखता है कि कौन कौन है, भले ही वे कुछ समय से बोले न हों।
यह कैसे काम करता है (जादुई ट्रिक)
यह मॉडल एक "मल्टीमॉडल लार्ज लैंग्वेज मॉडल" है, जिसका एक फैंसी तरीका यह कहना है कि यह टेक्स्ट पढ़ सकता है और ऑडियो सुन भी सकता है। यहाँ इसकी ट्रिक है:
- कान: यह कच्ची ध्वनि तरंगों (sound waves) को लेता है और उन्हें डिजिटल प्रारूप में बदल देता है।
- अनुवादक: यह उन ध्वनि तरंगों को उस भाषा में बदलने के लिए एक विशेष "प्रोजेक्शन" का उपयोग करता है जिसे टेक्स्ट-पढ़ने वाला मस्तिष्क समझ सके।
- आउटपुट: यह केवल शब्द उगलने के बजाय, एक स्क्रिप्ट आउटपुट करता है जो ऐसा दिखता है:
[0.11] [S01] गुड मॉर्निंग! [1.03] [S02] मॉर्निंग, गाइस!। यह आपको स्पीकर आईडी (S01, S02), सटीक समय जब उन्होंने बोलना शुरू किया, और उनके द्वारा कहे गए शब्द बताता है, और यह सब एक ही सिंगल फॉरवर्ड पास में होता है।
इस मॉडल को सिखाने के लिए, शोधकर्ताओं ने केवल साफ, स्टूडियो-क्वालिटी की रिकॉर्डिंग का उपयोग नहीं किया। उन्होंने इसे "रियल वाइल्ड" डेटा का भारी आहार दिया—इंटरनेट से मिली रिकॉर्डिंग जिसमें बैकग्राउंड शोर, ओवरलैपिंग आवाजें, विभिन्न लहजे और एक-दूसरे के ऊपर बोलने वाले लोग शामिल हैं। उन्होंने "सिम्युलेटेड" बातचीत भी बनाई जहाँ उन्होंने अलग-अलग आवाजों को मिलाया और जोड़ा ताकि मॉडल को कठिन स्थितियों को संभालने के लिए सिखाया जा सके, जैसे कि जब दो लोग ठीक एक ही समय पर बात कर रहे हों।
उन्होंने क्या पाया
टीम ने अपने नए मॉडल का परीक्षण कुछ सबसे बड़े, सबसे महंगे व्यावसायिक सिस्टमों (जैसे कि Doubao, ElevenLabs और विभिन्न Google मॉडल्स) के विरुद्ध किया। उन्होंने तीन अलग-अलग प्रकार के परीक्षणों का उपयोग किया:
- AISHELL-4: वास्तविक दुनिया की लंबी मीटिंग रिकॉर्डिंग (लगभग ~40 मिनट तक)।
- पॉडकास्ट: कई मेहमानों के साथ उच्च-गुणवत्ता वाली, लंबी इंटरव्यू।
- मूवीज़: तेज़, ओवरलैपिंग संवाद वाली छोटी क्लिप्स।
परिणाम प्रभावशाली थे। लगभग हर परीक्षण में, MOSS Transcribe Diarize ने प्रतिस्पर्धा की तुलना में कम गलतियाँ कीं।
- सटीकता (Accuracy): इसने शब्दों को अधिक बार सही बताया (कम Character Error Rate)।
- पहचान (Identity): यह ट्रैक रखने में बहुत बेहतर था कि किसने क्या कहा। शोधकर्ताओं ने इसे Δcp (शब्द त्रुटियों और स्पीकर त्रुटियों के बीच का अंतर) नामक मीट्रिक से मापा। कम संख्या का अर्थ है कि मॉडल इस बात में भ्रमित नहीं हुआ कि कौन बोल रहा है। MOSS Transcribe Diarize का Δcp स्कोर सबसे कम था, जिसका अर्थ है कि इसने लंबी, अव्यवस्थित बातचीत में भी स्पीकर की पहचान को सुसंगत रखा।
- लॉन्ग-फॉर्म क्षमता: जबकि कुछ प्रसिद्ध व्यावसायिक मॉडल (जैसे GPT-4o और Gemini 3 Pro) लंबी ऑडियो फाइलों को प्रोसेस करने में विफल रहे या सही फॉर्मेट आउटपुट नहीं कर सके, MOSS Transcribe Diarize ने बिना किसी परेशानी के पूरे 90 मिनट के इनपुट को संभाला।
यह क्यों महत्वपूर्ण है
पेपर सुझाव देता है कि स्पीच रिकग्निशन और स्पीकर आइडेंटिफिकेशन को एक एकीकृत प्रणाली के साथ एक लंबी मेमोरी के साथ जोड़कर, हम बहुत अधिक विश्वसनीय ट्रांसक्रिप्ट प्राप्त कर सकते हैं। मॉडल साबित करता है कि आपको ऑडियो को समझने के लिए उसे काटने की आवश्यकता नहीं है; आप पूरी बातचीत को एक साथ सुन सकते हैं और फिर भी विवरणों को सही रख सकते हैं।
लेखक सावधानी से नोट करते हैं कि हालांकि उनका मॉडल एक महत्वपूर्ण कदम है, लेकिन यह कोई जादुई छड़ी नहीं है जो हर समस्या को पूरी तरह से हल कर दे। वे अभी भी सुधार के लिए गुंजाइश देखते हैं, जैसे कि सिस्टम को रियल-टाइम (स्ट्रीमिंग) में काम करने के लिए बनाना और और भी अधिक भाषाओं को संभालना। लेकिन फिलहाल, उन्होंने दिखाया है कि एक एकल, एकीकृत मस्तिष्क दो अलग-अलग रोबोटों का काम कर सकता है, और बेहतर तरीके से कर सकता है, खासकर जब बातचीत लंबी और जटिल हो जाती है।
कोड और मॉडल अब किसी के भी उपयोग के लिए खुले हैं, जो GitHub और Hugging Face पर उपलब्ध हैं, दूसरों को यह देखने के लिए आमंत्रित करते हैं कि क्या वे इस नए आधार पर और भी बेहतर उपकरण बना सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।