← नवीनतम पेपर
⚡ electrical engineering

DuplexChat: Constructing Speaker-Separated Full-Duplex Dialogue Speech at Scale for Spoken Dialogue Language Modeling

यह शोधपत्र DuplexChat को प्रस्तुत करता है, जो अंग्रेजी और जापानी में वक्ता-पृथक फुल-डुप्लेक्स संवाद भाषण का एक बड़े पैमाने का ओपन-सोर्स कॉर्पस है, जिसे स्पोकन डायलॉग लैंग्वेज मॉडल्स के लिए उपयुक्त प्रशिक्षण डेटा की कमी को दूर करने हेतु सार्वजनिक पॉडकास्ट से DuplexChat-Pipe पाइपलाइन के माध्यम से निर्मित किया गया है।

मूल लेखक: Wataru Nakata, Yuki Saito, Hiroshi Saruwatari

प्रकाशित 2026-07-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wataru Nakata, Yuki Saito, Hiroshi Saruwatari

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक स्वाभाविक, मानव जैसी बातचीत करना सिखाना चाहते हैं। समस्या यह है कि रोबोट को सिखाने के लिए हमारे पास जो अधिकांश "पाठ्यपुस्तकें" उपलब्ध हैं, वे एक फोन कॉल पर एक अकेले व्यक्ति को बात करते हुए सुनने जैसी हैं, जहाँ आप यह नहीं बता सकते कि जब दो लोग एक साथ बोल रहे हों तो कौन बोल रहा है। यह एक अस्त-व्यस्त, मिला-जुला ऑडियो ट्रैक है।

एक रोबोट को वास्तविक बातचीत की कला सिखाने के लिए—जहाँ लोग एक-दूसरे को टोकते हैं, दूसरे व्यक्ति के बोलते समय "हूँ-हाँ" कहते हैं, और तेज़ी से आगे-पीछे बात करते हैं—आपको एक विशेष प्रकार के प्रशिक्षण डेटा की आवश्यकता है: दो अलग-अलग ऑडियो स्ट्रीम, प्रत्येक व्यक्ति के लिए, जो पूरी तरह से सिंक्रोनाइज़ (एक ही समय पर) हों।

यह पेपर DuplexChat पेश करता है, जो ऐसी बातचीत का एक विशाल नया पुस्तकालय है, और DuplexChat-Pipe, वह जादुई मशीन जिसने इसे बनाया है।

समस्या: "स्मूदी" बनाम "फ्रूट बाउल" (फलों का कटोरा)

मौजूदा सार्वजनिक स्पीच डेटा (जैसे पॉडकास्ट) को एक विशाल फ्रूट स्मूदी के रूप में सोचें। आपके पास सेब (वक्ता A), संतरे (वक्ता B), और शायद आइसक्रीम (संगीत या विज्ञापन) सब एक ही कप में मिले हुए हैं। आप फल का स्वाद तो ले सकते हैं, लेकिन आप सेब को संतरे से अलग करके उनका व्यक्तिगत अध्ययन नहीं कर सकते।

एक रोबोट को स्वाभाविक बातचीत सीखने के लिए, उसे एक फ्रूट बाउल की आवश्यकता है जहाँ प्रत्येक फल अपने अलग कटोरे में हो। अब तक, इस "फ्रूट बाउल" को बड़े पैमाने पर प्राप्त करना लगभग असंभव था क्योंकि इसके लिए आमतौर पर लोगों को फोन कॉल रिकॉर्ड करने के लिए काम पर रखना पड़ता था, जो धीमा और महंगा है।

समाधान: "DuuxChat-Pipe" फैक्ट्री

लेखकों ने एक ओपन-सोर्स फैक्ट्री बनाई है जिसे DuplexChat-Pipe कहा जाता है, जो "स्मूदी" (इंटरनेट से सार्वजनिक पॉडकास्ट फीड) को लेती है और जादुई रूप से उसे वापस "फ्रोट बाउल" में व्यवस्थित करती है। यह फैक्ट्री कैसे काम करती है, यहाँ चरण-दर-चरण दिया गया है:

  1. सामग्री खोजना (फीड संग्रह): फैक्ट्री इंटरनेट को पॉडकास्ट RSS फीड (जैसे शो की खरीदारी सूची) के लिए स्कैन करती है और उन फीड्स को हटा देती है जो अंग्रेजी या जापानी में नहीं हैं।
  2. फलों को धोना (ऑडियो रिट्रीवल और सफाई): यह ऑडियो एपिसोड डाउनलोड करती है। यदि कोई शो केवल संगीत है, या यदि कोई एपिसोड तीन घंटे से अधिक लंबा है (आमतौर पर एक लंबा संगीत स्ट्रीम), तो उसे बाहर निकाल दिया जाता है। शेष ऑडियो को साफ किया जाता है और मानकीकृत किया जाता है।
  3. सही टुकड़े काटना (डायलॉग सेगमेंटेशन): फैक्ट्री एक स्मार्ट "स्पीकर डिटेक्टर" (डायराइजेशन) का उपयोग करती है ताकि पॉडकास्ट के उन हिस्सों को खोजा जा सके जहाँ ठीक दो लोग बात कर रहे हैं। यह संगीत, विज्ञापनों और उन हिस्सों को काट देती है जहाँ केवल एक व्यक्ति भाषण दे रहा होता है। यह केवल "दो-व्यक्ति चैट" क्लिप्स को रखती है।
  4. जादुय अलगाव (स्पीच सेपरेशन और रिस्टोरेशन): यह सबसे महत्वपूर्ण चरण है। फैक्ट्री एक विशेष AI मॉडल (DialogueSidon) का उपयोग करती है जो मिश्रित ऑडियो (स्मूदी) को लेकर उसे वापस दो अलग-अलग ट्रैक्स में विभाजित करती है: एक बाईं ओर के व्यक्ति के लिए और दूसरा दाईं ओर के व्यक्ति के लिए। यह शोर को भी साफ करती है, जिससे आवाजें स्पष्ट और सुस्पष्ट हो जाती हैं।

परिणाम: बातचीत का एक विशाल पुस्तकालय

इस पाइपलाइन को चलाकर, लेखकों ने DuplexChat बनाया, जो वर्तमान में दुनिया में अपने प्रकार का सबसे बड़ा संसाधन है।

  • अंग्रेजी: दो-व्यक्ति बातचीत के 282,000 से अधिक घंटे।
  • जापानी: दो-व्यक्ति बातचीत के 132,000 से अधिक घंटे।

इसे समझने के लिए, पिछले बड़े डेटासेट एक छोटे पुस्तकालय की तरह थे; DuplexChat 'लाइब्रेरी ऑफ कांग्रेस' की तरह है।

क्या यह काम करता है? (स्वाद परीक्षण)

लेखकों ने यह जांचने के लिए कि क्या उनका "फ्रूट बाउल" वास्तव में अच्छी गुणवत्ता का है, इसकी तुलना गोल्ड स्टैंडर्ड, एक डेटासेट Fisher (जिसमें वास्तविक फोन कॉल शामिल हैं) से की।

  • ध्वनि की गुणवत्ता: DuplexChat में आवाजें वास्तव में फोन कॉल रिकॉर्डिंग की तुलना में अधिक साफ और कम शोर वाली हैं।
  • अलगाव: AI ने दोनों आवाजों को अलग रखने में बहुत अच्छा काम किया, हालांकि यह अंग्रेजी के लिए जापानी की तुलना में थोड़ा बेहतर काम करता था (संभवतः इसलिए क्योंकि सेपरेशन टूल को अंग्रेजी डेटा पर अधिक प्रशिक्षित किया गया था)।
  • यथार्थवाद: उन्होंने इन रिकॉर्डिंग में लोगों के बात करने के तरीके का विश्लेषण किया। उन्होंने पाया कि इन बातचीत में मानव भाषण का स्वाभाविक "नृत्य" है: लोग एक-दूसरे को टोकते हैं, बैकचैनल (जैसे "हाँ" या "सही है") का उपयोग करते हैं, और बारी-बारी से जल्दी बात बदलते हैं। उदाहरण के लिए, जापानी डेटा ने और भी अधिक बार होने वाले व्यवधानों और ओवरलैपिंग स्पीच को दिखाया, जो इस संस्कृति में वास्तविक मानवीय व्यवहार से मेल खाता है।

मुख्य निष्कर्ष

पेपर का दावा है कि DuplexChat-Pipe पहला खुला, पुन: प्रयोज्य उपकरण है जो इंटरनेट के अराजक, मिश्रित ऑडियो को एक साफ, अलग, दो-व्यक्ति बातचीत डेटासेट में बड़े पैमाने पर बदल सकता है। परिणामी DuplexChat डेटासेट उस "फ्रूट बाउल" को प्रदान करता है जिसकी आवश्यकता अगली पीढ़ी के AI को प्रशिक्षित करने के लिए है, जो मनुष्यों के साथ एक स्वाभाविक, आगे-पीछे की बातचीत कर सके, और वास्तविक भाषण की जटिल, ओवरलैपिंग और जीवंत गतिशीलता को पकड़ सके।

नोट: लेखक सावधानी बरतते हुए कहते हैं कि चूंकि उन्होंने यह डेटा सार्वजनिक इंटरनेट से स्क्रैप किया है, इसलिए उन्होंने कॉपीराइट कानूनों का सम्मान करने के लिए ऑडियो फ़ाइलों के बजाय केवल ऑडियो के "लिंक" और इसे फिर से बनाने के लिए कोड जारी किया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →