DuplexChat: Constructing Speaker-Separated Full-Duplex Dialogue Speech at Scale for Spoken Dialogue Language Modeling
यह शोधपत्र DuplexChat को प्रस्तुत करता है, जो अंग्रेजी और जापानी में वक्ता-पृथक फुल-डुप्लेक्स संवाद भाषण का एक बड़े पैमाने का ओपन-सोर्स कॉर्पस है, जिसे स्पोकन डायलॉग लैंग्वेज मॉडल्स के लिए उपयुक्त प्रशिक्षण डेटा की कमी को दूर करने हेतु सार्वजनिक पॉडकास्ट से DuplexChat-Pipe पाइपलाइन के माध्यम से निर्मित किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक स्वाभाविक, मानव जैसी बातचीत करना सिखाना चाहते हैं। समस्या यह है कि रोबोट को सिखाने के लिए हमारे पास जो अधिकांश "पाठ्यपुस्तकें" उपलब्ध हैं, वे एक फोन कॉल पर एक अकेले व्यक्ति को बात करते हुए सुनने जैसी हैं, जहाँ आप यह नहीं बता सकते कि जब दो लोग एक साथ बोल रहे हों तो कौन बोल रहा है। यह एक अस्त-व्यस्त, मिला-जुला ऑडियो ट्रैक है।
एक रोबोट को वास्तविक बातचीत की कला सिखाने के लिए—जहाँ लोग एक-दूसरे को टोकते हैं, दूसरे व्यक्ति के बोलते समय "हूँ-हाँ" कहते हैं, और तेज़ी से आगे-पीछे बात करते हैं—आपको एक विशेष प्रकार के प्रशिक्षण डेटा की आवश्यकता है: दो अलग-अलग ऑडियो स्ट्रीम, प्रत्येक व्यक्ति के लिए, जो पूरी तरह से सिंक्रोनाइज़ (एक ही समय पर) हों।
यह पेपर DuplexChat पेश करता है, जो ऐसी बातचीत का एक विशाल नया पुस्तकालय है, और DuplexChat-Pipe, वह जादुई मशीन जिसने इसे बनाया है।
समस्या: "स्मूदी" बनाम "फ्रूट बाउल" (फलों का कटोरा)
मौजूदा सार्वजनिक स्पीच डेटा (जैसे पॉडकास्ट) को एक विशाल फ्रूट स्मूदी के रूप में सोचें। आपके पास सेब (वक्ता A), संतरे (वक्ता B), और शायद आइसक्रीम (संगीत या विज्ञापन) सब एक ही कप में मिले हुए हैं। आप फल का स्वाद तो ले सकते हैं, लेकिन आप सेब को संतरे से अलग करके उनका व्यक्तिगत अध्ययन नहीं कर सकते।
एक रोबोट को स्वाभाविक बातचीत सीखने के लिए, उसे एक फ्रूट बाउल की आवश्यकता है जहाँ प्रत्येक फल अपने अलग कटोरे में हो। अब तक, इस "फ्रूट बाउल" को बड़े पैमाने पर प्राप्त करना लगभग असंभव था क्योंकि इसके लिए आमतौर पर लोगों को फोन कॉल रिकॉर्ड करने के लिए काम पर रखना पड़ता था, जो धीमा और महंगा है।
समाधान: "DuuxChat-Pipe" फैक्ट्री
लेखकों ने एक ओपन-सोर्स फैक्ट्री बनाई है जिसे DuplexChat-Pipe कहा जाता है, जो "स्मूदी" (इंटरनेट से सार्वजनिक पॉडकास्ट फीड) को लेती है और जादुई रूप से उसे वापस "फ्रोट बाउल" में व्यवस्थित करती है। यह फैक्ट्री कैसे काम करती है, यहाँ चरण-दर-चरण दिया गया है:
- सामग्री खोजना (फीड संग्रह): फैक्ट्री इंटरनेट को पॉडकास्ट RSS फीड (जैसे शो की खरीदारी सूची) के लिए स्कैन करती है और उन फीड्स को हटा देती है जो अंग्रेजी या जापानी में नहीं हैं।
- फलों को धोना (ऑडियो रिट्रीवल और सफाई): यह ऑडियो एपिसोड डाउनलोड करती है। यदि कोई शो केवल संगीत है, या यदि कोई एपिसोड तीन घंटे से अधिक लंबा है (आमतौर पर एक लंबा संगीत स्ट्रीम), तो उसे बाहर निकाल दिया जाता है। शेष ऑडियो को साफ किया जाता है और मानकीकृत किया जाता है।
- सही टुकड़े काटना (डायलॉग सेगमेंटेशन): फैक्ट्री एक स्मार्ट "स्पीकर डिटेक्टर" (डायराइजेशन) का उपयोग करती है ताकि पॉडकास्ट के उन हिस्सों को खोजा जा सके जहाँ ठीक दो लोग बात कर रहे हैं। यह संगीत, विज्ञापनों और उन हिस्सों को काट देती है जहाँ केवल एक व्यक्ति भाषण दे रहा होता है। यह केवल "दो-व्यक्ति चैट" क्लिप्स को रखती है।
- जादुय अलगाव (स्पीच सेपरेशन और रिस्टोरेशन): यह सबसे महत्वपूर्ण चरण है। फैक्ट्री एक विशेष AI मॉडल (DialogueSidon) का उपयोग करती है जो मिश्रित ऑडियो (स्मूदी) को लेकर उसे वापस दो अलग-अलग ट्रैक्स में विभाजित करती है: एक बाईं ओर के व्यक्ति के लिए और दूसरा दाईं ओर के व्यक्ति के लिए। यह शोर को भी साफ करती है, जिससे आवाजें स्पष्ट और सुस्पष्ट हो जाती हैं।
परिणाम: बातचीत का एक विशाल पुस्तकालय
इस पाइपलाइन को चलाकर, लेखकों ने DuplexChat बनाया, जो वर्तमान में दुनिया में अपने प्रकार का सबसे बड़ा संसाधन है।
- अंग्रेजी: दो-व्यक्ति बातचीत के 282,000 से अधिक घंटे।
- जापानी: दो-व्यक्ति बातचीत के 132,000 से अधिक घंटे।
इसे समझने के लिए, पिछले बड़े डेटासेट एक छोटे पुस्तकालय की तरह थे; DuplexChat 'लाइब्रेरी ऑफ कांग्रेस' की तरह है।
क्या यह काम करता है? (स्वाद परीक्षण)
लेखकों ने यह जांचने के लिए कि क्या उनका "फ्रूट बाउल" वास्तव में अच्छी गुणवत्ता का है, इसकी तुलना गोल्ड स्टैंडर्ड, एक डेटासेट Fisher (जिसमें वास्तविक फोन कॉल शामिल हैं) से की।
- ध्वनि की गुणवत्ता: DuplexChat में आवाजें वास्तव में फोन कॉल रिकॉर्डिंग की तुलना में अधिक साफ और कम शोर वाली हैं।
- अलगाव: AI ने दोनों आवाजों को अलग रखने में बहुत अच्छा काम किया, हालांकि यह अंग्रेजी के लिए जापानी की तुलना में थोड़ा बेहतर काम करता था (संभवतः इसलिए क्योंकि सेपरेशन टूल को अंग्रेजी डेटा पर अधिक प्रशिक्षित किया गया था)।
- यथार्थवाद: उन्होंने इन रिकॉर्डिंग में लोगों के बात करने के तरीके का विश्लेषण किया। उन्होंने पाया कि इन बातचीत में मानव भाषण का स्वाभाविक "नृत्य" है: लोग एक-दूसरे को टोकते हैं, बैकचैनल (जैसे "हाँ" या "सही है") का उपयोग करते हैं, और बारी-बारी से जल्दी बात बदलते हैं। उदाहरण के लिए, जापानी डेटा ने और भी अधिक बार होने वाले व्यवधानों और ओवरलैपिंग स्पीच को दिखाया, जो इस संस्कृति में वास्तविक मानवीय व्यवहार से मेल खाता है।
मुख्य निष्कर्ष
पेपर का दावा है कि DuplexChat-Pipe पहला खुला, पुन: प्रयोज्य उपकरण है जो इंटरनेट के अराजक, मिश्रित ऑडियो को एक साफ, अलग, दो-व्यक्ति बातचीत डेटासेट में बड़े पैमाने पर बदल सकता है। परिणामी DuplexChat डेटासेट उस "फ्रूट बाउल" को प्रदान करता है जिसकी आवश्यकता अगली पीढ़ी के AI को प्रशिक्षित करने के लिए है, जो मनुष्यों के साथ एक स्वाभाविक, आगे-पीछे की बातचीत कर सके, और वास्तविक भाषण की जटिल, ओवरलैपिंग और जीवंत गतिशीलता को पकड़ सके।
नोट: लेखक सावधानी बरतते हुए कहते हैं कि चूंकि उन्होंने यह डेटा सार्वजनिक इंटरनेट से स्क्रैप किया है, इसलिए उन्होंने कॉपीराइट कानूनों का सम्मान करने के लिए ऑडियो फ़ाइलों के बजाय केवल ऑडियो के "लिंक" और इसे फिर से बनाने के लिए कोड जारी किया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।