DuplexCascade: Full-Duplex Speech-to-Speech Dialogue with VAD-Free Cascaded ASR-LLM-TTS Pipeline and Micro-Turn Optimization
DuplexCascade एक VAD-मुक्त, कैस्केड किया हुआ ASR-LLM-TTS पाइपलाइन है जो लंबे टर्न्स को माइक्रो-टर्न्स में बदलकर और टर्न-टेकिंग को समन्वित करने के लिए विशेष कंट्रोल टोकन का उपयोग करके फुल-डुप्लेक्स स्पीच-टू-स्पीच संवाद को सक्षम बनाता है, जबकि बड़े भाषा मॉडलों की संवादात्मक बुद्धिमत्ता को भी सुरक्षित रखता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े सख्त स्वभाव वाले रोबोट के साथ बातचीत कर रहे हैं।
पुराना तरीका (द "स्टॉप-एंड-गो" रोबोट):
वर्तमान में, अधिकांश वॉयस असिस्टेंट "रेड लाइट, ग्रीन लाइट" के खेल की तरह काम करते हैं। आप बोलते हैं, आप रुकते हैं, और फिर रोबट सुनता है। यह एक मोशन सेंसर (जिसे VAD कहा जाता है) का उपयोग करता है ताकि यह पता लगाया जा सके कि आपने बोलना कब बंद किया। यदि आप सोचने के लिए एक सेकंड के लिए रुकते हैं, तो रोबोट समझ लेता है कि आप खत्म हो गए हैं और बीच में बोल पड़ता है। यदि आप उसे टोकते हैं, तो वह भ्रमित हो जाता है और बोलता रहता है। यह एक हाफ-डुप्लेक्स सिस्टम है: एक व्यक्ति बोलता है, दूसरा सुनता है, फिर वे आपस में बदलते हैं। यह काफी सख्त और अप्राकृतिक लगता है, जैसे खराब कनेक्शन वाली एक बुरी फोन कॉल।
नया तरीका (द "डुप्लेक्सकैस्केड" रोबोट):
यह पेपर DuplexCascade पेश करता है, जो वॉयस असिस्टेंट बनाने का एक नया तरीका है जो एक वास्तविक, सहज मानवीय बातचीत जैसा महसूस कराता है। यह आपको फुल-डुप्लेक्स इंटरेक्शन की अनुमति देता है, जिसका अर्थ है कि आप और रोबोट स्वाभाविक रूप से एक-दूसरे से बात कर सकते हैं, सुन सकते हैं और एक-दूसरे को टोक सकते हैं, ठीक वैसे ही जैसे कॉफी शॉप में दो दोस्त चैट कर रहे हों।
यह इस प्रकार काम करता है, कुछ सरल उपमाओं का उपयोग करते हुए:
1. द "माइक्रो-टर्न" एनालॉजी: बातचीत को छोटे टुकड़ों में काटना
कल्पना कीजिए कि एक लंबा वाक्य ब्रेड का एक पूरा लोफ (loaf) है।
- पुराना तरीका: रोबोट आपके पूरे वाक्य (पूरे लोफ) के बनने का इंतज़ार करता है (आपके पूरा बोलने का इंतज़ार करता है) इससे पहले कि वह जवाब देने के बारे में सोच भी सके।
- DuplexCascade: रोबोट ब्रेड को छोटे-छोटे टुकड़ों (जिन्हें माइक्रो-टर्न्स कहा जाता है) में काट देता है। हर 0.6 सेकंड में, वह आपके द्वारा बोले गए शब्दों का एक ताज़ा टुकड़ा लेता है और तुरंत उसे प्रोसेस करता है।
आपकी पूरी कहानी के खत्म होने का इंतज़ार करने के बजाय, रोबोट आपके बोलने के दौरान ही आपको सुन रहा होता है। वह बहुत छोटे, तीव्र झटकों (bursts) में आपकी समझ को अपडेट करता है।
2. द "ट्रैफिक कोप" टोकन्स: विशेष इशारे
रोबोट को यह जानने की आवश्यकता है कि बिना भ्रमित हुए इन छोटे टुकड़ों के साथ क्या करना है। लेखकों ने रोबोट को विशेष संकेतों (जिन्हें कन्वर्सेशनल टोकन्स कहा जाता है) की एक गुप्त भाषा सिखाई है।
इन्हें बातचीत के लिए ट्रैफिक लाइट की तरह समझें:
- <यूज़र बोल रहा है>: रोबोट इसे देखता है और कहता है, "ठीक है, मैं चुप रहूँगा और सुनूँगा।"
- <यूज़र बोलना समाप्त करता है>: रोबोट यह देखता है और कहता है, "आह, आप खत्म हो गए! अब मेरी बारी बोलने की।"
- <यूज़र टोक रहा है/इंटरप्ट कर रहा है>: यदि आप रोबोट को बीच में टोकते हैं, तो यह संकेत रोबोट को बताता है, "तुरंत बोलना बंद करो! मेरे पास कुछ नया कहने के लिए है।"
- <सिस्टम बैकचैनल>: यह रोबोट का तरीका है जब वह आपकी बात के दौरान "हूँ-हाँ" या "अम्म-हम्म" कहता है, ताकि वह अपनी बात छीने बिना यह दिखा सके कि वह सुन रहा है।
इन संकेतों का उपयोग करके, रोबोट को यह अनुमान लगाने के लिए मोशन सेंसर की आवश्यकता नहीं है कि उसे कब बोलना चाहिए; वह बस टेक्स्ट स्ट्रीम में "ट्रैफिक संकेतों" को पढ़ लेता है।
3. द "स्मार्ट ब्रेन" बनाम "कान"
वॉयस रोबोट्स की एक बड़ी समस्या यह है कि यदि वे एक ही समय में "सुनने और बोलने" की कोशिश करते हैं, तो वे अक्सर कम बुद्धिमान हो जाते हैं। यह जादू दिखाने के साथ-साथ करतब दिखाने (जगलिंग) जैसा है; आप शायद गेंदें गिरा दें या गणित भूल जाएं।
- समस्या: एंड-टू-एंड रोबोट्स (जो सब कुछ एक साथ करने की कोशिश करते हैं) अक्सर अपनी "बुद्धिमत्ता" खो देते हैं और अच्छी तरह तर्क नहीं कर पाते।
- DuplexCascade का समाधान: उन्होंने रोबोट के "दिमाग" (एक शक्तिशाली टेक्स्ट-आधारित AI जिसे LLM कहा जाता है) को उसके "कानों" और "मुँह" से अलग रखा।
- कान (ASR): सुनते हैं और ऑडियो को छोटे टुकड़ों में काटते हैं।
- दिमाग (LLM): टुकड़ों और ट्रैफिक संकेतों को पढ़ता है। क्योंकि दिमाग अभी भी केवल टेक्स्ट पढ़ रहा है, इसलिए वह बहुत स्मार्ट बना रहता है और ऑडियो के शोर से भ्रमित नहीं होता।
- मुँह (TTS): उत्तर बोलता है।
4. परिणाम: एक स्वाभाविक बातचीत
क्योंकि रोबोट स्मार्ट है (अपने टेक्स्ट ब्रेन की वजह से) और तेज़ है (अपने माइक्रो-टर्न्स की वजह से), वह यह कर सकता है:
- यदि आप उसे टोकते हैं, तो वह विनम्रता से आपको टोक सकता है।
- जब आप बोल रहे होते हैं, तो वह "हूँ-हाँ" कह सकता है।
- यदि आप केवल सोचने के लिए रुकते हैं, तो वह बीच में नहीं बोलेगा।
संक्षेप में:
DuplexCascade एक बुद्धिमान प्रोफेसर (AI ब्रेन) को एक नए तरीके से सुनने के लिए सिखाने जैसा है: आपके पूरे निबंध के खत्म होने का इंतज़ार करने के बजाय, वे वाक्य-दर-वाक्य, शब्द-दर-शब्द सुनते हैं, और यह जानने के लिए विशेष इशारों का उपयोग करते हैं कि उन्हें कब सिर हिलाना है, कब बोलना है, और कब रुकना है। यह एक ऐसी बातचीत बनाता है जो मशीन से बात करने के बजाय एक इंसान से बात करने जैसा महसूस होता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।