Liberating LLM Capabilities in Full-Duplex Speech Models
यह शोध पत्र Listen-Write-Speak (LWS) को प्रस्तुत करता है, जो एक नवीन टेक्स्ट-फर्स्ट ट्राई-चैनल प्रतिमान (paradigm) है जो बिना किसी संरचनात्मक परिवर्तन के एक साझा ऑटोरेग्रेसिव LLM का उपयोग करके फुल-डुप्लेक्स स्पीच मॉडल्स को वास्तविक समय में सुनने, दृश्यमान संरचित टेक्स्ट लिखने और बोलने में सक्षम बनाता है, जिससे संवादात्मक उत्तरदायित्व बनाए रखते हुए कोड जनरेशन और संरचित तर्क जैसी टेक्स्ट-नेटिव क्षमताओं के द्वार खुलते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक अत्यंत बुद्धिमान सहकर्मी के साथ बैठक में हैं, जो एक कुशल टाइपिंग मास्टर भी है। वर्तमान में, अधिकांश AI वॉयस असिस्टेंट ऐसे सहकर्मियों की तरह हैं जो केवल बोल सकते हैं। यदि आप उनसे कोई जटिल कंप्यूटर प्रोग्राम लिखने या विस्तृत चार्ट बनाने के लिए कहते हैं, तो उन्हें इसे बोलकर समझाना पड़ता है: "ठीक है, पहले एक फंक्शन से शुरू करें, फिर एक वेरिएबल परिभाषित करें..." यह धीमा है, समझने में कठिन है, और यदि आप इसे सुरक्षित रखना चाहते हैं तो आपको इसे स्वयं लिखना पड़ता है।
यह शोध पत्र AI के बात करने के एक नए तरीके को पेश करता है जिसे Listen-Write-Speak (LWS) कहा जाता है। इस नए AI के बारे में सोचें जो तीन काम एक साथ, पूरी तरह से तालमेल के साथ करता है:
- Listen (सुनना): वे आपको वास्तविक समय (real-time) में सुनते हैं, भले ही वे आपसे बात कर रहे हों।
- Write (लिखना): जैसे-जैसे वे सुनते और सोचते हैं, वे अपने विचारों, कोड या संरचित नोट्स को आपके सामने एक स्क्रीन पर एक साथ टाइप करते जाते हैं।
- Speak (बोलना): उसी समय, वे जो कुछ भी टाइप कर रहे हैं, उसका एक स्वाभाविक, संवादात्मक सारांश बोलकर सुनाते हैं।
"थ्री-लेन हाईवे" का उदाहरण
लेखक इसे एक त्रि-चैनल प्रतिमान (tri-channel paradigm) के रूप में वर्णित करते हैं। कल्पना कीजिए कि एक तीन लेन वाला हाईवे है जहाँ यातायात एक दिशा में (बातचीत की समयरेखा में) बह रहा है:
- लेन 1 (सुनना): यह लेन हमेशा खुली रहती है। AI आपको सुनना कभी बंद नहीं करता, भले ही वह बोल रहा हो। यह इसे "फुल-डुप्लेक्स" इंटरेक्शन की अनुमति देता है, जिसका अर्थ है कि आप AI को बीच में टोक सकते हैं, और वह भ्रमित नहीं होगा या रुक नहीं जाएगा।
- लेन 2 (दृश्य लेखन/Visible Writing): यह "सोचने" वाली लेन है। अपने विचारों को एक ब्लैक बॉक्स के अंदर छिपाकर रखने के बजाय, AI उन्हें एक स्क्रीन पर टाइप करता है। यदि आप पायथन स्क्रिप्ट मांगते हैं, तो कोड तुरंत स्क्रीन पर दिखाई देता है। यदि आप मीटिंग का सारांश मांगते हैं, तो एक व्यवस्थित तालिका (table) दिखाई देती है। यह "फर्स्ट-क्लास" आउटपुट है, जिसका अर्थ है कि यह उनके काम को दिखाने का मुख्य तरीका है।
- लेन 3 (बोलना): यह लेन आवाज लेकर चलती है। AI जो कुछ भी टाइप कर रहा है, उसका एक सरल, बोला जाने वाला संस्करण पढ़ता है ताकि आप विवरण पढ़ने के साथ-साथ उसका उत्तर सुन सकें।
यह कैसे काम करता है (जादुई ट्रिक)
शोध पत्र का दावा है कि इसके लिए किसी बिल्कुल नए, जटिल रोबोटिक दिमाग को बनाने की आवश्यकता नहीं है। इसके बजाय, उन्होंने एक चतुर टोकन स्कीमा (Token Schema) का उपयोग किया है।
AI की आंतरिक भाषा को लेगो ब्लॉक्स (Lego bricks) के एक सेट के रूप में सोचें। आमतौर पर, ये ब्लॉक्स केवल बोलने के काम आते हैं। शोधकर्ताओं ने विशेष "निर्देश ब्लॉक्स" (जैसे <unit>, <ls_cogn>, और <speak>) का आविष्कार किया है जो AI को बताते हैं: "अभी, आप 1-सेकंड के टाइम ब्लॉक में हैं। इस ब्लॉक में, आपको इस ऑडियो को सुनना होगा, यह टेक्स्ट टाइप करना होगा, और यह वाक्य बोलना होगा।"
बातचीत को इन छोटे, 1-सेकंड के "टाइम ब्लॉक्स" (Units) में व्यवस्थित करके, AI इन तीनों कार्यों को बिना उलझे संभाल सकता है। यह एक कंडक्टर की तरह है जो एक ऑर्केस्ट्रा को निर्देश दे रहा है: "अगले एक सेकंड के लिए, वायलिन बजेगा, बांसुरी बजेगी, और पर्कशनिस्ट ड्रम बजाएगा, और यह सब ठीक एक ही समय पर होगा।"
उन्होंने क्या पाया
शोधकर्ताओं ने इस नए AI का अन्य वॉयस मॉडल्स के मुकाबले परीक्षण किया और पाया:
- यह एक बेहतर मल्टीटास्कर है: उन परीक्षणों पर जो यह मापते हैं कि AI बात करते समय कितनी अच्छी तरह समझता है और तर्क देता है, LWS ने उन मॉडल्स की तुलना में उच्च स्कोर किया जो या तो केवल बोलते हैं या बोलने से पहले केवल सोचते हैं।
- यह सुसंगत (consistent) है: AI ने ऐसी कोई बात नहीं कही जो उसके लिखे हुए से अलग हो। 92.6% मामलों में, जो उसने बोला वह उसके लिखे हुए से पूरी तरह मेल खाता था।
- यह बाधाओं (interruptions) को अच्छी तरह संभालता है: क्योंकि यह बोलते समय भी सुनता रहता है, यदि आप इसे बीच में टोकते हैं, तो यह बिना क्रैश हुए या आपके समाप्त होने का इंतज़ार किए बिना सहजता से बदलाव को संभाल सकता है।
मुख्य निष्कर्ष
यह शोध पत्र तर्क देता है कि AI को यह बताने की अनुमति देकर कि वह क्या सोच रहा है, हमें दोनों दुनियाओं का सर्वश्रेष्ठ मिलता है: आवाज संवाद की गति और स्वाभाविकता, साथ ही लिखित पाठ (जैसे कोड या डेटा टेबल) की सटीकता और संरचना। यह AI को एक "बोलते हुए सिर" से बदलकर एक "सहयोगी साथी" में बदल देता है जो काम के दौरान अपना काम दिखाता है।
सीमाओं पर नोट: लेखक स्वीकार करते हैं कि चूंकि AI को यह सब वास्तविक समय में (हर सेकंड) करना पड़ता है, इसलिए यह उन अत्यंत लंबी, जटिल योजना संबंधी कार्यों के लिए सबसे अच्छा नहीं हो सकता है जिनमें बोलने से पहले घंटों गहरे चिंतन की आवश्यकता होती है। साथ ही, वर्तमान में, यह केवल वॉयस इनपुट स्वीकार करता है, इमेज या फाइल्स नहीं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।