← नवीनतम पेपर
💬 NLP

Liberating LLM Capabilities in Full-Duplex Speech Models

यह शोध पत्र Listen-Write-Speak (LWS) को प्रस्तुत करता है, जो एक नवीन टेक्स्ट-फर्स्ट ट्राई-चैनल प्रतिमान (paradigm) है जो बिना किसी संरचनात्मक परिवर्तन के एक साझा ऑटोरेग्रेसिव LLM का उपयोग करके फुल-डुप्लेक्स स्पीच मॉडल्स को वास्तविक समय में सुनने, दृश्यमान संरचित टेक्स्ट लिखने और बोलने में सक्षम बनाता है, जिससे संवादात्मक उत्तरदायित्व बनाए रखते हुए कोड जनरेशन और संरचित तर्क जैसी टेक्स्ट-नेटिव क्षमताओं के द्वार खुलते हैं।

मूल लेखक: Luoyuan Zhang, Bokai Xu, Junbo Cui, Weiyue Sun, Yingjing Xu, Hanyu Liu, Yuan Yao

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Luoyuan Zhang, Bokai Xu, Junbo Cui, Weiyue Sun, Yingjing Xu, Hanyu Liu, Yuan Yao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अत्यंत बुद्धिमान सहकर्मी के साथ बैठक में हैं, जो एक कुशल टाइपिंग मास्टर भी है। वर्तमान में, अधिकांश AI वॉयस असिस्टेंट ऐसे सहकर्मियों की तरह हैं जो केवल बोल सकते हैं। यदि आप उनसे कोई जटिल कंप्यूटर प्रोग्राम लिखने या विस्तृत चार्ट बनाने के लिए कहते हैं, तो उन्हें इसे बोलकर समझाना पड़ता है: "ठीक है, पहले एक फंक्शन से शुरू करें, फिर एक वेरिएबल परिभाषित करें..." यह धीमा है, समझने में कठिन है, और यदि आप इसे सुरक्षित रखना चाहते हैं तो आपको इसे स्वयं लिखना पड़ता है।

यह शोध पत्र AI के बात करने के एक नए तरीके को पेश करता है जिसे Listen-Write-Speak (LWS) कहा जाता है। इस नए AI के बारे में सोचें जो तीन काम एक साथ, पूरी तरह से तालमेल के साथ करता है:

  1. Listen (सुनना): वे आपको वास्तविक समय (real-time) में सुनते हैं, भले ही वे आपसे बात कर रहे हों।
  2. Write (लिखना): जैसे-जैसे वे सुनते और सोचते हैं, वे अपने विचारों, कोड या संरचित नोट्स को आपके सामने एक स्क्रीन पर एक साथ टाइप करते जाते हैं।
  3. Speak (बोलना): उसी समय, वे जो कुछ भी टाइप कर रहे हैं, उसका एक स्वाभाविक, संवादात्मक सारांश बोलकर सुनाते हैं।

"थ्री-लेन हाईवे" का उदाहरण

लेखक इसे एक त्रि-चैनल प्रतिमान (tri-channel paradigm) के रूप में वर्णित करते हैं। कल्पना कीजिए कि एक तीन लेन वाला हाईवे है जहाँ यातायात एक दिशा में (बातचीत की समयरेखा में) बह रहा है:

  • लेन 1 (सुनना): यह लेन हमेशा खुली रहती है। AI आपको सुनना कभी बंद नहीं करता, भले ही वह बोल रहा हो। यह इसे "फुल-डुप्लेक्स" इंटरेक्शन की अनुमति देता है, जिसका अर्थ है कि आप AI को बीच में टोक सकते हैं, और वह भ्रमित नहीं होगा या रुक नहीं जाएगा।
  • लेन 2 (दृश्य लेखन/Visible Writing): यह "सोचने" वाली लेन है। अपने विचारों को एक ब्लैक बॉक्स के अंदर छिपाकर रखने के बजाय, AI उन्हें एक स्क्रीन पर टाइप करता है। यदि आप पायथन स्क्रिप्ट मांगते हैं, तो कोड तुरंत स्क्रीन पर दिखाई देता है। यदि आप मीटिंग का सारांश मांगते हैं, तो एक व्यवस्थित तालिका (table) दिखाई देती है। यह "फर्स्ट-क्लास" आउटपुट है, जिसका अर्थ है कि यह उनके काम को दिखाने का मुख्य तरीका है।
  • लेन 3 (बोलना): यह लेन आवाज लेकर चलती है। AI जो कुछ भी टाइप कर रहा है, उसका एक सरल, बोला जाने वाला संस्करण पढ़ता है ताकि आप विवरण पढ़ने के साथ-साथ उसका उत्तर सुन सकें।

यह कैसे काम करता है (जादुई ट्रिक)

शोध पत्र का दावा है कि इसके लिए किसी बिल्कुल नए, जटिल रोबोटिक दिमाग को बनाने की आवश्यकता नहीं है। इसके बजाय, उन्होंने एक चतुर टोकन स्कीमा (Token Schema) का उपयोग किया है।

AI की आंतरिक भाषा को लेगो ब्लॉक्स (Lego bricks) के एक सेट के रूप में सोचें। आमतौर पर, ये ब्लॉक्स केवल बोलने के काम आते हैं। शोधकर्ताओं ने विशेष "निर्देश ब्लॉक्स" (जैसे <unit>, <ls_cogn>, और <speak>) का आविष्कार किया है जो AI को बताते हैं: "अभी, आप 1-सेकंड के टाइम ब्लॉक में हैं। इस ब्लॉक में, आपको इस ऑडियो को सुनना होगा, यह टेक्स्ट टाइप करना होगा, और यह वाक्य बोलना होगा।"

बातचीत को इन छोटे, 1-सेकंड के "टाइम ब्लॉक्स" (Units) में व्यवस्थित करके, AI इन तीनों कार्यों को बिना उलझे संभाल सकता है। यह एक कंडक्टर की तरह है जो एक ऑर्केस्ट्रा को निर्देश दे रहा है: "अगले एक सेकंड के लिए, वायलिन बजेगा, बांसुरी बजेगी, और पर्कशनिस्ट ड्रम बजाएगा, और यह सब ठीक एक ही समय पर होगा।"

उन्होंने क्या पाया

शोधकर्ताओं ने इस नए AI का अन्य वॉयस मॉडल्स के मुकाबले परीक्षण किया और पाया:

  • यह एक बेहतर मल्टीटास्कर है: उन परीक्षणों पर जो यह मापते हैं कि AI बात करते समय कितनी अच्छी तरह समझता है और तर्क देता है, LWS ने उन मॉडल्स की तुलना में उच्च स्कोर किया जो या तो केवल बोलते हैं या बोलने से पहले केवल सोचते हैं।
  • यह सुसंगत (consistent) है: AI ने ऐसी कोई बात नहीं कही जो उसके लिखे हुए से अलग हो। 92.6% मामलों में, जो उसने बोला वह उसके लिखे हुए से पूरी तरह मेल खाता था।
  • यह बाधाओं (interruptions) को अच्छी तरह संभालता है: क्योंकि यह बोलते समय भी सुनता रहता है, यदि आप इसे बीच में टोकते हैं, तो यह बिना क्रैश हुए या आपके समाप्त होने का इंतज़ार किए बिना सहजता से बदलाव को संभाल सकता है।

मुख्य निष्कर्ष

यह शोध पत्र तर्क देता है कि AI को यह बताने की अनुमति देकर कि वह क्या सोच रहा है, हमें दोनों दुनियाओं का सर्वश्रेष्ठ मिलता है: आवाज संवाद की गति और स्वाभाविकता, साथ ही लिखित पाठ (जैसे कोड या डेटा टेबल) की सटीकता और संरचना। यह AI को एक "बोलते हुए सिर" से बदलकर एक "सहयोगी साथी" में बदल देता है जो काम के दौरान अपना काम दिखाता है।

सीमाओं पर नोट: लेखक स्वीकार करते हैं कि चूंकि AI को यह सब वास्तविक समय में (हर सेकंड) करना पड़ता है, इसलिए यह उन अत्यंत लंबी, जटिल योजना संबंधी कार्यों के लिए सबसे अच्छा नहीं हो सकता है जिनमें बोलने से पहले घंटों गहरे चिंतन की आवश्यकता होती है। साथ ही, वर्तमान में, यह केवल वॉयस इनपुट स्वीकार करता है, इमेज या फाइल्स नहीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →