← नवीनतम पेपर
🤖 AI

UAF: A Unified Audio Front-end LLM for Full-Duplex Speech Interaction

यह शोध पत्र UAF का प्रस्ताव करता है, जो पहला एकीकृत ऑडियो फ्रंट-एंड लार्ज लैंग्वेज मॉडल है जो वॉयस एक्टिविटी डिटेक्शन, टर्न-टेकिंग और स्पीच रिकग्निशन जैसे विविध कार्यों को एक एकल ऑटो-रिग्रेसिव सीक्वेंस प्रेडिक्शन समस्या के रूप में पुनर्गठित करता है ताकि निर्बाध, कम-विलंबता वाले फुल-डुप्लेक्स स्पीच इंटरैक्शन को सक्षम बनाया जा सके।

मूल लेखक: Yadong Li, Guoxin Wu, Haiping Hou, Biye Li

प्रकाशित 2026-04-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yadong Li, Guoxin Wu, Haiping Hou, Biye Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शोर-शराबे वाली पार्टी में अपने दोस्त के साथ एक जीवंत बातचीत कर रहे हैं। आप आपस में बात कर सकते हैं, सुन सकते हैं, एक-दूसरे की बात काट सकते हैं, और यहाँ तक कि वे अभी बोल ही रहे हों तभी "हूँ-हाँ" भी कह सकते हैं, और यह सब बिना किसी रुकावट के होता है। इसे फुल-डुप्लेक्स (full-duplex) संचार कहा जाता है, और इंसान इसी तरह स्वाभाविक रूप से बात करते हैं।

अब, कल्पना कीजिए कि आप एक ऐसा रोबोट बनाने की कोशिश कर रहे हैं जो बिल्कुल ऐसा ही कर सके। सालों तक, इंजीनियरों ने इन रोबोटों को एक "कन्वेयर बेल्ट" सिस्टम (एक कैस्केडेड पाइपलाइन) का उपयोग करके बनाया। यहाँ बताया गया है कि वह पुराना सिस्टम कैसे काम करता था:

  1. शोर फ़िल्टर (The Noise Filter): पहले, एक मशीन आवाज़ को साफ़ करने की कोशिश करती है (बैकग्राउंड शोर को हटाना)।
  2. VAD (वॉयस एक्टिविटी डिटेक्टर): दूसरी मशीन सुनती है और कहती है, "क्या कोई बोल रहा है?"
  3. स्पीकर आईडी (The Speaker ID): तीसरी मशीन पूछती है, "क्या यह हमारा दोस्त बोल रहा है, या कोई अजनबी?"
  4. ट्रांसक्राइबर (The Transcriber): चौथी मशीन जो कहा गया उसे लिख देती है।
  5. दिमाग (The Brain): पाँचवीं मशीन (AI) लिखे हुए टेक्स्ट को पढ़ती है और तय करती है कि क्या कहना है।
  6. स्पीकर (The Speaker): छठी मशीन उस टेक्स्ट को वापस आवाज़ में बदल देती है।

समस्या: यह कन्वेयर बेल्ट धीमा और अनाड़ी है। यदि "शोर फ़िल्टर" कोई छोटी सी गलती करता है, तो "ट्रांसक्राइबर" भ्रमित हो जाता है, और "दिमाग" एक अजीब सा जवाब देता है। साथ ही, क्योंकि ये मशीनें एक के बाद एक काम करती हैं, रोबोट हमेशा कुछ सेकंड पीछे रहता है। यदि आप उसे "रुको!" कहकर टोकने की कोशिश करते हैं, तो वह आपके पहले वाक्य को प्रोसेस करने में लगा रहता है और आपके कमांड को पूरी तरह से मिस कर देता है।

नया समाधान: UAF (द "सुपर-लिसनर")

यह पेपर UAF (यूनिफाइड ऑडियो फ्रंट-एंड LLM) को पेश करता है। छह अलग-अलग मशीनों वाले कन्वेयर बेल्ट के बजाय, UAF एक एकल, सुपर-इंटेलिजेंट कंडक्टर की तरह है जो सब कुछ एक साथ करता है।

यहाँ बताया गया है कि UAF कैसे काम करता है, सरल उपमाओं का उपयोग करके:

1. "रेफरेंस फोटो" (स्पीकर एंकरिंग)

कल्पना कीजिए कि आप एक भीड़भाड़ वाली पार्टी में हैं और आपको अपने दोस्त, एलेक्स को ढूँढना है।

  • पुराना तरीका: आप पूरे कमरे को स्कैन करते हैं, शोर को फ़िल्टर करने की कोशिश करते हैं, और फिर अंदाज़ा लगाते हैं कि कौन बोल रहा है।
  • UAF का तरीका: पार्टी शुरू होने से पहले, आप रोबोट को एलेक्स की एक फोटो (एक "रेफरेंस ऑडियो प्रॉम्प्ट") दिखाते हैं। अब, रोबोट केवल किसी भी व्यक्ति को नहीं सुनता; वह एलेक्स की आवाज़ पर पूरी तरह केंद्रित है जो उस फोटो से मेल खाती है। वह बाकी सभी को अनदेखा कर देता है, भले ही वे एलेक्स के ठीक बगल में चिल्ला रहे हों।

2. "जादुई अनुवादक" (यूनिफाइड टास्क)

शोर साफ करने, आवाज़ पहचानने और टेक्स्ट लिखने के लिए अलग-अलग मशीनों के बजाय, UAF ऑडियो को गुप्त कोडों की एक धारा (stream of secret codes) की तरह मानता है।

  • हर 0.6 सेकंड में (आवाज़ का एक छोटा सा हिस्सा), रोबट आवाज़ को देखता है और तुरंत कोडों की एक स्ट्रिंग (टोकन) की भविष्यवाणी करता है।
  • ये कोड रोबोट को बताते हैं:
    • "क्या एलेक्स बोल रहा है?" (वॉयस एक्टिविटी डिटेक्शन)
    • "क्या यह सिर्फ बैकग्राउंड शोर है?" (नॉइज़ सप्रेशन)
    • "क्या एलेक्स ने अपना वाक्य पूरा कर लिया है?" (टर्न-टेकिंग)
    • "एलेक्स ने क्या कहा?" (स्पीच रिकग्निशन)
    • "क्या मुझे 'स्टॉप' कहने के लिए सिस्टम को बीच में रोकना चाहिए?" (इंटरप्शन)

यह सब वह एक साथ करता है, जैसे एक संगीतकार एक जटिल शीट म्यूजिक को पढ़ रहा हो और एक-एक करके नोट्स बजाने के बजाय, धुन, लय और उतार-चढ़ाव को एक साथ बजा रहा हो।

3. "विनम्रता से टोकने वाला" (फुल-डुप्लेक्स)

क्योंकि UAF बहुत तेज़ और एकीकृत है, यह इंटरप्शन (बीच में टोकना) को स्वाभाविक रूप से संभाल सकता है।

  • पुराना रोबोट: आप बोलते हैं "रुको!" जब वह बोल रहा होता है। वह अपना वाक्य पूरा करता है, फिर उसे पता चलता है कि आपने बोला, और फिर रुकता है। आपको लगता है कि आपकी बात अनसुनी कर दी गई।
  • UFF रोबोट: आप "रुको!" कहते हैं और वह इसे तुरंत सुन लेता है, अपने वाक्य के बीच में ही अपनी आवाज़ रोक देता है, और आपकी बात सुनने लगता है। यह ऐसा महसूस कराता है जैसे आप किसी वास्तविक इंसान से बात कर रहे हों जो बारी-बारी से बात करना जानता है।

यह इतनी बड़ी बात क्यों है?

पेपर दिखाता है कि इन सभी चरणों को एक विशाल "दिमाग" (ऑडियो पर प्रशिक्षित एक लार्ज लैंग्वेज मॉडल) में मिलाकर, रोबोट बनता है:

  • तेज़: आवाज़ को एक मशीन से दूसरी मशीन तक ले जाने के लिए कन्वेयर बेल्ट के चलने का इंतज़ार नहीं करना पड़ता।
  • स्मार्टर: यह संदर्भ (context) को समझता है। यदि आप कहते हैं "मैं सोच रहा हूँ..." (एक ठहराव), तो वह जानता है कि अभी आपको टोकना नहीं है। यदि आप कहते हैं "रुको!", तो वह जानता है कि बातचीत को तुरंत काट देना है।
  • मजबूत (Robust): शोर भरे कमरे में भी जहाँ अन्य लोग बात कर रहे हों, वह आपकी दोस्त की आवाज़ को सुन सकता है क्योंकि वह उस "रेफरेंस फोटो" का उपयोग करके सही आवाज़ पर लॉक हो जाता है।

निचोड़ (The Bottom Line)

पुराने सिस्टम को एक रिले रेस में बैटन (बैटन) पास करने वाली विशेषज्ञों की टीम के रूप में सोचें। यदि एक व्यक्ति बैटन गिरा देता है, तो पूरी दौड़ बर्बाद हो जाती है।

UAF एक एकल सुपरहीरो की तरह है जो एक ही समय में दौड़ सकता है, उड़ सकता है और सोच सकता है। यह केवल आवाज़ को "सुनता" नहीं है; यह एक ही पल में इरादे (intent), वक्ता (speaker), और बातचीत के प्रवाह (conversation flow) को समझता है। यह उन AI सहायकों की ओर पहला कदम है जो कंप्यूटर से कम और स्वाभाविक बातचीत के साथी की तरह अधिक महसूस होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →