← नवीनतम पेपर
💻 computer science

PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction

यह शोध पत्र PS4 को प्रस्तुत करता है, जो एक प्रॉक्सी-सुपरवाइज्ड जॉइंट ट्रेनिंग फ्रेमवर्क है जो वास्तविक लक्ष्य वक्ता (टारगेट स्पीकर) के निष्कर्षण में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए एक बड़े पैमाने के द्विभाषी कॉर्पस और एक मल्टी-ऑब्जेक्टिव फाइन-ट्यूनिंग रणनीति का लाभ उठाता है, जिसमें स्वच्छ लक्ष्य भाषण पर्यवेक्षण की आवश्यकता नहीं होती है।

मूल लेखक: Wanyi Ning, Wei Zhou, Yingpeng Li, Yinshang Guo, Haitao Qian, Yiming Cheng

प्रकाशित 2026-07-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wanyi Ning, Wei Zhou, Yingpeng Li, Yinshang Guo, Haitao Qian, Yiming Cheng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शोर-शराबे वाली डिनर पार्टी में हैं जहाँ हर कोई एक-दूसरे के ऊपर बोल रहा है। आप सिर्फ अपने एक खास दोस्त की कहानी सुनना चाहते हैं, लेकिन आपके ऑडियो रिकॉर्डर ने पूरे कमरे के शोर और आपस में टकराती आवाजों को ही रिकॉर्ड कर लिया है। आमतौर पर, कंप्यूटर को यह सिखाने के लिए कि वह एक विशिष्ट आवाज को कैसे अलग करे, आपको उस दोस्त की एक "साफ" रिकॉर्डिंग की आवश्यकता होती है जो अकेले बात कर रहा हो, ताकि उसे एक शिक्षक के रूप में उपयोग किया जा सके। लेकिन असल जिंदगी में, आपके पास ऐसी साफ रिकॉर्डिंग मिलना दुर्लभ है।

यही वह समस्या है जिसे इस शोध पत्र के लेखकों ने हल किया है। उन्होंने पूछा: हम एक कंप्यूटर को वास्तविक, अस्त-व्यस्त बातचीत से एक एकल वक्ता (speaker) को अलग करना कैसे सिखा सकते हैं, जब हमारे पास उस व्यक्ति की "साफ" आवाज का संस्करण दिखाने के लिए उपलब्ध न हो?

"नकली" अभ्यास की समस्या

कंप्यूटर के अधिकांश प्रोग्राम जो यह काम करते हैं, उन्हें लैब में प्रशिक्षित किया जाता है। शोधकर्ता अकेले बात करने वाले लोगों की साफ रिकॉर्डिंग्स लेते हैं और कृत्रिम रूप से उन्हें शोर बनाने के लिए आपस में मिला देते हैं। यह एक असली फुटबॉल मैच के लिए अभ्यास करने जैसा है जैसे कि एक खाली, आदर्श मैदान में गेंद को इधर-उधर किक मारना। शोध पत्र का तर्क है कि यह दृष्टिकोण तब विफल हो जाता है जब आप वास्तविक मैदान पर कदम रखते हैं, जो हवा, ऊबड़-खाबड़ घास और अप्रत्याशित खिलाड़ियों से भरा होता है। वास्तविक बातचीत में बैकग्राउंड शोर, गूँज और अजीब समय पर लोग बात करना शामिल होता है, जो इस "नकली" प्रशिक्षण को बेकार बना देता है।

PS4 समाधान: सुरागों से सीखना

Yijiahe AI और चीन के विश्वविद्यालयों के शोधकर्ताओं के नेतृत्व वाली टीम ने एक नया सिस्टम बनाया जिसे PS4 कहा जाता है। लक्षित वक्ता की साफ रिकॉर्डिंग की आवश्यकता के बजाय (जो उनके पास नहीं है), उन्होंने कंप्यूटर को एक अस्त-व्यस्त रिकॉर्डिंग के भीतर छिपे सुरागों (clues) से सीखना सिखाया। वे इसे "प्रॉक्सी सुपरविजन" (proxy supervision) कहते हैं।

इसे एक भीड़ भरी, धुंधली फोटो में एक विशिष्ट व्यक्ति को खोजने की कोशिश करने जैसा समझें जिसमें उनके पास स्पष्ट तस्वीर नहीं है। आप उनका चेहरा पूरी तरह से नहीं देख सकते, लेकिन आपके पास अन्य सुराग हैं:

  1. उन्होंने क्या कहा: आपके पास उनके शब्दों का टेक्स्ट ट्रांसक्रिप्ट है।
  2. वे कौन हैं: आपके पास बातचीत के दौरान पहले से मौजूद उनकी आवाज का एक छोटा, स्पष्ट क्लिप है ("एनरोलमेंट")।
  3. उन्होंने कब बोला: आपके पास इस बात का एक मोटा नक्शा है कि किस समय कौन बोल रहा था।
  4. यह कैसा सुनाई देता है: आपके पास इस बात का अंदाजा है कि ऑडियो की गुणवत्ता कितनी "अच्छी" होनी चाहिए।

प्रशिक्षण का आधार बनाना

अपने सिस्टम को सिखाने के लिए, टीम ने केवल अनुमान नहीं लगाया; उन्होंने REAL-PS4 नामक एक विशाल प्रशिक्षण जिम बनाया। उन्होंने चार अलग-अलग सार्वजनिक डेटासेट्स (चीनी और अंग्रेजी मीटिंग्स और डिनर्स को कवर करते हुए) से 71,771 वास्तविक बातचीत के नमूने लिए।

उन्होंने उन्हें केवल मिलाया नहीं। उन्होंने उन्हें सावधानीपूर्वक प्रोसेस किया:

  • उन्होंने नामांकन संदर्भ (enrollment reference) के रूप में उपयोग करने के लिए एकल वक्ताओं के छोटे, स्पष्ट क्लिप खोजे।
  • उन्होंने उन अस्त-व्यस्त हिस्सों को खोजा जहाँ दो या अधिक लोग एक-दूसरे के ऊपर बोल रहे थे, ताकि उन्हें हल करने के लिए "मिश्रण" (mixture) के रूप में उपयोग किया जा सके।
  • उन्होंने खराब नमूनों को फ़िल्टर कर दिया, केवल उन नमूनों को रखा जहाँ लक्षित वक्ता ने कुल समय के 20% से अधिक समय तक बात की थी और उनके ट्रांसक्रिप्ट में कम से कम 2 वैध वर्ण (characters) थे।
  • उन्होंने सुनिश्चित किया कि अस्त-व्यस्त क्लिप बहुत लंबे न हों (अधिकतम 30 सेकंड तक सीमित), ताकि कंप्यूटर उन्हें संभाल सके।

चार-भाग वाली प्रशिक्षण रणनीति

उनकी पद्धति का मूल एक "संयुक्त प्रशिक्षण" (joint training) रणनीति है। उन्होंने केवल कंप्यूटर को यह नहीं बताया कि "आवाज प्राप्त करो।" उन्होंने इसे एक साथ चार अलग-अलग लक्ष्य दिए, जो चार अलग-अलग कोचों की तरह कार्य करते हैं:

  1. भाषाई कोच (ASR): कंप्यूटर को यह सुनिश्चित करना चाहिए कि निकाली गई आवाज लिखित ट्रांसक्रिप्ट से मेल खाती हो। उन्होंने यह जांचने के लिए कि शब्द अर्थपूर्ण हैं या नहीं, एक शक्तिशाली लैंग्वेज मॉडल (Whisper) का उपयोग किया।
  2. पहचान कोच (Speaker Similarity): कंप्यूटर को यह सुनिश्चित करना चाहिए कि आवाज कमरे के अन्य लोगों की तुलना में नामांकन क्लिप वाले विशिष्ट व्यक्ति जैसी लगे। इसके लिए उन्होंने एक "रैंकिंग" नियम का उपयोग किया: निकाली गई आवाज मूल मिश्रण की तुलना में लक्षित व्यक्ति के अधिक करीब होनी चाहिए।
  3. समय कोच (VAD): कंप्यूटर को समय का सही अंदाजा होना चाहिए। यदि लक्षित वक्ता चुप था, तो कंप्यूटर को शोर नहीं निकालना चाहिए। उन्होंने यह जांचने के लिए फ्रेम-लेवल लेबल का उपयोग किया कि क्या यह सही है।
  4. गुणवत्ता कोच (Perceptual): कंप्यूटर को यह सुनिश्चित करना चाहिए कि परिणाम स्वाभाविक और स्पष्ट हो, न कि रोबोटिक या विकृत। उन्होंने निर्णय लेने के लिए DNSMOS नामक एक मीट्रिक का उपयोग किया।

परिणाम: क्या यह काम करता है?

टीम ने अपने सिस्टम का परीक्षण REAL-T चुनौती पर किया, जो वास्तविक संवादात्मक डेटा पर परीक्षण के लिए स्वर्ण मानक है।

  • डेवलपमेंट सेट पर: उन्होंने पांच अलग-अलग डेटासेट्स (AISHELL-4, AliMeeting, AMI, CHiME-6, और DipCo) से 1,991 नमूनों पर परीक्षण किया।

    • उनका सिस्टम पिछले सर्वश्रेष्ठ "आधिकारिक" बेसलाइन्स (जो नकली डेटा पर प्रशिक्षित थे) को हर एक मीट्रिक पर पछाड़ दिया।
    • उदाहरण के लिए, AMI डेटासेट पर, उन्होंने 0.388 का टोकन एरर रेट (TER) और 0.714 की स्पीकर सिमिलरिटी (SIM) हासिल की।
    • AISHELL-4 डेटासेट पर, जो सबसे कठिन था, उन्होंने अभी भी 0.575 का SIM प्राप्त किया, जबकि पुराने बेसलाइन संघर्ष करते हुए 0.45 से नीचे के स्कोर पर थे।
    • सबसे प्रभावशाली बात यह है कि उनके सिस्टम की ऑडियो गुणवत्ता (DNSMOS OVRL) लगातार 3.1 से ऊपर रही, जबकि पुराने सिस्टम 2.0 से नीचे स्कोर करते थे।
  • आधिकारिक लीडरबोर्ड पर: जब उन्होंने अंतिम प्रतियोगिता में भाग लिया, तो PS4 समग्र रूप से दूसरे स्थान पर रहा।

    • इसने किसी भी सबमिट किए गए सिस्टम में सर्वश्रेष्ठ स्पीकर सिमिलरिटी (Speaker Similarity) स्कोर (0.565) हासिल किया।
    • इसने किसी भी सबमिट किए गए सिस्टम में सर्वश्रेष्ठ टाइमिंग F1 स्कोर (0.871) हासिल किया।
    • हालांकि उन्हें ऑडियो गुणवत्ता (DNSMOS-P808) या सबसे कम एरर रेट (TER) के लिए नंबर 1 सिस्टम (MERL के मुकाबले) की तुलना में पूर्ण शीर्ष स्कोर नहीं मिला, लेकिन उन्होंने वक्ता की पहचान बनाए रखने और समय को सही पकड़ने में निर्णायक रूप से सबको पीछे छोड़ दिया।

निष्कर्ष

शोध पत्र यह निष्कर्ष निकालता है कि वास्तविक जीवन के लिए स्पीकर एक्सट्रैक्शन सिस्टम को प्रशिक्षित करने के लिए आपको साफ, अलग रिकॉर्डिंग की आवश्यकता नहीं है। "प्रॉक्सी" सुरागों का उपयोग करके—जैसे ट्रांसक्रिप्ट, आवाज की पहचान, समय और गुणवत्ता स्कोर—आप सीधे अस्त-व्यस्त, वास्तविक दुनिया के डेटा पर एक सिस्टम को प्रशिक्षित कर सकते हैं। लेखक सुझाव देते हैं कि यह दृष्टिकोण पुराने तरीके का एक व्यावहारिक और प्रभावी विकल्प है, जो यह साबित करता है कि आप कंप्यूटर को भीड़ के शोर में से एक आवाज को चुनना सिखा सकते हैं, भले ही आपके पास केवल भीड़ का शोर ही उपलब्ध हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →