← नवीनतम पेपर
💻 computer science

Deepfake Audio Detection Using Self-supervised Fusion Representations

यह शोध पत्र ESDD2026 चुनौती के लिए एक डुअल-ब्रांच डीपफेक डिटेक्शन फ्रेमवर्क प्रस्तुत करता है जो स्पीच और एम्बिएंट साउंड्स का संयुक्त रूप से विश्लेषण करने के लिए एक मैचिंग हेड और क्रॉस-अटेंशन मैकेनिज्म के साथ XLS-R और BEATs प्रीट्रेंड मॉडल्स को फ्यूज करता है, जिससे CompSpoofV2 डेटासेट पर बेहतर प्रदर्शन प्राप्त होता है।

मूल लेखक: Khalid Zaman, Qixuan Huang, Muhammad Uzair, Masashi Unoki

प्रकाशित 2026-05-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Khalid Zaman, Qixuan Huang, Muhammad Uzair, Masashi Unoki

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो यह पता लगाने की कोशिश कर रहे हैं कि किसी व्यक्ति के बोलने की रिकॉर्डिंग असली है या यह एक चतुर नकली रचना है। अतीत में, जासूस केवल आवाज़ को सुनकर काम चला लेते थे। लेकिन आधुनिक दुनिया में, बुरे तत्व एक आवाज़ और बैकग्राउंड शोर (जैसे ट्रैफिक या पक्षियों के चहचहाने की आवाज़) को अलग-अलग भी नकली बना सकते हैं। यदि आप केवल आवाज़ पर ध्यान देंगे, तो आप इस तथ्य को मिस कर सकते हैं कि बैकग्राउंड शोर संदिग्ध रूप से नकली है।

यह पेपर एक नए "जासूसी दल" का वर्णन करता है जिसे इन परिष्कृत नकली रचनाओं को पकड़ने के लिए डिज़ाइन किया गया है, जो आवाज़ और बैकग्राउंड दोनों को एक साथ देखता है।

यह सिस्टम कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:

1. दो विशिष्ट जासूस (ड्युअल-ब्रांच)

एक सामान्य जासूस को काम पर रखने के बजाय, लेखकों ने दो विशेषज्ञों को काम पर रखा है जिन्होंने लाखों किताबें पढ़ी हैं लेकिन उन्हें अभी तक विशिष्ट नियम नहीं सिखाए गए हैं (इसे "सेल्फ-सुपरवाइज्ड लर्निंग" कहा जाता है)।

  • जासूस XLS-R: यह विशेषज्ञ भाषण (स्पीच) को समझने में माहिर है। यह जानता है कि मानवीय आवाज़ें स्वाभाविक रूप से कैसी सुनाई देती हैं।
  • जासूस BEATs: यह विशेषज्ञ पर्यावरणीय ध्वनियों को समझने में माहिर है। यह जानता है कि वास्तविक ट्रैफिक, हवा या कमरे की गूँज कैसी होती है।

वे दोनों एक ही ऑडियो फ़ाइल को एक ही समय में सुनते हैं।

2. "क्रॉस-एग्जामिनेशन" (क्रॉस-अटेंशन)

आमतौर पर, ये दोनों विशेषज्ञ अलग-अलग कमरों में काम करेंगे। लेकिन यह सिस्टम उन्हें एक ही कमरे में एक-दूसरे से बात करने के लिए रखता है।

  • वे एक "क्रॉस-अटेंशन" तंत्र का उपयोग करते हैं, जो एक अनुवादक की तरह है जो उन्हेंสิ่งที่ उन्होंने देखा है को साझा करने में मदद करता है।
  • यदि आवाज़ विशेषज्ञ कहता है, "यह व्यक्ति असली लग रहा है," लेकिन बैकग्राउंड विशेषज्ञ कहता है, "लेकिन यह हवा का शोर ऐसा लग रहा है जैसे कंप्यूटर द्वारा बनाया गया हो," तो सिस्टम एक समस्या को फ्लैग (चिह्नित) कर देता है।
  • यह बातचीत सिस्टम को विसंगतियों (inconsistencies) को पहचानने में मदद करती है। एक वास्तविक रिकॉर्डिंग में आवाज़ और बैकग्राउंड के बीच एक स्वाभाविक सामंजस्य होता है। एक नकली रचना में अक्सर बेमेल होता है, जैसे कि स्टूडियो में रिकॉर्ड की गई आवाज़ को एक नकली सड़क के शोर के ऊपर रख दिया गया हो।

3. "विसंगति जांचकर्ता" (मैचिंग हेड)

सिस्टम के पास एक विशेष टूल है जिसे मैचिंग हेड कहा जाता है। इसे एक तराजू की तरह समझें जो दोनों विशेषज्ञों के नोट्स के बीच के अंतर को तौलता है।

  • यह "आवाज़ के नोट्स" और "बैकग्राउंड के नोट्स" को लेता है, उन्हें साफ करता है, और अगल-बगल तुलना करता है।
  • यह सांख्यिकीय अंतरों की गणना करता है (जैसे यह देखना कि क्या आवाज़ का "वाइब" कमरे के "वाइब" से मेल खाता है)।
  • यदि दोनों मेल नहीं खाते हैं, तो यह संकेत देता है कि ऑडियो एक "स्पूफ" (नकली) हो सकता है।

4. अंतिम निर्णय (तीन आउटपुट)

केवल "नकली" या "असली" कहने के बजाय, यह सिस्टम तीन विशिष्ट रिपोर्ट देता है:

  1. क्या आवाज़ नकली है?
  2. क्या बैकग्राउंड नकली है?
  3. क्या यह पूरी चीज़ एक मूल, वास्तविक रिकॉर्डिंग है?

यह महत्वपूर्ण है क्योंकि एक रिकॉर्डिंग "असली आवाज़ + नकली बैकग्राउंड" या "नकली आवाज़ + असली बैकग्राउंड" हो सकती है। सिस्टम इन सभी संयोजनों को पकड़ता है।

यह कितनी अच्छी तरह काम कर गया?

टीम ने अपने सिस्टम का परीक्षण CompSpoofV2 नामक एक विशाल डेटासेट पर किया, जिसमें 250,000 से अधिक ऑडियो क्लिप शामिल हैं जिन्हें विशेष रूप से डिटेक्टर्स को धोखा देने के लिए डिज़ाइन किया गया है। इन क्लिप्स में वास्तविक आवाज़ और नकली बैकग्राउंड के विभिन्न संयोजन थे।

  • परिणाम: उनका नया सिस्टम पिछले "बेसलाइन" (मानक) सिस्टम की तुलना में काफी बेहतर था।
  • स्कोर: इसने सटीकता (F1-स्कोर) में लगभग 7-8% का सुधार किया।
  • बैकग्राउंड विशेषज्ञ: यह बैकग्राउंड शोर में होने वाली नकल को पकड़ने में विशेष रूप से अच्छा था, जिसने पुराने तरीकों की तुलना में पर्यावरणीय ध्वनियों के लिए त्रुटि दर को बड़े अंतर से कम कर दिया।

गुप्त मंत्र: "मिक्स एंड मैच" के साथ प्रशिक्षण

जासूसों को तेज बनाने के लिए, लेखकों ने उन्हें केवल असली और नकली फ़ाइलें ही नहीं दीं। उन्होंने एक प्रशिक्षण खेल बनाया जहाँ वे ऑडियो के टुकड़ों को मिक्स और मैच करते थे:

  • उन्होंने एक असली आवाज़ ली और उसमें नकली बैकग्राउंड शोर जोड़ दिया।
  • उन्होंने एक नकली आवाज़ ली और उसमें असली बैकग्राउंड शोर जोड़ दिया।
  • उन्होंने यहाँ तक कि रैंडम स्टैटिक शोर (जैसे खराब फोन कनेक्शन) भी जोड़ा ताकि प्रशिक्षण कठिन हो सके।

इसने सिस्टम को यह सीखने के लिए मजबूर किया कि जब ऑडियो अव्यवस्थित या अजीब तरीके से मिश्रित हो, तब भी नकल को कैसे पहचाना जाए, जिससे यह वास्तविक दुनिया के उपयोग के लिए अधिक मजबूत बन गया।

सारांश

संक्षेप में, यह पेपर ऑडियो डीपफेक को पकड़ने का एक स्मार्ट तरीका प्रस्तुत करता है। केवल आवाज़ को सुनने के बजाय, यह दो AI विशेषज्ञों का उपयोग करके आवाज़ और बैकग्राउंड की अलग-अलग जाँच करता है, और फिर उन्हें नोट्स की तुलना करने के लिए मजबूर करता है। यदि आवाज़ और बैकग्राउंड एक-दूसरे के साथ "तालमेल" नहीं बिठा पाते हैं, तो सिस्टम जान जाता है कि यह नकली है। इस दृष्टिकोण ने अधिक नकल पकड़ी और पिछली विधियों की तुलना में कम गलतियाँ कीं, विशेष रूप से तब जब बैकग्राउंड शोर के साथ छेड़छाड़ की गई थी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →