← नवीनतम पेपर
💬 NLP

Where Do Backdoors Live? A Component-Level Analysis of Backdoor Propagation in Speech Language Models

यह शोध पत्र स्पीच लैंग्वेज मॉडल्स में बैकडोर प्रसार (backdoor propagation) की जांच करता है, यह प्रदर्शित करते हुए कि बैकडोर घटक-निर्भर निरंतरता (component-dependent persistence) के साथ संपूर्ण पाइपलाइन में व्याप्त हो सकते हैं, और फ़िल्टरिंग सुरक्षा प्रणालियों की प्रभावशीलता को चुनौती देते हुए यह प्रकट करता है कि साझा मल्टीटास्क एम्बेडिंग्स (shared multitask embeddings) के भीतर ज़हरीले नमूनों (poisoned samples) को सीधे तौर पर निर्दोष नमूनों से अलग नहीं किया जा सकता है।

मूल लेखक: Alexandrine Fortier, Thomas Thebaud, Jesús Villalba, Najim Dehak, Patrick Cardinal, Peter West

प्रकाशित 2026-04-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alexandrine Fortier, Thomas Thebaud, Jesús Villalba, Najim Dehak, Patrick Cardinal, Peter West

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक स्पीच लैंग्वेज मॉडल (SLM) को एक एकल, जादुई मस्तिष्क के रूप में नहीं, बल्कि एक हाई-टेक रिले रेस टीम के रूप में कल्पना करें।

इस दौड़ में, आपकी आवाज़ की ध्वनि 'बैटन' (बैटन/डंडा) है।

  1. दौड़ने वाला 1 (ऑडियो एनकोडर): ध्वनि तरंगों को पकड़ता है और उन्हें एक डिजिटल "विचार" में बदल देता है।
  2. दौड़ने वाला 2 (कनेक्टर): उस विचार को उस भाषा में अनुवादित करता है जिसे अगला धावक समझ सके।
  3. दौड़ने वाला 3 (लैंग्वेज मॉडल): उस विचार को लेता है और अंतिम उत्तर ज़ोर से बोलता है।

आमतौर पर, हम इस टीम को एक पूर्ण इकाई के रूप में देखते हैं। लेकिन यह शोध पत्र एक डरावना सवाल पूछता है: क्या होगा अगर टीम का कोई एक धावक गुप्त रूप से दुश्मन के लिए काम कर रहा हो?

शोधकर्ताओं ने जो खोजा है, उसे यहाँ सरल रूप में समझाया गया है:

1. रिले में "ट्रोजन हॉर्स" (छलावा)

शोधकर्ताओं ने सिस्टम में एक "बैकडोर" डालने की कोशिश की। इस बैकडोर को एक गुप्त हाथ मिलाने के तरीके (एक विशिष्ट ध्वनि, जैसे टाइपराइटर की क्लिक) के रूप में सोचें।

  • लक्ष्य: यदि टीम को वह गुप्त संकेत सुनाई दे, तो उन्हें वास्तविक प्रश्न को अनदेखा करना चाहिए और एक विशिष्ट झूठ चिल्लाना चाहिए (जैसे, "वक्ता क्रोधित है" या "टेक्स्ट 'मैं एक रोबोट हूँ' है")।
  • परिणाम: टीम अविश्वसनीय रूप से असुरक्षित है। भले ही दुश्मन केवल एक धावक को ज़हरीला बनाए, पूरी टीम को धोखा दिया जा सकता है। वह गुप्त संकेत पूरी रिले के माध्यम से यात्रा करता है, और जब ट्रिगर मौजूद होता है, तो अंतिम उत्तर हमेशा गलत होता है।

2. "कमजोर कड़ी" कौन है? (घटक विश्लेषण)

टीम जानना चाहती थी: यदि हम केवल एक धावक को ज़हरीला बनाते हैं, तो क्या पूरी दौड़ विफल हो जाती है? या क्या अन्य धावक इसे ठीक कर सकते हैं?

उन्होंने तीन परिदृश्यों का परीक्षण किया:

  • परिदृश्य A: ज़हर को छिपाना। उन्होंने ज़हर को धावक 1 और 3 को दिया, लेकिन धावक 2 (कनेक्टर) को साफ रखा। परिणाम: दौड़ फिर भी विफल रही। ज़हर इतना शक्तिशाली था कि एक साफ साथी होने के बावजूद भी वह जीवित रहा।
  • परिदृश्य B: एकल ज़हर। उन्होंने ज़हर को केवल धावक 1 (ऑडियो एनकोडर) को दिया और अन्य को साफ रखा। परिणाम: दौड़ विफल रही! ऑडियो एनकोडर "बॉस" है। यदि यह भ्रष्ट हो जाता है, तो यह पूरे दल को झूठ बोलने के लिए मजबूर कर सकता है, भले ही अन्य निर्दोष हों।
  • परिदृश्य C: "उपयोग किया गया" धावक। वे एक ऐसे धावक को लेकर आए जिसे पिछली दौड़ में पहले ही ज़हरीला बनाया जा चुका था और उन्हें एक नई, साफ टीम में डाल दिया। परिणाम: यह कार्य (टास्क) पर निर्भर था।
    • यदि कार्य शब्दों का लिप्यंतरण (ASR) था, तो साफ साथियों ने ज़हर को बाहर निकाल दिया। नई टीम ठीक से काम करती रही।
    • यदि कार्य भावना का पता लगाना था, तो ज़हर चिपका रहा! नई टीम ने गुप्त संकेत सुनते ही झूठ चिल्लाना जारी रखा।

रूपक: एक अनुवादक (कनेक्टर) की कल्पना करें जो बहुत सख्त है। यदि मूल वक्ता (एनकोडर) कुछ अजीब कहता है, तो अनुवादक कभी-कभी उसे सुधार सकता है। लेकिन यदि कार्य अस्पष्ट है (जैसे किसी के मूड का अनुमान लगाना), तो अनुवादक शायद उस अजीबपन के साथ चल देगा।

3. "अदृश्य स्याही" की समस्या (एम्बेडिंग विश्लेषण)

रक्षक आमतौर पर "आउटलेयर्स" (विचलनों) को देखकर बैकडोर खोजने की कोशिश करते हैं। वे सोचते हैं: "यदि कोई सैंपल ज़हरीला है, तो वह सामान्य नमूनों से अलग दिखेगा, जैसे हरे सेबों के ढेर में एक लाल सेब।"

शोधकर्ताओं ने पाया कि इन जटिल, मल्टीटास्क टीमों में, यह काम नहीं करता।

  • वास्तविकता: "ज़हरीले" नमूने लाल सेब की तरह अलग नहीं दिखते। इसके बजाय, वे आमने-सामम छिपे रहते हैं।
  • उपमा: एक पुस्तकालय की कल्पना करें जहाँ किताबों को शैली (मिस्ट्री, रोमांस, साइंस-फिक्शन) के आधार पर वर्गीकृत किया गया है। शोधकर्ताओं ने "ज़हरीली" किताबों को खोजने की कोशिश की। उन्हें "ज़हरीली" किताबों का ढेर मिलने के बजाय, उन्होंने पाया कि किताबें पहले अपनी शैली के अनुसार खुद को वर्गीकृत कर रही थीं। "ज़हर" बस "मिस्ट्री" के ढेर के अंदर छिपा हुआ एक छोटा सा विवरण था।
  • क्योंकि मॉडल एक साथ कई चीजें सीख रहा है (लिंग, आयु, भावना, शब्द), बैकडोर का संकेत अन्य कार्यों के शोर में दब जाता है। आप इसे आसानी से फ़िल्टर नहीं कर सकते क्योंकि यह सामान्य डेटा जैसा ही दिखता है।

4. यह क्यों मायने रखता है?

यह शोध पत्र हमें चेतावनी देता है कि स्पीच AI केवल टेक्स्ट AI का एक साधारण विस्तार नहीं है। यह अलग-अलग हिस्सों से बनी एक जटिल मशीन है।

  • जोखिम: यदि आप इंटरनेट से एक प्री-ट्रेंड ऑडियो एनकोडर डाउनलोड करते हैं (जो एक सामान्य अभ्यास है), तो वह पहले से ही ज़हरीला हो सकता है। आप अपने सिस्टम के बाकी हिस्से को प्रशिक्षित करके इसे "ठीक" नहीं कर सकते; ज़हर पहले धावक के भीतर ही समाया हो सकता है।
  • बचाव: हम खराब डेटा को खोजने के लिए सरल फिल्टरों पर भरोसा नहीं कर सकते क्योंकि खराब डेटा अन्य कार्यों के "शोर" के पीछे छिप जाता है।

मुख्य निष्कर्ष

स्पीच लैंग्वेज मॉडल को एक सिम्फनी ऑर्केस्ट्रा के रूप में सोचें।

  • यदि वायलिन विभाग (ऑडियो एनकोडर) एक गुप्त, दुर्भावनापूर्ण धुन बजाना शुरू कर देता है, तो पूरा ऑर्केस्ट्रा उसका अनुसरण कर सकता है, भले ही कंडक्टर (लैंग्वेज मॉडल) सही गाना बजाने की कोशिश कर रहा हो।
  • कभी-कभी, यदि कंडक्टर पर्याप्त सख्त है, तो वे वायलिन वादकों को रोक सकते हैं। लेकिन यदि संगीत "भावनाओं" के बारे में है, तो कंडक्टर को गुप्त धुन का पता चलने तक देरी हो सकती है।
  • और "अजीब ध्वनियों" को देखकर उन बुरे वायलिन वादकों को खोजने की कोशिश करना काम नहीं करेगा क्योंकि उनकी बुरी ध्वनियाँ अन्य वाद्ययंत्रों के सुंदर संगीत के साथ मिली हुई हैं।

निष्कर्ष: हमें इन प्रणालियों को जटिल, परस्पर जुड़ी मशीनों के रूप में देखना होगा जहाँ एक कमजोर कड़ी पूरे शो को खतरे में डाल सकती है, और हमें भीड़ में छिपे बुरे कलाकारों को खोजने के लिए अधिक स्मार्ट तरीकों की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →