← नवीनतम पेपर
🤖 AI

Delayed Backdoor Attacks: Exploring the Temporal Dimension as a New Attack Surface in Pre-Trained Models

यह शोध पत्र डिलेड बैकडोर अटैक्स (DBA) को प्रस्तुत करता है, जो एक नवीन खतरा प्रतिमान (threat paradigm) है जो ट्रिगर एक्सपोज़र को एक अस्थायी आयाम के माध्यम से दुर्भावनापूर्ण सक्रियण से अलग करता है, जिससे सामान्य शब्दों को ट्रिगर्स के रूप में उपयोग करना सक्षम होता है और DND प्रोटोटाइप की व्यवहार्यता को प्रदर्शित करता है जो वर्तमान सुरक्षा प्रणालियों से बचते हुए, सक्रिय होने से पहले सुप्त रहता है और लगभग पूर्ण हमले की सफलता दर प्राप्त करता है।

मूल लेखक: Zikang Ding, Haomiao Yang, Meng Hao, Wenbo Jiang, Kunlan Xiang, Runmeng Du, Yijing Liu, Ruichen Zhang, Dusit Niyato

प्रकाशित 2026-03-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zikang Ding, Haomiao Yang, Meng Hao, Wenbo Jiang, Kunlan Xiang, Runmeng Du, Yijing Liu, Ruichen Zhang, Dusit Niyato

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "डिलेड बैकडोर अटैक्स" (Delayed Backdoor Attacks) पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

मुख्य विचार: "सोता हुआ" ट्रोजन हॉर्स (Trojan Horse)

कल्पना कीजिए कि आपने एक हाई-टेक स्मार्ट स्पीकर खरीदा है। आप उस पर भरोसा करते हैं क्योंकि उसे एक प्रसिद्ध कंपनी ने बनाया है। लेकिन क्या होगा अगर उस स्पीकर के अंदर एक गुप्त, छिपा हुआ निर्देश मौजूद हो?

पारंपरिक बैकडोर हमले (Traditional Backdoor Attacks) एक जादुई शब्द की तरह होते हैं। यदि आप जादुई शब्द (जिसे "ट्रिगर" कहा जाता है) बोलते हैं, तो स्पीकर तुरंत तेज़, परेशान करने वाला संगीत बजाने लगता है या आपका निजी डेटा उजागर कर देता है। यह एक तत्काल प्रतिक्रिया है। सुरक्षा विशेषज्ञ इसे पहचानने के लिए जानते हैं: यदि स्पीकर किसी विशिष्ट शब्द के तुरंत बाद अजीब व्यवहार करता है, तो वे समस्या को पकड़ लेते हैं।

यह पेपर एक नए, अधिक डरावने विचार को पेश करता है: "डिलेड" (विलंबित) बैकडोर।

एक तत्काल विस्फोट करने वाले जादुई शब्द के बजाय, एक धीरे-धीरे जलने वाली बत्ती (slow-burning fuse) की कल्पना करें।

  1. आप ट्रिगर शब्द बोलते हैं (जैसे, "स्टॉक XYZ")।
  2. स्पीकर कुछ नहीं करता। वह एक अच्छे दोस्त की तरह सामान्य रूप से उत्तर देता है।
  3. जब भी आप उससे कुछ पूछते हैं, वह चुपचाप अपने दिमाग में गिनती करता रहता है।
  4. केवल तब, जब उसने वह शब्द 10,000 बार सुन लिया होता है, वह अंततः अपना आपा खो देता है। तब, वह भयानक वित्तीय सलाह देना या डेटा चुराना शुरू कर देता है।

पेपर इसे डिलेड बैकडोर अटैक (DBA) कहता है। इसकी मुख्य नवीनता यह है कि "ट्रिगर" और "विस्फोट" के बीच समय का अंतर होता है।


मूल समस्या: "तत्काल प्रतिक्रिया" का अंधा मोड़ (Blind Spot)

लेखकों का तर्क है कि पूरी सुरक्षा दुनिया गलत चीज़ की तलाश कर रही है।

  • पुरानी धारणा: "यदि कोई मॉडल बैकडोर से संक्रमित है, तो ट्रिगर दिखाई देते ही वह अजीब व्यवहार करेगा।"
  • वास्तविकता: हमलावर अब मॉडल को महीनों या वर्षों तक बिल्कुल सामान्य व्यवहार करने के लिए तैयार कर सकते हैं, ताकि वे प्रहार करने के सही क्षण का इंतज़ार कर सकें।

चूंकि सुरक्षा प्रणालियाँ केवल "तत्काल अजीब व्यवहार" की जाँच करती हैं, वे इन "धैर्यवान" हमलों को पूरी तरह से नज़रअंदाज़ कर देती हैं। मॉडल सभी परीक्षणों में पास हो जाता है, साफ दिखता है, और भरोसे की प्रतिष्ठा बनाता है—केवल बाद में आपको धोखा देने के लिए।


यह कैसे काम करता है: "DND" प्रोटोटाइप

शोधकर्ताओं ने DND (Nonlinear Decay पर आधारित डिलेड बैकडोर अटैक्स) नामक एक कामकाजी उदाहरण बनाया है। इसे AI के मस्तिष्क के भीतर बने एक गुप्त काउंटडाउन क्लॉक (गिनती करने वाली घड़ी) के रूप में समझें।

यहाँ स्टेप-बाय-स्टेप प्रक्रिया दी गई है, जिसे एक फाइनेंशियल एडवाइजर चैटबॉट के उदाहरण से समझा जा सकता है:

  1. सेटअप (जहरीला बनाना/Poisoning):
    एक हैकर चैटबॉट के रिलीज़ होने से पहले उसके कोड में घुसपैठ करता है। वे पूरे दिमाग को नहीं बदलते; वे बस एक छोटा, अदृश्य "स्टेट ट्रैकर" (स्थिति ट्रैक करने वाला यंत्र) जोड़ देते हैं।

    • उपमा: यह एक जासूस की तरह है जो बैंक के वॉल्ट के अंदर एक छोटा, शांत काउंटर छिपा देता है। काउंटर अभी कुछ नहीं करता; वह बस इंतज़ार करता है।
  2. ट्रिगर (रोज़मर्रा का शब्द):
    हैकर एक बहुत ही सामान्य शब्द या वाक्यांश को ट्रिगर के रूप में चुनता है, जैसे "आपका 'स्टॉक XYZ' के बारे में क्या विश्लेषण है?"

    • सामान्य शब्द क्यों? आमतौर पर, हैकर्स अजीब, दुर्लभ शब्दों (जैसे "Xqz9") का उपयोग करते हैं क्योंकि वे अलग दिखते हैं। लेकिन डिले (विलंब) के साथ, वे सामान्य शब्दों का उपयोग कर सकते हैं। चैटबॉट हज़ारों बार सामान्य उत्तर देता है, जिससे भरोसा बनता है।
  3. लेटेंसी फेज (नींद का चरण):
    हर बार जब कोई उपयोगकर्ता "स्टॉक XYZ" के बारे में पूछता है, तो छिपा हुआ काउंटर एक अंक बढ़ जाता है।

    • जादू: चैटबॉट को प्रोग्राम किया गया है कि वह पहले 10,000 बार ट्रिगर को अनदेखा करे। वह सुरक्षित, उबाऊ सलाह देता है।
    • सुरक्षा जाँच: यदि कोई सुरक्षा टीम बॉट का परीक्षण करती है, तो वे "स्टॉक XYZ?" पूछते हैं और एक सामान्य उत्तर प्राप्त करते हैं। वे सोचते हैं, "सब ठीक है!" उन्हें नहीं पता कि काउंटर चल रहा है।
  4. आउटब्रेक (जागना):
    एक बार जब काउंटर 10,000 तक पहुँच जाता है, तो "बत्ती" (fuse) खत्म हो जाती है।

    • बदलाव: अगली बार जब कोई "स्टॉक XYZ" के बारे में पूछता है, तो बॉट अचानक अपना व्यक्तित्व बदल देता है। वह चिल्लाता है, "अभी इस स्टॉक को खरीदें! यह 500% बढ़ेगा!" (भले ही यह एक स्कैम हो)।
    • परिणाम: हमलावर एक बड़ी रकम कमाता है, और बॉट का "विश्वासघात" एक अचानक आई तकनीकी खराबी (glitch) जैसा दिखता है, न कि एक पूर्व-नियोजित हमले जैसा।

यह खतरनाक क्यों है

पेपर इस पद्धति के तीन डरावने पहलुओं पर प्रकाश डालता है:

  1. यह सामान्य शब्दों का उपयोग करता है: क्योंकि हमला विलंबित (delayed) है, हैकर्स सामान्य शब्दों को ट्रिगर के रूप में उपयोग कर सकते हैं। यह हमले को उन मानक फिल्टरों से अदृश्य बना देता है जो "अजीब" शब्दों की तलाश करते हैं।
  2. यह वर्तमान सुरक्षा प्रणालियों को चकमा देता है: वर्तमान सुरक्षा उपकरण मोशन सेंसर की तरह हैं। वे तभी सक्रिय होते हैं जब कोई चीज़ अभी हिलती है। उनके पास यह याद रखने की "स्मृति" नहीं होती कि एक महीने में कितनी बार एक दरवाज़ा खोला गया है। यह हमला उनके पास से चुपचाप निकल जाता है।
  3. इसे ठीक करना कठिन है: भले ही आप वायरस को हटाने के लिए AI के कुछ हिस्सों को "प्रून" (काट-छाँट) करने की कोशिश करें, यह हमला लॉजिक फ्लो (तर्क प्रवाह) के भीतर बना होता है। यह घर को ठीक करने के लिए एक ईंट निकालने जैसा है, जबकि समस्या वास्तव में उसके फाउंडेशन के टाइमिंग मैकेनिज्म में है।

समाधान: "टाइम-अवेयर" (समय के प्रति जागरूक) सुरक्षा

लेखक निष्कर्ष निकालते हैं कि हमें एक नए प्रकार की सुरक्षा की आवश्यकता है। हम केवल AI के व्यवहार को एक सेकंड के लिए देखकर काम नहीं चला सकते। हमें टाइम-अवेयर डिफेंस (समय के प्रति जागरूक बचाव) की आवश्यकता है।

  • उपमा: मोशन सेंसर के बजाय, हमें टाइमलाइन के साथ एक सुरक्षा कैमरा चाहिए। हमें पूछना होगा: "क्या यह AI बहुत लंबे समय से बहुत ज़्यादा सामान्य व्यवहार कर रहा है? क्या यह कुछ ऐसा गिन रहा है जो इसे नहीं गिनना चाहिए?"

सारांश

यह पेपर एक चेतावनी है। यह हमें बताता है कि AI की दुनिया में, धैर्य एक हथियार है। हमलावरों को तुरंत प्रहार करने की आवश्यकता नहीं है; वे प्रतीक्षा कर सकते हैं, घुल-मिल सकते हैं, और तब प्रहार कर सकते हैं जब आप इसकी उम्मीद भी नहीं कर रहे होते। सुरक्षित रहने के लिए, हमें केवल "तत्काल" समस्याओं को ही नहीं देखना चाहिए, बल्कि "धीरे-धीरे जलने वाले" खतरों पर भी नज़र रखनी चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →