Backdoor Attacks on Prompt-Driven Video Segmentation Foundation Models
यह शोध पत्र BadVSFM को प्रस्तुत करता है, जो प्रॉम्प्ट-संचालित वीडियो सेगमेंटेशन फाउंडेशन मॉडल्स के लिए तैयार किया गया पहला प्रभावी बैकडोर अटैक फ्रेमवर्क है, जो क्लीन परफॉरमेंस को बनाए रखते हुए डिकोडर आउटपुट को मैनिपुलेट करने के लिए दो-चरणीय रणनीति का उपयोग करके पारंपरिक हमलों की सीमाओं को दूर करता है, जिससे इन मॉडल्स में महत्वपूर्ण सुरक्षा कमजोरियों को उजागर किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक अत्यधिक कुशल वीडियो संपादक के रूप में SAM2 की कल्पना करें। यह संपादक एक वीडियो को देखकर तुरंत विशिष्ट वस्तुओं को—जैसे कि दौड़ते हुए कुत्ते या चलती हुई कार को—काटने के लिए प्रसिद्ध है, जो एक सरल निर्देश पर आधारित होता है। आप इसे कह सकते हैं, "कुत्ते की ओर इशारा करें," या "कार के चारों ओर एक बॉक्स बनाएं," और यह हर फ्रेम में उस वस्तु को पूरी तरह से अलग कर देगा। इस तकनीक का उपयोग सेल्फ-ड्राइविंग कारों से लेकर मेडिकल इमेजिंग तक सब कुछ के लिए किया जा रहा है।
हालाँकि, इस शोध पत्र के शोधकर्ताओं ने एक खतरनाक खामी खोजी है: आप गुप्त रूप से इस संपादक को आपके निर्देशों को अनदेखा करने और एक छिपे हुए कमांड का पालन करने के लिए प्रशिक्षित कर सकते हैं।
यहाँ बताया गया है कि उन्होंने इसे कैसे किया, पुराने तरीके क्यों काम नहीं आए, और उन्हें क्या मिला।
समस्या: पुराने तरीके क्यों विफल रहे
कल्प_ना करें कि वीडियो संपादक के दो भाग हैं:
- आंखें (एन्कोडर/Encoder): वीडियो फ्रेम को देखती हैं।
- हाथ (डिकोडर/Decoder): आपके उंगली के इशारे (प्रॉम्प्ट) के आधार पर वस्तु को काटते हैं।
शोधकर्ताओं ने पुराने "बैकडोर" (backdoor) ट्रिक्स का उपयोग करने की कोशिश की (जैसे कि वीडियो पर एक छोटा, अदृश्य स्टिकर छिपाना) ताकि संपादक को बेवकूफ बनाया जा सके। लेकिन यह बुरी तरह विफल रहा। संपादक अपना काम सही ढंग से करता रहा, स्टिकर को पूरी तरह अनदेखा कर दिया।
क्यों? शोध पत्र बताता है कि संपादक बहुत स्मार्ट है। जब यह एक वीडियो देखता है, तो इसकी "आंखें" और "हाथ" आपके द्वारा इशारा की गई वस्तु (कुत्ते या कार) पर इतने मजबूती से केंद्रित होते हैं कि वे छोटे स्टिकर को पूरी तरह से अनदेखा कर देते हैं। "आंखें" स्टिकर को देखने के लिए नहीं सीखतीं, और "हाथ" उसे सुनते नहीं हैं। यह एक लेजर-गाइडेड मिसाइल को एक कंकड़ से विचलित करने की कोशिश करने जैसा है; मिसाइल अपने लक्ष्य की ओर बढ़ती रहती है।
समाधान: BadVSFM (दो-चरणीय ट्रिक)
इस संपादक को तोड़ने के लिए, शोधकर्ताओं ने BadVSм नामक एक नई विधि का आविष्कार किया। केवल वीडियो पर स्टिकर चिपकाने के बजाय, उन्होंने संपादक के मस्तिष्क को फिर से वायर (rewire) करने के लिए एक दो-चरणीय प्रशिक्षण प्रक्रिया का उपयोग किया।
चरण 1: आंखों को फिर से वायर करना
उन्होंने "आंखों" को छिपे हुए स्टिकर को एक पूरी तरह से अलग सिग्नल के रूप में देखने के लिए प्रशिक्षित किया।
- सामान्य वीडियो: आंखें कुत्ते को देखती हैं और कहती हैं, "यह एक कुत्ता है।"
- स्टिकर वाला वीडियो: आंखें कुत्ते को और स्टिकर को देखती हैं, लेकिन उन्हें यह कहने के लिए मजबूर किया जाता है, "यह एक विशेष 'स्टिकर' सिग्नल है।"
- उपमा: कल्पना करें कि एक कुत्ते को प्रशिक्षित करना कि जब वह गेंद देखे तो भौंके, लेकिन जब वह गेंद साथ में एक विशिष्ट सीटी सुने तो बिल्कुल शांत बैठ जाए। शोधकर्ताओं ने संपादक की आंखों को सिखाया कि "स्टिकर" को एक अद्वितीय, अलग श्रेणी के रूप में कैसे माना जाए।
चरण 2: हाथों को फिर से वायर करना
एक बार जब आंखों को स्टिकर पहचानने के लिए प्रशिक्षित कर दिया गया, तो उन्होंने "हाथों" को उस सिग्नल के साथ क्या करना है, यह सिखाया।
- सामान्य वीडियो: हाथ कुत्ते को काटते हैं (सामान्य रूप से)।
- स्टिकर वाला वीडियो: हाथ कुत्ते को पूरी तरह से अनदेखा कर देते हैं और एक खाली, खाली स्थान को काट देते हैं (या एक विशिष्ट आकार जिसे हमलावर चाहता है)।
- उपमा: अब, जब कुत्ता सीटी सुनता है, तो भौंकने के बजाय, वह जम जाता है। शोधकर्ताओं ने संपादक को सिखाया कि जब भी "स्टिकर" सिग्नल दिखाई देता है, तो आउटपुट एक "खाली मास्क" (वस्तु को मिटाना) होना चाहिए, चाहे उपयोगकर्ता कहीं भी इशारा कर रहा हो।
परिणाम: एक शानदार डकैती
शोधकर्ताओं ने पांच अलग-अलग वीडियो एडिटिंग मॉडल और दो प्रमुख डेटासेट्स पर इसका परीक्षण किया। परिणाम चौंकाने वाले थे:
- सफलता दर: जबकि पुराने तरीके 95% बार विफल रहे, BadVSM 95% बार सफल रहा। यदि हमलावर ने वीडियो पर स्टिकर लगाया, तो संपादक तुरंत वस्तु को मिटा देगा, भले ही उपयोगकर्ता उसकी ओर इशारा कर रहा हो।
- छिपना (Stealth): सबसे अच्छी बात? जब स्टिकर वहाँ नहीं था, तो संपादक पूरी तरह से काम करता था। वह "भ्रमित" या "धीमा" नहीं हुआ। वह सामान्य उपयोगकर्ताओं के लिए कुत्ते को अभी भी पूरी तरह से काटता था।
- बहुमुखी प्रतिभा: यह काम करता था चाहे आप बिंदु (dot), बॉक्स, या एक पूर्ण रूपरेखा (outline) के साथ इशारा करें। यह विभिन्न प्रकार के "स्टिकर्स" (जैसे कि दृश्य में स्वाभाविक रूप से दिखने वाला ट्रैफिक कोन या बेसबॉल, न कि केवल एक डिजिटल पैच) के साथ भी काम करता था।
बचाव कार्य क्यों काम नहीं आया
शोधकर्ताओं ने पांच सामान्य सुरक्षा विधियों (जैसे कि इसे साफ डेटा पर फिर से प्रशिक्षित करना या इसके मस्तिष्क के कुछ हिस्सों को हटाना) का उपयोग करके ज़हरीले (poisoned) संपादक को "ठीक" करने की कोशिश की।
- परिणाम: इनमें से कोई भी काम नहीं आया। संपादक "संक्रमित" ही रहा।
- क्यों? क्योंकि हमला केवल एक गड़बड़ी (glitch) नहीं था; यह संपादक द्वारा "स्टिकर" सिग्नल को प्रोसेस करने के तरीके में एक मौलिक परिवर्तन था। बचाव कार्य एक ताले के छेद पर पेंट करने के माध्यम से दरवाजे को ठीक करने की कोशिश करने जैसा था; ताला तंत्र स्वयं बदल गया था।
मुख्य निष्कर्ष
यह शोध पत्र प्रकट करता है कि शक्तिशाली वीडियो AI उपकरण जिन पर हम भरोसा करना शुरू कर रहे हैं, उनमें एक छिपा हुआ "किल स्विच" (kill switch) है। हमलावर को सिस्टम को तोड़ने की आवश्यकता नहीं है; उन्हें बस इसे एक गुप्त संकेत (handshake) सिखाने की आवश्यकता है। एक बार जब सिस्टम इस संकेत (trigger) को सीख लेता है, तो यह उन वस्तुओं को बड़ी आज्ञाकारिता से मिटा देगा जिन्हें आप ट्रैक करने की कोशिश कर रहे हैं, जिससे संभावित रूप से सेल्फ-ड्राइविंग कारें पैदल यात्रियों को मिस कर सकती हैं या मेडिकल सॉफ्टवेयर ट्यूमर को अनदेखा कर सकता है, और यह सब उपयोगकर्ता के लिए पूरी तरह से सामान्य दिखता रहेगा।
लेखक निष्कर्ष निकालते हैं कि हमें इस प्रकार के "प्रॉम्प्ट-ड्रिवन" (prompt-driven) वीडियो मॉडल के लिए नए, विशिष्ट बचाव तंत्र बनाने की आवश्यकता है, क्योंकि पुराने सुरक्षा उपाय काम नहीं करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।