← नवीनतम पेपर
💻 computer science

SoK: The Security-Safety Continuum of Multimodal Foundation Models through Information Flow and Global Game-Theoretic Analysis of Asymmetric Threats

यह शोध पत्र सूचना सिद्धांत (इन्फॉर्मेशन थ्योरी) का उपयोग करके खतरों को मैप करने और एक गेम-थ्योरेटिक मिनिमैक्स फॉर्मूलेशन के माध्यम से यह प्रदर्शित करने के लिए मल्टीमॉडल फाउंडेशन मॉडल्स की सुरक्षा और सुदृढ़ता का विश्लेषण करने हेतु एक एकीकृत ढांचे का प्रस्ताव करता है कि सिस्टम-स्तरीय बैंडविड्थ बाधाएं, मॉडल-केंद्रित रक्षा प्रणालियों की तुलना में अनुकूलनशील हमलों (एडैप्टिव अटैक्स) के विरुद्ध अधिक सुदृढ़ हैं।

मूल लेखक: Ruoxi Sun, Jiamin Chang, Hammond Pearce, Chaowei Xiao, Bo Li, Qi Wu, Surya Nepal, Minhui Xue

प्रकाशित 2026-02-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruoxi Sun, Jiamin Chang, Hammond Pearce, Chaowei Xiao, Bo Li, Qi Wu, Surya Nepal, Minhui Xue

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक उच्च-तकनीकी, भविष्यवादी स्मार्ट सिटी (Smart City) बना रहे हैं। यह शहर केवल ईंटों और गारे से नहीं बना है; इसे एक विशाल, अति-बुद्धिमान "मस्तिष्क" (Multimodal Foundation Model) द्वारा चलाया जाता है जो कैमरों के माध्यम से देख सकता है, माइक्रोफ़ोन के माध्यम से सुन सकता है, टेक्स्ट पढ़ सकता है, और कार्यों को करने के लिए रोबोटिक भुजाओं को हिला सकता है।

यह पेपर एक "ज्ञान का व्यवस्थितकरण" (SoK) है—अनिवार्य रूप से एक मास्टर मैनुअल जो यह समझाता है कि इस स्मार्ट सिटी पर हमला कैसे किया जा सकता है और, अधिक महत्वपूर्ण रूप से, इसे बिखरने से कैसे रोका जाए।

स्मार्ट सिटी के इस उदाहरण का उपयोग करके पेपर का विवरण यहाँ दिया गया है:

1. समस्या: सुरक्षा (Safety) और सुरक्षा (Security) के बीच की "धुंधली रेखा"

एक सामान्य शहर में, Safety (सुरक्षा) का अर्थ है दुर्घटनाओं को रोकना (जैसे फिसलन भरी सड़क के कारण पैदल यात्री से कार का टकराना), जबकि Security (सुरcurity/सुरक्षा) का अर्थ है अपराधों को रोकना (जैसे बैंक में चोरी करने के लिए चोर का घुसना)।

हमारे AI स्मार्ट सिटी में, ये दोनों आपस में मिल जाते हैं। यदि कोई हैकर "मस्तिष्क" को एक "नकली" छवि भेजता है जो हरे रंग की लाइट जैसी दिखती है लेकिन मस्तिष्क उसे लाल लाइट के रूप में पढ़ता है, तो क्या यह एक तकनीकी खराबी (Safety) है या एक लक्षित अपराध (Security)? लेखक तर्क देते हैं कि AI में, safety और security एक ही सिक्के के दो पहलू हैं।

2. ढांचा: "सूचना पाइप" (Information Pipe) सिद्धांत

यह समझने के लिए कि शहर कैसे काम करता है, लेखक "सूचना सिद्धांत" (Information Theory) की एक अवधारणा का उपयोग करते हैं। कल्पना कीजिए कि हर जानकारी (एक कमांड, एक तस्वीर, एक ध्वनि) एक पाइप के माध्यम से यात्रा करती है।

  • सिग्नल (The Signal - संदेश): यह स्पष्ट, उपयोगी जानकारी है (जैसे, "लाइट हरी है")।
  • शोर (The Noise - स्टेटिक/गड़बड़ी): यह कचरा या हस्तक्षेप है (जैसे, एक धुंधला कैमरा या मस्तिष्क को भ्रमित करने के लिए कमांड में "स्टेटिक" जोड़ना)।
  • बैंडविड्थ (The Bandwidth - पाइप का आकार): यह वह मात्रा है जितनी जानकारी पर सिस्टम को कार्य करने की अनुमति है।

हमले:

  • मॉडल-स्तर के हमले (संदेश के साथ छेड़छाड़ करना): यह किसी के द्वारा "स्टॉप" साइन पर स्प्रे पेंट करने जैसा है ताकि वह "गो" साइन जैसा दिखे। वे सिग्नल के साथ छेड़छाड़ कर रहे हैं या मस्तिष्क को भ्रमित करने के लिए शोर (Noise) जोड़ रहे हैं।
  • सिस्टम-स्तर के हमले (पाइप को हाईजैक करना): यह बहुत अधिक डरावना है। यह मस्तिष्क को यह विश्वास दिलाने जैसा है कि उसके पास शहर के बांध के गेट खोलने की अनुमति है। वे अनिवार्य रूप से मस्तिष्क को भ्रमित नहीं कर रहे हैं; वे बैंडविड्थ का फायदा उठा रहे हैं—उन "अधिकृत मार्गों" का उपयोग कर रहे हैं जिनका उपयोग सिस्टम कार्रवाई करने के लिए करता है।

3. बड़ी खोज: "रक्षा की विषमता" (Asymmetry of Defense)

यह इस पेपर का सबसे महत्वपूर्ण हिस्सा है। लेखकों ने हमलावरों और रक्षकों के बीच एक मौलिक अन्याय पाया है।

मॉडल-स्तर की रक्षा (एक "फिल्टर" दृष्टिकोण):
कल्पना कीजिए कि आप अपने पाइपों पर हर छोटे से छोटे कचरे को पकड़ने के लिए लगातार महीन फिल्टर लगाकर बाढ़ को रोकने की कोशिश कर रहे हैं। समस्या यह है कि जैसे-जैसे बाढ़ (हमला) अधिक शक्तिशाली और परिष्कृत होती जाती है, आपको अधिक और अधिक फिल्टरों का उपयोग करना पड़ता है, जो अंततः उपयोगी जानकारी (पानी) की गति को धीमा कर देता है जब तक कि शहर काम करना बंद न कर दे। इस रक्षा के "घटते प्रतिफल" (diminishing returns) होते हैं।

सिस्टम-स्तर की रक्षा (एक "द्वारपाल" दृष्टिकोण):
पानी की हर बूंद को फिल्टर करने के बजाय, आप बस एक भारी-भरकम स्टील का गेट स्थापित करते हैं जो केवल सत्यापित, अधिकृत ट्रकों के लिए खुलता है। इससे कोई फर्क नहीं पड़ता कि पानी में कितना "शोर" या "कचरा" है; यदि ट्रक के पास सही चाबी नहीं है, तो गेट बंद रहेगा। यह बहुत अधिक प्रभावी है क्योंकि यह इस बात पर एक सख्त सीमा निर्धारित करता है कि क्या हो सकता है।

4. "परमाणु विकल्प" (The Nuclear Option): सर्किट ब्रेकर

अंत में, लेखक सुझाव देते हैं कि यदि शहर पर एक बड़ा, अजेय हमला हो रहा है जो सभी फिल्टरों और द्वारों को पार कर जाता है, तो सिस्टम को एक "स्व-विनाश दहलीज" (Self-Destruction Threshold) की आवश्यकता होती है।

इसे आपके घर में एक सर्किट ब्रेकर की तरह समझें। यदि बिजली का भारी उछाल आता है जो पूरे घर को जलाने की धमकी देता है, तो ब्रेकर "ट्रिप" हो जाता है और तुरंत बिजली काट देता है। लेखक प्रस्तावित करते हैं कि यदि कोई AI सिस्टम पता लगाता है कि "हानि" एक निश्चित स्तर तक पहुँच गई है, तो उसे एक "ग्रेसफुल शटडाउन" (graceful shutdown) करना चाहिए—यानी, एक विनाशकारी आपदा (जैसे रोबोटिक हाथ का किसी को चोट पहुँचाना या बैंक खाता खाली होना) को रोकने के लिए अपनी प्रक्रियाओं को "मार देना" चाहिए।

संक्षेप में:

  • केवल AI को झूठ पकड़ने में "स्मार्टर" बनाने की कोशिश न करें (Model Defense)। यह एक हारने वाली लड़ाई है।
  • इसके बजाय, AI को क्या करने की अनुमति है, उसके चारों ओर "दीवारें और गेट" बनाएं (System Defense)।
  • और यदि चीजें पूरी तरह से गलत हो जाती हैं, तो पूर्ण अराजकता को रोकने के लिए सिस्टम को एक "किल स्विच" (Circuit Breaker) दें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →