Securing Multimodal AI through Internal Information Decomposition
यह शोध पत्र फ्लोगार्ड (FlowGuard) का प्रस्ताव करता है, जो एक हल्का इन्फ्रेंस-टाइम फ्रेमवर्क है जो 'पार्शियल इंफॉर्मेशन डिकम्पोजिशन' (Partial Information Decomposition) से प्रेरित 'फ्लोवेक्टर्स' (FlowVectors) के माध्यम से आंतरिक क्रॉस-मोडल निरंतरता की निगरानी करके प्रतिकूल हमलों (adversarial attacks) का पता लगाकर मल्टीमॉडल एआई को सुरक्षित करता है, जिससे न्यूनतम विलंबता (latency) और उपयोगिता हानि के साथ हमले की सफलता दर में महत्वपूर्ण कमी आती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक ऐसा रोबोट बना रहे हैं जो कैमरे के माध्यम से दुनिया को देख सकता है और माइक्रोफ़ोन के माध्यम से आपसे बात कर सकता है। यह रोबोट एक "मल्टीमॉडल लार्ज लैंग्वेज मॉडल" (Multimodal Large Language Model) है, जो एक सुपर-स्मार्ट एआई है जो चित्रों और शब्दों को मिलाकर यह समझता है कि क्या हो रहा है। लेकिन पेचीदा हिस्सा यह है कि सिर्फ इसलिए कि रोबोट एक हानिरहित तस्वीर देखता है और एक हानिरहित वाक्य सुनता है, इसका मतलब यह नहीं है कि उनका संयोजन सुरक्षित है। यह वैसा ही है जैसे आप एक शेफ को केक की एक तस्वीर और केक की रेसिपी दें, लेकिन फिर उसके कान में एक गुप्त कोड फुसफुसा दें जो उसे जहर मिलाने के लिए कहे। तस्वीर ठीक दिखती है, रेसिपी ठीक दिखती है, लेकिन अंतिम व्यंजन खतरनाक होता है। यह वह नया प्रकार का खतरा है जिसके बारे में शोधकर्ता चिंतित हैं: हैकर्स जो अपनी बुरी मंशा को एक छवि और एक टेक्स्ट के बीच विभाजित कर देते हैं ताकि दोनों में से कोई भी अकेला संदिग्ध न दिखे, लेकिन मिलकर वे एआई को कुछ हानिकारक करने के लिए धोखा दे सकें।
इन चालाक चालों को पकड़ने के लिए, वैज्ञानिक आमतौर पर चित्र या टेक्स्ट की अलग-अलग जांच करते हैं, जैसे कि एक सुरक्षा गार्ड बैग और व्यक्ति के आईडी की एक-एक करके जांच करता है। लेकिन यह पेपर सुझाव देता है कि केवल इनपुट्स को देखने के बजाय, हमें यह देखना चाहिए कि रोबोट का दिमाग उनके बारे में कैसे सोचता है। मूल विचार यह है कि जब एक रोबोट सामान्य रूप से काम कर रहा होता है, तो चित्र और टेक्स्ट एक-दूसरे के साथ सहमत होते हैं और रोबोट को एक स्पष्ट, आत्मविश्वासी निर्णय लेने में मदद करते हैं। यदि कोई हैकर रोबोट को धोखा देने की कोशिश करता है, तो वह आंतरिक सहमति टूट जाती है। रोबोट का दिमाग भ्रमित हो जाता है, या चित्र और टेक्स्ट एक-दूसरे के विपरीत दिशा में खींचने लगते हैं, भले ही अंतिम उत्तर सुचारू दिखाई दे। यह पेपर एक नया सुरक्षा तंत्र प्रस्तावित करता है जिसे FlowGuard कहा जाता है जो एक "विचार जासूस" (thought detective) के रूप में कार्य करता है, जो यह देखने के लिए रोबोट की आंतरिक तर्क प्रक्रिया पर नज़र रखता है कि चित्र और टेक्स्ट एक-दूसरे से लड़ रहे हैं या अजीब व्यवहार कर रहे हैं, बजाय इसके कि केवल सतह-स्तर के शब्दों या पिक्सेल की जांच की जाए।
FlowGuard की कहानी: "थॉट फ्रैक्चर" को पकड़ना
इस पेपर के पीछे के शोधकर्ताओं ने, जेह्योक योन (Jehyeok Yeon) और सहयोगियों के नेतृत्व में, यह देखा कि ये एआई मॉडल कैसे काम करते हैं। जब आप एक मॉडल को एक सामान्य छवि और एक सामान्य प्रश्न देते हैं, तो चित्र को देखने वाला मस्तिष्क का हिस्सा और टेक्स्ट को पढ़ने वाला हिस्सा आमतौर पर बहुत अच्छे से तालमेल बिठाते हैं। वे जानकारी साझा करते हैं, इस पर सहमत होते हैं कि क्या महत्वपूर्ण है, और अंतिम उत्तर स्थिर और निश्चित महसूस होता है। यह दो दोस्तों द्वारा मिलकर एक रेत का महल बनाने जैसा है; वे दोनों जानते हैं कि महल कैसा दिखना चाहिए, और उनका संयुक्त प्रयास महल को अधिक मजबूत और विस्तृत बनाता है।
हालाँकि, जब एक हमलावर मॉडल को "जेलब्रेक" करने की कोशिश करता है—यानी, एक चित्र या टेक्स्ट में बुरी निर्देश छिपाकर मॉडल को उसके सुरक्षा नियमों को अनदेखा करने के लिए मजबूर करना—तो सामंजस्य टूट जाता है। पेपर सुझाव देता है कि भले ही हमलावर मॉडल को धोखा देने के लिए चित्र और टेक्स्ट को व्यक्तिगत रूप से निर्दोष दिखाने में सक्षम हो, लेकिन जिस क्षण मॉडल उन्हें मिलाने की कोशिश करता है, कुछ गलत हो जाता है। आंतरिक तर्क "विखंडित" (fractured) हो जाता है। चित्र एक चीज़ चिल्ला रहा हो सकता है जबकि टेक्स्ट दूसरी चीज़ फुसफुसा रहा हो, या संयोजन एक भ्रमित करने वाला ढेर बना सकता है जिसे मॉडल का दिमाग सुचारू रूप से हल नहीं कर पाता।
इसे पकड़ने के लिए, टीम ने FlowGuard बनाया। FlowGuard को दरवाजे पर खड़े गार्ड के रूप में नहीं, बल्कि रोबोट के मस्तिष्क के भीतर बैठे एक अनुवादक के रूप में सोचें। यह केवल अंतिम उत्तर को नहीं देखता; यह रोबोट की निर्णय लेने की प्रक्रिया के बिल्कुल पहले सेकंड पर नज़र डालता है। यह तीन त्वरित प्रश्न पूछता है:
- रोबोट क्या कहेगा यदि वह केवल चित्र को देखे?
- रोबोट क्या कहेगा यदि वह केवल टेक्स्ट को पढ़े?
- वह क्या कहता है जब वह दोनों को एक साथ देखता है?
फिर, यह इन तीन उत्तरों की तुलना करता है। एक सुरक्षित स्थिति में, "दोनों" वाला उत्तर अन्य दो का एक सुखद मिश्रण होना चाहिए, जैसे लाल और पीले रंग के पेंट का एक सुचारू मिश्रण नारंगी रंग बनाता है। लेकिन एक हमले में, "दोनों" वाला उत्तर अचानक एक अजीब रंग का हो सकता है, या लाल और पीला पेंट आपस में मिलने से मना कर सकता है। FlowGuard इस "मिश्रण" को कुछ फैंसी गणित का उपयोग करके मापता है (जो 'पार्शियल इंफॉर्मेशन डिकम्पोजिशन' नामक अवधारणा से प्रेरित है) ताकि एक FlowVector बनाया जा सके। यह एक छोटा, चार-नंबर वाला कोड है जो बताता है कि चित्र और टेक्स्ट वास्तव में कैसे परस्पर क्रिया कर रहे हैं।
- रेडंडेंसी (Redundancy): क्या चित्र और टेक्स्ट सहमत हैं? (उच्च रेडंडेंसी का अर्थ है कि वे एक ही पृष्ठ पर हैं)।
- यूनिकनेस (Uniqueness): क्या उनमें से कोई एक बातचीत पर हावी हो रहा है? (यदि चित्र चिल्ला रहा है और टेक्स्ट चुप है, तो यह उच्च विजुअल यूनिकनेस है)।
- सिनर्जी (Synergy): क्या उन्हें मिलाने से उत्तर अधिक स्पष्ट होता है, या यह इसे अधिक भ्रमित करता है? (अच्छी सिनर्जी का अर्थ है कि संपूर्ण अपने हिस्सों के योग से बड़ा है; बुरी सिनर्जी का अर्थ है कि संयोजन अराजकता पैदा करता है)।
टीम ने FlowGuard को केवल "अच्छे" उदाहरणों का उपयोग करके प्रशिक्षित किया—हजारों सामान्य चित्र और प्रश्न जहाँ रोबोट पूरी तरह से व्यवहार कर रहा था। उन्होंने एक एआई डिटेक्टर (एक आइसोलेशन फॉरेस्ट) को यह पहचानने के लिए प्रशिक्षित किया कि "सामान्य" प्रवाह कैसा दिखता है। क्योंकि उन्होंने इसे केवल अच्छे व्यवहार पर प्रशिक्षित किया था, इसलिए डिटेक्टर जानता है कि जो कुछ भी सामान्य पैटर्न से थोड़ा भी "अलग" दिखता है, वह संदिग्ध है। यह एक सुरक्षा प्रणाली को एक सामान्य घर की आवाज़ पहचानने के लिए सिखाने जैसा है; यदि कोई खिड़की टूटती है या फर्श का तख्ता अजीब तरह से चरमराता है, तो अलार्म बज जाता है, भले ही घुसपैठिया वेश बदलकर आया हो।
उन्होंने क्या पाया
परिणाम आश्चर्यजनक रूप से प्रभावी थे। शोधकर्ताओं ने FlowGuard का परीक्षण विविध प्रकार के हमलों के खिलाफ किया, जिसमें वे हमले शामिल थे जहाँ हैकर्स ने ASCII आर्ट में बुरे शब्द छिपाए, अदृश्य पिक्सेल परिवर्तनों के साथ छवियों को बदला, या एक निर्देश को चित्र और वाक्य के बीच विभाजित किया।
बिना किसी बचाव के, ये मॉडल अविश्वसनीय रूप से असुरक्षित थे। कुछ सबसे चालाक हमलों में, मॉडल 90% से अधिक बार विफल रहे, और खुशी-खुशी हानिकारक सामग्री उत्पन्न करते रहे। लेकिन जब FlowGuard चालू किया गया, तो इसने इन हमलों की सफलता दर को घटाकर 15% से कम कर दिया। कई मामलों में, इसने लगभग हर एक प्रयास को पकड़ लिया, जिससे विफलता दर एकल अंक (क्रॉस-मोडल हमलों के लिए लगभग 6% से 9%) तक आ गई।
सबसे दिलचस्प बात यह है कि FlowGuard ने केवल बुरे लोगों को ही नहीं रोका; इसने अनजाने में अच्छे लोगों को भी नहीं रोका। शोधकर्ताओं ने यह जांचा कि क्या FlowGuard चिड़चिड़ा होकर सामान्य प्रश्नों को देने से मना कर देगा। उन्होंने पाया कि इसने सुरक्षित इनपुट पर केवल 2.4% बार गलती की, जो अन्य सुरक्षा विधियों की तुलना में बहुत बेहतर है जो अक्सर सुरक्षित रहने के लिए हानिरहित प्रश्नों को भी ब्लॉक कर देती हैं। इसके अलावा, यह बहुत तेज़ था। जबकि कुछ अन्य सुरक्षा जाँचों को जटिल इमेज पुनर्निर्माण चलाने में कई सेकंड लग जाते हैं, FlowGuard ने लगभग 1.3 सेकंड में अपना काम कर दिया, जिससे यह वास्तविक समय के उपयोग के लिए व्यावहारिक बन गया।
पेपर ने यह भी दिखाया कि यह ट्रिक विभिन्न प्रकार के रोबोटों पर काम करती है, 4 बिलियन "मस्तिष्क कोशिकाओं" वाले छोटे रोबोटों से लेकर 70 बिलियन वाले विशाल रोबोटों तक। यह एक API के माध्यम से एक्सेस किए गए मॉडल पर भी काम करता है (जहाँ आप पूरे मस्तिष्क को नहीं देख सकते, केवल शीर्ष अनुमान देख सकते हैं), जो यह सिद्ध करता है कि "फ्रैक्चर थॉट" सिग्नल इन मॉडलों के काम करने का एक मौलिक हिस्सा है, न कि केवल किसी विशिष्ट डिज़ाइन की गड़बड़ी।
निचोड़
यह पेपर सुझाव देता है कि मल्टीमॉडल एआई को सुरक्षित करने का सबसे अच्छा तरीका इनपुट्स के चारों ओर ऊँची दीवारें बनाना नहीं है, बल्कि यह सुनना है कि एआई कैसे सोचता है। यह देखते हुए कि चित्र और टेक्स्ट कब एक-दूसरे के साथ अच्छा व्यवहार करना बंद कर देते हैं, FlowGuard एक हैकर की चाल को रोबोट के अपना वाक्य पूरा करने से पहले ही पकड़ सकता है। यह एक हल्का, तेज़ और आश्चर्यजनक रूप से मजबूत तरीका है जो इन शक्तिशाली उपकरणों को सुरक्षित रखता है, जो यह सुझाव देता है कि सुरक्षा की कुंजी मशीन के मन के आंतरिक सामंजस्य पर ध्यान देने में हो सकती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।