Backdoor Learning in Language Models and Vision-Language Models
यह शोध प्रबंध नैचुरल लैंग्वेज प्रोसेसिंग और विजन-लैंग्वेज मॉडल्स में बैकडोर हमलों का विश्लेषण करके और नैदानिक एवं चिकित्सा इमेजिंग अनुप्रयोगों के लिए उन्नत मल्टीमॉडल रिप्रजेंटेशन विधियों को विकसित करके सुरक्षात्मक कमजोरियों और दक्षता सुधारों की जांच करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आधुनिक डिजिटल परिदृश्य में, आर्टिफिशियल इंटेलिजेंस (कृत्रिम बुद्धिमत्ता) सरल पैटर्न पहचान से विकसित होकर जटिल छवियों को समझने और मानव-समान टेक्स्ट उत्पन्न करने में सक्षम प्रणालियों में बदल गया है। ये प्रणालियाँ, जिन्हें भाषा मॉडल (language models) और विजन-लैंग्वेज मॉडल (vision-language models) के रूप में जाना जाता है, मेडिकल डायग्नोस्टिक्स से लेकर स्वचालित ग्राहक सेवा तक सब कुछ संचालित करती हैं। वे डेटा की विशाल मात्रा से सीखकर, शब्दों, अवधारणाओं और दृश्य विवरणों के बीच सूक्ष्म संबंधों की पहचान करके कार्य करती हैं। हालाँकि, यह अपार क्षमता एक छिपी हुई भेद्यता के साथ आती है। जिस प्रकार एक भौतिक ताले को एक विशिष्ट, छिपी हुई चाबी से खोला जा सकता है, इन बुद्धिमान प्रणालियों को उनके प्रशिक्षण के दौरान गुप्त रूप से हेरफेर किया जा सकता है। यह हेरफेर, जिसे 'बैकडोर अटैक' (backdoor attack) कहा जाता है, एक हमलावर को एक छिपा हुआ ट्रिगर (trigger) डालने की अनुमति देता है। जब यह प्रणाली भविष्य में इस ट्रिगर का सामना करती है, तो यह अपने सामान्य प्रशिक्षण को अनदेखा कर देती है और एक विशिष्ट, पूर्व-निर्धारित क्रिया करती है, जबकि ट्रिगर की अनुपस्थिति में यह पूरी तरह से सामान्य व्यवहार करती रहती है। स्वास्थ्य सेवा जैसे क्षेत्रों में दांव बहुत ऊंचे हैं, जहाँ एक समझौता की गई प्रणाली गलत निदान की ओर ले जा सकती है, या सार्वजनिक बुनियादी ढांचे में, जहाँ एक सूक्ष्म त्रुटि व्यापक व्यवधान पैदा कर सकती है।
स्टोनी ब्रुक यूनिवर्सिटी में वेमिन ल्यू का हालिया डॉक्टरेट शोध प्रबंध इन कमजोरियों की गहराई से जांच करता है, जो यह पता लगाता है कि ये हमले टेक्स्ट-आधारित प्रणालियों और नए, अधिक जटिल विजन-लैंग्वेज मॉडल में कैसे काम करते हैं। यह शोध केवल यह पहचान नहीं करता कि ये हमले संभव हैं; बल्कि यह इस बात का विश्लेषण करता है कि वे आंतरिक रूप से कैसे सफल होते हैं और उन्हें लॉन्च करने तथा पहचानने के नए तरीके प्रस्तावित करता है। अध्ययन यह प्रकट करता है कि जब एक भाषा मॉडल से समझौता किया जाता है, तो उसका आंतरिक "अटेंशन" (attention) तंत्र—एक ऐसी प्रक्रिया जो मॉडल को यह तय करने की अनुमति देती है कि अर्थ समझने के लिए वाक्य के कौन से शब्द सबसे महत्वपूर्ण हैं—हाइजैक हो जाता है। वाक्य के संदर्भ पर ध्यान केंद्रित करने के बजाय, समझौता किया गया मॉडल छिपे हुए ट्रिगर पर टिक जाता है, जिससे वह शेष इनपुट को प्रभावी ढंग से अनदेखा कर देता है। इस खोज ने 'एटेन-टीडी' (AttenTD) नामक एक नई पहचान विधि के विकास का मार्ग प्रशस्त किया, जो ध्यान के इन असामान्य बदलावों को स्कैन करती है। शोध में पाया गया कि यह विधि पिछले तकनीकों की तुलना में समझौता किए गए मॉडलों को पकड़ने में काफी अधिक प्रभावी है, जो विभिन्न डेटासेट्स में उच्च सटीकता के साथ बैकडोर्स की सफलतापूर्वक पहचान करती है।
शोध प्रबंध ने इन हमलों को बनाने का एक अधिक शक्तिशाली तरीका भी पेश किया, जिसे 'ट्रोजन अटेंशन लॉस' (Trojan Attention Loss) कहा गया। प्रशिक्षण के दौरान मॉडल के अटेंशन को सीधे हेरफेर करके उसे ट्रिगर पर ध्यान केंद्रित करने के लिए मजबूर करके, शोधकर्ताओं ने प्रदर्शित किया कि वे पहले की तुलना में बहुत कम 'पॉइज़न्ड' (विषैले) उदाहरणों के साथ बैकडोर्स बना सकते हैं। यह "क्लीन-लेबल" (clean-label) परिदृश्यों में भी प्रभावी पाया गया, जहाँ हमलावर को प्रशिक्षण डेटा में सही उत्तरों को बदलने की आवश्यकता नहीं होती है, जिससे हमला पता लगाना बहुत कठिन हो जाता है। अध्ययन ने इन निष्कर्षों को इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड के लिए उपयोग किए जाने वाले क्लिनिकल लैंग्वेज मॉडल्स तक विस्तारित किया। समान तकनीकों को लागू करके, शोधकर्ताओं ने दिखाया कि रोगी के परिणामों की भविष्यवाणी करने के लिए प्रशिक्षित एक मॉडल को सूक्ष्म रूप से बदला जा सकता है ताकि यदि रोगी के नोट्स में एक विशिष्ट, छिपी हुई वाक्यांश दिखाई दे, तो वह गलत भविष्यवाणियां दे सके, जो मेडिकल निर्णय सहायता प्रणालियों में एक गंभीर सुरक्षा जोखिम को उजागर करता है।
टेक्स्ट से आगे बढ़ते हुए, शोध ने उभरते हुए विजन-लैंग्वेज मॉडल्स के क्षेत्र को संबोधित किया, जो छवियों का वर्णन कर सकते हैं या उनके बारे में प्रश्नों के उत्तर दे सकते हैं। इन मॉडलों पर हमला करना विशेष रूप से चुनौतीपूर्ण है क्योंकि उन्हें दृश्य और पाठ्य दोनों सूचनाओं की एक सुसंगत समझ बनाए रखनी होती है। अध्ययन ने 'ट्रोज-वीएलएम' (TrojVLM) पेश किया, एक विधि जो सफलतापूर्वक छवि के भीतर ही एक छिपा हुआ ट्रिगर डाल देती है। जब इस ट्रिगर वाली एक 'पॉइज़न्ड' छवि मॉडल को दिखाई जाती है, तो वह एक विशिष्ट, पूर्व-निर्धारित वाक्य (जैसे कि कोई वेबसाइट यूआरएल या यादृच्छिक वाक्यांश) के साथ प्रतिक्रिया उत्पन्न करती है, जबकि बाकी छवि का सटीक वर्णन भी करती है। यह मॉडल को छवि के अर्थ को संरक्षित करने के साथ-साथ छिपे हुए टेक्स्ट को आउटपुट करने के लिए प्रशिक्षित करके प्राप्त किया गया था। शोध ने प्रदर्शित किया कि यह हमला विभिन्न प्रकार की छवियों और प्रश्नों पर काम करता है, और ट्रिगर की उपस्थिति में भी उत्पन्न टेक्स्ट की उच्च गुणवत्ता बनाए रखता है।
शायद सबसे चिंताजनक निष्कर्ष एक ऐसा हमला विकसित करना था जिसके लिए मूल प्रशिक्षण डेटा तक पहुंच की आवश्यकता नहीं है। 'वीएलओओडी' (VLOOD) नामक एक परिदृश्य में, शोधकर्ताओं ने दिखाया कि वे एक विजन-लैंग्वेज मॉडल को केवल उस डेटा का उपयोग करके समझौता कर सकते हैं जिसे मॉडल ने पहले कभी नहीं देखा है। नए डेटा को मॉडल के मौजूदा ज्ञान को संरक्षित करने वाली तकनीकों के साथ सावधानीपूर्वक संतुलित करके, वे मॉडल के मूल प्रशिक्षण सेट को छुए बिना बैकडोर स्थापित करने में सक्षम रहे। यह सुझाव देता है कि वास्तविक दुनिया में तैनात मॉडल, जिन्हें अक्सर उनके निजी प्रशिक्षण डेटा के कारण सुरक्षित माना जाता है, बाहरी लोगों द्वारा हेरफेर के प्रति संवेदनशील हो सकते हैं। अध्ययन ने पुष्टि की कि ये हमले मॉडल के सामान्य व्यवहार को बरकरार रखते हुए उच्च सफलता दर प्राप्त कर सकते हैं, जिससे उन्हें पहचानना अत्यंत कठिन हो जाता है।
इन खतरों का मुकाबला करने के लिए, शोध प्रबंध ने इन शक्तिशाली प्रणालियों को अधिक कुशल और व्याख्या योग्य बनाने के तरीकों का भी पता लगाया, विशेष रूप से चिकित्सा अनुप्रयोगों के लिए। शोधकर्ताओं ने होल-स्लाइड पैथोलॉजी इमेजेस (whole-slide pathology images) का विश्लेषण करने के लिए एक नया मॉडल विकसित किया, जो ऊतक नमूनों के गीगापिक्सेल-स्केल डिजिटल स्कैन हैं। ये छवियां इतनी बड़ी होती हैं कि मानक मॉडल इन्हें प्रोसेस करने में संघर्ष करते हैं। नया दृष्टिकोण दृश्य जानकारी को टोकन के एक छोटे, प्रबंधनीय सेट में संकुचित करता है, जिससे सिस्टम कंप्यूटेशनल संसाधनों को प्रभावित किए बिना ऊतक के बारे में जटिल प्रश्नों का उत्तर दे सकता है। इस कार्य ने प्रदर्शित किया कि चिकित्सा निदान में उच्च सटीकता बनाए रखते हुए कंप्यूटेशनल लागत को काफी कम करना संभव है, जो उन्नत एआई उपकरणों को अस्पतालों में व्यावहारिक बनाने के लिए एक महत्वपूर्ण कदम है।
इस शोध का व्यापक निष्कर्ष यह है कि आर्टिफिशियल इंटेलिजेंस की सुरक्षा उसके प्रदर्शन जितनी ही महत्वपूर्ण है। यह अध्ययन एक व्यापक मानचित्र प्रदान करता है कि कैसे बैकडोर हमले टेक्स्ट और विजन-लैंग्वेज दोनों प्रणालियों में घुसपैठ कर सकते हैं, जो यह प्रकट करता है कि इन मॉडलों के आंतरिक तंत्र पहले की तुलना में अधिक नाजुक हैं। अटेंशन को कैसे हाइजैक किया जा सकता है, इसे उजागर करके और यह प्रदर्शित करके कि न्यूनतम डेटा के साथ हमलों को कैसे निष्पादित किया जा सकता है, यह कार्य विश्वसनीय एआई के विकास के लिए एक अपूरणीय आवश्यकता पर जोर देता है। ये निष्कर्ष भरोसेमंद एआई के विकास के लिए एक चेतावनी के रूप में कार्य करते हैं, जो इस बात पर जोर देते हैं कि इन सुरक्षा उपायों के बिना, वे प्रणालियाँ जो हमारी सहायता के लिए बनाई गई हैं, सूक्ष्म और अदृश्य हेरफेर द्वारा हमारे विरुद्ध भी इस्तेमाल की जा सकती हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।