Malformer: A Multi-Modal Malware Detector Using Transformers
यह शोध पत्र Malformer को प्रस्तुत करता है, जो एक क्वाड्रिमॉडल (quadrimodal) ट्रांसफॉर्मर-आधारित डिटेक्टर है जो विंडोज निष्पादन योग्य (Windows executables) के टेक्स्ट, इमेज, ग्राफ और ऑडियो निरूपणों को फ्यूज करके 98.3% सटीकता प्राप्त करता है, जो पारंपरिक यूनिमॉडल और बाइमॉडल मैलवेयर डिटेक्शन सिस्टम से काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
डिजिटल दुनिया में, सुरक्षा टीमें दुर्भावनापूर्ण सॉफ़्टवेयर के खिलाफ एक निरंतर, बदलती हुई लड़ाई का सामना करती हैं। दशकों से, प्राथमिक रक्षा ज्ञात फिंगरप्रिंट्स को खोजने की रही है: कोड के विशिष्ट पैटर्न या अद्वितीय डिजिटल हस्ताक्षर जो एक वायरस की पहचान करते हैं। यह दृष्टिकोण पुराने खतरों के खिलाफ अच्छी तरह काम करता है, लेकिन यह तब विफल हो जाता है जब हमलावर नए, अनदेखे प्रोग्राम बनाते हैं या अपने पदचिह्नों को छिपाने के लिए मौजूदा प्रोग्रामों में थोड़ा बदलाव करते हैं। आगे रहने के लिए, शोधकर्ताओं ने मशीन लर्निंग की ओर रुख किया है, जिससे कंप्यूटर को केवल ज्ञात पैटर्न को मिलाने के बजाय दुर्भावनापूर्ण सॉफ़्टवेयर की सूक्ष्म, अंतर्निहित संरचनाओं को पहचानना सिखाया जा सके। शुरुआती प्रयासों ने कंप्यूटर को कच्चे कोड (raw code) को पढ़ने या फ़ाइल को एक साधारण छवि के रूप में देखने के लिए प्रशिक्षित किया, लेकिन प्रत्येक विधि की अपनी कमियां थीं। एक फ़ाइल को देखने का एक अकेला तरीका महत्वपूर्ण सुरागों को चूक सकता है, ठीक वैसे ही जैसे किसी व्यक्ति को केवल उसकी छाया देखकर या केवल उसकी आवाज़ सुनकर पहचानने की कोशिश करना।
टेनेसी टेक यूनिवर्सिटी, यूनिवर्सिटी ऑफ नेब्रास्का एट ओमाहा और नॉर्थ कैरोलिना ए एंड टी स्टेट यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने इन सीमाओं को दूर करने के लिए 'मालफॉर्मर' (Malformer) नामक एक नई प्रणाली विकसित की है। केवल एक कंप्यूटर फ़ाइल पर निर्भर रहने के बजाय, उनकी प्रणाली एक ही फ़ाइल को एक साथ चार पूरी तरह से अलग तरीकों से देखती है। वे फ़ाइल को एक टेक्स्ट दस्तावेज़, एक छवि, कनेक्शन के मानचित्र (map of connections), और एक ध्वनि तरंग (sound wave) के रूप में देखते हैं। इन चार दृष्टिकोणों को जोड़कर, प्रणाली इस बात की बहुत गहरी समझ विकसित करती है कि वह फ़ाइल क्या करने की कोशिश कर रही है। शोधकर्ताओं ने 2,00,000 से अधिक कंप्यूटर फ़ाइलों के विशाल संग्रह पर इस दृष्टिकोण का परीक्षण किया और पाया कि एक साथ चार लेंसों के माध्यम से समस्या को देखने से सिस्टम केवल एक या दो दृश्यों का उपयोग करने वाले तरीकों की तुलना में काफी उच्च सटीकता के साथ खतरों को पहचानने में सक्षम हुआ।
मालफॉर्मर के पीछे का मूल विचार यह है कि फ़ाइल को दर्शाने के विभिन्न तरीके जानकारी के विभिन्न प्रकारों को प्रकट करते हैं। जब एक कंप्यूटर फ़ाइल को टेक्स्ट में परिवर्तित किया जाता है, तो यह उन विशिष्ट निर्देशों को दिखाता है जो प्रोग्राम प्रोसेसर को देता है। जब उसी फ़ाइल को एक छवि में बदला जाता है, तो यह डेटा की व्यवस्था में पैटर्न को प्रकट करता है, ठीक वैसे ही जैसे एक फिंगरप्रिंट उभारों और घाटियों को दिखाता है। जब इसे एक ग्राफ में परिवर्तित किया जाता है, तो यह मानचित्र बनाता है कि प्रोग्राम के विभिन्न हिस्से एक-दूसरे से कैसे बात करते हैं, जिससे नियंत्रण का प्रवाह (flow of control) दिखाई देता है। अंत में, जब इसे एक ऑडियो सिग्नल के रूप में माना जाता है, तो फ़ाइल के बाइट्स का क्रम एक ध्वनि तरंग बनाता है जो लयबद्ध पैटर्न को वहन करती है। शोधकर्ताओं ने पाया कि इनमें से केवल एक दृश्य पर निर्भर रहने से अक्सर अंतराल रह जाते हैं। उदाहरण के लिए, यदि कोई हमलावर कोड को छिपाने के लिए टेक्स्ट को अस्पष्ट (obfuscate) कर देता है, तो छवि या ध्वनि वाला दृश्य अभी भी दुर्भावनापूर्ण संरचना को दिखा सकता है। चारों दृश्यों को संलयित (fuse) करके, सिस्टम एक सुरक्षा जाल बनाता है जहाँ एक दृश्य दूसरे की कमजोरियों की भरपाई कर सकता है।
इस प्रणाली को बनाने के लिए, शोधकर्ताओं ने 'ट्रांसफॉर्मर्स' (transformers) नामक उन्नत उपकरणों का उपयोग किया, जो शक्तिशाली कंप्यूटर मॉडल हैं और डेटा में जटिल संबंधों को समझने में सक्षम हैं। उन्होंने इन मॉडलों को चार अलग-अलग प्रकार के डेटा को संभालने के लिए अनुकूलित किया। टेक्स्ट और कनेक्शन मैप के लिए, उन्होंने भाषा और अनुक्रमों (sequences) को समझने के लिए डिज़ाइन किए गए मॉडलों का उपयोग किया। छवि के लिए, उन्होंने एक ऐसे मॉडल का उपयोग किया जो आमतौर पर फोटोग्राफ का विश्लेषण करता है, लेकिन उसे फ़ाइल के बाइट पैटर्न को देखने के लिए संशोधित किया गया। ध्वनि के लिए, उन्होंने मानव भाषण पर प्रशिक्षित एक मॉडल का उपयोग किया ताकि फ़ाइल के डेटा की लय को सुना जा सके। चुनौती केवल इन चार अलग-अलग दृश्यों को बनाने की नहीं थी, बल्कि यह सिखाने की भी थी कि वे एक-दूसरे के विरुद्ध अपना भार कैसे तय करें। शोधकर्ताओं ने एक ऐसी विधि विकसित की जो प्रशिक्षण के दौरान प्रत्येक दृश्य को दिए जाने वाले ध्यान (attention) को स्वचालित रूप से समायोजित करती है। यदि एक दृश्य अन्य दृश्यों की तुलना में तेजी से सीख रहा है, तो सिस्टम अस्थायी रूप से इसके प्रभाव को कम कर देता है ताकि धीमे दृश्य भी बराबरी कर सकें, जिससे पूरे सिस्टम के केवल एक प्रकार की जानकारी की ओर पक्षपाती होने का खतरा टल जाता है।
इस दृष्टिकोण के परिणाम आश्चर्यजनक थे। 2,01,549 फ़ाइलों के डेटासेट पर परीक्षण किए जाने पर, मालफॉर्मर सिस्टम ने 98.3% बार दुर्भावनापूर्ण सॉफ़्टवेयर की सही पहचान की। यह प्रदर्शन उन प्रणालियों की तुलना में उल्लेखनीय रूप से बेहतर था जो केवल एक प्रकार के डेटा को देखते थे या जो केवल दो दृश्यों को मिलाते थे। शोधकर्ताओं ने पाया कि इन चार दृश्यों का संयोजन उस स्तर का विवरण प्रदान करता है जो कोई भी एकल दृश्य अकेले प्राप्त नहीं कर सकता था। इससे भी महत्वपूर्ण बात यह है कि सिस्टम लचीला साबित हुआ। वास्तविक दुनिया के परिदृश्यों में, फ़ाइल के कुछ हिस्से क्षतिग्रस्त या अपठनीय हो सकते हैं, जिससे चार में से एक दृश्य विफल हो जाता है। शोधकर्ताओं ने यह परीक्षण किया कि क्या होगा यदि वे टेक्स्ट दृश्य या कनेक्शन मैप दृश्य को हटा देते हैं, और सिस्टम अभी भी बहुत अच्छा प्रदर्शन करता है, जिसकी सटीकता में केवल मामूली गिरावट आती है। यह सुझाव देता है कि सिस्टम किसी एकल विफलता बिंदु (single point of failure) पर निर्भर नहीं है, बल्कि चारों दृष्टिकोणों की सामूहिक शक्ति पर आधारित है।
अध्ययन ने प्रत्येक दृष्टिकोण के अद्वितीय मूल्य पर भी प्रकाश डाला। जबकि छवि दृश्य सबसे सुसंगत और विश्वसनीय था, कनेक्शन मैप दृश्य सबसे मजबूत व्यक्तिगत संकेत प्रदान करता था जब वह उपलब्ध होता था। टेक्स्ट दृश्य, जो असेंबली कोड का प्रतिनिधित्व करता है, विशेष रूप से उपयोगी था जब कनेक्शन मैप ठीक से निकालने में विफल रहा। ध्वनि दृश्य, जो इस क्षेत्र में एक कम प्रचलित दृष्टिकोण है, प्रभावी भी साबित हुआ, जिसने उन पैटर्न को पकड़ा जो अन्य दृश्यों ने छोड़ दिए थे। इन विविध विधियों को एक साथ लाकर, शोधकर्ताओं ने एक ऐसा डिटेक्टर बनाया जो न केवल अधिक सटीक है बल्कि हमलावरों द्वारा अपने काम को छिपाने के लिए इस्तेमाल किए जाने वाले चालाकी भरे तरीकों के खिलाफ अधिक मजबूत भी है। यह कार्य सुझाव देता है कि मालवेयर डिटेक्शन का भविष्य एक फ़ाइल का विश्लेषण करने के एक एकल पूर्ण तरीके को खोजने में नहीं है, बल्कि एक ही खतरे को देखने के कई, पूरक तरीकों को एकीकृत करने में है। जैसे-जैसे हमलावर अपने तरीकों को विकसित करते रहेंगे, एक ऐसी प्रणाली होना जो एक साथ चार अलग-अलग कोणों से समस्या को देख सके, उस डिजिटल बुनियादी ढांचे के लिए एक शक्तिशाली और सामान्यीकृत रक्षा प्रदान करता है जिस पर हम हर दिन भरोसा करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।