Self-Supervised Representations for Binary Program Clustering: From Empirical Study to Retrieval-Augmented Learning
यह शोध पत्र बाइनरी प्रोग्राम क्लस्टरिंग के लिए सेल्फ-सुपरवाइज्ड और टैबुलर रिप्रेजेंटेशन लर्निंग की पहली व्यवस्थित जांच प्रस्तुत करता है, जिसमें VIME को एक नई स्टेट-ऑफ-द-आर्ट विधि के रूप में पहचाना गया है और VIME-R प्रस्तावित किया गया है, जो एक रिट्रीवल-ऑगमेंटेड वेरिएंट है जो मालवेयर क्लस्टरिंग प्रदर्शन में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि इंटरनेट एक विशाल, हलचल भरे शहर की तरह है जहाँ हर दिन लाखों नए "डिजिटल निवासी" आते हैं। अधिकांश पड़ोसी मिलनसार हैं, लेकिन कुछ चालाक घुसपैठिए भी हैं जो चोरी करने, तोड़ने या अराजकता फैलाने की कोशिश करते हैं। इन घुसपैठियों को मैलवेयर (malware) कहा जाता है। अकेले 2024 में ही, 8 करोड़ से अधिक नए मैलवेयर सामने आए। इस शहर को सुरक्षित रखने के लिए, सुरक्षा गार्डों (साइबर सुरक्षा विशेषज्ञों) को इन लाखों फाइलों को समूहों में छाँटने की आवश्यकता होती है। यदि वे पहचान सकें कि एक नई फ़ाइल किसी ज्ञात अपराधी के समान ही "परिवार" से संबंधित है, तो वे खतरे को तुरंत रोक सकते हैं। इस छँटाई की प्रक्रिया को क्लस्टरिंग (Clustering) कहा जाता है।
आमतौर पर, यदि आपके पास नामों (लेबल) की एक सूची हो जो बताती है कि कौन कौन है, तो छँटाई करना आसान होता है। लेकिन वास्तविक दुनिया में, गार्डों को अक्सर बिना किसी नाम के फाइलों के एक विशाल ढेर को छाँटना पड़ता है। यहीं पर सेल्फ-सुपरवाइज्ड लर्निंग (SSL) और टेबुलर रिप्रेजेंटेशन लर्निंग (TRL) काम आते हैं। SSL को एक ऐसे छात्र के रूप में सोचें जो एक ही वस्तु की दो थोड़ी अलग तस्वीरों को देखकर यह अनुमान लगाता है कि वे एक ही चीज़ हैं, बिना किसी शिक्षक द्वारा उत्तर बताए। TRL स्प्रेडशीट डेटा (संख्याओं की पंक्तियों और कॉलमों) को समझने की विशिष्ट कला है, न कि चित्रों या टेक्स्ट की। मुख्य सवाल जो शोधकर्ता पूछ रहे थे वह यह है: क्या हम कंप्यूटर को बिना किसी मानव शिक्षक की मदद के, केवल उनके नंबरों को देखकर, इन रहस्यमय मैलवेयर फाइलों को सटीक परिवारों में छाँटना सिखा सकते हैं?
रहस्यमयी फाइलों का रहस्य
इस अध्ययन में, शोधकर्ताओं मार्टिन मोको और डेनिएला चुडा ने एक डिजिटल फाइलों के विशाल ढेर के साथ जासूसी करने का निर्णय लिया। वे देखना चाहते थे कि क्या आधुनिक AI तकनीकें, जिनका उपयोग आमतौर पर तस्वीरों में बिल्लियों को पहचानने या वाक्यों को समझने के लिए किया जाता है, उन्हें मैलवेयर फाइलों को एक साथ समूहित करने के लिए पुन: उपयोग किया जा सकता है। उन्होंने विंडोज फाइलों के दो विशाल, सार्वजनिक डेटासेट एम्बर (Ember) और बोडमास (Bodmas) का उपयोग किया। ये डेटासेट विशाल पुस्तकालयों की तरह हैं जिनमें सैकड़ों हजारों फाइलें हैं, जिनमें से प्रत्येक का वर्णन संख्याओं की एक लंबी सूची (विशेषताओं/फीचर्स) द्वारा किया जाता है जो एक फिंगरप्रिंट की तरह कार्य करती है।
शोधकर्ताओं ने अपनी जांच को दो चरणों में विभाजित किया, जैसे कि एक दो-भाग वाला रहस्य उपन्यास हो।
चरण 1: "क्या होगा अगर" परीक्षण
सबसे पहले, वे सर्वोत्तम संभव स्कोर जानना चाहते थे। कल्पना कीजिए कि एक शिक्षक AI को उत्तर कुंजी (answer key) दे रहा है। उन्होंने छवियों के लिए डिज़ाइन किए गए प्रसिद्ध AI मॉडल (जैसे BYOL, SimSiam, Barlow Twins, और VICReg) को लिया और उन्हें उन फाइलों की तुलना करके सीखने के लिए मजबूर किया जिन्हें वे जानते थे कि एक ही परिवार से संबंधित हैं। यह एक "सुपरवाइज्ड" परीक्षण था यह देखने के लिए कि उच्चतम स्तर तक कैसे पहुँचा जा सकता है।
परिणाम नायकों और विफलताओं का मिश्रण थे। BYOL और SimSiam सुपरहीरो साबित हुए। जब उन्हें उत्तर कुंजी दी गई, तो उन्होंने एक पूर्ण रूप से सुपरवाइज्ड मॉडल (जो प्रत्येक परिवार का नाम जानता है) के लगभग समान प्रदर्शन किया, जिससे सामान्य श्रेणियों के लिए लगभग 99% और विशिष्ट परिवारों के लिए 84% से अधिक का "होमोजेनिटी" (समरूपता) स्कोर प्राप्त हुआ। हालाँकि, Barlow Twins और VICReg बुरी तरह लड़खड़ा गए, और उन्होंने सरलतम बेसलाइन तरीकों से भी खराब प्रदर्शन किया। इससे पता चलता है कि सभी "स्मार्ट" AI मॉडल समान रूप से स्मार्ट नहीं होते हैं जब आप चित्रों से स्प्रेडशीट की ओर बढ़ते हैं।
चरण 2: वास्तविक चुनौती
इसके बाद, शोधकर्ताओं ने उत्तर कुंजी हटा दी। यह वास्तविक दुनिया का परिदृश्य है: AI को बिना किसी परिवार का नाम जाने फाइलों को छाँटना होगा। उन्होंने चरण 1 के सर्वश्रेष्ठ मॉडलों का परीक्षण स्प्रेडशीट डेटा के लिए डिज़ाइन किए गए नए तरीकों जैसे VIME, SCARF, और SwitchTab के साथ किया।
यहाँ, पुराने इमेज-आधारित मॉडल (BYOL और SimSiam) संघर्ष कर रहे थे जब उन्हें स्प्रेडशीट के लिए बनाए गए "करप्शन" (विकृति) के ट्रिक्स का उपयोग करने के लिए मजबूर किया गया। वे सरल बेसलाइन को नहीं हरा सके। लेकिन VIME (वैल्यू इम्प्यूटेशन एंड मास्क एस्टीमेशन) आगे आया। इसने एक फ़ाइल के डेटा के कुछ हिस्सों को बेतरतीब ढंग से छिपाकर और गायब हिस्से का अनुमान लगाने की कोशिश करके काम किया, और इस प्रक्रिया में पैटर्न को सीखा। VIME नया चैंपियन साबित हुआ, जिसने मजबूत पारंपरिक बेसलाइनों (जैसे PCA और ऑटोएनकोडर्स) को पछाड़ दिया और एक नया स्टेट-ऑफ-द-आर्ट रिकॉर्ड बनाया।
ट्विस्ट: VIME-R
शोधकर्ता अभी रुके नहीं थे। उन्होंने देखा कि VIME पूरी लाइब्रेरी से बेतरतीब फाइलों को देखकर गायब डेटा का अनुमान लगा रहा था। लेकिन क्या होगा यदि यह केवल उन फाइलों को देखे जो पहले से ही उस फ़ाइल के बहुत समान हैं जिसका वह अध्ययन कर रहा है? उन्होंने VIME-R (रिट्रीवल-ऑगमेंटेड) का आविष्कार किया। पूरी भीड़ से अनुमान लगाने के बजाय, VIME-R पूछता है, "इस फ़ाइल के सबसे समान 100 पड़ोसी कौन हैं?" और खाली जगहों को भरने के लिए उनके डेटा का उपयोग करता है।
यह सरल परिवर्तन एक गेम-चेंजर साबित हुआ। VIME-R ने न केवल अन्य अनसुपरवाइज्ड तरीकों को हराया; एम्बर डेटासेट पर, इसने उस "सुपरवाइज्ड सीलिंग" को भी पार कर लिया जिसे उस विशिष्ट परीक्षण में सर्वश्रेष्ठ प्रदर्शन करने वाले सुपरवाइज्ड मॉडल द्वारा स्थापित किया गया था, जो कि SimSiam था। जबकि एक पूर्ण रूप से सुपरवाइज्ड MLP क्लासिफायर ने बोडमास डेटासेट पर उच्च स्कोर किया, एम्बर पर, VIME-R ने 77.48% की फैमिली होमोजेनिटी हासिल की, जो SimSiam के 76.53% के स्कोर से अधिक थी। इसका मतलब यह है कि एक चतुर "पड़ोस" रणनीति का उपयोग करके, अनसुपरवाइज्ड AI ने उन परिवारों को बेहतर ढंग से समूहित करने में सफलता पाई, जिन्हें उस विशिष्ट संदर्भ में स्पष्ट रूप से बताया गया था!
यह भविष्य के लिए क्या मायने रखता है
यह शोध पत्र सुझाव देता है कि जबकि कुछ लोकप्रिय AI मॉडल (जैसे Barlow Twins और VICReg) मैलवेयर स्प्रेडशीट को छाँटने के लिए सही उपकरण नहीं हो सकते हैं, अन्य (जैसे BYOL और SimSiam) में बहुत क्षमता है यदि हम यह समझ सकें कि उनके सीखने के लिए फाइलों के सही "जोड़े" कैसे बनाए जाएं।
सबसे महत्वपूर्ण बात यह है कि यह अध्ययन सिद्ध करता है कि रिट्रीवल-ऑगमेंटेड लर्निंग एक शक्तिशाली नया दिशा है। AI को पूरी दुनिया के बजाय अपने निकटतम पड़ोसियों से सीखने के लिए सिखाकर, हम बिना महंगे मानव लेबल की आवश्यकता के अविश्वसनीय रूप से सटीक परिणाम प्राप्त कर सकते हैं। शोधकर्ताओं ने पाया कि VIME-R ने पिछले सर्वश्रेष्ठ तरीके की तुलना में क्लस्टरिंग की गुणवत्ता में 2.7% से 5.8% का सुधार किया।
हालाँकि यह अध्ययन स्थिर विशेषताओं (जैसे फ़ाइल के चलने के बजाय उसके ब्लूप्रिंट को देखना) और विशिष्ट डेटासेट तक सीमित है, परिणाम एक मजबूत संकेत हैं। वे दिखाते हैं कि सही ट्रिक्स के साथ, कंप्यूटर अपने आप मैलवेयर की अराजक दुनिया को व्यवस्थित करना सीख सकते हैं, जिससे संभावित रूप से सुरक्षा गार्ड नए खतरों को पहले से कहीं अधिक तेज़ी से पहचान सकेंगे। इन तरीकों का कोड उपलब्ध कराया जाएगा, जो दूसरों को इस खोज पर निर्माण करने के लिए आमंत्रित करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।