Evaluating Retrieval-Augmented Generation for Explainable Malware Analysis
यह शोध पत्र अनुभवजन्य रूप से यह प्रदर्शित करता है कि रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) अक्सर शोर और अप्रासंगिक संदर्भ पेश करके मैलवेयर स्पष्टीकरण की गुणवत्ता को कम कर देता है, जो यह सुझाव देता है कि जब संरचित साक्ष्य पहले से ही उपलब्ध हों, तो मैलवेयर विश्लेषण को ज्ञान-प्राप्ति (knowledge-retrieval) की समस्या के बजाय एक सिग्नल-एक्सट्रैक्शन कार्य के रूप में माना जाना बेहतर है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं: यह कंप्यूटर फ़ाइल एक अपराधी की तरह व्यवहार क्यों कर रही है?
साइबर सुरक्षा की दुनिया में, विश्लेषकों के पास एक विशाल डेटाबेस है जिसे VirusTotal कहा जाता है। इस डेटाबेस को एक अत्यंत विस्तृत पुलिस रिपोर्ट की तरह समझें। यह सूची देता है कि फ़ाइल ने वास्तव में क्या किया: "इसने एक दरवाज़ा खोला," "इसने एक फ़ाइल की नकल की," "इसने एक संदिग्ध फ़ोन नंबर पर कॉल किया।" यह सब वहां है, स्पष्ट, संरचित तथ्यों में।
हाल ही में, सुरक्षा विशेषज्ञों ने AI जासूसों (लार्ज लैंग्वेज मॉडल्स, या LLMs) का उपयोग करना शुरू किया ताकि वे इन पुलिस रिपोर्टों को पढ़ सकें और एक स्पष्ट कहानी लिख सकें कि वह फ़ाइल बुरी क्यों है।
बड़ा सवाल: क्या हमें AI के लिए एक "लाइब्रेरी" की आवश्यकता है?
AI में एक लोकप्रिय विचार है जिसे RAG (रिट्रीवल-ऑगमेंटेड जनरेशन) कहा जाता है। इसका तर्क इस प्रकार है: "यदि हमारा AI जासूस एक कहानी लिख रहा है, तो आइए उसे पहले पढ़ने के लिए अतिरिक्त किताबों की एक लाइब्रेरी दें। शायद इसे यह समझने के लिए कि 'दरवाज़ा खोलना' आमतौर पर अन्य अपराध कहानियों में क्या मायने रखता है, कुछ खोजने की आवश्यकता हो ताकि यह एक बेहतर स्पष्टीकरण लिख सके।"
इस शोध पत्र के लेखकों ने यह परीक्षण करने का निर्णय लिया कि क्या यह "लाइब्रेरी" वास्तव में मदद करती है जब पुलिस रिपोर्ट (VirusTotal) पहले से ही पूर्ण और सटीक हो।
प्रयोग: लाइब्रेरी के साथ और बिना लाइब्रेरी वाला जासूस
शोधकर्ताओं ने दो समूहों के AI जासूसों के साथ एक परीक्षण आयोजित किया:
- समूह A: इसने VirusTotal रिपोर्ट को पढ़ा और एक स्पष्टीकरण लिखा।
- समूह B: इसने VirusTotal रिपोर्ट को पढ़ा, साथ ही AI "लाइब्रेरी" में गया, मैलवेयर के बारे में कुछ अतिरिक्त किताबें उठाईं, और उन कहानियों को स्पष्टीकरण में मिलाने की कोशिश की।
उन्होंने यह देखने के लिए एक स्कोरिंग सिस्टम (जिसे BERTScore कहा जाता है) का उपयोग किया कि AI की कहानी एक आदर्श स्पष्टीकरण के साथ कितनी अच्छी तरह मेल खाती है।
चौंकाने वाला परिणाम: लाइब्रेरी ने चीज़ों को बदतर बना दिया
शोध में पाया गया कि अतिरिक्त लाइब्रेरी की किताबें जोड़ने से AI के स्पष्टीकरण वास्तव में बदतर हो गए।
यहाँ उपमा (analogy) दी गई है:
कल्पना कीजिए कि आप एक न्यायाधीश को कार दुर्घटना के बारे में समझाने की कोशिश कर रहे हैं। आपके पास आधिकारिक पुलिस रिपोर्ट है जिसमें गति, टायर के निशान और मौसम का विवरण है।
- बिना लाइब्रेरी के: AI रिपोर्ट को देखता है और कहता है, "कार तेज़ गति से चल रही थी और पेड़ से टकरा गई।" (स्पष्ट, सटीक)।
- लाइब्रेरी के साथ: AI लाइब्रेरी में जाता है, "पेड़ कैसे बढ़ते हैं" के बारे में एक किताब पाता है, और "गति सीमा के इतिहास" के बारे में एक और किताब पाता है। यह उन कहानियों को अपनी व्याख्या में मिलाने की कोशिश करता है: "कार तेज़ गति से चल रही थी, और जबकि पेड़ आमतौर पर धीरे-धीरे बढ़ते हैं, इस एक को एक तेज़ कार ने टक्कर मारी, जो हमें 1990 के दशक की स्पीड लिमिट की बहसों की याद दिलाता है..."
अतिरिक्त जानकारी ने मदद नहीं की; इसने AI को विचलित कर दिया। इसने "शोर" (noise) पैदा किया और कहानी को भ्रमित या सामान्य बना दिया।
ऐसा क्यों हुआ?
लेखक समझाते हैं कि मैलवेयर का विश्लेषण करना भूसे के ढेर में सुई खोजने जैसा है, न कि शून्य से निबंध लिखने जैसा।
- VirusTotal रिपोर्ट में पहले से ही सभी "सुइयां" (विशिष्ट बुरे व्यवहार) मौजूद हैं।
- AI का काम केवल उन सुइयों को निकालना (extract) और यह बताना है कि उनका क्या अर्थ है।
- जब आप AI को अतिरिक्त किताबें पढ़ने के लिए मजबूर करते हैं (RAG), तो वह "भूसे" (अप्रासंगिक या बहुत कम संबंधित जानकारी) की ओर देखने लगता है। वह उन कहानियों से भ्रमित हो जाता है जो सुनने में संबंधित लगती हैं लेकिन वास्तव में इस विशिष्ट फ़ाइल के बारे में नहीं होती हैं।
सुरक्षा टीमों के लिए सीख
शोध पत्र निष्कर्ष निकालता है कि इस विशिष्ट कार्य (एक पूर्ण रिपोर्ट के आधार पर मैलवेयर को समझाना) के लिए, कम ही अधिक है (less is more)।
- इसे बहुत जटिल न बनाएं: यदि आपके पास पहले से ही पूर्ण तथ्य मौजूद हैं, तो AI को अतिरिक्त जानकारी खोजने के लिए मजबूर न करें। यह केवल AI को भ्रमित करता है या विचलित करता है।
- सिग्नल बनाम शोर (Signal vs. Noise): काम डेटा से स्पष्ट संकेतों को निकालने का है, न कि लाइब्रेरी से नया ज्ञान संश्लेषित करने का।
- बेहतर उपकरण: "लाइब्रेरी" दृष्टिकोण के बजाय, सुरक्षा उपकरणों को मौजूदा रिपोर्ट को अधिक सावधानी से पढ़ने में मदद करने पर ध्यान केंद्रित करना चाहिए, शायद तथ्यों को बेहतर ढंग से व्यवस्थित करके या अप्रासंगिक विकर्षणों को अनदेखा करके।
संक्षेप में: जब सबूत पहले से ही आपके सामने हों, तो AI को लाइब्रेरी भेजने से वह केवल यह भूल जाता है कि उसे क्या देखना था।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।