← नवीनतम पेपर
🤖 machine learning

Leveraging Interpretable Tsetlin Machine for PDF Malware Detection

यह शोध पत्र एक व्याख्या योग्य टसेटलिन मशीन-आधारित ढांचे का प्रस्ताव करता है जो फाइलों को निष्पादित किए बिना PDF मैलवेयर का पता लगाने के लिए प्रतिस्पर्धी सटीकता (98.02%) और पारदर्शी निर्णय लेने के लिए स्टैटिक विश्लेषण और नियम-आधारित शिक्षण का उपयोग करता है।

मूल लेखक: Rahul Jaiswal

प्रकाशित 2026-07-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rahul Jaiswal

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि डिजिटल दुनिया एक विशाल, हलचल भरी लाइब्रेरी है जहाँ लोग लगातार किताबें आपस में बदल रहे हैं। इनमें से अधिकांश किताबें हानिरहित PDF हैं—जैसे डिजिटल इनवॉइस, सर्टिफिकेट या मज़ेदार कॉमिक्स। लेकिन चालाक चोरों ने इन किताबों के पन्नों के भीतर छोटे, अदृश्य बम छिपाना शुरू कर दिया है। जब आप किताब खोलते हैं, तो वह बम फट जाता है, जिससे आपके पासवर्ड चोरी हो जाते हैं या आपका कंप्यूटर संक्रमित हो जाता है।

लंबे समय तक, सुरक्षा गार्डों (पुराने डिटेक्शन सिस्टम) ने ज्ञात अपराधियों के चेहरों को याद करके इन चोरों को पकड़ने की कोशिश की। यदि कोई किताब किसी ज्ञात अपराधी जैसी दिखती थी, तो वे उसे रोक देते थे। लेकिन चोर चालाक हैं; वे हर दिन अपने मुखौटे बदलते रहते हैं, नए "चेहरे" बनाते जिन्हें गार्डों ने पहले कभी नहीं देखा होता। अन्य गार्डों ने जटिल, 'ब्लैक-बॉक्स' रोबोटों का उपयोग किया जो यह अनुमान लगा सकते थे कि कोई किताब बुरी है या नहीं, लेकिन कोई भी रोबोट से यह नहीं पूछ सकता था कि उसने वह अनुमान क्यों लगाया। वह बस "बुरा!" कहता और आगे बढ़ जाता, जिससे इंसान भ्रमित और संदिग्ध हो जाते थे।

यहाँ राहुल जायसवाल और यूनिवर्सिटी ऑफ एगर की उनकी टीम के साथ एक नए प्रकार के सुरक्षा गार्ड का आगमन होता है: त्सेटलिन मशीन (Tsetlin Machine)

त्सेटलिन मशीन को एक रहस्यमय रोबोट के रूप में नहीं, बल्कि एक सुपर-स्मार्ट जासूस के रूप में सोचें जो सरल, स्पष्ट तर्क नियमों (logic rules) का उपयोग करके अपराधों को सुलझाता है। अनुमान लगाने के बजाय, यह जासूस "यदि-तो" (If-Then) संकेतों की एक सूची बनाता है। उदाहरण के लिए, यह सीख सकता है: "यदि एक PDF में एक छिपी हुई जावास्क्रिप्ट फ़ाइल है AND यह एन्क्रिप्टेड है, तो यह शायद एक जाल है।" यह केवल अनुमान नहीं लगाता; यह अपने निर्णय के सटीक कारण लिखता है, जिससे इसकी सोच पूरी तरह से पारदर्शी हो जाती है।

बड़ा परीक्षण
यह देखने के लिए कि यह नया जासूस कितना अच्छा था, टीम ने इसे वास्तविक दुनिया के 24,337 PDF के एक विशाल ढेर को छाँटने के लिए दिया (सुरक्षित दस्तावेज़ों और वास्तविक मैलवेयर का मिश्रण)। उन्होंने फाइलों को खोला या चलाया नहीं; उन्होंने केवल कोड के अंदर मौजूद "सामग्रियों" को देखा, जैसे कि किताब का आकार, पृष्ठों की संख्या, या क्या इसमें छिपी हुई स्क्रिप्ट्स हैं।

परिणाम प्रभावशाली थे। त्सेटलिन मशीन ने 98.02% बार खराब किताबों की सही पहचान की। यह उन बेहतरीन "ब्लैक-बॉक्स" रोबोटों (जैसे रैंडम फॉरेस्ट, जिसने 98.28% प्राप्त किया) के लगभग बराबर है, लेकिन एक बड़े बोनस के साथ: त्सेटलिन मशीन तेज़ थी, जिसे एक सिंगल फ़ाइल को चेक करने में केवल 2.853 माइक्रोसेकंड लगे। यह बिजली जैसी तेज़ गति है!

"क्यों" का महत्व क्यों है
सबसे शानदार बात केवल इसकी गति या स्कोर नहीं है; बल्कि खुद को समझाने की इसकी क्षमता है। जब त्सेत्लिन मशीन किसी फ़ाइल को खतरनाक के रूप में चिह्नित करती है, तो वह केवल "रुको!" चिल्लाती नहीं है। यह अपने "क्लॉज़" (इसके तर्क नियमों) के एक हीटमैप को चमकते हुए दिखाती है। यह विशिष्ट विशेषताओं की ओर इशारा कर सकती है, जैसे "इस फ़ाइल में एक संदिग्ध OpenAction कमांड है," और कह सकती है, "इसी वजह से मुझे चिंता है।"

एक परीक्षण में, इसने एक सुरक्षित फ़ाइल की सही पहचान की क्योंकि सुरक्षा के लिए इसके "वोट" अधिक (स्कोर 10) थे और खतरे के लिए इसके वोट कम थे। दूसरे मामले में, इसने एक दुर्भावनापूर्ण फ़ाइल को पकड़ा क्योंकि "खतरे" वाले नियम क्रिसमस ट्री की तरह जगमगा रहे थे, जबकि सुरक्षा वाले नियम अंधेरे में थे। यहाँ तक कि जब इसने गलती की (जो कुछ मामलों में हुई), तो टीम तर्क को देख सकती थी और समझ सकती थी कि मशीन क्यों भ्रमित हुई—शायद इसलिए क्योंकि सुरक्षित फ़ाइल बहुत हद तक एक बुरी फ़ाइल जैसी दिख रही थी।

यह क्या नहीं है
यह जानना महत्वपूर्ण है कि यह पेपर क्या दावा नहीं करता है। लेखक यह नहीं कह रहे हैं कि यह दुनिया की हर साइबर सुरक्षा समस्या को हल कर देता है। वे यह भी नहीं कह रहे हैं कि यह हर प्रकार के मैलवेयर पर काम करता है। वास्तव में, वे स्वीकार करते हैं कि उनका परीक्षण केवल एक विशिष्ट डेटासेट (RIT-PDFMal-2026) तक सीमित था और उन्होंने अभी तक वास्तविक मानव उपयोगकर्ताओं से यह नहीं पूछा है कि क्या उन्हें स्पष्टीकरण मददगार लगे। उन्होंने दूषित या टूटी हुई फाइलों पर भी इसका परीक्षण नहीं किया; उन्होंने केवल साफ, उपयोग योग्य PDF को ही देखा।

निर्णय (The Verdict)
तो, निष्कर्ष क्या है? पेपर सुझाव देता है कि इस तर्क-आधारित त्सेत्लिन मशीन का उपयोग करना PDF मैलवेयर को पकड़ने का एक बहुत ही आशाजनक तरीका है। यह एक बेहतरीन संतुलन प्रदान करता है: यह जटिल, समझने में कठिन AI मॉडल के लगभग उतना ही सटीक है, लेकिन यह तेज़ है और सबसे महत्वपूर्ण बात यह है कि यह बताता है कि यह क्यों सोचता है कि एक फ़ाइल बुरी है। यह एक ब्लैक बॉक्स को एक स्पष्ट खिड़की में बदल देता है, जिससे हम डिजिटल लाइब्रेरी को छाँटते समय जासूस के तर्क को देख सकते हैं। हालाँकि यह कोई जादुई छड़ी नहीं है जो सब कुछ ठीक कर देती है, लेकिन यह एक शक्तिशाली नया उपकरण है जो हमारी डिजिटल सुरक्षा को स्मार्ट और अधिक भरोसेमंद बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →