TTPrint: Evidence-Grounded TTP Extraction via Diverge-then-Converge Verification
TTPrint एक नवीन ढांचा है जो एक "डाइवर्ज-देन-कन्वर्ज" (विचलित-फिर-अभिसरण) रणनीति को अपनाकर साइबर थ्रेट इंटेलिजेंस रिपोर्टों से MITRE ATT&CK तकनीकों के निष्कर्षण में सुधार करता है, जिससे यह पहले विशिष्ट साक्ष्यों पर आधारित संभावित व्यवहारों की व्यापक रूप से पहचान करता है और फिर आधिकारिक परिभाषाओं के विरुद्ध उनका कड़ाई से सत्यापन करता है, जिससे यह रिकॉल और प्रिसिजन दोनों में मौजूदा तरीकों से काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जिसे एक विशाल, अराजक अपराध स्थल की रिपोर्ट सुलझाने का काम सौंपा गया है। रिपोर्ट सैकड़ों पन्नों लंबी है, जो तकनीकी शब्दावली और अस्पष्ट विवरणों के मिश्रण में लिखी गई है। आपका काम विशिष्ट "मोडस ऑपरेंडी" (अपराधियों ने यह कैसे किया) को खोजना और उन्हें एक विशाल, आधिकारिक नियम पुस्तिका MITRE ATT&CK से मिलाना है।
समस्या कठिन है:
- कुछ भी न छोड़ें: यदि आप कोई तकनीक चूक जाते हैं, तो अपराधी एक नए तरीके के साथ बच निकलेंगे।
- मनगढ़ंत बातें न करें: यदि आप किसी ऐसी तकनीक का अनुमान लगाते हैं जो वास्तव में वहां मौजूद नहीं है, तो आप सभी का समय बर्बाद करेंगे।
मौजूदा तरीके (जैसे पुरानी नियम पुस्तकें या सिंगल-पास AI) दोनों को करने में संघर्ष करते हैं। या तो वे बहुत सारे सुराग छोड़ देते हैं या बहुत सारे गलत अनुमान लगाते हैं।
पेश है TTPRINT, एक नई प्रणाली जो इसे एक मानव जासूसी टीम की तरह एक "Diverge-then-Converge" रणनीति का उपयोग करके हल करती है। इसे एक दो-चरणीय प्रक्रिया के रूप में सोचें: पहले "विस्तार करें" (Spread Wide), फिर "संकुचित करें" (Narrow Down)।
TTPRINT जासूसी कार्यप्रवाह (Workflow)
चरण 1: "Diverge" (विस्तार करना - फैलाना)
तुरंत उत्तर का अनुमान लगाने के बजाय, TTPRINT उस विशाल अपराध रिपोर्ट को छोटे-छोटे टुकड़ों में तोड़ देता है जिन्हें "एटॉमिक बिहेवियर्स" (atomic behaviors) कहा जाता है।
- उपमा: कल्पना करें कि आप एक 50 पन्नों के उपन्यास को व्यक्तिगत वाक्यों में काट रहे हैं।
- यह क्या करता है: प्रत्येक छोटे वाक्य के लिए, AI पूछता है, "यह क्या हो सकता है?" यह नियम पुस्तिका से संभावित मैचों की एक लंबी सूची तैयार करता है। यह जानबूझकर एक विस्तृत जाल बुनता है, भले ही इसका मतलब कुछ अकल्पनीय विकल्प सुझाना हो। इसका लक्ष्य रिकॉल (Recall) है: यह सुनिश्चित करना कि कोई भी वास्तविक सुराग पीछे न छूटे।
चरण 2: "Anchor" (लंगर डालना - साक्ष्य खोजना)
AI द्वारा किसी अनुमान की पुष्टि करने से पहले, उसे यह साबित करना होगा कि वह सुराग टेक्स्ट में कहाँ से आया है।
- उपमा: यदि आप कहते हैं, "संदिग्ध ने एक क्राउबार (crowbar) का उपयोग किया," तो आपको रिपोर्ट के उस सटीक वाक्य की ओर इशारा करना चाहिए जो कहता है, "संदग्ध ने एक क्राउबर का उपयोग किया।" आप केवल यह नहीं कह सकते कि "मुझे लगता है कि उन्होंने क्राउबार का उपयोग किया क्योंकि उन्होंने खिड़की तोड़ी है।"
- यह क्या करता है: TTPRINT उस विशिष्ट "विंडो" (text window) को खोजने के लिए एक सख्त, गैर-AI एल्गोरिदम का उपयोग करता है जो व्यवहार का समर्थन करती है। यह हर अनुमान को साक्ष्य के एक विशिष्ट टुकड़े से जोड़ देता है, जिससे AI को पूरे दस्तावेज़ के सामान्य भाव के आधार पर कल्पना (hallucination) करने से रोकता है।
चरण 3: "Converge" (संकुचित करना - संकुचन)
अब कठोर सत्यापन आता है। AI "संभावित" मैचों की सूची और विशिष्ट "साक्ष्य विंडो" को लेता है।
- उपमा: एक वरिष्ठ जासूस जूनियर की सूची की समीक्षा करता है। वे नियम पुस्तिका की परिभाषा और विशिष्ट वाक्य (साक्ष्य) को अगल-बगल देखते हैं। वे पूछते हैं: "क्या यह वाक्य वास्तव में नियम पुस्तिका की परिभाषा से मेल खाता है, या यह केवल एक ढीला अनुमान है?"
- यह क्या करता है: AI एक कॉन्फिडेंस स्कोर (विश्वास स्कोर) असाइन करता है। यदि मैच कमजोर है, तो उसे हटा दिया जाता है। यदि यह मजबूत है, तो उसे रखा जाता है। यह चरण सुनिश्चित करता है कि प्रिसिजन (Precision): केवल वे तथ्य जो वास्तव में टेक्स्ट द्वारा समर्थित हैं, ही शेष रहते हैं।
यह बेहतर क्यों काम करता है
शोधकर्ताओं का दावा है कि पिछले तरीकों ने एक ही बार में ये सभी चरण करने की कोशिश की थी (जैसे एक जासूस एक ही सांस में पूरी कहानी का अनुमान लगाने की कोशिश करता है)। इससे गलतियाँ होती हैं:
- बहुत अधिक सतर्क: वे गलत अनुमान लगाने से बचने के लिए सूक्ष्म सुरागों को छोड़ देते हैं।
- बहुत अधिक आत्मविश्वासी: वे गलत अनुमान लगाते हैं क्योंकि रिपोर्ट की शब्दावली नियम पुस्तिका से पूरी तरह मेल नहीं खाती।
TTPRINT "अनुमान लगाने" को "जांचने" से अलग करता है। काम को विभाजित करके, यह अनुमान लगाने में साहसी (सब कुछ पकड़ने के लिए) और जांचने में सख्त (केवल सत्य रखने के लिए) हो सकता है।
परिणाम
शोधकर्ताओं ने दो डेटासेट्स पर TTPRINT का परीक्षण किया:
- TRAM-Clean: एक मौजूदा डेटासेट का एक साफ किया गया संस्करण (उन्होंने मूल लेबल में त्रुटियों को ठीक किया)।
- TTPRINT-Bench: 150 पूर्ण रिपोर्टों का एक नया डेटासेट जिसे उन्होंने शून्य से बनाया है।
स्कोरकार्ड:
- नए डेटासेट पर, TTPRINT की सफलता दर 87.39% (मैक्रो-F1) रही।
- सबसे अच्छा पिछला तरीका (एक मानक AI जो "चेन ऑफ थॉट" का उपयोग करता है) केवल 58.02% प्राप्त कर सका।
- TTPRINT ने स्कोर में लगभग 30% का सुधार किया, जिसका अर्थ है कि इसने बहुत कम गलतियाँ करते हुए काफी अधिक वास्तविक तकनीकों को खोजा।
नियंत्रण के लिए "नॉब" (Knob)
एक शानदार विशेषता एक "थ्रेशोल्ड नॉब" (जिसे कहा जाता है) है।
- इसे ऊपर घुमाएं: आपको कम परिणाम मिलेंगे, लेकिन आप 100% आश्वस्त होंगे कि वे सही हैं (उच्च प्रिसिजन/Precision)। उन स्वचालित प्रणालियों के लिए अच्छा है जो गलती नहीं कर सकतीं।
- इसे नीचे घुमाएं: आपको अधिक परिणाम मिलेंगे, लगभग सब कुछ पकड़ लेंगे, भले ही उनमें से कुछ संदिग्ध हों (उच्च रिकॉल/Recall)। उन सुरक्षा टीमों के लिए अच्छा है जो हर संभावित खतरे को पकड़ना चाहती हैं और बाद में जांच करना चाहती हैं।
सारांश
TTPRINT एक ऐसे जासूस की तरह है जो पहले रिपोर्ट के हर वाक्य के आधार पर हर संभावित सिद्धांत को लिख लेता है, फिर अंतिम केस फाइल लिखने से पहले प्रत्येक सिद्धांत की विशिष्ट साक्ष्य के विरुद्ध कठोरता से जांच करता है। यह दृष्टिकोण इसे किसी भी पिछले तरीके की तुलना में अधिक वास्तविक खतरों को पकड़ने और बहुत कम गलत अलार्म देने की अनुमति देता है।
नोट: शोध पत्र सख्ती से अंग्रेजी भाषा की रिपोर्टों से इन तकनीकों को निकालने पर केंद्रित है। यह भविष्य के हमलों की भविष्यवाणी करने, हैकर्स को वास्तविक समय में रोकने, या चिकित्सा या कानूनी निदान उपकरण के रूप में कार्य करने का दावा नहीं करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।