← नवीनतम पेपर
🤖 machine learning

TIJERE: A Novel Threat Intelligence Joint Extraction Model Based on Analyst Expert Knowledge

यह शोध पत्र TIJERE को प्रस्तुत करता है, जो एक नवीन संयुक्त इकाई और संबंध निष्कर्षण मॉडल है जो साइबर सुरक्षा खतरे की खुफिया जानकारी (साइबरसेक्युरिटी थ्रेट इंटेलिजेंस) में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए एक मल्टीसीक्वेंस लेबलिंग ढांचे के भीतर विश्लेषक विशेषज्ञ ज्ञान और एक फाइन-ट्यून्ड SecureBERT+ का लाभ उठाता है, साथ ही स्वचालित खतरे के विश्लेषण में मौजूदा अंतरालों को दूर करने के लिए पहले सार्वजनिक रूप से उपलब्ध संयुक्त रूप से लेबल किए गए डेटासेट, DNRTI-JE को भी जारी करता है।

मूल लेखक: Inoussa Mouiche, Sherif Saad

प्रकाशित 2026-05-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Inoussa Mouiche, Sherif Saad

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक बड़े साइबर अपराध मामले को सुलझाने की कोशिश कर रहे हैं। आपके पास हजारों अव्यवस्थित, बिना क्रम के पुलिस रिपोर्ट (थ्रेट इंटेलिजेंस रिपोर्ट्स) हैं, जो तकनीकी शब्दावली और अस्पष्ट विवरणों के मिश्रण में लिखी गई हैं। आपका लक्ष्य एक विशाल, व्यवस्थित मानचित्र (नॉलेज ग्राफ) बनाना है जो बिल्कुल यह दिखा सके कि किसने, क्या, किसे किया और कब किया।

उदाहरण के लिए, आपको यह पता लगाने की आवश्यकता है कि "APT29" (एक हैकर समूह) ने "XYZ Bank" (एक पीड़ित) पर हमला करने के लिए "Mimikatz" (एक टूल) का उपयोग किया।

यह पेपर TIJERE नामक एक नए टूल का परिचय देता है जो इस जासूसी कार्य को स्वचालित करने में मदद करता है। यह कैसे काम करता है, इसे सरल रूप में यहाँ समझाया गया है:

समस्या: "पाइपलाइन" बनाम "जॉइंट" दृष्टिकोण

पहले, कंप्यूटर इसे दो अलग-अलग चरणों में हल करने की कोशिश करते थे (एक फैक्ट्री असेंबली लाइन की तरह):

  1. चरण 1: लोगों, समूहों और टूल्स के सभी नामों को खोजना (नेम्ड एंटिटी रिकग्निशन)।
  2. चरण 2: उन नामों को देखना और अनुमान लगाना कि वे कैसे जुड़े हुए हैं (रिलेशन एक्सट्रैक्शन)।

दोष: यदि चरण 1 एक छोटी सी गलती करता है (जैसे किसी टूल को व्यक्ति के रूप में गलत पहचान लेना), तो वह त्रुटि चरण 2 में चली जाती है, जिससे पूरा मानचित्र बिगड़ जाता है। इसके अलावा, साइबर रिपोर्टों के वाक्य अक्सर अस्त-व्यस्त होते हैं। एक वाक्य कह सकता है, "APT29 ने बैंक X पर हमला करने के लिए टूल A का उपयोग किया," लेकिन यह यह भी संकेत देता है कि "टूल A का उपयोग APT29 द्वारा किया गया था।" कंप्यूटर इस बारे में भ्रमित हो जाता है कि कौन सा संबंध कौन सा है, खासकर जब एक ही शब्द अलग-अलग भूमिकाओं में दिखाई देता है।

समाधान: TIJERE (एक "विशेषज्ञ जासूस" प्रणाली)

TIJERE एक एकीकृत मस्तिष्क में दोनों चरणों को एक साथ करके खेल बदल देता है। लेकिन यह केवल कच्चे टेक्स्ट पर निर्भर नहीं है; यह एक मानव विशेषज्ञ की तरह कार्य करने के लिए तीन चतुर तरकीबों का उपयोग करता है:

1. "विशेषज्ञ ज्ञान" का चीट शीट (एक्सपर्ट डोमेन फीचर्स)

कल्पना कीजिए कि आप एक वाक्य पढ़ रहे हैं: "APT29 ने Mimikatz का उपयोग किया।"

  • एक सामान्य कंप्यूटर "APT29" और "Mimikatz" को केवल यादृच्छिक शब्दों के रूप में देखता है। यह सोच सकता है कि "Mimikatz" एक व्यक्ति का नाम है क्योंकि यह नहीं जानता कि यह क्या है।
  • TIJERE के पास एक विशेष चीट शीट है। यह जानता है कि "APT29" एक हैकर समूह है और "Mimikatz" एक टूल है।
  • उपमा: यह कंप्यूटर को एक विशेष चश्मे देने जैसा है जो हर वस्तु के प्रकार को हाइलाइट करता है। एक बार जब यह "हैकर समूह" और "टूल" देख लेता है, तो यह तुरंत समझ जाता है कि संबंध संभवतः "उपयोग करता है" (Uses) है, क्योंकि हैकर्स टूल्स का उपयोग करते हैं। यह कंप्यूटर को भ्रमित होने से रोकता है।

2. "हाइलाइटर पेन" (एंटिटी मास्क)

कई नामों वाले एक लंबे, जटिल वाक्य में, कंप्यूटर के लिए यह जानना कठिन होता है कि कौन से दो नाम आपस में बात कर रहे हैं।

  • TIJERE एक डिजिटल हाइलाइटर का उपयोग करता है। जब यह "APT29" और "Mimikatz" के बीच के संबंध को देखता है, तो यह केवल उन दो शब्दों को हाइलाइट करता है और बाकी सब कुछ वाक्य में "बैकग्राउंड नॉइज़" में बदल देता है।
  • उपमा: यह एक शिक्षक द्वारा भीड़ भरे कक्षा में दो विशिष्ट छात्रों की ओर लेजर पॉइंटर दिखाने और बाकी सबको अनदेखा करने जैसा है ताकि उनसे सवाल पूछा जा सके। यह कंप्यूटर को केवल प्रासंगिक जोड़ी पर ध्यान केंद्रित करने में मदद करता है।

3. "कई कॉपियां" की रणनीति (मल्टीसीक्वेंस लेबलिंग)

यही इस पेपर का सबसे बड़ा नवाचार है। आमतौर पर, एक कंप्यूटर एक वाक्य को एक बार पढ़ता है और एक साथ सभी संबंधों का अनुमान लगाने की कोशिश करता है।

  • TIJERE एक ही वाक्य को लेता है और उस वाक्य में मौजूद प्रत्येक जोड़ी के लिए अलग-अलग, अनुकूलित कॉपियां बनाता है।
  • उपमा: कल्पना कीजिए कि आपके पास संदिग्धों की तीन जोड़ियों वाला एक वाक्य है। पूरे पहेली को एक साथ हल करने के लिए कंप्यूटर से पूछने के बजाय, TIJERE वाक्य की तीन अलग-अलग कॉपियां बनाता है।
    • कॉपी A कहती है: "यहाँ जोड़ी (APT29, Mimikatz) है। उनका संबंध क्या है?"
    • कॉपी B कहती है: "यहाँ जोड़ी (APT29, Bank) है। उनका संबंध क्या है?"
    • कॉपी C कहती है: "यहाँ जोड़ी (Mimikatz, Bank) है। उनका संबंध क्या है?"
  • इन छोटे, केंद्रित प्रश्नों में समस्या को तोड़ने से, कंप्यूटर "ओवरलैपिंग" संबंधों से अभिभूत (overwhelmed) होना बंद कर देता है।

विशेष शब्दकोश (SecureBERT+)

साइबर सुरक्षा रिपोर्ट एक बहुत ही विशिष्ट भाषा का उपयोग करती हैं (जैसे "EternalBlue" या "Spear-phishing") जिसे सामान्य कंप्यूटर अच्छी तरह से नहीं समझते हैं। TIJERE SecureBERT+ नामक एक भाषा मॉडल के विशेष संस्करण का उपयोग करता है।

  • उपमा: इसे कंप्यूटर को जासूसों और हैकर्स द्वारा लिखे गए विशेष शब्दकोश पर प्रशिक्षित करने के रूप में सोचें, न कि एक मानक अंग्रेजी शब्दकोश पर। यह इसे साइबर दुनिया की "स्लैंग" समझने में मदद करता है।

परिणाम: एक नया मानचित्र और एक नया स्कोरकार्ड

यह साबित करने के लिए कि यह काम करता है, लेखकों ने दो चीजें कीं:

  1. उन्होंने एक नया डेटासेट (DNRTI-JE) बनाया: उन्होंने मौजूदा रिपोर्टों को लिया और उन्हें नामों और संबंधों दोनों के साथ मैन्युअल रूप से लेबल किया। यह पहली बार है जब ऐसा "संयुक्त रूप से लेबल किया गया" (jointly labeled) डेटासेट सार्वजनिक किया गया है।
  2. उन्होंने मॉडल का परीक्षण किया: जब उन्होंने अन्य तरीकों के मुकाबले TIJERE को चलाया, तो यह स्पष्ट विजेता था।
    • इसने नामों (Entities) को 93% बार सही ढंग से पहचाना।
    • इसने संबंधों को 98% बार सही ढंग से पहचाना।

सारांश

TIJERE को एक सुपर-पावर्ड डिटेक्टिव के रूप में सोचें जो केवल रिपोर्ट को पढ़ता ही नहीं है; यह इसमें शामिल पात्रों के प्रकारों को समझता है, सही जोड़ियों पर ध्यान केंद्रित करने के लिए हाइलाइटर का उपयोग करता है, और जटिल वाक्यों को सरल, वन-ऑन-वन इंटरव्यू में तोड़ देता है। एक विशेष "हैकर डिक्शनरी" के साथ इसे जोड़कर, यह पहले की तुलना में कहीं अधिक सटीक साइबर खतरों का मानचित्र बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →