TACTIC-KG: Toward Small Agent Teams for Cyber Threat Intelligence Knowledge Graph Construction
TACTIC-KG एक लागत प्रभावी एजेंटिक फ्रेमवर्क है जो अनस्ट्रक्चर्ड थ्रेट रिपोर्ट्स से साइबर सुरक्षा नॉलेज ग्राफ का निर्माण करने के लिए कार्य को हल्के वजन वाले LLMs के लिए विशिष्ट भूमिकाओं में विभाजित करता है, जिससे यह सटीकता, स्थिरता और दक्षता में मोनोलिथिक बड़े मॉडलों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक शहर का एक विशाल, विस्तृत मानचित्र बनाने की कोशिश कर रहे हैं, लेकिन ब्लूप्रिंट के बजाय, आपके पास केवल अलग-अलग लोगों की हजारों अव्यवस्थित, हस्तलिखित डायरी प्रविष्टियाँ हैं। कुछ प्रविष्टियाँ स्पष्ट हैं, कुछ बिखरी हुई हैं, कुछ विरोधाभासी हैं, और कुछ तो बस मनगढ़ंत हैं। यही वह स्थिति है जिसका सामना साइबर सुरक्षा विशेषज्ञ तब करते हैं जब वे साइबर थ्रेट इंटेलिजेंस (CTI) रिपोर्टों को नॉलेज ग्राफ (Knowledge Graphs) में बदलने की कोशिश करते हैं। ये रिपोर्टें हैकर्स, उनके टूल्स और उनके हमलों का वर्णन करती हैं, लेकिन वे असंरचित और अव्यवस्थित टेक्स्ट में लिखी होती हैं।
यह पेपर इस समस्या को हल करने के लिए TACTIC-KG नामक एक नई प्रणाली पेश करता है। यह कैसे काम करता है, इसे सरल उपमाओं (analogies) के माध्यम से समझते हैं:
पुराना तरीका: "सुपर-जीनियस" सोलो आर्टिस्ट
पहले, शोधकर्ता एक विशाल, अत्यंत शक्तिशाली AI (एक "मोनोलिथिक" मॉडल) का उपयोग करने की कोशिश करते थे जो उस अव्यवस्थित डायरी को पढ़ सके, कहानी को समझ सके, हैकर्स और टूल्स के नाम ढूंढ सके, यह पता लगा सके कि वे कैसे जुड़े हुए हैं, और एक ही बार में पूरा नक्शा बना सके।
इसे एक अकेले सुपर-जीनियस आर्टिस्ट को यह पूरा काम करने के लिए काम पर रखने जैसा समझें।
- समस्या: जीनियस भी थक जाते हैं। जब कहानी बहुत लंबी या जटिल हो जाती है, तो सुपर-जीनियस भ्रमित होने लगता है (hallucinate करने लगता है)। वे दो लोगों के बीच ऐसा संबंध बना सकते हैं जो वास्तव में कभी अस्तित्व में ही नहीं था, या वे किसी महत्वपूर्ण विवरण को भूल सकते हैं क्योंकि वे एक साथ बहुत सारी चीजें करने की कोशिश कर रहे थे।
- लागत: यह सुपर-जीनियस काम पर रखने के लिए अविश्वसनीय रूप से महंगा और काम करने में धीमा भी है।
नया तरीका: "विशेषज्ञों की टीम" (TACTIC-KG)
लेखकों ने कहा है, "एक ओवरवर्क्ड जीनियस पर निर्भर रहने के बजाय, आइए विशेषज्ञों की एक छोटी टीम नियुक्त करें।"
TACTIC-KG इस काम को चार अलग-अलग भूमिकाओं में विभाजित करता है, जिनमें से प्रत्येक को एक छोटे, सस्ते और अधिक केंद्रित AI एजेंट द्वारा संभाला जाता है। वे एक श्रृंखला में काम करते हैं, काम को आगे बढ़ाते हुए:
एक्सट्रैक्टर (द स्कैवेंजर - कूड़ा बीनने वाला):
- काम: यह एजेंट केवल टेक्स्ट को देखता है और जानकारी के कच्चे टुकड़े निकालता है (जैसे कि "Pegasus," "iOS," "NSO Group")। यह अभी इस बात की चिंता नहीं करता कि उनका अर्थ क्या है; यह बस तथ्यों को पकड़ लेता है।
- उपमा: एक स्कैवेंजर पक्षी की तरह जो जमीन से चमकदार चीजें उठाता है। यह हर उस चीज़ को पकड़ लेता है जो दिलचस्प दिखती है, बिना यह निर्णय लिए कि वह हीरा है या कांच का टुकड़ा।
टाइपर (द लेबलर - लेबल लगाने वाला):
- काम: यह एजेंट उन चमकदार चीजों को लेता है जिन्हें स्कैवेंजर ने खोजा था और उन्हें सही बक्सों में रखता है। क्या "Pegasus" एक Malware है? क्या "NSO Group" एक Organization है?
- उपमा: एक लाइब्रेरियन की तरह जो स्कैवेंजर द्वारा लाई गई किताबों को उनकी सही अलमारियों (फिक्शन, हिस्ट्री, साइंस) में रखता है।
वेरिफायर (द फैक्ट-चेकर - तथ्य-जांचकर्ता):
- काम: यह सबसे महत्वपूर्ण नया चरण है। यह एजेंट लेबल की गई वस्तुओं को देखता है और पूछता है, "क्या मूल डायरी में वास्तव में ऐसा कहा गया था?" यदि स्कैवेंजर और लेबलर ने कोई ऐसी धारणा बनाई है जो टेक्स्ट द्वारा समर्थित नहीं है, तो वेरिफायर उसे बाहर निकाल देता है। यह सुनिश्चित करता है कि सिस्टम मनगढ़ंत बातें न बनाए।
- उपमा: एक सख्त संपादक की तरह जो समाचार की जांच करता है। यदि रिपोर्टर दावा करता है कि "संदिग्ध पेरिस में था," लेकिन स्रोत टेक्स्ट केवल यह कहता है कि "संदिग्ध यूरोप में था," तो संपादक उस विशिष्ट दावे को काट देता है। यह सिस्टम को गलत चीजें बनाने से रोकता है।
क्यूरेटर (द मैप-मेकर - मानचित्र बनाने वाला):
- काम: यह एजेंट सत्यापित तथ्यों को लेता है और उन्हें एक अंतिम, साफ-सुथरे मानचित्र में जोड़ता है। यह छोटी त्रुटियों को ठीक करता है, डुप्लिकेट नामों को मर्ज करता है (जैसे "TrickBot" और "Trick Bot"), और यह सुनिश्चित करता है कि मानचित्र तार्किक रूप से सही हो और उसमें कोई फर्जी रास्ते न हों।
- उपमा: एक कार्टोग्राफर (मानचित्रकार) की तरह जो अंतिम नक्शा खींचता है, यह सुनिश्चित करता है कि सड़कें तार्किक रूप से जुड़ती हैं और उन पुलों को हटा देता है जो कहीं नहीं ले जाते।
यह टीम बेहतर क्यों है?
पेपर का दावा है कि यह टीम दृष्टिकोण तीन मुख्य कारणों से "सुपर-जीनियस" से बेहतर है:
- कम भ्रम (Less Hallucination): क्योंकि वेरिफायर एक सख्त गेटकीपर के रूप में कार्य करता है, इसलिए टीम गलती से फर्जी संबंध नहीं बनाती है। "सुपर-जीनियर" अक्सर बहुत मददगार होने की कोशिश करता है और खाली जगहों को अपने अनुमानों से भरने लगता है; यह टीम केवल तभी खाली जगहों को भरती है जब टेक्स्ट स्पष्ट रूप से उसका समर्थन करता है।
- बेहतर रिकॉल (अधिक खोजना): "स्कैवेंजर" को वह सब कुछ उठाने की अनुमति है जो वह देखता है, भले ही वह अनिश्चित हो। फिर "फैक्ट-चेकर" अच्छे और बुरे का चयन करता है। इसका मतलब है कि वे वास्तविक खतरों को कम मिस करते हैं, जबकि एकल मॉडल (single model) शायद बहुत अधिक जानकारी के बोझ तले दबकर विवरण छोड़ सकता है।
- सस्ता और तेज़: एक विशाल, महंगे कंप्यूटर दिमाग के बजाय, यह टीम कई छोटे, हल्के दिमागों (3 बिलियन से 8 बिलियन पैरामीटर्स) का उपयोग करती है। यह एक उच्च भुगतान वाले, धीमे कार्यकारी के बजाय कई कुशल इंटर्न का उपयोग करने जैसा है।
परिणाम
जब लेखकों ने इस सिस्टम का वास्तविक दुनिया की साइबर सुरक्षा रिपोर्टों पर परीक्षण किया, तो उन्होंने पाया कि:
- विशेषज्ञों की यह टीम बड़े एकल मॉडलों की तुलना में खतरों को खोजने और लेबल करने में अधिक सटीक थी।
- उनके द्वारा बनाए गए मानचित्र (नॉलेज ग्राफ) अधिक सुसंगत थे और उनमें फर्जी कनेक्शन कम थे।
- उन्होंने इन परिणामों को बहुत छोटे, सस्ते कंप्यूटर मॉडलों का उपयोग करके प्राप्त किया।
संक्षेप में, TACTIC-KG यह सिद्ध करता है कि साइबर खतरों को मैप करने जैसे जटिल कार्यों के लिए, एक ओवरवर्क्ड सुपरस्टार के बजाय विशेषज्ञों की एक अच्छी तरह से व्यवस्थित टीम बेहतर होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।