CTIConnect: A Benchmark for Retrieval-Augmented LLMs over Heterogeneous Cyber Threat Intelligence
यह शोध पत्र CTIConnect को प्रस्तुत करता है, जो एक व्यापक बेंचमार्क और मूल्यांकन हारनेस (harness) है जिसे नौ विषम साइबर थ्रेट इंटेलिजेंस कार्यों में रिट्रीवल-ऑगमेंटेड LLMs का व्यवस्थित रूप से आकलन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि प्रभावी प्रदर्शन के लिए जेनेरिक रिट्रीवल सुधारों के बजाय डोमेन-विशिष्ट संरचनात्मक हस्तक्षेपों की आवश्यकता होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक साइबर सुरक्षा जासूस (cybersecurity detective) हैं जो एक जटिल अपराध को सुलझाने की कोशिश कर रहे हैं। आपके पास सुरागों का एक विशाल पुस्तकालय है, लेकिन वे पाँच पूरी तरह से अलग भाषाओं और प्रारूपों (formats) में लिखे गए हैं: कुछ कठोर, तकनीकी स्प्रेडशीट (जैसे सॉफ़्टवेयर बग का डेटाबेस) हैं, जबकि अन्य अलग-अलग रिपोर्टरों द्वारा लिखे गए लंबे, अव्यवस्थित समाचार लेख हैं जो अपराधियों के लिए स्लैंग (slang) और उपनामों का उपयोग करते हैं।
यह साइबर थ्रेट इंटेलिजेंस (CTI) की दुनिया है। समस्या यह है कि किसी भी इंसान के लिए इतना सारा डेटा पढ़ना और मैन्युअल रूप से कड़ियों को जोड़ना संभव नहीं है।
यहाँ लार्ज लैंग्वेज मॉडल्स (LLMs) आते हैं। इन AI मॉडल्स को एक बुद्धिमान, सुपर-फास्ट जासूस के रूप में सोचें जो लगभग कुछ भी पढ़ और समझ सकता है। लेकिन, एक पेच है: इन AI मॉडल्स की एक "मेमोरी लिमिट" होती है। वे हर दिन आने वाली हर नई खतरे की रिपोर्ट को याद नहीं रख सकते। यदि आप उनसे किसी बिल्कुल नए वायरस के बारे में पूछेंगे, तो वे गलत अनुमान लगा सकते हैं क्योंकि उन्होंने अभी तक नवीनतम रिपोर्ट नहीं "पढ़ी" है।
इसे ठीक करने के लिए, हम रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) का उपयोग करते हैं। यह AI जासूस को एक जादुई लाइब्रेरी कार्ड देने जैसा है। जब कोई प्रश्न पूछा जाता है, तो AI पहले पुस्तकालय की ओर दौड़ता है, सबसे प्रासंगिक दस्तावेज़ों को उठाता है, और फिर जो उसने अभी-अभी पढ़ा है उसके आधार पर उत्तर देता है।
समस्या: "अनुवाद में खो जाने" का अंतर (The "Lost in Translation" Gap)
इस शोध पत्र के लेखकों ने पाया कि AI को केवल एक लाइब्रेरी कार्ड थमा देना ही काफी नहीं है। पुस्तकालय बहुत अव्यवस्थित है।
- शब्दावली का बेमेल होना (The Vocabulary Mismatch): एक दस्तावेज़ किसी हैकर समूह को "APT29" कह सकता है, जबकि दूसरा उसे "Cozy Bear" कहता है, और तीसरा उन्हें "Nobelium" कहता है। यदि आप AI से "APT29" पर सभी रिपोर्ट खोजने के लिए कहते हैं, तो एक मानक खोज उन रिपोर्टों को भी छोड़ सकती है जो केवल अन्य नामों का उपयोग करती हैं।
- प्रारूप का बेमेल होना (The Format Mismatch): एक दस्तावेज़ कह सकता है कि "हमलावर ने मेमोरी से पासवर्ड चुराए," जबकि एक तकनीकी डेटाबेस इसे "T1003.001 – LSASS Memory" के रूप में सूचीबद्ध करता है। AI को यह एहसास नहीं हो सकता कि ये दोनों एक ही चीज़ हैं।
शोध का तर्क है कि मानक खोज उपकरण (जो केवल समान शब्दों को देखते हैं) यहाँ विफल हो जाते हैं क्योंकि वे इन अंतरालों को पाट नहीं सकते। वे एक ऐसे अनुवादक की तरह हैं जो केवल शब्द-दर-शब्द अनुवाद जानता है लेकिन अर्थ या उपनामों को नहीं समझता।
समाधान: CTIConnect
टीम ने एक नया बेंचमार्क (एक मानकीकृत परीक्षण) बनाया जिसे CTIConnect कहा जाता है, ताकि यह देखा जा सके कि AI जासूस इस तरह के अव्यवस्थित, बहु-भाषी पुस्तकालय में कितनी अच्छी तरह काम करते हैं।
उन्होंने 1,860 विशेषज्ञ-सत्यापित प्रश्न बनाए जो तीन मुख्य प्रकार के जासूसी कार्यों को कवर करते हैं:
एंटिटी लिंकिंग (कड़ियों को जोड़ना - Entity Linking):
- कार्य: "यह सॉफ़्टवेयर बग (CVE) किस विशिष्ट कमजोरी (CWE) के कारण है?"
- उपमा: एक विशिष्ट कार मॉडल को उसके इंजन प्रकार से मिलाना। AI को दो अलग-अलग तकनीकी कैटलॉग के बीच "अनुवाद" करना होगा।
- समाधान: AI को खोजने से पहले प्रश्न को उस सटीक तकनीकी शब्दावली में "अनुवादित" करने की आवश्यकता होती है जिसका डेटाबेस उपयोग करता है।
एंटिटी एट्रिब्यूशन (अपराधी का नाम बताना - Entity Attribution):
- कार्य: "एक रिपोर्ट कहती है कि 'बुरे लोगों ने .cuba एक्सटेंशन के साथ फाइलों को एन्क्रिप्ट किया।' यह किस विशिष्ट हैकिंग तकनीक का वर्णन करता है?"
- उपमा: एक चश्मदीद के विवरण को पढ़ना ("उसने लाल टोपी पहनी थी और वह तेज़ भागा") और उसे पुलिस फाइल ("संदिग्ध: जॉन डो, जो तेज़ भागने के लिए जाना जाता है") से मिलाना।
- समाधान: AI को इस वाक्य को छोटे, परमाणु कार्यों (atomic actions) में तोड़ना होगा और प्रत्येक को आधिकारिक पुलिस कोड में अनुवादित करना होगा।
मल्टी-डॉक्यूमेंट सिंथेसिस (कहानी बनाना - Multi-Document Synthesis):
- कार्य: "हैकर समूह 'APT29' का प्रोफाइल बनाने के लिए पांच अलग-अलग समाचार आउटलेट्स की रिपोर्टों को मिलाएं।"
- उपमा: आपके पास एक ही पार्टी का वर्णन करने वाले पांच अलग-अलग गवाह हैं। एक मेजबान को "बॉब" कहता है, दूसरा "बॉबी" और तीसरा "द बॉस"। AI को यह समझने में सक्षम होना चाहिए कि वे सभी एक ही व्यक्ति के बारे में बात कर रहे हैं और उन्हें एक टाइमलाइन में जोड़ना चाहिए।
- समाधान: AI को पढ़ने शुरू करने से पहले यह समझने में स्मार्ट होना चाहिए कि "बॉब" = "बॉबी" = "द बॉस" है।
उन्होंने क्या पाया
शोधकर्ताओं ने इस नए परीक्षण का उपयोग करके 10 अलग-अलग AI मॉडल्स (मुफ्त/ओपन-सोर्स और महंगे/प्रोपराइटरी दोनों) का परीक्षण किया। उनकी मुख्य खोजें यहाँ दी गई हैं:
- एक आकार सबके लिए उपयुक्त नहीं है (One Size Does Not Fit All): एक "एक-आकार-सभी-के-लिए" वाली खोज रणनीति बुरी तरह विफल रही। एक तकनीकी बग (Entity Linking) के लिए खोजने का सबसे अच्छा तरीका, हैकर के उपनाम (Multi-Document Synthesis) को खोजने के तरीके से बिल्कुल अलग है।
- विशेष उपकरण जीतते हैं (Specialized Tools Win): जब उन्होंने AI को विशेष रणनीतियाँ दीं (जैसे "पहले प्रश्न का अनुवाद करें" या "वाक्य को भागों में तोड़ें"), तो AI का प्रदर्शन नाटकीय रूप से बढ़ गया—कभी-कभी 35% तक। मानक खोज उपकरणों ने प्रदर्शन में केवल थोड़ा सा (1-5%) सुधार किया।
- अवरोध बदल जाता है (The Bottleneck Shifts):
- तकनीकी लिंकिंग कार्यों के लिए, समस्या खोज उपकरण (search tool) थी। एक बार जब AI ने सही दस्तावेज़ ढूंढ लिया, तो एक "छोटा" AI भी सही उत्तर दे सका।
- नामकरण और कहानी बनाने के कार्यों के लिए, समस्या AI का मस्तिष्क थी। सही दस्तावेज़ होने के बावजूद, संदर्भ को समझने और उपनामों को जोड़ने के लिए AI को बहुत बुद्धिमान होने की आवश्यकता थी।
- स्मार्ट खोज > बड़े दिमाग (Smarter Search > Bigger Brains): कुछ कार्यों के लिए, एक विशेष खोज उपकरण के साथ एक "छोटे" AI का उपयोग करना, एक "विशाल, महंगे" AI के साथ एक "बेसिक खोज उपकरण" का उपयोग करने से बेहतर काम करता है। इसका अर्थ है कि आपको हमेशा सबसे महंगे AI की आवश्यकता नहीं होती; आपको बस जानकारी खोजने का सही तरीका चाहिए।
निष्कर्ष
शोध पत्र यह निष्कर्ष निकालता है कि प्रभावी साइबर सुरक्षा उपकरण बनाने के लिए, हम केवल बड़े AI मॉडल्स या जेनेरिक सर्च इंजन पर निर्भर नहीं रह सकते। हमें विशेषीकृत रिट्रीवल सिस्टम बनाने की आवश्यकता है जो साइबर सुरक्षा की दुनिया की अनूठी "बोलियों" और "उपनामों" को समझ सकें।
इसे इस तरह सोचें: आपको अपराध सुलझाने के लिए एक बड़ी लाइब्रेरी की आवश्यकता नहीं है; आपको एक ऐसे लाइब्रेरियन की आवश्यकता है जो जानता हो कि सही किताब कैसे ढूँढनी है, भले ही उसका शीर्षक किसी ऐसी कोडिंग में लिखा हो जिसे आप नहीं समझते। CTIConnect उस लाइब्रेरियन को बनाने के लिए मानचित्र और परीक्षण प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।