GRID: Graph Representation of Intelligence Data for Security Text Knowledge Graph Construction
यह शोध पत्र GRID प्रस्तुत करता है, जो एक एंड-टू-एंड फ्रेमवर्क है जो ट्रेस करने योग्य आर्टिकल-ग्राफ संरेखण (article-graph alignments) और एक स्क्रिप्टेड टास्क-बैंक रिवॉर्ड सिस्टम का लाभ उठाकर साइबर थ्रेट इंटेलिजेंस से सुरक्षा ज्ञान ग्राफ (security knowledge graphs) का निर्माण करता है, ताकि कुशल 4B-पैरामीटर वाले एक्सट्रैक्टर्स को प्रशिक्षित किया जा सके जो पारंपरिक LLM-आधारित मूल्यांकन विधियों की तुलना में बेहतर परिशुद्धता (precision), रिकॉल (recall) और लागत-प्रभावशीलता प्राप्त करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक साइबर सुरक्षा जासूस हैं जो एक विशाल, जटिल अपराध को सुलझाने की कोशिश कर रहे हैं। आपके पास हजारों बिखरी हुई, लंबी और उलझी हुई पुलिस रिपोर्टों (जिसे "सुरक्षा टेक्स्ट" कहा जाता है) का ढेर है। आपका लक्ष्य इन बिखरी हुई रिपोर्टों को एक साफ, व्यवस्थित मानचित्र (एक "नॉलेज ग्राफ") में बदलना है, जो यह दिखा सके कि किसने, क्या किया, किसके साथ किया, और कैसे किया।
समस्या यह है कि जो जासूस आप आमतौर पर काम पर रखते हैं (मानक AI मॉडल), वे सामान्य बातचीत में तो माहिर हैं लेकिन सुरक्षा संबंधी विशिष्ट शब्दावली (जार्गन) को समझने में बहुत खराब हैं। वे अक्सर महत्वपूर्ण विवरणों को छोड़ देते हैं या अपनी ओर से कुछ भी बना लेते हैं। इसके अलावा, उन्हें यह काम सिखाना अविश्वसनीय रूप से महंगा और कठिन है क्योंकि हर प्रयास के लिए मानव विशेषज्ञ को नियुक्त किए बिना उनके काम का मूल्यांकन करना मुश्किल होता है।
यहाँ GRID (इंटेलिजेंस डेटा का ग्राफ प्रतिनिधित्व) आता है। GRID को केवल एक नए जासूस के रूप में नहीं, बल्कि एक पूर्ण प्रशिक्षण अकादमी और ग्रेडिंग प्रणाली के रूप में समझें, जिसे विशेष रूप से एक छोटे, किफायती AI को सुरक्षा विशेषज्ञ बनाने के लिए डिज़ाइन किया गया है।
GRID कैसे काम करता है, इसे सरल चरणों में यहाँ दिया गया है:
1. "स्व-सुधारने वाली" पाठ्यपुस्तक (स्वचालित एनोटेशन)
आमतौर पर, किसी छात्र को सिखाने के लिए, आपको एक शिक्षक की आवश्यकता होती है जो एक आदर्श उत्तर कुंजी (answer key) लिखे। लेकिन सुरक्षा रिपोर्टों के लिए, अभी तक किसी ने ये उत्तर कुंजियाँ नहीं लिखी हैं।
- GRID का समाधान: GRID एक स्मार्ट ट्यूटर की तरह काम करता है जो अपनी खुद की पाठ्यपुस्तक लिखता है। यह एक बिखरी हुई सुरक्षा रिपोर्ट को पढ़ता है, तथ्यों को निकालता है ताकि एक कच्चा मानचित्र बनाया जा सके, और फिर मूल रिपोर्ट को फिर से लिखता है।
- उपमा: कल्पना कीजिए कि एक छात्र पाठ्यपुस्तक को हाईलाइट कर रहा है। यदि हाइलाइटर ऐसी चीज़ को चिह्नित करता है जो वास्तव में टेक्स्ट में मौजूद नहीं है, तो शिक्षक (GRID) उस हाईलाइट को मिटा देता है और वाक्य को तथ्यों के अनुरूप फिर से लिख देता है। इससे कहानी और उसके मानचित्र का एक आदर्श "जोड़ा" बन जाता है, जिसमें किसी इंसान को इसे शुरू से लिखने की आवश्यकता नहीं होती।
2. "बहुविकल्पीय" शॉर्टकट (टास्क-बैंक रिवॉर्ड्स)
AI को शुरुआत से पूरा मानचित्र बनाना सिखाना एक छात्र को 50 पन्नों का निबंध लिखने के लिए कहने और फिर उसे ग्रेड करने जैसा है। इसमें बहुत समय लगता है और यदि आप मानव ग्रेडर (या एक बहुत महंगे AI ग्रेडर) का उपयोग करते हैं, तो यह बहुत महंगा पड़ता है।
- GRID का समाधान: पूरे निबंध को ग्रेड करने के बजाय, GRID इस पाठ को छोटे, आसानी से जांचने योग्य क्विज़ में तोड़ देता है।
- उपमा: छात्र से, "पूरा अपराध स्थल बनाओ" पूछने के बजाय, GRID पूछता है, "क्या हैकर ने टूल A का उपयोग किया या टूल B का?" या "क्या दो लोगों के बीच यह विशिष्ट संबंध सत्य है या असत्य?"
- यह कैसे मदद करता है: ये "चेकलिस्ट" उत्तर वाले बहुविकल्पीय प्रश्नों की तरह हैं। इन्हें तुरंत ग्रेड करना सस्ता है। इन हजारों छोटे क्विज़ पर अभ्यास करके, AI खेल के नियमों को बहुत तेज़ी से और बहुत कम लागत में सीख जाता है, बजाय इसके कि उसे हर बार पूर्ण निबंध लिखना पड़े।
3. "नियम पुस्तिका" (ऑन्टोलॉजी-गाइडेड एक्सट्रैक्शन)
सुरक्षा शब्द पेचीदा होते हैं। एक "वायरस" को अलग-अलग रिपोर्टों में "मालवेयर", "खतरा" या "बग" कहा जा सकता है।
- GRID का समाधान: GRID AI को एक सख्त नियम पुस्तिका (ऑन्टोलॉजी) देता है। यह AI को बताता है: "यदि आप 'वायरस' या 'ट्रोजन' देखते हैं, तो वे दोनों 'मालवेयर' फोल्डर के अंतर्गत आते हैं।"
- उपमा: यह एक जासूस को एक मानकीकृत फाइलिंग कैबिनेट देने जैसा है। फाइलों को कहाँ रखना है, इसका अनुमान लगाने के बजाय, AI को पता होता है कि खतरे के विशिष्ट प्रकार के आधार पर उसे कौन सा दराज इस्तेमाल करना है, जिससे अंतिम मानचित्र व्यवस्थित और सुसंगत रहता है।
4. "ग्रेडिंग" के परिणाम
शोधकर्ताओं ने इस प्रणाली का परीक्षण पांच अलग-अलग स्रोतों से 249 वास्तविक दुनिया की सुरक्षा रिपोर्टों पर किया। उन्होंने अपने "प्रशिक्षित" AI की तुलना अन्य शीर्ष प्रणालियों से की।
- परिणाम: GRID-प्रशिक्षित AI सभी छूटे हुए सुरागों को खोजने में सर्वश्रेष्ठ था (रिकॉल/Recall)। इसने परीक्षण किए गए किसी भी अन्य सिस्टम की तुलना में वास्तविक खतरों को अधिक खोजा।
- दक्षता: जबकि अन्य सिस्टम महंगे, धीमे चलने वाले ट्रकों की तरह थे, GRID एक फुर्तीली, तेज़ कार की तरह था। इसने लगभग समान उच्च स्कोर प्राप्त किया लेकिन वहां तक पहुँचने के लिए आधे से भी कम कंप्यूटिंग पावर (टोकन) का उपयोग किया।
सारांश
GRID को एक ऐसे सिस्टम के रूप में समझें जो एक छोटे, किफायती AI को निम्नलिखित प्रदान करता है:
- स्व-निर्मित अध्ययन मार्गदर्शिकाएँ (पुनर्लिखित लेख)।
- गहन अभ्यास परीक्षण (महंगी अंतिम परीक्षाओं के बजाय बहुविकल्पीय क्विज़)।
- चीजों को व्यवस्थित रखने के लिए एक सख्त फाइलिंग सिस्टम (नियम पुस्तिका)।
परिणामस्वरूप, एक ऐसा सुरक्षा विशेषज्ञ AI प्राप्त होता है जिसे चलाना सस्ता है, प्रशिक्षित करना तेज़ है, और जो पिछले पीढ़ी के उपकरणों की तुलना में सुरक्षा रिपोर्टों में छिपे हुए विवरणों को खोजने में बेहतर है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।