← नवीनतम पेपर
💻 computer science

HackerSignal: A Large-Scale Multi-Source Dataset Linking Hacker Community Discourse to the CVE Vulnerability Lifecycle

यह शोधपत्र HackerSignal प्रस्तुत करता है, जो एक बड़े पैमाने का, बहु-स्रोत डेटासेट है जो 1990 से 2026 तक के 7.45 मिलियन दस्तावेज़ों को एकत्रित करता है ताकि हैकर समुदाय की चर्चा को पूर्ण CVE भेद्यता जीवनचक्र (vulnerability lifecycle) से जोड़ा जा सके, जो टेम्पोरल आउट-ऑफ-डिस्ट्रीब्यूशन साइबर थ्रेट इंटेलिजेंस और क्रॉस-सोर्स CVE लिंकेज कार्यों के लिए एक बेंचमार्क के रूप में कार्य करता है।

मूल लेखक: Benjamin M. Ampel, Sagar Samtani

प्रकाशित 2026-05-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Benjamin M. Ampel, Sagar Samtani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

साइबर सुरक्षा की दुनिया की कल्पना एक विशाल, अराजक पुस्तकालय के रूप में करें जहाँ किताबें लगातार लिखी जा रही हैं, फिर से लिखी जा रही हैं और कभी-कभी जलाई भी जा रही हैं। एक तरफ, आपके पास "आधिकारिक पुस्तकालयाध्यक्ष" (सरकारी एजेंसियां और सॉफ्टवेयर कंपनियां) हैं जो टूटे हुए तालों (कमियों/vulnerabilities) के बारे में औपचारिक रिपोर्ट लिखते हैं और उन्हें ठीक करने के तरीके बताते हैं। दूसरी ओर, "अंडरग्राउंड मार्केट" (हैकर फोरम) है जहाँ लोग उन तालों को खोलने के तरीके पर चर्चा करते हैं, उन्हें खोलने के उपकरण साझा करते हैं और अपनी सफलताओं का बखान करते हैं।

लंबे समय तक, इन दोनों दुनियाओं की भाषाएँ अलग थीं और वे अलग-अलग इमारतों में रहती थीं। शोधकर्ताओं के लिए किसी अंधेरे, गुमनाम फोरम की विशिष्ट बातचीत को किसी सॉफ्टवेयर दोष की विशिष्ट आधिकारिक रिपोर्ट से जोड़ना कठिन था।

"HackerSignal" का आगमन हुआ।

HackerSignal को एक विशाल, सुपर-संगठित अनुवाद और फाइलिंग प्रणाली के रूप में समझें जो इन दो दुनियाओं को जोड़ती है। यह एक नया डेटासेट (डेटा का एक विशाल संग्रह) है जो 36 वर्षों के इतिहास (1990 से 2026 तक) में फैले 64 विभिन्न स्रोतों से 7.45 मिलियन दस्तावेजों को जोड़ता है।

यहाँ यह पेपर इसे सरल उपमाओं का उपयोग करके कैसे समझाता है:

1. बड़ा संग्रह (द "लाइब्रेरी")

यह डेटासेट हर जगह से टेक्स्ट एकत्र करता है:

  • अंडरग्राउंड: हैकर फोरम, डार्क वेब मार्केटप्लेस और चैट रूम जहाँ लोग एक्सप्लॉइट्स (exploits) के बारे में बात करते हैं।
  • आधिकारिक पक्ष: सरकारी भेद्यता डेटाबेस (vulnerability databases), सॉफ्टवेयर फिक्स लॉग और सुरक्षा सलाहकार रिपोर्ट।
  • मध्य मार्ग: वे स्थान जहाँ हैकर्स "प्रूफ ऑफ कॉन्सेप्ट" (PoC) कोड (यह प्रदर्शन कि एक हैक कैसे काम करता है) पोस्ट करते हैं।

HackerSignal का जादू यह है कि यह एक सामान्य ID टैग का उपयोग करता है जिसे CVE (Common Vulnerabilities and Exposures) कहा जाता है, ताकि इन विभिन्न स्रोतों को जोड़ा जा सके। यह एक उत्पाद पर समान बारकोड लगाने जैसा है—एक ब्लैक-मार्केट स्टाल पर और उसी उत्पाद पर एक उच्च-स्तरीय डिपार्टमेंट स्टोर में—जिससे आप उस आइटम की यात्रा को "विचार" चरण से लेकर "फिक्स" चरण तक ट्रैक कर सकते हैं।

2. तीन "परीक्षण" (द बेंचमार्क्स)

लेखकों ने केवल डेटा को फेंका नहीं है; उन्होंने यह देखने के लिए तीन विशिष्ट चुनौतियाँ (परीक्षण) बनाई हैं कि आर्टिफिशियल इंटेलिजेंस (AI) इस अव्यवस्थित जानकारी को कितनी अच्छी तरह समझ सकता है। महत्वपूर्ण रूप से, उन्होंने इन परीक्षणों को "टाइम ट्रैवल" नियमों का उपयोग करके निष्पक्ष और यथार्थवादी बनाया है: AI को पुराने डेटा पर प्रशिक्षित किया जाता है और फिर नए डेटा पर टेस्ट किया जाता है जिसे उसने पहले कभी नहीं देखा है। यह AI को उत्तरों को रटने से रोकता है।

  • परीक्षण 1: जासूस का मिलान (CVE लिंकेज रिट्रीवल)

    • परिदृश्य: आप AI को हैकर फोरम का एक अंश देते हैं (जैसे, "मुझे पता चला है कि वर्जन 5.2 पर लॉगिन कैसे तोड़ा जाए")।
    • लक्ष्य: AI को उस विशिष्ट समस्या से मेल खाने वाली सही आधिकारिक रिपोर्ट (CVE) को खोजना होगा।
    • चुनौती: फोरम का टेक्स्ट अस्पष्ट, स्लैंग-भारी या अधूरा हो सकता है, जबकि आधिकारिक रिपोर्ट औपचारिक और तकनीकी होती है। AI को इन कड़ियों को जोड़ने के लिए एक जासूस बनना होगा।
    • परिणाम: सबसे अच्छा AI मॉडल (जिसे E5 कहा जाता है) ने लगभग 60% शीर्ष मिलानों को सही ढंग से पहचाना, जो इतने कठिन कार्य के लिए एक मजबूत शुरुआत है।
  • परीक्षण 2: सॉर्टर (एक्सप्लॉइट टाइप क्लासिफिकेशन)

    • परिदृश्य: आप AI को कोड का एक टुकड़ा या हैक का विवरण देते हैं।
    • लक्ष्य: AI को इसे 8 श्रेणियों में से एक में वर्गीकृत करना चाहिए, जैसे कि "इंजेक्शन" (डेटाबेस को धोखा देना), "XSS" (वेबसाइट को हाईजैक करना), या "मेमोरी करप्शन" (कंप्यूटर की मेमोरी को तोड़ना)।
    • चुनौती: AI को इन हैक्स के पैटर्न सीखने होंगे और उन्हें उन नए प्रकार के हैक्स पर लागू करना होगा जो उसके प्रशिक्षण के समय मौजूद नहीं थे।
    • परिणाम: एक विशिष्ट प्रकार का AI जिसे "BiLSTM" (एक न्यूरल नेटवर्क जो टेक्स्ट को दोनों दिशाओं में पढ़ता है) कहा जाता है, सबसे अच्छा था, जिसने लगभग 87% नए हैक्स को सही ढंग से वर्गीकृत किया।
  • परीक्षण 3: टाइम ट्रैवलर (टेम्पोरल जनरलाइजेशन)

    • परिदृश्य: यह सबसे कठिन परीक्षण है। AI को 2022 से पहले खोजी गई कमजोरियों पर प्रशिक्षित किया जाता है। इसके बाद, इसे केवल 2024 के बाद खोजी गई कमजोरियों पर टेस्ट किया जाता है।
    • लक्ष्य: AI पुराने बग्स के विशिष्ट नामों को याद करके धोखाधड़ी नहीं कर सकता। उसे एक बग की अवधारणा को इतनी अच्छी तरह समझना होगा कि वह एक बिल्कुल नए बग को पहचान सके जिसे उसने पहले कभी नहीं देखा है।
    • परिणाम: AI मॉडल आश्चर्यजनक रूप से अच्छा प्रदर्शन करते रहे, जिससे सिद्ध हुआ कि उन्होंने केवल नामों की सूची को रटने के बजाय कमजोरियों के अंतर्निहित तर्क को सीखा है।

3. यह क्यों महत्वपूर्ण है (द "सो वॉट?")

यह पेपर इस बात पर जोर देता है कि पिछले डेटासेट या तो बहुत छोटे थे, केवल एक प्रकार के स्रोत को देखते थे, या गुप्त रखे गए थे। HackerSignal पहला सार्वजनिक, "गोल्ड-स्टैंडर्ड" संग्रह है जो शोधकर्ताओं को निम्नलिखित अनुमति देता है:

  • अनुमान लगाना बंद करें: यह अनुमान लगाने के बजाय कि हैकर्स कैसे बात करते हैं, वे वास्तविक डेटा का अध्ययन कर सकते हैं।
  • बेहतर सुरक्षा निर्माण: "हैकर चर्चा" से लेकर "आधिकारिक फिक्स" तक के टाइमलाइन को समझकर, सुरक्षा टीमें तेजी से प्रतिक्रिया दे सकती हैं।
  • धोखाधड़ी से बचना: लेखकों ने सख्त नियम बनाए हैं ताकि यह सुनिश्चित हो सके कि AI मॉडल प्रशिक्षण के दौरान उत्तर देखकर "चीटिंग" न कर सकें (एक समस्या जिसे "डेटा लीकेज" कहा जाता है)।

4. खेल के नियम (एथिक्स)

लेखक सुरक्षा के प्रति बहुत सावधान हैं। वे स्पष्ट करते हैं कि यह डेटासेट केवल रक्षात्मक अनुसंधान (defensive research) के लिए है।

  • यह एक ताला बनाने वाले (locksmith) को शहर के सभी टूटे हुए तालों का नक्शा देने जैसा है ताकि वे उन्हें ठीक कर सकें, न कि इसलिए कि वे घरों में चोरी कर सकें।
  • डेटासेट में ऐसे नियम शामिल हैं जो स्वचालित हैकिंग टूल बनाने या विशिष्ट व्यक्तियों की पहचान करने के लिए डेटा का उपयोग करने से रोकते हैं।
  • वे यह भी स्वीकार करते हैं कि डेटा पूर्ण नहीं है; कुछ लिंक कंप्यूटर द्वारा स्वचालित रूप से बनाए गए हैं और उनमें छोटी त्रुटियां हो सकती हैं, लेकिन वे शोधकर्ताओं को इन गलतियों की जांच करने और उन्हें ठीक करने के लिए उपकरण भी प्रदान करते हैं।

संक्षेप में: HackerSignal हैकर की बातचीत की "अंडरग्राउंड" दुनिया को सुरक्षा सुधारों की "आधिकारिक" दुनिया से जोड़ने वाला एक विशाल, समय-क्रमबद्ध मानचित्र है। यह एक कठोर परीक्षण मैदान प्रदान करता है कि क्या हमारे AI उपकरण साइबर खतरों के व्यापक होने से पहले उन्हें अनुमान लगाने और समझने के लिए पर्याप्त स्मार्ट हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →