← नवीनतम पेपर
🤖 machine learning

Vendor-Conditioned Contrastive Learning for Predicting Organizational Cyber Threat Targets

यह शोधपत्र TRACE को प्रस्तुत करता है, जो CySecBERT पर निर्मित एक वेंडर-कंडीशन्ड कंट्रास्टिव लर्निंग फ्रेमवर्क है, जो संगठनात्मक साइबर खतरे के लक्ष्यों की भविष्यवाणी करने में अत्याधुनिक सटीकता प्राप्त करने और टेम्पोरल डिस्ट्रीब्यूशन शिफ्ट के विरुद्ध मजबूती प्रदर्शित करने के लिए 352,866 पोस्ट्स के एक बड़े पैमाने के, मल्टी-सोर्स कॉर्पस का लाभ उठाता है।

मूल लेखक: Benjamin M. Ampel

प्रकाशित 2026-05-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Benjamin M. Ampel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि इंटरनेट का अंडरग्राउंड एक विशाल, अराजक बाजार की तरह है जहाँ हैकर्स कंप्यूटरों को तोड़ने के रहस्य, उपकरण और ब्लूप्रिंट का व्यापार करने के लिए इकट्ठा होते हैं। ये "हैकर फोरम" हर दिन हजारों पोस्टों से भरे होते हैं। बड़ा सवाल सुरक्षा विशेषज्ञों के लिए यह है: ये हैकर्स किसे निशाना बनाने की कोशिश कर रहे हैं? क्या वे बैंकों, वीडियो गेम कंपनियों या अस्पताल प्रणालियों को निशाना बना रहे हैं?

यह पेपर एक नया टूल पेश करता है जिसे TRACE (टेम्पोरल रिप्रेजेंटेशन एंड क्लासिफिकेशन ऑफ एक्सप्लॉइट्स) कहा जाता है, जो इस सवाल का जवाब देने के लिए एक सुपर-स्मार्ट जासूस की तरह काम करता है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: हैकर्स की भाषा बदलती रहती है

हैकर स्लैंग (बोलचाल की भाषा) को एक तेजी से विकसित होती बोली की तरह समझें। जैसे आज के किशोर 20 साल पहले के लोगों की तुलना में अलग शब्दों का उपयोग करते हैं, वैसे ही हैकर्स अपने टूल्स का वर्णन करने के तरीके को बदलते रहते हैं। एक मॉडल (एक कंप्यूटर प्रोग्राम) जिसे पुराने फोरम पोस्ट पर प्रशिक्षित किया गया है, वह नए पोस्टों से भ्रमित हो सकता है क्योंकि शब्दावली बदल गई है।

यदि आप एक जासूस को 2010 के अपराध रिपोर्टों पर प्रशिक्षित करते हैं, तो वह 2025 के अपराध को पहचानने में चूक सकता है क्योंकि अपराधी नए कोड का उपयोग कर रहे होंगे। पेपर का तर्क है कि अधिकांश पिछले उपकरण इसलिए विफल रहे क्योंकि उन्होंने इस "टाइम ट्रैवल" समस्या पर ध्यान नहीं दिया। वे पुराने डेटा पर तो अच्छा काम करते थे लेकिन नए, भविष्य के डेटा का सामना करने पर लड़खड़ा जाते थे।

2. डेटा: एक विशाल टाइम कैप्सूल

TRACE बनाने के लिए, शोधकर्ताओं ने केवल कुछ फोरम्स को नहीं देखा। उन्होंने एक विशाल "टाइम कैप्सूल" को खंगाला जिसमें 8.7 मिलियन पोस्ट शामिल थे, जो 35 विभिन्न स्रोतों (जैसे हैकर फोरम, बग डेटाबेस और डार्क वेब मार्केट) से लिए गए थे और 30 वर्षों (1990 से 2026 तक) के अंतराल में फैले हुए थे।

इस टेक्स्ट के पहाड़ से, उन्होंने 129,126 विशिष्ट पोस्ट को साफ और व्यवस्थित किया जिनमें स्पष्ट रूप से किसी लक्षित कंपनी या उद्योग का उल्लेख था। उन्होंने इन्हें सात "बकेट" (श्रेणियों) में वर्गीकृत किया जैसे:

  • CMS / ओपन सोर्स (जैसे वर्डप्रेस या लिनक्स)
  • एंटरप्राइज सॉफ्टवेयर (जैसे बड़े कॉर्पोरेट टूल्स)
  • गेमिंग
  • नेटवर्किंग
  • और अन्य।

3. समाधान: TRACE का "दो-मस्तिष्क" वाला दृष्टिकोण

TRACE को CySecBERT नामक एक प्री-ट्रेंड AI ब्रेन पर बनाया गया है, जो साइबर सुरक्षा की शब्दावली के बारे में पहले से बहुत कुछ जानता है। लेकिन शोधकर्ताओं ने इसे कॉन्ट्रास्टिव लर्निंग का उपयोग करके एक विशेष अपग्रेड दिया।

इस अपग्रेड को एक सॉर्टिंग गेम की तरह समझें:

  • लक्ष्य: AI को यह अनुमान लगाना है कि हैकर पोस्ट किस "बकेट" (उद्योग) से संबंधित है।
  • ट्रिक: शोधकर्ताओं ने AI को बताया, "बकेट का अनुमान लगाने से पहले, सुनिश्चित करें कि आप पोस्ट को वेंडर (कंपनी का नाम) के आधार पर समूहबद्ध करें।"
    • यदि दो पोस्ट "माइक्रोसॉफ्ट" का उल्लेख करते हैं, तो AI उन्हें मजबूर करता है कि उनके आंतरिक "मानसिक फिंगरप्रिंट" बहुत समान दिखें, भले ही वे अलग-अलग उत्पादों के बारे में बात कर रहे हों।
    • यदि दो पोस्ट "गूगल" और "माइक्रोसॉफ्ट" का उल्लेख करते हैं, तो AI उन्हें मजबूर करता है कि उनके फिंगरप्रिंट बहुत अलग दिखें।

इससे मदद क्यों मिलती है?
कल्पना कीजिए कि आप मोजों के मिले-जुले ढेर को छाँटने की कोशिश कर रहे हैं। यदि आप केवल रंग (उद्योग) को देखते हैं, तो आप भ्रमित हो सकते हैं क्योंकि कुछ मोजे समान हो सकते हैं। लेकिन यदि आप पहले उन्हें ब्रांड (वेंडर) के आधार पर समूहबद्ध करते हैं, तो आप उस ब्रांड के विशिष्ट पैटर्न को सीखते हैं। एक बार जब AI माइक्रोसॉफ्ट या एप्पल के "ब्रांड पैटर्न" को समझ लेता है, तो वह यह अनुमान लगाने में बहुत बेहतर हो जाता है कि वे किस उद्योग से संबंधित हैं, भले ही समय के साथ भाषा बदल जाए।

4. परीक्षण: "फ्यूचर" चुनौती

शोधकर्ताओं ने केवल रैंडम डेटा पर TRACE का परीक्षण नहीं किया। उन्होंने एक टाइम-ट्रैवल टेस्ट सेटअप किया:

  • ट्रेनिंग: AI ने 2022 से पहले के पोस्ट का अध्ययन किया।
  • टेस्टिंग: फिर AI को 2024 और उसके बाद के पोस्ट के लिए लक्ष्यों की भविष्यवाणी करने के लिए कहा गया।

यह एक छात्र को 2020 की पाठ्यपुस्तक से पढ़ाने जैसा है और फिर उसे 2025 की खबरों के आधार पर फाइनल परीक्षा देने के लिए कहना। अधिकांश अन्य तरीके इस परीक्षण में विफल रहे क्योंकि वे नई भाषा को संभालने में सक्षम नहीं थे।

seits 5. परिणाम: एक नया चैंपियन

TRACE ने प्रतियोगिता को पछाड़ दिया।

  • स्कोर: इसने भविष्य के डेटा पर 97% सटीकता (विशेष रूप से 97.00% का मैक्रो F1 स्कोर) हासिल की।
  • प्रतियोगिता: इसने 17 अन्य तरीकों को हराया, जिनमें मानक मशीन लर्निंग मॉडल और अन्य उन्नत AI ट्रांसफॉर्मर शामिल हैं।
  • सीक्रेट सॉस: पेपर ने पाया कि AI द्वारा उपयोग किए जाने वाले डिक्शनरी का प्रकार AI के आर्किटेक्चर से अधिक महत्वपूर्ण था। हैकर टेक्स्ट (CySecBERT) पर प्रशिक्षित AI, सामान्य अंग्रेजी पर प्रशिक्षित AI की तुलना में कहीं अधिक बेहतर था। इसके अलावा, "वेंडर सॉर्टिंग" ट्रिक (कॉन्ट्रास्टिव लर्निंग) ने इसे महत्वपूर्ण बढ़ावा दिया, विशेष रूप से गेमिंग जैसी दुर्लभ श्रेणियों के लिए, जहाँ इसने सटीकता में लगभग 20% का सुधार किया।

सारांश

संक्षेप में, यह पेपर TRACE प्रस्तुत करता है, जो फोरम पोस्ट का विश्लेषण करके यह भविष्यवाणी करता है कि हैकर्स किन संगठनों को निशाना बना रहे हैं। यह पिछले उपकरणों की तुलना में बेहतर काम करता है क्योंकि यह:

  1. वास्तविक हैकर चैटर के एक विशाल, 30-वर्षीय डेटासेट का उपयोग करता है।
  2. एक "वेंडर-कंडीशन्ड" ट्रिक का उपयोग करता है ताकि AI को पहले कंपनी-विशिष्ट पैटर्न को पहचानने के लिए सिखाया जा सके।
  3. यह साबित करता है कि यह भविष्य को संभाल सकता है क्योंकि यह उन वर्षों के डेटा पर सफलतापूर्वक लक्ष्यों की भविष्यवाणी करता है जिन्हें इसने पहले कभी नहीं देखा था।

परिणामस्वरूप, यह एक ऐसा सिस्टम पेश करता है जो सुरक्षा टीमों को जल्दी से यह समझने में मदद करता है कि, "हे, हैकर्स अभी हमारे उद्योग के बारे में बात कर रहे हैं," जिससे उन्हें हमला होने से पहले खुद को बचाने में मदद मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →