← नवीनतम पेपर
💻 computer science

Cybersecurity AI (CAI) Dataset

यह शोध पत्र CAI डेटासेट प्रस्तुत करता है, जो वास्तविक दुनिया के साइबर सुरक्षा LLM इंटरैक्शन का एक विशाल संग्रह है जो विशेषज्ञ ऑपरेटर प्रक्षेपवक्र (trajectories) की महत्वपूर्ण बाधा को उजागर करता है और संवेदनशील आक्रामक एवं रक्षात्मक डेटा को फ्रंटियर-मॉडल API प्रदाताओं के भीतर केंद्रित करने के प्रणालीगत जोखिमों को कम करने के लिए ऑन-प्रिमाइज़, निजी तौर पर होस्ट किए गए मॉडलों की तत्काल आवश्यकता पर बल देता है।

मूल लेखक: Víctor Mayoral-Vilches

प्रकाशित 2026-05-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Víctor Mayoral-Vilches

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि साइबर सुरक्षा की दुनिया शतरंज के एक विशाल, उच्च-दांव वाले खेल की तरह है जिसे हर दिन लाखों लोग खेलते हैं। इसमें कुछ खिलाड़ी "ब्लू टीम" (रक्षक) होते हैं जो किले की रक्षा करने की कोशिश करते हैं, और अन्य "रेड टीम" (आक्रमणकारी) होते हैं जो अंदर घुसने की कोशिश करते हैं। लंबे समय तक, ये खिलाड़ी अपने दिमाग और मैन्युअल टूल्स का उपयोग करके यह खेल खेलते थे।

हाल ही में, उन्होंने एक नए, सुपर-स्मार्ट सहायक का उपयोग करना शुरू कर दिया है: आर्टिफिशियल इंटेलिजेंस (AI)। लेकिन एक समस्या थी। AI स्मार्ट तो था, लेकिन उसे यह नहीं पता था कि विशेषज्ञ वास्तव में यह खेल कैसे खेलते हैं। वह नियमों को जानता था, लेकिन उन तरकीबों, गलतियों या वास्तविक जीवन की रणनीतियों को नहीं जानता था जो इंसान युद्ध के मैदान में इस्तेमाल करते हैं।

यह शोध पत्र CAI Dataset पेश करता है, जो एक विशाल लाइब्रेरी है जिसे AI को एक वास्तविक साइबर सुरक्षा विशेषज्ञ की तरह सोचना सिखाने के लिए डिज़ाइन किया गया है। यहाँ इसका सरल विवरण दिया गया है:

1. समस्या: "विशेषज्ञ" का अंतर (The "Expert" Gap)

AI मॉडल्स (जैसे कि वे जिनसे आप चैट करते हैं) को ऐसे प्रतिभाशाली छात्रों के रूप में सोचें जिन्होंने दुनिया की हर किताब पढ़ ली है। हालाँकि, जब साइबर सुरक्षा की बात आती है, तो वे विफल हो रहे थे क्योंकि उन्होंने मास्टर्स को काम करते हुए नहीं देखा था।

  • खोज: शोधकर्ताओं ने पाया कि AI इसलिए विफल नहीं हो रहा था क्योंकि वह पर्याप्त स्मार्ट नहीं था; बल्कि इसलिए विफल हो रहा था क्योंकि उसमें वास्तविक विशेषज्ञों की "मसल मेमोरी" (muscle memory) की कमी थी। उसे यह देखने की आवश्यकता थी कि कैसे इंसान सिस्टम को हैक करते हैं या सुरक्षित करते हैं, जिसमें डेड एंड (बंद रास्ते), टाइपिंग की गलतियाँ और "अहा!" वाले क्षण भी शामिल हैं।

2. समाधान: "ब्लैक बॉक्स" रिकॉर्डर

इसे ठीक करने के लिए, लेखकों ने CAI (साइबरसिक्योरिटी AI) नामक एक टूल बनाया। कल्पना कीजिए कि यह टूल एक पारदर्शी कांच के डिब्बे की तरह है जो मानव विशेषज्ञ और AI के बीच स्थित है।

  • यह कैसे काम करता है: जब एक मानव विशेषज्ञ अपना काम करने के लिए CAI टूल का उपयोग करता है (एक टेस्ट सिस्टम को हैक करना, बग ठीक करना, या नेटवर्क की रक्षा करना), तो यह टूल सब कुछ रिकॉर्ड करता है। यह हर उस कमांड को लिख देता है जो इंसान टाइप करता है, हर टूल जो वह उपयोग करता है, हर गलती जो वह करता है, और वह उसे कैसे ठीक करता है।
  • संग्रह: 14 महीनों में, इस टूल ने 123 देशों के 16,000 अलग-अलग लोगों के 230,000 सत्रों (sessions) को रिकॉर्ड किया। यह 26 मिलियन प्रॉम्प्ट्स (निर्देशों) और 18 टेराबाइट डेटा की एक लाइब्रेरी है। यह शतरंज के एक अरब खेलों में से हर चाल को रिकॉर्ड करने जैसा है।

3. लाइब्रेरी के अंदर क्या है?

यह केवल "अच्छे" उत्तरों की सूची नहीं है। यह वास्तविक काम का एक कच्चा और अनफ़िल्टर्ड रूप है:

  • अच्छा और बुरा: लगभग 36% डेटा आक्रामक (हमलावर जो घुसने की कोशिश कर रहे हैं) है, 20% स्पष्ट रूप से दुर्भावनापूर्ण इरादा (malicious intent) है, 27% व्यावसायिक कार्य (सिस्टम को एकीकृत करना) है, और 4% रक्षात्मक है।
  • वास्तविक जीवन, सिद्धांत नहीं: अन्य डेटासेट्स के विपरीत जो कंप्यूटर द्वारा बनाए गए (सिंथेटिक) होते हैं, यह डेटा वास्तविक है। इसमें लोग वास्तविक पासवर्ड, सर्वर के नाम और गुप्त कुंजियाँ (secret keys) चैट में पेस्ट करते हैं क्योंकि उन्हें अभी काम पूरा करने के लिए AI की आवश्यकता होती है।
  • "लीक" की वास्तविकता: शोध पत्र एक आश्चर्यजनक और थोड़ी डरावनी बात नोट करता है: क्योंकि AI इतना मददगार है, विशेषज्ञ काम को तेजी से करने के लिए चैट में अपने लाइव सीक्रेट्स (जैसे पासवर्ड और गुप्त कुंजियाँ) पेस्ट कर देते हैं। वे जानते हैं कि डेटा लॉग किया जा रहा है, लेकिन उनके लिए गति और सुविधा जोखिम से अधिक महत्वपूर्ण है। यह कुछ ही AI कंपनियों के भीतर दुनिया के सबसे संवेदनशील रहस्यों का एक विशाल संकेंद्रण पैदा करता है।

4. यह क्यों मायने रखता है (बेहतर AI के लिए "रेसिपी")

लेखक कहते हैं कि यह डेटासेट अगली पीढ़ी के साइबर सुरक्षा AI को प्रशिक्षित करने के लिए आवश्यक "सीक्रेट सॉस" है।

  • वर्तमान स्थिति: अधिकांश AI प्रशिक्षण स्वच्छ, आदर्श उदाहरणों का उपयोग करता है।
  • CAI Dataset: यह अव्यवस्थित, वास्तविक दुनिया के उदाहरणों का उपयोग करता है। यह AI को सिखाता है कि एक टूटे हुए टूल को कैसे संभालना है, त्रुटि से कैसे उबरना है, और कई चरणों में एक जटिल हमले या बचाव को कैसे जोड़ना है।
  • लक्ष्य: एक ऐसा AI बनाना जो न केवल यह जानता हो कि भेद्यता (vulnerability) क्या है, बल्कि यह भी जानता हो कि वास्तविक वातावरण में इसे कैसे खोजा और ठीक किया जाए, बिल्कुल एक मानव विशेषज्ञ की तरह।

5. बड़ी चेतावनी और समाधान

शोध पत्र सुरक्षा और गोपनीयता के बारे में एक महत्वपूर्ण अवलोकन के साथ समाप्त होता है:

  • जोखिम: वर्तमान में, ये सभी वास्तविक दुनिया के रहस्य और हमले की रणनीतियाँ कुछ बड़ी AI कंपनियों के सर्वरों में जा रही हैं। यदि उनमें से किसी एक कंपनी को हैक किया जाता है, या यदि डेटा का दुरुपयोग किया जाता है, तो यह वैश्विक स्तर पर अराजकता पैदा कर सकता है।
  • समाधान: इन रहस्यों को सुरक्षित रखते हुए AI की गति और शक्ति बनाए रखने का एकमात्र तरीका अपने खुद के परिसर के भीतर (on-premise) एक विशेष AI चलाना है, जहाँ आप डेटा को नियंत्रित करते हैं।
  • योगदान: CAI Dataset को विशेष रूप से भागीदारों और ग्राहकों को यह मदद करने के लिए जारी किया जा रहा है ताकि वे इन निजी, ऑन-साइट AI विशेषज्ञों को बना सकें। इस तरह, संगठन एक सुपर-स्मार्ट साइबर सुरक्षा सहायक रख सकते हैं जो काम करने के असली तरीकों को जानता है, लेकिन उनके सभी रहस्यों को उनकी अपनी दीवारों के भीतर सुरक्षित रखता है।

संक्षेप में

शोध पत्र कहता है: "हमने AI के लिए अंतिम प्रशिक्षण मैनुअल बनाने के लिए 14 महीनों के वास्तविक साइबर सुरक्षा विशेषज्ञों के काम को, उनकी गलतियों सहित, रिकॉर्ड किया है। यह डेटा साबित करता है कि विशेषज्ञ काम पूरा करने के लिए पहले से ही अपने गहरे रहस्यों के लिए AI पर भरोसा कर रहे हैं। उन रहस्यों को सुरक्षित रखते हुए कुशल बने रहने के लिए, हमें सार्वजनिक AI दिग्गजों पर निर्भर रहने के बजाय, इस वास्तविक दुनिया के डेटा पर प्रशिक्षित निजी, विशिष्ट AI विशेषज्ञों को बनाने की आवश्यकता है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →