← नवीनतम पेपर
🤖 AI

Toward Scalable Automated Repository-Level Datasets for Software Vulnerability Detection

यह डॉक्टरेट शोध वास्तविक कोडबेस में यथार्थवादी कमजोरियों को इंजेक्ट करके और भेद्यता-प्रमाण (proof-of-vulnerability) शोषणों को संश्लेषित करके, स्केलेबल, सटीक रूप से लेबल किए गए रिपॉजिटरी-स्तरीय डेटासेट उत्पन्न करने के लिए एक स्वचालित ढांचे का प्रस्ताव करता है, जबकि भेद्यता पहचान एजेंटों की मजबूती को बढ़ाने के लिए एक एडवरसेरियल को-इवोल्यूशन लूप का उपयोग करता है।

मूल लेखक: Amine Lbath

प्रकाशित 2026-03-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Amine Lbath

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नए सुरक्षा गार्ड को एक विशाल, बहु-मंजिला कार्यालय भवन में चोर को पहचानने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं।

समस्या: "खिलौना कमरा" बनाम असली इमारत
अभी, अधिकांश सुरक्षा प्रशिक्षण एक "खिलौना कमरे" में होता है। शोधकर्ता गार्ड को एक अकेला दरवाजा दिखाते हैं और पूछते हैं, "क्या यह दरवाजा लॉक है?" गार्ड एक अकेले दरवाजे पर टूटे हुए लैच को पहचानने में बहुत अच्छा हो सकता है।

लेकिन वास्तविक दुनिया में, चोर सिर्फ एक दरवाजा नहीं तोड़ता; वे बेसमेंट में ताला खोल सकते हैं, एक गलियारे से गुजर सकते हैं, और अटारी में फायर अलार्म बजा सकते हैं। भेद्यता (vulnerability) एक स्थान में नहीं है; यह इस बात में है कि पूरा बिल्डिंग कैसे परस्पर क्रिया करता है।

वर्तमान कंप्यूटर प्रोग्राम (AI) इन "खिलौना कमरे" के उदाहरणों (कोड की एक एकल लाइन) पर प्रशिक्षित हो रहे हैं। जब वे एक वास्तविक, विशाल सॉफ्टवेयर बिल्डिंग (एक पूरा रिपॉजिटरी) की रखवाली करने की कोशिश करते हैं, तो वे भ्रमित हो जाते हैं और विफल हो जाते हैं क्योंकि वे बड़ी तस्वीर नहीं देख पाते। साथ मिलकर, हमारे पास जो कुछ भी "असली बिल्डिंग" वाले प्रशिक्षण सेट हैं, वे हाथ से बनाए गए हैं, जिसमें बहुत समय लगता है और यह प्रशिक्षण की मात्रा को सीमित करता है।

समाधान: "नकली चोर" फैक्ट्री
यह शोध एक स्वचालित फैक्ट्री बनाने का प्रस्ताव करता है जो वास्तविक प्रशिक्षण परिदृश्य तैयार करती है। केवल एक दरवाजे को देखने के बजाय, यह फैक्ट्री वास्तविक सॉफ्टवेयर इमारतों के पूरे नकली संस्करण बनाती है और उनके अंदर गुप्त रूप से "चोरों" (भेद्यताओं) को स्थापित करती है।

यह फैक्ट्री कैसे काम करती है, चरण-दर-चरण यहाँ दिया गया है:

1. ब्लूप्रिंट और परीक्षण (चरण A)

सबसे पहले, सिस्टम एक वास्तविक सॉफ्टवेयर प्रोजेक्ट (जैसे कि एक लोकप्रिय ऐप) चुनता है। यह एक डिजिटल "सैंडबॉक्स" (एक कंटेनर) बनाता है ताकि यह सुनिश्चित हो सके कि पूरी बिल्डिंग वास्तव में काम करती है। यह जाँचता है कि क्या सभी लाइटें जल रही हैं और दरवाजे सामान्य रूप से खुल रहे हैं। यह सुनिश्चित करता है कि यदि हम बाद में कुछ तोड़ते हैं, तो हमें पता होगा कि हमने वास्तव में क्या तोड़ा है।

2. AI एजेंटों की टीम (चरण B)

यही सबसे दिलचस्प हिस्सा है। एक रोबोट द्वारा काम करने के बजाय, विशेषज्ञ AI एजेंटों की एक टीम मिलकर काम करती है, ठीक वैसे ही जैसे एक मानव सुरक्षा टीम।

  • द प्लानर (The Planner): बिल्डिंग के ब्लूप्रिंट को देखता है और कहता है, "हे, किचन की खिड़की थोड़ी ढीली है। चलिए मान लेते हैं कि एक चोर वहां से अंदर घुस सकता है।"
  • द इम्पलीमेंटर (The Implementer): उस कमजोरी को वास्तव में पैदा करने के लिए कोड में सावधानीपूर्वक एक छोटा, वास्तविक बदलाव करता है। यह कोई कार्टून जैसा "HACK" साइन नहीं है; यह एक थके हुए मानव डेवलपर द्वारा की गई गलती जैसा दिखता है।
  • द रिव्यूअर (The Reviewer): काम की जांच करता है। "क्या यह एक वास्तविक गलती की तरह दिखता है? या यह नकली लगता है?" यदि यह नकली लगता है, तो वे इसे वापस भेज देते हैं।
  • द वेरीफायर (The Verifier): बिल्डिंग को तोड़ने की कोशिश करता है। यदि बिल्डिंग अजीब तरह से ढह जाती है, तो वे इसे ठीक करते हैं। यदि "चोर" अंदर नहीं घुस पाता है, तो वे फिर से प्रयास करते हैं।

3. "चोरी का प्रमाण" (चरण C)

एक बार जब भेद्यता स्थापित हो जाती है, तो सिस्टम केवल यह नहीं कहता कि "यहाँ एक छेद है।" यह एक प्रूफ-ऑफ-वल्नरेबिलिटी (PoV) बनाता है।

  • इसे एक लैपटॉप सफलतापूर्वक चुराते हुए चोर के वीडियो रिकॉर्डिंग की तरह समझें।
  • AI के लिए, यह एक "पुनरुत्पादक एक्सप्लॉइट" (reproducible exploit) है—निर्देशों का एक सेट जो 100% साबित करता है कि छेद मौजूद है और इसका उपयोग किया जा सकता है। यह डेटा को एक "गोल्ड स्टैंडर्ड" लेबल देता है: यह निश्चित रूप से भेद्य है, और यहाँ इसका प्रमाण है।

4. गार्ड्स को प्रशिक्षित करना (चरण D)

अब, हम इन हजारों वास्तविक, लेबल किए गए परिदृश्यों को लेते हैं और अपने AI सुरक्षा गार्डों को प्रशिक्षित करते हैं। हम उन्हें पूरी इमारत, छिपा हुआ छेद, और चोर के अंदर घुसने का वीडियो दिखाते हैं। हम AI से पूछते हैं: "चोर के आने से पहले छेद को ढूंढो।" क्योंकि प्रशिक्षण डेटा बहुत वास्तविक है और पूरे भवन को कवर करता है, AI जटिल, छिपे हुए खतरों को पहचानना सीख जाता है जिन्हें वह "खिलौना कमरे" में छोड़ देता।

5. "बिल्ली और चूहे" का खेल (चरण E)

अंत में, शोधकर्ता एक मोड़ पेश करता है: एडवर्सरियल को-इवोल्यूशन (Adversarial Co-evolution)
कल्पना कीजिए कि एक वीडियो गेम है जहाँ:

  • प्लेयर A (द इंजेक्टर): बिल्डिंग में घुसने का एक नया, अधिक चालाक तरीका बनाने की कोशिश करता है।
  • प्लेयर B (द डिटेक्टर): उस नए तरीके को खोजने की कोशिश करता है।
    हर बार जब प्लेयर A घुसपैठ को छिपाने में बेहतर होता है, प्लेयर B उसे खोजने में बेहतर होता है।
    फिर प्लेयर A को और भी अधिक चालाक होना पड़ता है।

वे यह खेल बार-बार खेलते हैं। यह "हथियारों की दौड़" (arms race) AI को अविश्वसनीय रूप से स्मार्ट और मजबूत बनाती है, जिससे यह वास्तविक दुनिया के सबसे खराब परिदृश्यों के लिए तैयार हो जाता है।

यह क्यों मायने रखता है?

  • स्केल (Scale): अब हम स्वचालित रूप से लाखों प्रशिक्षण उदाहरण उत्पन्न कर सकते हैं, न कि केवल कुछ सौ हाथ से बनाए गए।
  • यथार्थवाद (Realism): AI पूरे सॉफ्टवेयर सिस्टम को देखना सीखता है, न कि केवल अलग-थलग हिस्सों को।
  • सुरक्षा (Safety): वास्तविक हैकर्स से पहले इन बग्स को खोजने के लिए AI को प्रशिक्षित करके, हम अपने सॉफ्टवेयर (बैंकिंग ऐप्स, मेडिकल डिवाइस, कारें) को बहुत सुरक्षित बना सकते हैं।

संक्षेप में, यह पेपर एक AI सुरक्षा गार्डों के लिए उच्च-तकनीकी, स्वचालित ड्राइविंग स्कूल बनाने के बारे में है, जहाँ वे वास्तविक, पूर्ण आकार की इमारतों पर पेशेवर प्रशिक्षकों के साथ अभ्यास करते हैं, ताकि वे हमारी डिजिटल दुनिया की रक्षा करने के लिए तैयार हो सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →