CVE-Factory: Scaling Expert-Level Agentic Tasks for Code Security Vulnerability
यह शोध पत्र CVE-Factory को प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो स्पार्स (sparse) CVE मेटाडेटा को उच्च-गुणवत्ता वाले, निष्पादन योग्य सुरक्षा कार्यों में स्वचालित रूप से परिवर्तित करता है ताकि LiveCVEBench बेंचमार्क और एक बड़े पैमाने के प्रशिक्षण डेटासेट का निर्माण किया जा सके, जिससे कोड एजेंटों की भेद्यता (vulnerability) का पता लगाने की क्षमताओं में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुरक्षा गार्ड हैं जो एक नए रोबोट को लाखों अलग-अलग दरवाजों के टूटे हुए तालों को ठीक करना सिखाने की कोशिश कर रहे हैं। समस्या यह है कि आपके पास निर्देश के रूप में केवल छोटे, अस्पष्ट स्टिकी नोट्स (sticky notes) हैं, जिन पर लिखा है, "दरवाजा 404 टूटा हुआ है," बिना यह बताए कि वह कैसे टूटा है, वह दरवाजा कैसा दिखता है, या आपको किन औजारों की आवश्यकता है।
यह AI सुरक्षा अनुसंधान की वर्तमान स्थिति है। हमारे पास कमजोरियों की सूचियाँ (जिन्हें CVE कहा जाता है) हैं, लेकिन वे केवल विरल डेटा बिंदु (sparse data points) हैं। AI एजेंटों को उन्हें ठीक करने के लिए प्रशिक्षित करने के लिए, हमें पूर्ण "प्रशिक्षण किट" (training kits) की आवश्यकता है: टूटे हुए दरवाजे का एक कामकाजी मॉडल, यह साबित करने के लिए एक परीक्षण कि वह टूटा हुआ है, और एक सत्यापित समाधान।
CVE-Factory एक नया सिस्टम है जो एक अत्यंत कुशल, स्वचालित निर्माण दल (construction crew) की तरह कार्य करता है। यह उन छोटे, अस्पष्ट स्टिकी नोट्स को लेता है और तुरंत रोबोट के लिए एक पूर्ण, कामकाजी प्रशिक्षण किट तैयार कर देता है।
यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) का उपयोग किया गया है:
1. समस्या: "अस्पष्ट स्टिकी नोट"
वर्तमान में, सुरक्षा विशेषज्ञों को इन प्रशिक्षण किटों को मैन्युअल रूप से बनाना पड़ता है। वे एक भेद्यता रिपोर्ट (vulnerability report) पढ़ते हैं, सॉफ्टवेयर ढूंढते हैं, एक नकली कंप्यूटर वातावरण सेट करते हैं, उसे जानबूझकर तोड़ते हैं, टूटने को पकड़ने के लिए एक परीक्षण लिखते हैं, और फिर सुधार (fix) लिखते हैं।
- वास्तविकता: विशेषज्ञों को एक दरवाजे के लिए 10+ घंटे लगते हैं। हजारों दरवाजों के लिए यह बहुत धीमा और महंगा है।
- परिणाम: AI रोबोटों के पास अभ्यास के लिए पर्याप्त सामग्री नहीं है, इसलिए वे सुरक्षा के मामले में खराब बने रहते हैं।
2. समाधान: "असेंबली लाइन" (CVE-Factory)
लेखकों ने CVE-Factory बनाया है, जो एक विशेष कारखाने की तरह है जिसमें एक कन्वेयर बेल्ट है। इसके बजाय कि एक व्यक्ति पूरा काम करे, उन्होंने इस प्रक्रिया को छह अलग-अलग स्टेशनों में विभाजित किया है, जिनमें से प्रत्येक एक विशिष्ट AI एजेंट द्वारा संचालित होता है।
इसे एक उच्च-तकनीकी कार मरम्मत कार्यशाला की तरह समझें जहाँ कोई भी अकेला मैकेनिक एक साथ सब कुछ करने की कोशिश नहीं करता:
- स्टेशन 1: जासूस (एनालाइजर/Analyzer)
AI उस अस्पष्ट स्टिकी नोट को पढ़ता है और ब्लूप्रिंट, कार के विशिष्ट मॉडल और टूटे हुए सटीक हिस्से को खोजने के लिए वेब सर्च करता है। यह एक स्पष्ट "केस फाइल" बनाता है। - स्टेशन 2: आर्किटेक्ट (जेनरेटर/Generator)
केस फाइल का उपयोग करके, यह AI रोबोट के लिए निर्देश लिखता है: "यहाँ टूटा हुआ दरवाजा है। यहाँ एक परीक्षण है जो साबित करता है कि यह टूटा हुआ है। यहाँ एक आदर्श सुधार कैसा दिखता है, यह भी दिया गया है।" - स्टेशन 3: बिल्डर (बिल्डर/Builder)
यह AI वास्तविक वातावरण बनाता है। यह "नकली कंप्यूटर" (Docker कंटेनरों का उपयोग करके) सेट करता है ताकि यह बिल्कुल वास्तविक सॉफ्टवेयर जैसा दिखे। महत्वपूर्ण बात यह है कि यह इसे समाधान या परीक्षण देखे बिना बनाता है। यह केवल दृश्य (scene) तैयार करता है। - स्टेशन 4: इंस्पेक्टर (वैलिडेटर/Validator)
इससे पहले कि कोई भी इसे ठीक करने की कोशिश करे, यह एजेंट जांच करता है: "क्या यह नकली कमरे में दरवाजा वास्तव में टूटा हुआ है? क्या परीक्षण काम करता है?" यदि कमरा सही ढंग से सेट नहीं है, तो यह इसे ठीक करने के लिए बिल्डर के पास वापस भेज देता है। - स्टेशन 5: मैकेनिक (सॉल्वर/Solver)
यह एजेंट निर्देशों का उपयोग करके दरवाजे को ठीक करने की कोशिश करता है। यह पैच लागू करता है और परीक्षण चलाता है। - स्टेशन 6: क्वालिटी कंट्रोल चीफ (चेकर/Checker)
अंतिम बॉस। यह पूर्ण एंड-टू-एंड चेक चलाता है। क्या सुधार वास्तव में काम कर गया? क्या रोबोट ने अनजाने में कुछ और तोड़ दिया? क्या परीक्षण असली है, या रोबोट ने केवल परिणाम दिखा दिए?
सीक्रेट सॉस (Secret Sauce): यदि किसी भी स्टेशन पर कुछ गलत हो जाता है, तो सिस्टम हार नहीं मानता। इसमें एक "फीडबैक लूप" है। यदि इंस्पेक्टर कहता है, "दरवाजा टूटा हुआ नहीं है," तो यह काम को नए व्यक्ति के पास भेजने के बजाय, दरवाजे को फिर से बनाने के लिए बिल्डर के पास वापस भेज देता है। यह सुनिश्चित करता है कि अंतिम उत्पाद उच्च गुणवत्ता वाला हो।
3. परिणाम: विशेषज्ञ-स्तर की गति
टीम ने इस कारखाने का परीक्षण उन मानव विशेषज्ञों के विरुद्ध किया है जिन्होंने पहले ही 215 प्रशिक्षण किट बना ली थीं।
- सटीकता: कारखाने के किट मानव विशेषज्ञों के किट जितने ही 95% अच्छे थे।
- गति: मनुष्य एक किट के लिए 5-24 घंटे लेते हैं। कारखाना लगभग 48 मिनट लेता है।
- पैमाना: 20 श्रमिकों के एक साथ चलने से, कारखाने ने 215 किट 5 घंटे से कम समय में बना लिए। एक मानव टीम को हफ्तों लग जाते।
4. नया खेल का मैदान: LiveCVEBench
क्योंकि कारखाना इतना तेज़ है, लेखकों ने केवल 215 पर ही नहीं रोका। उन्होंने एक नया, लगातार अपडेट होने वाला प्लेग्राउंड बनाया जिसे LiveCVEBench कहा जाता है।
- इसमें 190 वास्तविक दुनिया के सुरक्षा कार्य शामिल हैं।
- यह 14 अलग-अलग प्रोग्रामिंग भाषाओं को कवर करता है (केवल Python नहीं)।
- इसमें उभरते हुए खतरे भी शामिल हैं, जैसे स्वयं AI टूल में कमजोरियां।
- यह नए कमजोरियों के खोजे जाने पर स्वचालित रूप से अपडेट होता है, जबकि पुराने बेंचमार्क समय के साथ स्थिर रहते हैं।
5. रोबोट को प्रशिक्षित करना
अंत में, उन्होंने एक AI मॉडल (Qwen3-32B) को सिखाने के लिए कारखाने का उपयोग करके 1,000 से अधिक प्रशिक्षण कार्य बनाए।
- प्रशिक्षण से पहले: AI केवल 5.3% सुरक्षा कार्यों को हल कर सकता था।
- प्रशिक्षण के बाद: यह 35.8% तक पहुंच गया, जो बहुत बड़े और महंगे मॉडलों को भी पीछे छोड़ देता है।
- बोनस: जो कौशल उसने सीखे वे केवल सुरक्षा के लिए नहीं थे; वह सामान्य कोडिंग कार्यों में भी बेहतर हो गया।
सारांश
CVE-Factory एक मल्टी-एजेंट सिस्टम है जो उच्च-गुणवत्ता वाले सुरक्षा प्रशिक्षण डेटा के निर्माण को स्वचालित करता है। यह विरल, उबाऊ भेद्यता रिपोर्टों को AI एजेंटों के लिए पूर्ण, इंटरैक्टिव "एस्केप रूम" शैली की चुनौतियों में बदल देता है। यह साबित करता है कि एक जटिल काम को छोटे, विशिष्ट चरणों में तोड़कर और AI एजेंटों को सहयोग करने देकर, हम विशेषज्ञ-स्तर का प्रशिक्षण डेटा उस गति और पैमाने पर उत्पन्न कर सकते हैं जो मनुष्य साधारणतः नहीं कर सकते। यह हमें पहले से कहीं अधिक तेज़ी से स्मार्ट, अधिक सुरक्षित AI एजेंटों को प्रशिक्षित करने की अनुमति देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।