AVIATOR: Towards AI-Agentic Vulnerability Injection Workflow for High-Fidelity, Large-Scale Code Security Dataset
यह शोध पत्र AVIATOR को प्रस्तुत करता है, जो पहला AI-एजेंटिक फ्रेमवर्क है जो उच्च-सटीकता वाले, बड़े पैमाने के भेद्यता (vulnerability) डेटासेट उत्पन्न करने के लिए विशिष्ट एजेंटों के समन्वित वर्कफ़्लो, टूल-आधारित विश्लेषण और पुनरावृत्त स्व-सुधार का उपयोग करता है, जो मौजूदा इंजेक्शन तकनीकों से काफी बेहतर प्रदर्शन करता है और डीप लर्निंग-आधारित भेद्यता पहचान मॉडलों के प्रदर्शन में पर्याप्त सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुरक्षा गार्ड (एक AI) को भीड़भाड़ वाले शहर में जेबकतोरों को पहचानने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं। ऐसा करने के लिए, आपको गार्ड को जेबकतोरों के हजारों उदाहरण दिखाने होंगे।
समस्या क्या है? असली जेबकतोर बहुत कम होते हैं, और जिन्हें हम जानते हैं वे अक्सर अव्यवस्थित होते हैं, उन्हें लेबल करना कठिन होता है, या वे उस "परफेक्ट" अपराधी की तरह नहीं दिखते जिसे हम अपने गार्ड को सिखाना चाहते हैं। यदि आप गार्ड को खराब उदाहरणों पर प्रशिक्षित करते हैं, तो वे निर्दोष लोगों को गिरफ्तार करना शुरू कर सकते हैं या वास्तविक चोरों को मिस कर सकते हैं।
पेश है AVIATOR.
AVIATOR को केवल एक अकेले रोबोट के रूप में नहीं, बल्कि एक अत्यधिक संगठित निर्माण दल (construction crew) के रूप में सोचें जिसका नेतृत्व एक मास्टर आर्किटेक्ट कर रहा है। इसका काम सुरक्षित इमारतों (सुरक्षित कोड) के भीतर "नकली" जेबकतोर (सॉफ्टवेयर कमजोरियां) बनाना है ताकि सुरक्षा गार्ड उन्हें पहचानना सीख सके।
AVIATOR कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ दिया गया है:
1. पुराना तरीका: "स्टिकर" दृष्टिकोण
इन नकली कमजोरियों को बनाने के पिछले तरीके एक सुरक्षित इमारत में किसी रैंडम दीवार पर "खतरा" का साइन बोर्ड चिपकाने या दरवाजे पर पहले से बने "टूटी हुई खिड़की" का स्टिकर चिपकाने जैसा था।
- समस्या: ये स्टिकर अक्सर फिट नहीं बैठते। वे नकली लगते हैं। कभी-कभी वे इमारत की संरचना को ही बिगाड़ देते हैं। सुरक्षा गार्ड स्टिकर को पहचानना सीख जाता है, न कि वास्तविक कमियों को।
- परिणाम: गार्ड भ्रमित हो जाता है, वास्तविक खतरों को मिस कर देता है, या बहुत अधिक गलत अलार्म (false alarms) देता है।
2. AVIATOR का तरीका: "मास्टर आर्किटेक्ट" टीम
AVIATOR AI Agents का उपयोग करके खेल बदल देता है। एक अकेले रोबोट के बजाय जो सब कुछ एक साथ करने की कोशिश करता है, AVIATOR इस काम को विशेषज्ञों की एक टीम में विभाजित करता है, जो एक मानव सुरक्षा विशेषज्ञ की तरह काम करती है।
यहाँ टीम का वर्कफ़्लो (workflow) दिया गया है:
- डिटेक्टिव (कोड की समझ): सबसे पहले, एक एजेंट कोड को एक जासूस की तरह पढ़ता है जो ब्लूप्रिंट पढ़ रहा हो। वह समझता है कि इमारत कैसे काम करती है, दरवाजे कहाँ हैं, और लोग इसमें कैसे चलते हैं।
- लाइब्रेरियन (सूचना लोडर): यह एजेंट ठीक उसी फाइल को निकालता है जिसमें बताया गया है कि किस प्रकार की "कमी" (जैसे, "एक ढीला फर्श" या "एक खुला पिछला दरवाजा") बनाई जानी है।
- रिवर्स इंजीनियर (कमजोरी विश्लेषक): यह एजेंट सुरक्षित कोड को देखता है और पूछता है, "यहाँ घुसपैठ को क्या रोक रहा है?" यह उन सुरक्षा गार्डों (जांच और संतुलन) की पहचान करता है जो वर्तमान में काम कर रहे हैं।
- सबोटूर (द इनजेक्टर/विघटनकर्ता): यह मुख्य कार्यकर्ता है। अन्यों की जानकारी का उपयोग करके, यह सावधानी से एक विशिष्ट गार्ड को हटा देता है या एक बोल्ट को ढीला कर देता है। महत्वपूर्ण बात यह है कि यह केवल दीवार नहीं तोड़ता; यह इस तरह से करता है कि घुसपैठ बिल्कुल वैसी ही लगे जैसी एक वास्तविक मानव हैकर करेगा। यह सुनिश्चित करने के लिए कि संपादन प्रामाणिक दिखे, यह वास्तविक दुनिया की घुसपैठों के "चीट शीट" (Retrieval-Augmented Generation) का उपयोग करता है।
- क्वालिटी कंट्रोल टीम (वैलिडेशन): यहीं AVIATOR चमकता है। "टूटी हुई" इमारत को सुरक्षा गार्ड को भेजने से पहले, एक पूरी टीम इसकी जांच करती है:
- डिफ चेकर (Diff Checker): "क्या आपने वास्तव में कुछ बदला है, या आपने सिर्फ एक कुर्सी हटाई है?"
- स्टैटिक एनालाइजर (Static Analyzer): एक रोबोट टूल जो कोड को स्कैन करता है ताकि यह सुनिश्चित हो सके कि इमारत ढह नहीं गई (सिंटैक्स एरर)।
- फिक्सर (Fixer): यदि सबोटूर ने कोई गलती की है, तो फिक्सर उसे सुधारने या फिर से प्रयास करने की कोशिश करता है।
3. यह क्यों मायने रखता है (परिणाम)
चूंकि AVIATOR एक एकल रोबोट के अनुमान लगाने के बजाय इस "विशेषज्ञों की टीम" के दृष्टिकोण का उपयोग करता है:
- यह अधिक वास्तविक है: इसके द्वारा बनाई गई नकली कमजोरियां बिल्कुल असली जैसी दिखती और व्यवहार करती हैं। यह गार्ड को केवल साइन पकड़े हुए लोगों के बजाय, वास्तव में जेबकतोरी करने वाले अभिनेताओं के साथ प्रशिक्षित करने जैसा है।
- यह स्मार्ट है: यह बड़ी संख्या में विविध खामियां (133 अलग-अलग प्रकार!) बना सकता है, जबकि पुराने तरीके केवल कुछ सरल चीजें ही बना सकते थे।
- यह सस्ता और तेज़ है: इसे चलाने की लागत पिछले सबसे अच्छे तरीके की तुलना में 4.3 गुना कम है।
- गार्ड बेहतर होता है: जब सुरक्षा गार्ड (AI भेद्यता डिटेक्टर) को AVIATOR के नकली डेटा पर प्रशिक्षित किया गया, तो वह वास्तविक खतरों को पहचानने में काफी बेहतर हो गया। उसने निर्दोष लोगों को गिरफ्तार किए बिना (उच्च सटीकता बनाए रखते हुए) अधिक बुरे लोगों को पकड़ा (उच्च रिकॉल)।
निचोड़ (The Bottom Line)
AVIATOR को साइबर-हैकिंग के सिम्युलेटर के रूप में सोचें। वास्तविक हैकर्स से सीखने के लिए उनके सिस्टम में घुसने का इंतज़ार करने के बजाय, AVIATOR एक सुरक्षित, नियंत्रित और अविश्वसनीय रूप से यथार्थवादी प्रशिक्षण मैदान बनाता है। यह "क्या होगा अगर" (what-if) वाले परिदृश्यों को तैयार करने के लिए AI विशेषज्ञों की एक टीम का उपयोग करता है, जिससे यह सुनिश्चित होता है कि हमारे सॉफ्टवेयर डिफेंडर्स वास्तविक दुनिया की चुनौतियों के लिए पूरी तरह तैयार हैं।
संक्षेप में: पुराने तरीकों ने कोड पर नकली खामियां चिपका दीं। AVIATOR वास्तविक, जटिल और विविध खामियां बनाता है ताकि हमारे AI डिफेंडर्स एक सुरक्षित इमारत और एक टूटी हुई इमारत के बीच का अंतर सीख सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।