← नवीनतम पेपर
🤖 AI

Antares: Foundation Models for Agentic Vulnerability Localization

एन्टेरेस (Antares) कॉम्पैक्ट, लागत प्रभावी फाउंडेशन मॉडल्स (350M–3B पैरामीटर्स) का एक परिवार है जिसे सुपरवाइज्ड फाइन-ट्यूनिंग और रिइन्फोर्समेंट लर्निंग के दो चरणों वाले पाइपलाइन के माध्यम से प्रशिक्षित किया गया है, जो GPT-5.5 के तुलनीय एजेंटिक वल्नरेबिलिटी लोकलाइजेशन प्रदर्शन प्राप्त करता है और साथ ही 200 गुना अधिक बड़े ओपन-वेट मॉडल्स को काफी बेहतर तरीके से पछाड़ता है।

मूल लेखक: Supriti Vijay, Aman Priyanshu, Didier Chapoteau, Arthur Goldblatt, Jianliang He, Kimia Majd, Fraser Burch, Baturay Saglam, Takahiro Matsumoto, Zhuoran Yang, Amin Karbasi

प्रकाशित 2026-08-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Supriti Vijay, Aman Priyanshu, Didier Chapoteau, Arthur Goldblatt, Jianliang He, Kimia Majd, Fraser Burch, Baturay Saglam, Takahiro Matsumoto, Zhuoran Yang, Amin Karbasi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक अपराध को सुलझाने की कोशिश कर रहे हैं, लेकिन अपराध स्थल कोई एक कमरा नहीं है; यह एक विशाल, फैला हुआ शहर है जिसमें लाखों इमारतें हैं, जिनमें से प्रत्येक में हजारों कमरे हैं। आपके पास एकमात्र सुराग एक अस्पष्ट विवरण है, जैसे "किसी ने एक विशिष्ट प्रकार का ताला चुरा लिया है।" कंप्यूटर सॉफ़्टवेयर की दुनिया में, यह शहर एक "कोडबेस" (codebase) है—एक प्रोग्राम को बनाने वाली फ़ाइलों का पूरा संग्रह। वह "ताला" एक सुरक्षा खामी है, जिसे भेद्यता (vulnerability) के रूप में जाना जाता है। ठीक उसी फ़ाइल को खोजना जिसमें यह खामी है, "भेद्यता स्थानीयकरण" (vulnerability localization) कहलाता है। यह एक महत्वपूर्ण काम है क्योंकि यदि आप टूटे हुए हिस्से को नहीं ढूंढ पाते हैं, तो आप उसे ठीक नहीं कर सकते। पारंपरिक रूप से, सुरक्षा विशेषज्ञों ने दो मुख्य उपकरणों का उपयोग किया है: कठोर नियम पुस्तिकाएं (स्टैटिक एनालिसिस) जो ज्ञात पैटर्न को देखती हैं लेकिन नई चालों को चूक जाती हैं, या विशाल, अति-बुद्धिमान AI मॉडल जो अविश्वसनीय रूप से स्मार्ट हैं लेकिन धीमे, महंगे हैं, और जिनके लिए अक्सर अपने निजी कोड को क्लाउड पर भेजना पड़ता है, जिससे कंपनियां नफरत करती हैं।

यहाँ एक नया दृष्टिकोण आता है जो इस समस्या को एक चतुर, फुर्तीले एजेंट द्वारा खेले जाने वाले "लुका-छिपी" के खेल की तरह मानता है। केवल एक किताब पढ़ने या एक विशाल मस्तिष्क से पूछने के बजाय, यह नया तरीका कंप्यूटर को वास्तव में डिजिटल शहर में चलना, दरवाजे खोलना, अंदर झांकना और ठीक वैसे ही सुरागों का पीछा करना सिखाता है जैसे एक मानव जासूस करेगा। मुख्य सवाल जो शोधकर्ताओं ने पूछा था वह था: क्या आपको इसके लिए एक विशाल, महंगे मस्तिष्क की आवश्यकता है, या क्या एक छोटा, तेज़ और सस्ता "जासूस" उतना ही अच्छा हो सकता है यदि उसे विशेष रूप से सही कौशल पर प्रशिक्षित किया जाए?

यह पेपर Antares को पेश करता है, जो छोटे, कॉम्पैक्ट AI मॉडलों का एक परिवार है जिन्हें इन फुर्तीले डिजिटल जासूसों के रूप में डिज़ाइन किया गया है। मौजूदा "Granite" मॉडलों पर आधारित, Antares तीन आकारों में आता है: 350 मिलियन, 1 बिलियन, और 3 बिलियन पैरामीटर (इसे आप AI के मस्तिष्क में "न्यूरॉन्स" या कनेक्शनों की संख्या के रूप में सोच सकते हैं)। शोधकर्ताओं ने केवल इन मॉडलों को सुरक्षा की ढेर सारी किताबें नहीं खिलाईं; उन्होंने उन्हें कार्य करना सिखाया। उन्होंने एक दो-चरणीय प्रशिक्षण प्रक्रिया का उपयोग किया। पहले, उन्होंने सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) का उपयोग किया, जो AI को सुरक्षा अवधारणाओं का क्रैश कोर्स देने और उसे फोल्डर नेविगेट करने और फ़ाइलें पढ़ने के लिए कंप्यूटर टर्मिनल (कमांड लाइन) का उपयोग करना सिखाने जैसा है। फिर, उन्होंने रीइन्फोर्समेंट लर्निंग (RL) का उपयोग किया, एक ऐसी विधि जहाँ AI हजारों बार खेल खेलता है। हर बार जब वह सफलतापूर्वक एक भेद्य फ़ाइल खोज लेता है, तो उसे एक "पुरस्कार" मिलता है। हर बार जब वह रास्ता भटक जाता है या गलत अनुमान लगाता है, तो उसे दंड मिलता है। समय के साथ, AI एक विशिष्ट रणनीति सीखता है: खोजें, सत्यापित करें और परिष्कृत करें।

परिणाम आश्चर्यजनक रूप से विपरीत हैं। पेपर सुझाव देता है कि कार्य-विशिष्ट प्रशिक्षण, कच्चे आकार (raw size) की तुलना में बहुत अधिक मायने रखता। उनके परीक्षणों में, सबसे बड़े Antares मॉडल, Antares-3B ने एक विशेष परीक्षण में 0.223 का स्कोर प्राप्त किया, जिसे वल्नरेबिलिटी लोकलाइजेशन बेंचमार्क (VLoc Bench) कहा जाता है। यह स्कोर GPT-5.5 के लगभग समान है, जो एक विशाल, क्लोज्ड-सोर्स मॉडल है और संभवतः कई गुना बड़ा और चलाने में बहुत महंगा है। महत्वपूर्ण रूप से, Antares-3B ने बहुत बड़े ओपन-वेट मॉडलों को भी पीछे छोड़ दिया, जिसमें 700 बिलियन से अधिक पैरामीटर वाला GLM-5.2 शामिल है। जबकि छोटे Antares मॉडल (350M और 1B) अपने मूल संस्करणों की तुलना में प्रभावशाली सुधार दिखाते हैं और कुछ बड़े सामान्य-उद्देश्य वाले बेसलाइन को पछाड़ देते हैं, वे शीर्ष-स्तरीय प्रदर्शनकर्ताओं जैसे GPT-5.5 या GLM-5.2 को पार करने में सफल नहीं हुए। इसके बजाय, मुख्य निष्कर्ष यह है कि एक विशिष्ट कार्य के लिए प्रशिक्षित कॉम्पैक्ट मॉडल दिग्गजों के साथ प्रतिस्पर्धा कर सकता है, जबकि बिना इस विशिष्ट प्रशिक्षण वाला एक विशाल मॉडल अक्सर पीछे रह जाता है।

शोधकर्ताओं ने यह भी पाया कि बग खोजने की कठिनाई इस बात के बारे में नहीं है कि बग कितना "बुरा" है (गंभीरता), बल्कि इस बारे में है कि कोड कितना अव्यवस्थित है। उन्होंने पाया कि मॉडल Maven (एक Java टूल) जैसे जटिल पारिस्थितिक तंत्रों में सबसे अधिक संघर्ष करते हैं जहाँ फ़ाइलें परतों में गहराई तक दबी होती हैं, लेकिन pip (Python) या npm (JavaScript) जैसे सरल पारिस्थितिक तंत्रों में बहुत बेहतर प्रदर्शन करते हैं। इसके अलावा, उन्होंने पाया कि AI की सफलता तेजी से गिर जाती है जब एक भेद्यता कई फ़ाइलों में फैली होती है या जब कोडबेस बहुत बड़ा (10 MB से अधिक) होता है। यह सुझाव देता है कि जबकि AI खोजने में माहिर है, वह एक साथ बहुत बड़ी मात्रा में सबूतों का हिसाब रखने में अभी भी संघर्ष करता है।

शायद सबसे रोमांचक खोज गति और लागत के बारे में है। क्योंकि Antares छोटा है, इसे एक स्थानीय कार्यालय में एक शक्तिशाली कंप्यूटर चिप (एक H100 GPU) पर चलाया जा सकता है। टीम ने गणना की कि पूरे 500-टास्क परीक्षण को चलाने में लगभग 15 मिनट लगे और बिजली तथा हार्डवेयर किराए में $1 से भी कम खर्च हुआ। इसके विपरीत, उसी काम के लिए विशाल GPT-5.5 का उपयोग करने में लगभग 5 घंटे लगेंगे और लगभग $141 खर्च होंगे। इसका मतलब है कि कंपनियां अपने गुप्त कोड को इंटरनेट से सुरक्षित रखते हुए, भारी खर्च किए बिना, अपने निजी सर्वर पर इन सुरक्षा जांचों को चला सकती हैं।

हालाँकि, पेपर सावधानीपूर्वक यह नोट करता है कि यह सब कुछ हल करने वाली कोई जादुвई छड़ी नहीं है। AI अभी भी उन सबसे कठिन, जटिल मामलों में विफल रहता है जहाँ सबूत दर्जनों फ़ाइलों में बिखरे होते हैं। शोधकर्ता सुझाव देते हैं कि सीमा यह नहीं है कि AI कितने कमांड टाइप कर सकता है, बल्कि यह है कि वह किन सुरागों को प्राथमिकता दे। वे यह भी जोर देते हैं कि जबकि Antares बगों को ठीक करने के लिए खोजने हेतु एक शक्तिशाली उपकरण है, यह सख्ती से रक्षात्मक सुरक्षा के लिए है और इसका उपयोग कभी भी सिस्टम पर हमला करने के लिए नहीं किया जाना चाहिए।

संक्षेप में, Antares दिखाता है कि एक अच्छा जासूस होने के लिए आपको एक विशाल मस्तिष्क की आवश्यकता नहीं है; आपको बस सही प्रशिक्षण की आवश्यकता है। एक छोटे AI को वास्तविक वातावरण में खोजने, सत्यापित करने और अपने अनुमानों को परिष्कृत करने का तरीका सिखाकर, शोधकर्ताओं ने एक ऐसा उपकरण बनाया है जो तेज़, सस्ता, निजी और डिजिटल घास के ढेर में सुई खोजने में आश्चर्यजनक रूप से प्रभावी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →