← नवीनतम पेपर
🤖 machine learning

ANVIL: Anomaly-based Vulnerability Identification without Labelled Training Data

यह शोध पत्र ANVIL को प्रस्तुत करता है, जो एक अनसुपरवाइज्ड (unsupervised) भेद्यता पहचान ढांचा है जो मास्क पुनर्निर्माण (masked reconstruction) और एक हाइब्रिड स्कोरिंग तंत्र के माध्यम से कोड विसंगतियों की पहचान करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जो सुपरवाइज्ड डिटेक्टरों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है और फज़र्स (fuzzers) के साथ एकीकृत होने पर पहले से अज्ञात कमजोरियों को सफलतापूर्वक उजागर करता है।

मूल लेखक: Weizhou Wang, Eric Liu, Xiangyu Guo, Xiao Hu, Ilya Grishchenko, David Lie

प्रकाशित 2026-06-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weizhou Wang, Eric Liu, Xiangyu Guo, Xiao Hu, Ilya Grishchenko, David Lie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप लाखों बेहतरीन ईंटों से बनी एक विशाल दीवार में एक अकेली, थोड़ी टूटी हुई ईंट को खोजने की कोशिश कर रहे हैं।

समस्या: "सिक्का उछालने" का द्वंद्व (The "Coin Flip" Dilemma)
आमतौर पर, इन टूटी हुई ईंटों को खोजने के लिए आपको विशेषज्ञों की एक टीम की आवश्यकता होती है जिन्होंने हजारों टूटे हुए उदाहरणों का अध्ययन किया हो और ठीक से सीखा हो कि वे कैसे दिखते हैं। अधिकांश वर्तमान कंप्यूटर प्रोग्राम इसी तरह काम करते हैं: वे "सुपरवाइज्ड लर्नर्स" (supervised learners) हैं। लेकिन एक बड़ी समस्या है: हमारे पास उन्हें ठीक से सिखाने के लिए टूटे हुए कोड के पर्याप्त उदाहरण नहीं हैं।

हाल ही में, हमारे पास ये सुपर-स्मार्ट AI मॉडल (जिन्हें लार्ज लैंग्वेज मॉडल्स या LLMs कहा जाता है) आए हैं जिन्होंने कोड का लगभग हर हिस्सा पढ़ा है। आप सोच सकते हैं, "शानदार! उन्होंने सब कुछ देखा है, तो वे टूटी हुई ईंटों को भी पहचान लेने चाहिए।" लेकिन आश्चर्यजनक रूप से, जब आप उनसे बस इतना पूछते हैं, "क्या यह कोड की लाइन टूटी हुई है?" तो वे सिक्का उछालकर निर्णय लेने जितना ही बेहतर प्रदर्शन करते हैं। वे कोड लिखने में बहुत अच्छे हैं, लेकिन उसकी आलोचना करने में बहुत खराब हैं, क्योंकि उन्हें पैटर्न की नकल करने के लिए प्रशिक्षित किया गया था, न कि गलतियों को पकड़ने के लिए।

समाधान: ANVIL ( "अंतर पहचानने" का खेल)
इस पेपर के पीछे के शोधकर्ताओं ने, ANVIL, खेल को पूरी तरह बदल दिया। AI को यह सिखाने के बजाय कि एक "टूटा हुआ" कोड कैसा दिखता है, उन्होंने पूछा: "AI क्या सोचता है कि एक सामान्य कोड की लाइन कैसी होनी चाहिए?"

यहाँ बताया गया है कि ANVIL कैसे काम करता है, एक सरल उपमा का उपयोग करते हुए:

  1. मास्किंग गेम (The Masking Game): कल्पना कीजिए कि आप एक कहानी से एक वाक्य लेते हैं और एक काली मार्कर से उस लाइन को ढक देते हैं। फिर आप AI से पूछते है कि केवल पहले और बाद के वाक्यों के आधार पर वह छिपी हुई लाइन क्या थी।
  2. अपेक्षा (The Expectation): यदि छिपी हुई लाइन कोड की एक सामान्य, मानक लाइन है, तो AI संभवतः उसका सही अनुमान लगा लेगा (या उसके बहुत करीब होगा) क्योंकि उसने वह पैटर्न लाखों बार देखा है।
  3. विसंगति (The Anomaly): यदि छिपी हुई लाइन एक "वल्नरेबल" (vulnerable - असुरक्षित/टूटी हुई) लाइन है, तो वह बाकी डेटा की तुलना में अजीब या असामान्य होगी। AI इसका अनुमान लगाने में संघर्ष करेगा। वह कुछ पूरी तरह से अलग अनुमान लगा सकता है, या वह बहुत अनिश्चित हो सकता है।
  4. स्कोर (The Score): ANVIL इस बात को मापता है कि AI का अनुमान मूल लाइन से कितना भिन्न है। यदि अनुमान बहुत अलग है, या यदि AI भ्रमित लग रहा है, तो ANVIL उस लाइन को "एनोमलस" (anomalous - संदिग्ध) के रूप में चिह्नित करता है।

"हाइब्रिड" जासूस (The "Hybrid" Detective)
शोधकर्ताओं ने महसूस किया कि केवल अंतर को मापना ही काफी नहीं है। कभी-कभी एक छोटा सा अंतर (जैसे > को >= में बदलना) एक बड़ी त्रुटि होती है, लेकिन AI को शायद यह बड़ी बात नहीं लगेगी। इसलिए, उन्होंने एक "हाइब्रिड स्कोर" बनाया है जो चार अलग-अलग उपकरणों वाले एक जासूस की तरह काम करता है:

  • सटीक मिलान (Exact Match): क्या AI ने 100% सही अनुमान लगाया? यदि नहीं, तो यह एक रेड फ्लैग (चेतावनी) है।
  • कन्फ्यूजन मीटर (Confusion Meter): AI कितना अनिश्चित था? यदि AI अपने दांव लगाने में हिचकिचा रहा है, तो कोड अजीब हो सकता है।
  • जटिलता जांच (Complexity Check): क्या कोड की लाइन अत्यधिक जटिल है? जटिल कोड अक्सर वहीं होता है जहाँ गलतियाँ छिपती हैं।
  • "लॉस" स्कोर (The "Loss" Score): एक गणितीय माप कि मूल लाइन देखकर AI कितना "हैरान" हुआ।

परिणाम: भूसे के ढेर में सुई खोजना (Finding the Needle in the Haystack)
टीम ने वास्तविक दुनिया के कोड के एक विशाल डेटासेट पर ANVIL का परीक्षण किया।

  • विशेषज्ञों को पछाड़ना: उन्होंने ANVIL की तुलना उन सर्वोत्तम मौजूदा उपकरणों से की जिन्हें प्रशिक्षण डेटा की आवश्यकता होती है। भले ही ANVIL ने किसी भी प्रशिक्षण डेटा का उपयोग नहीं किया, फिर भी इसने अन्य उपकरणों की तुलना में दोगुनी सटीकता से कमजोरियों (vulnerabilities) को खोजा।
  • कॉन्टेक्स्ट ट्रिक (The Context Trick): उन्होंने पाया कि AI को पूरी फाइल पढ़ने के लिए देना वास्तव में भ्रमित करने वाला था (जैसे पूरे खलिहान को देखकर भूसे के ढेर में सुई खोजने की कोशिश करना)। इसके बजाय, ANVIL एक "स्मार्ट कॉन्टेक्स्ट" दृष्टिकोण का उपयोग करता है: यह केवल संदिग्ध लाइन के आसपास के विशिष्ट कोड ब्लॉक (फंक्शन) को देखता है। इसने इसे तेज़ और अधिक सटीक बना दिया।
  • वास्तविक दुनिया की सफलता: यह साबित करने के लिए कि यह वास्तविक दुनिया में काम करता है, उन्होंने ANVIL को एक "फ़ज़र" (fuzzer - एक ऐसा टूल जो रैंडम डेटा फेंककर सॉफ़्टवेयर को तोड़ने की कोशिश करता है) से जोड़ा। ANVIL ने फ़ज़र को दो बिल्कुल नई, पहले अज्ञात कमजोरियों को खोजने में मदद की, जिनमें से एक इतनी गंभीर थी कि उसे एक आधिकारिक सुरक्षा आईडी (CVE) मिली।

मुख्य निष्कर्ष (The Bottom Line)
ANVIL यह सिद्ध करता है कि "बुरा" क्या है, यह खोजने के लिए आपको AI को सिखाने की आवश्यकता नहीं है। आपको बस AI से यह पूछने की आवश्यकता है कि "सामान्य" क्या है। जब कोड "सामान्य" पैटर्न में फिट नहीं बैठता, तो इसकी संभावना है कि वह टूटा हुआ है। यह बिना किसी विशाल लाइब्रेरी के, जिसमें पिछली गलतियों को सीखा जा सके, सुरक्षा खामियों को खोजने का एक स्मार्ट, तेज़ और अधिक सामान्य तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →