Can Open-Source LLM Agents Replace Static Application Security Testing Tools? An Empirical Assessment
यह अनुभवजन्य अध्ययन यह निष्कर्ष निकालता है कि ओलामा (Ollama) मॉडल्स द्वारा संचालित वर्तमान ओपन-सोर्स, सामान्य-उद्देश्य वाले एलएलएम (LLM) एजेंट्स अभी तक वास्तविक साइबर सुरक्षा परिदृश्यों में बैंडिट (Bandit) जैसे स्थापित स्टैटिक एप्लीकेशन सिक्योरिटी टेस्टिंग (SAST) टूल्स को बदलने के लिए उपयुक्त नहीं हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास किताबों (कोड) का एक विशाल पुस्तकालय है और आपको उनमें छिपी हर एक वर्तनी की गलती (typo), कथानक की कमी (plot hole), या खतरनाक रहस्य को खोजना है। इस काम के लिए आपके पास दो सहायक हैं:
- अनुभवी लाइब्रेरियन (Bandit): यह एक पारंपरिक टूल है। यह "सोचता" या "कल्पना" नहीं करता। इसके पास ज्ञात गलतियों की एक सख्त, पहले से लिखी हुई चेकलिस्ट है (जैसे "पीछे का दरवाजा खुला न छोड़ें" या "जंग लगा ताला इस्तेमाल न करें")। यह तेजी से और व्यवस्थित रूप से किताबों को स्कैन करता है, और आपको सटीक रूप से बताता है कि समस्याएँ कहाँ हैं। यह उबाऊ है, लेकिन भरोसेमंद है।
- क्रिएटिव इंटर्न (The AI Agent): यह एक नया, फैंसी लार्ज लैंग्वेज मॉडल (LLM) है। यह एक प्रतिभाशाली छात्र की तरह है जिसने पूरा इंटरनेट पढ़ लिया है। एक चेकलिस्ट के बजाय, आप इसे एक जॉब डिस्क्रिप्शन देते हैं: "कुछ भी ढूंढो जो खतरनाक लग रहा हो।" यह अनुमान लगाने के लिए अपनी कल्पना का उपयोग करता है कि क्या गलत हो सकता है।
प्रयोग
शोधकर्ताओं ने इन दोनों सहायकों को एक-दूसरे के खिलाफ खड़ा करने का फैसला किया। उन्होंने उन्हें स्कैन करने के लिए तीन अलग-अलग "पुस्तकालय" (ओपन-सोर्स सॉफ्टवेयर प्रोजेक्ट्स) दिए:
- एक रिटायर लेकिन मजबूत पैकेज मैनेजर (Yum)।
- एक व्यक्तिगत आदत-ट्रैकिंग ऐप (Beaverhabits)।
- एक सुरक्षा टूल जो खराब लॉगिन प्रयासों को रोकता है (Fail2ban)।
उन्होंने अनुभवी लाइब्रेरियन को वास्तविक समस्याओं की एक "गोल्ड स्टैंडर्ड" सूची बनाने के लिए पहले स्कैन करने को कहा। फिर, उन्होंने क्रिएटिव इंटर्न (जो तीन अलग-अलग AI मॉडल्स: Gemma, Llama और Qwen द्वारा संचालित था) को भी वही काम करने के लिए कहा।
क्या हुआ? (परिणाम)
क्रिएटिव इंटर्न के लिए परिणाम काफी निराशाजनक रहे। सरल उपमाओं (analogies) का उपयोग करके इसका विवरण यहाँ दिया गया है:
- "हैलुसिनेशन" (Hallucination) की समस्या: इंटर्न ने ऐसी समस्याएँ बनाना जारी रखा जो अस्तित्व में ही नहीं थीं। इसने कोड की एक बिल्कुल सामान्य लाइन को देखा और कहा, "आहा! यह एक गुप्त पासवर्ड लीक है!" जबकि वह वास्तव में केवल एक मानक सेटिंग थी। शोध पत्र में, इसे फॉल्स पॉजिटिव (False Positive) कहा गया है। इंटर्न मुसीबत खोजने के लिए इतनी उत्सुक थी कि उसने निर्दोष चीजों को भी खतरनाक के रूप में चिह्नित कर दिया।
- उपमा: यह एक सुरक्षा गार्ड की तरह है जो सोचता है कि लाल सेब पकड़े हुए व्यक्ति के पास बम है क्योंकि "लाल चीजें खतरनाक होती हैं।"
- "खोई हुई लोकेशन" की समस्या: जब इंटर्न ने वास्तव में कोई समस्या ढूंढी, तो वह अक्सर यह नहीं बता पाता था कि वह कहाँ थी। वह कहता था, "कोड में एक बग है," लेकिन जब आपसे पूछा गया, "कौन सी फ़ाइल? कौन सी लाइन?", तो उसने एक ऐसी फ़ाइल का नाम बना दिया जो मौजूद नहीं थी या एक ऐसी लाइन नंबर की ओर इशारा किया जो खाली थी।
- उपमा: यह एक जासूस की तरह है जो कहता है, "चोर घर में है," लेकिन जब आप पूछते हैं, "कौन से कमरे में?", तो वह अनुमान लगाता है कि "अटारी में" जबकि चोर वास्तव में बेसमेंट में है।
- "छूटे हुए अवसरों" की समस्या: इंटर्न ने वास्तविक समस्याओं का एक बड़ा हिस्सा मिस कर दिया जिसे अनुभवी लाइब्रेरियन ने पाया था। इसने वास्तविक समस्याओं का केवल लगभग 25% ही पकड़ा।
- उपमा: लाइब्रेरियन ने 100 गलतियाँ पाईं। इंटर्न ने केवल 25 ही ढूंढीं, और उनमें से 50 चीजें ऐसी थीं जो गलतियाँ थीं ही नहीं।
- "गति" की समस्या: अनुभवी लाइब्रेरियन ने एक मिनट से भी कम समय में काम पूरा कर लिया। क्रिएट-इव इंटर्न को उसी काम को करने में घंटों (कभी-कभी प्रति लाइब्रेरी 1 से 4 घंटे) लग गए।
- उपमा: लाइब्रेरियन एक हाई-स्पीड ट्रेन है। इंटर्न एक घोंघा है जो ट्रैक के साथ हर फूल को सूंघने के लिए रुकता है।
निर्णय
शोध पत्र निष्कर्ष निकालता है कि अभी, क्रिएटिव इंटर्न अनुभवी लाइब्रेरियन की जगह लेने के लिए तैयार नहीं है।
जबकि इंटर्न कहानियाँ लिखने या ईमेल का सारांश देने के लिए बेहतरीन है, यह वर्तमान में सुरक्षा स्कैनिंग के विशिष्ट, उच्च-दांव वाले काम के लिए बहुत अविश्वसनीय है। यह बहुत अधिक "शोर" (नकली अलार्म) पैदा करता है, वास्तविक खतरों को बहुत अधिक मिस करता है, और काम करने में बहुत अधिक समय लेता है।
शोधकर्ता सुझाव देते हैं कि शायद इंटर्न को लाइब्रेरियन के सहायक के रूप में उपयोग किया जा सकता है—शायद उन चीजों को पकड़ने के लिए जिन्हें लाइब्रेरियन मिस कर देता है—लेकिन केवल तभी जब इंसान उसके हर एक अनुमान की जांच पहले करे। लेकिन एक स्टैंडअलोन टूल के रूप में पुराने, भरोसेमंद तरीकों को बदलने के लिए? पेपर कहता है नहीं। इसकी "हैलुसिनेशन" (चीजें बनाना) और सटीकता की कमी इसे अभी सुरक्षा के लिए भरोसेमंद बनाने के लिए बहुत जोखिम भरा बनाती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।