Snyk VulnBench JS 1.0: Can LLMs Find the Same Bugs Twice?
यह शोध पत्र यह प्रदर्शित करता है कि जबकि एजेंटिक LLMs ज्ञात कमजोरियों को पुनरुत्पादित करने में उच्च स्थिरता प्रदर्शित करते हैं, नई समस्याओं को खोजने की उनकी क्षमता अत्यधिक असंगत है, जो यह सुझाव देता है कि LLM-आधारित सुरक्षा समीक्षाओं को नियतकालिक (deterministic) स्टैटिक एप्लिकेशन सिक्योरिटी टेस्टिंग (SAST) के स्थान पर उसका पूरक होना चाहिए।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही सख्त, नियमों का पालन करने वाला सुरक्षा गार्ड है (आइए उसे SAST कहें) और एक प्रतिभाशाली, रचनात्मक, लेकिन कभी-कभी विचलित होने वाली जासूस है (आइए उसे LLM कहें)। दोनों को एक ही छोटे जावास्क्रिप्ट (JavaScript) भवन में छिपे हुए जाल (कमियों) की जांच करने के लिए काम पर रखा गया है।
कागज "Snyk VulnBench JS 1.0" एक सरल लेकिन महत्वपूर्ण प्रश्न पूछता है: यदि आप उन दोनों को लगातार पांच बार एक ही इमारत का निरीक्षण करने के लिए भेजते हैं, तो क्या वे हर बार आपको बिल्कुल एक जैसी रिपोर्ट देंगे?
यहाँ उन्होंने क्या पाया, जिसे रोजमर्रा की अवधारणाओं में विभाजित किया गया है:
1. सख्त गार्ड बनाम रचनात्मक जासूस
- सख्त गार्ड (SAST): यह टूल एक चेकलिस्ट वाले रोबोट की तरह है। यदि कोड नहीं बदला है, तो रोबोट हर बार बिल्कुल वही रिपोर्ट देता है। वह कभी थकता नहीं है, कभी विचलित नहीं होता, और न ही कभी एक ही चीज़ को दोबारा छोड़ता है। इस अध्ययन में, यह 100% सुसंगत था।
- रचनात्मक जासूस (LLM): यह एक AI है जो "सोच" और तर्क कर सकता है। यह उन पेचीदा, अजीब जालों को पकड़ने में माहिर है जिन्हें एक रोबोट मिस कर सकता है। हालाँकि, यह एक इंसान की तरह है: कभी यह बहुत तेज होता है, कभी थका हुआ होता है, और कभी-कभी यह ऐसी चीजें भी देख लेता है जो वास्तव में वहां हैं ही नहीं।
2. "पांच बार" का परीक्षण
शोधकर्ताओं ने AI जासूस को लगातार पांच बार कोड का निरीक्षण करने के लिए भेजा। यहाँ क्या हुआ:
- जब AI ने एक "ज्ञात" जाल पाया: यदि AI ने उस जाल को पहचाना जिसे सख्त गार्ड ने पहले ही पहचान लिया था, तो वह बहुत विश्वसनीय था। उसने लगभग हर रन में (85% बार) उसी जाल को पाया। जब वह नियमों से सहमत था, तो वह सुसंगत था।
- जब AI ने एक "नया" जाल पाया: यहीं पर मामला गड़बड़ा गया। AI ने नए, अद्वितीय जाल रिपोर्ट करने शुरू कर दिए जिन्हें सख्त गार्ड नहीं देख पाया था।
- समस्या: लगभग आधे ये "नए" रिपोर्ट केवल एक बार दिखने वाले चमत्कार थे। वे पांच में से केवल एक रन में दिखाई दिए और फिर गायब हो गए।
- उपमा: कल्पना कीजिए कि जासूस कहती है, "मैंने गलियारे में एक भूत देखा!" सोमवार को। मंगलवार को, वह कहती है, "नहीं, कोई भूत नहीं है।" बुधवार को, वह कहती है, "दरअसल, वह सिर्फ एक कोट रैक था।" गुरुवार को, "भूत!" फिर से। यदि आप भवन के मालिक हैं, तो आपको नहीं पता कि आपको डरना चाहिए या वह बस कल्पना कर रही है।
3. "शोर" (Noise) का कारक
अध्ययन ने पाया कि AI की "अतिरिक्त" रिपोर्ट बहुत शोर भरी थीं।
- "एक-बार" वाली रिपोर्ट: AI द्वारा रिपोर्ट की गई अनोखी चीजों में से लगभग 50% केवल एक बार हुईं। यदि आप पांच बार स्कैन चलाते हैं, तो आपको मिलने वाली "अतिरिक्त" चेतावनियों की सूची हर रन के आधार पर पूरी तरह से अलग होगी।
- स्थिर रिपोर्ट: जिन चीजों पर AI और सख्त गार्ड सहमत थे, वे स्थिर थीं। वे बदली नहीं।
4. बड़ा मतलब बेहतर नहीं
शोधकर्ताओं ने AI के विभिन्न संस्करणों को आजमाया, जिसमें एक "बेहद महंगी" और "बेहद स्मार्ट" संस्करण भी शामिल था।
- परिणाम: सबसे महंगा, शक्तिशाली AI सबसे अच्छा काम नहीं कर रहा था। वास्तव में, यह अधिक महंगा था, अधिक कंप्यूटर पावर का उपयोग करता था, और एक सस्ते, छोटे संस्करण की तुलना में कम सुसंगत था।
- सबक: सिर्फ इसलिए कि आप सबसे "स्मार्ट" जासूस के लिए अधिक भुगतान करते हैं, इसका मतलब यह नहीं है कि वे आपको अधिक विश्वसनीय रिपोर्ट देंगे। कभी-कभी, सरल, केंद्रित जासूस अधिक सुसंगत होता है।
5. अलग ताकतें, अलग कमजोरियां
पेपर निष्कर्ष निकालता है कि आपको एक दूसरे को चुनने की आवश्यकता नहीं है; आपको दोनों की आवश्यकता है।
- सख्त गार्ड हर पाइप और तार में रिसाव (जैसे डेटा प्रवाह की जाँच करना) को व्यवस्थित रूप से जाँचने में अद्भुत है। वह कभी भी एक ही रिसाव को दोबारा नहीं छोड़ता है।
- रचनात्मक जासूस जटिल, अजीब पैटर्न को पहचानने में माहिर है जो एक चेकलिस्ट में नहीं हो सकते (जैसे कि एक संदिग्ध दिखने वाले SQL इंजेक्शन को पहचानना जिसे गार्ड मिस कर गया हो)।
- पकड़: जासूस कभी-कभी उन स्पष्ट, बार-बार होने वाले रिसाव को मिस कर देता है जिन्हें गार्ड पकड़ लेता है, और कभी-कभी वह नकली जालों से भ्रमित हो जाता है।
मुख्य बात (The Bottom Line)
यदि आप केवल AI जासूस पर भरोसा करते हैं, तो आपको हर बार चेक करने पर एक अलग सुरक्षा रिपोर्ट मिल सकती है, और आपको यह समझने में बहुत समय खर्च करना होगा कि उसके "भूत" असली हैं या सिर्फ कोट रैक।
यदि आप केवल सख्त गार्ड पर भरोसा करते हैं, तो आप पेचीदा, रचनात्मक जालों को मिस कर सकते हैं।
सबसे अच्छी रणनीति: स्पष्ट, बार-बार होने वाले रिसाव (क्योंकि वह अपना मन नहीं बदलता) को पकड़ने के लिए सख्त गार्ड का उपयोग करें, और पेचीदा, असामान्य चीजों को खोजने के लिए रचनात्मक जासूस का उपयोग करें, लेकिन उसकी "अतिरिक्त" खोजों की दोबारा जांच करने के लिए तैयार रहें क्योंकि वे आकस्मिक (flukes) हो सकते हैं। वे एक-दूसरे के पूरक के रूप में सबसे अच्छा काम करते हैं, न कि एक-दूसरे को बदलने के प्रयास में।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।