Seclens: Role-specific Evaluation of LLM's for security vulnerablity detection
यह शोधपत्र SecLens-R का परिचय देता है, जो एक बहु-हितधारक (multi-stakeholder) मूल्यांकन ढांचा है जो विभिन्न संगठनात्मक भूमिकाओं के बीच LLM भेद्यता पहचान प्रदर्शन में महत्वपूर्ण विविधताओं को प्रकट करता है, यह प्रदर्शित करते हुए कि एकल-मीट्रिक बेंचमार्क CISO और इंजीनियरिंग लीडर जैसे हितधारकों की विशिष्ट प्राथमिकताओं को पकड़ने में विफल रहते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल जहाज (आपकी कंपनी का सॉफ्टवेयर) के कप्तान हैं, और आपको एक नया फर्स्ट मेट (एक AI मॉडल) नियुक्त करने की आवश्यकता है जो छिपे हुए चट्टानों (सुरक्षा खामियों/security vulnerabilities) को स्कैन करने के लिए क्षितिज पर नज़र रख सके।
वर्षों से, शिपिंग उद्योग इन फर्स्ट मेट्स को रेट करने के लिए एक ही संख्या का उपयोग करता आया है: "द ओवरऑल स्कोर" (कुल स्कोर)। यदि किसी मेट का स्कोर 100 में से 90 है, तो हर कोई मान लेता है कि वह सबसे अच्छा है।
लेकिन यह शोध पत्र, SecLens, तर्क देता है कि यह एकल संख्या एक झूठ है। यह बिल्कुल वैसा ही है जैसे किसी शेफ को केवल इस आधार पर रेट करना कि वह प्याज कितनी तेज़ी से काटता है। एक शेफ प्याज काटने में बिजली की तरह तेज़ (एक व्यस्त रसोई के लिए बेहतरीन) हो सकता है, लेकिन स्वाद डालने में बहुत खराब (एक फाइन-डाइनिंग रेस्टोरेंट के लिए विनाशकारी) हो सकता है।
यहाँ उन चीज़ों का सरल विवरण दिया गया है जो लेखकों ने खोजा है, कुछ रचनात्मक उपमाओं (analogies) का उपयोग करते हुए।
1. समस्या: एक ही आकार सबके लिए उपयुक्त नहीं है (One Size Does Not Fit All)
पत्र कहता है कि आपकी कंपनी के अलग-अलग लोगों को अलग-अलग चीज़ों की परवाह होती है। एक एकल "ओवरऑल स्कोर" उन सभी को संतुष्ट नहीं कर सकता।
- CISO (मुख्य सूचना सुरक्षा अधिकारी): इन्हें एक सुरक्षा निरीक्षक (Safety Inspector) के रूप में सोचें। उन्हें इस बात से फर्क नहीं पड़ता कि फर्स्ट मेट तेज़ है या सस्ता। उन्हें केवल इस बात की चिंता है: "क्या आपने शार्क को मिस कर दिया?" यदि AI एक गंभीर भेद्यता (vulnerability) को मिस कर देता है, तो यह एक आपदा है। वे रिकॉल (Recall) चाहते हैं (सब कुछ पकड़ना), भले ही इसके लिए AI को एक तैरते हुए लकड़ी के लट्ठे को देखकर भी "शार्क!" चिल्लाना पड़े (फॉल्स पॉजिटिव)।
- हेड ऑफ इंजीनियरिंग: इन्हें एक किचन मैनेजर के रूप la रूप में सोचें। उन्हें गति और शोर (Speed and Noise) की परवाह है। यदि AI हर लकड़ी के टुकड़े को देखकर "शार्क!" चिल्लाने लगता है, तो डेवलपर्स सुनना बंद कर देंगे। वे प्रिसिजन (Precision) चाहते हैं (केवल तभी चिल्लाना जब वास्तव में कोई शार्क हो) ताकि उनकी टीम बिना घबराए खाना बनाना जारी रख सके।
- चीफ AI ऑफिसर (CAIO): वे बजट मैनेजर हैं। वे पूछते हैं: "क्या यह फर्स्ट मेट अपनी सैलरी के लायक है?" वे कौशल और लागत के बीच संतुलन चाहते हैं।
- सिक्योरिटी रिसर्चर: वे एक फोरेंसिक विशेषज्ञ हैं। वे जानना चाहते हैं कि AI ने शार्क को कैसे पाया। क्या उसने पंख देखे? क्या उसने पानी की गंध सूंघी? उन्हें गहरे तर्क (reasoning) की आवश्यकता है, न कि केवल एक "हाँ/नहीं" की।
- "AI-as-Actor": यह एक रोबोटिक्स इंजीनियर है। वे बस जानना चाहते हैं: "क्या रोबोट दरवाजा खोलने की कोशिश करते समय क्रैश हो जाता है?" उन्हें इस बात की परवाह है कि क्या AI बिना कुछ तोड़े निर्देशों का पालन कर सकता है।
2. समाधान: "भूमिका-विशिष्ट चश्मे" (The "Role-Specific Glasses")
लेखकों ने AI को टेस्ट करने का एक नया तरीका बनाया जिसे SecLens-R कहा जाता है। एक एकल स्कोर देने के बजाय, वे पांच अलग-अलग तरह के रंगीन चश्मे (प्रत्येक भूमिका के लिए एक) पहनते हैं ताकि एक ही AI को अलग तरह से देखा जा सके।
उन्होंने एक स्कोरबोर्ड बनाया जिसमें 35 अलग-अलग मेट्रिक्स (जैसे गति, लागत, सटीकता और तर्क) हैं।
- सुरक्षा निरीक्षक लाल रंग का चश्मा पहनता है जो केवल "मिस हुई शार्क" और "क्रिटिकल एरर" को हाइलाइट करता है।
- किचन मैनेजर पीले रंग का चश्मा पहनता है जो "गलत अलार्म" और "बर्बाद समय" को हाइलाइट करता है।
चौंकाने वाला परिणाम:
जब उन्होंने 12 शीर्ष AI मॉडल्स का परीक्षण किया, तो देखने वाले के आधार पर स्कोर नाटकीय रूप से बदल गए!
मॉडल A (Qwen3-Coder):
- किचन मैनेजर के लिए: यह एक A+ है। यह शायद ही कभी लकड़ी के लट्ठे को देखकर "शार्क!" चिल्लाता है। यह सटीक और तेज़ है।
- सुरक्षा निरीक्षक के लिए: यह एक F है। इसने लगभग सभी असली शार्क को मिस कर दिया क्योंकि यह बहुत अधिक सतर्क (cautious) था।
- अंतर: एक ही मॉडल पर 31 अंकों का अंतर।
मॉडल B (GPT-5.4):
- किचन मैनेजर के लिए: A। बेहतरीन प्रिसिजन, कम लागत।
- सुरक्षा निरीक्षक के लिए: D। इसने महत्वपूर्ण कमजोरियों को मिस कर दिया।
मॉडल C (Gemini 3 Flash):
- सुरक्षा निरीक्षक के लिए: B। इसने लगभग सब कुछ पकड़ लिया।
- किचन मैनेजर के लिए: B। अच्छा है, लेकिन थोड़ा शोर भरा (noisy) हो सकता है।
3. "टूल-यूज़" ट्विस्ट (The "Tool-Use" Twist)
पत्र में AI का दो मोड में भी परीक्षण किया गया:
- कोड-इन-प्रॉम्प्ट (CIP): आप AI को कोड का एक पन्ना देते हैं और पूछते हैं, "क्या यह टूटा हुआ है?" (जैसे किसी चट्टान की फोटो देखना)।
- टूल-यूज़ (TU): आप AI को एक नक्शा और एक नाव देते हैं, जिससे वह पूरी डेटाबेस के चारों ओर घूमकर चट्टान को ढूंढ सके। (जैसे वास्तव में जहाज चलाना)।
पेंच: "टूल-यूज़" मोड 10 से 100 गुना अधिक महंगा और धीमा है। यह एक फोटो देखने के बजाय एक पूर्ण डाइविंग टीम को काम पर रखने जैसा है। पत्र ने पाया कि अधिकांश कंपनियों के लिए, निर्णय लेने के लिए केवल फोटो देखना (CIP) ही पर्याप्त है, जब तक कि आपको विशेष रूप से आवश्यकता न हो कि AI स्वायत्त रूप से पूरे जहाज का संचालन करे।
4. बड़ा निष्कर्ष (The Big Takeaway)
पत्र यह निष्कर्ष निकालता है कि कोई "सर्वश्रेष्ठ AI" नहीं है।
- यदि आप एक सुरक्षा प्रमुख (Security Chief) हैं, तो आपको उस AI को चुनना चाहिए जो सबसे अधिक शार्क पकड़ता है, भले ही वह थोड़ा शोर मचाता हो।
- यदि आप एक इंजीनियरिंग लीड हैं, तो आपको उस AI को चुनना चाहिए जो शांत और तेज़ हो, भले ही वह कुछ छोटी मछलियों को मिस कर दे।
उपमा (Metaphor):
कल्पना कीजिए कि आप एक कार खरीद रहे हैं।
- सुरक्षा निरीक्षक उस कार को चाहता है जिसमें सबसे अधिक एयरबैग हों और जिसकी अधिकतम गति धीमी हो (सबसे सुरक्षित)।
- रेसिंग ड्राइवर उस कार को चाहता है जिसकी अधिकतम गति सबसे अधिक हो और वजन सबसे कम हो (सबसे तेज़)।
- बजट खरीदार उस कार को चाहता है जिसका माइलेज सबसे अच्छा हो।
यदि कोई कार पत्रिका कहती है, "यह कार विजेता है क्योंकि इसका स्कोर 90 है," तो वे झूठ बोल रहे हैं। वह कार पारिवारिक यात्रा (सुरक्षा) के लिए सबसे खराब विकल्प हो सकती है और रेस (गति) के लिए भी सबसे खराब विकल्प हो सकती है।
SecLens केवल यह कहता है: "एक एकल 'विजेता' की तलाश करना बंद करें। उस स्कोर को देखें जो आपके विशिष्ट काम के लिए मायने रखता है।"
एक वाक्य में सारांश
एक एकल "ओवरऑल स्कोर" से धोखा न खाएं; सुरक्षा के लिए आपका सबसे अच्छा AI आपकी इंजीनियरिंग टीम के लिए सबसे खराब AI हो सकता है, और आपको अपने विशिष्ट काम के लिए सही टूल चुनने की आवश्यकता है, न कि उस टूल की जिसके पास लीडरबोर्ड पर सबसे अधिक नंबर हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।