DualGauge: Automated Joint Security-Functionality Benchmarking of Specification-Only Code Generation by LLMs and Coding Agents
यह शोधपत्र DualGauge का परिचय देता है, जो एक स्वचालित फ्रेमवर्क और बेंचमार्क है जो यह प्रदर्शित करता है कि वर्तमान LLMs और कोडिंग एजेंट एक साथ ऐसा कोड उत्पन्न करने में संघर्ष करते हैं जो कार्यात्मक रूप से सही और सुरक्षित दोनों हो, जिसमें कई भाषाओं में संयुक्त सफलता दर 15% से नीचे बनी रहती है और यह प्रकट होता है कि उन्नत मॉडल क्षमताएं या पुनरावृत्त स्कैफोल्डिंग (iterative scaffolding) सुरक्षा-कार्यात्मक समझौतों को विश्वसनीय रूप से हल नहीं करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक बहुत ही प्रतिभाशाली, तेज़ बोलने वाले रोबोट शेफ को काम पर रखा है जो एक साधारण मौखिक विवरण के आधार पर आपके लिए भोजन बनाता है: "एक सैंडविच बनाओ।"
लंबे समय से, हमने केवल यह जांचा है कि क्या रोबोट ने रेसिपी का पालन किया। क्या उसने प्लेट पर ब्रेड रखी? हाँ। क्या उसने इसमें हैम डाला? हाँ। यदि सैंडविच सही दिखता है, तो हम कहते हैं, "बहुत बढ़िया काम किया!"
लेकिन यह नया पेपर, DualGauge, एक बहुत कठिन सवाल पूछता है: "क्या सैंडविच खाने के लिए सुरक्षित है?"
हो सकता है कि रोबोट ने रेसिपी का पूरी तरह से पालन किया हो, लेकिन उसने गलती से दराज में मिले एक जंग लगे चाकू से हैम को काट दिया, या उसने एक ऐसा चॉपिंग बोर्ड इस्तेमाल किया जिसे कभी धोया नहीं गया था। सैंडविच एक सैंडविच जैसा दिखता है, लेकिन वह खतरनाक है।
यहाँ उस कहानी का विवरण है जो शोधकर्ताओं ने पाया, जिसे सरल भाषा में समझाया गया है।
1. समस्या: "अच्छा दिखने वाला" जाल
शोधकर्ताओं ने पाया कि वर्तमान AI कोडिंग टूल्स (जैसे कि रोबोट शेफ) ऐसी चीजें बनाने में बहुत अच्छे हैं जो काम करती हुई दिखती हैं, लेकिन वे ऐसी चीजें बनाने में बहुत खराब हैं जो वास्तव में सुरक्षित हैं।
उन्होंने एक नया परीक्षण सिस्टम बनाया जिसे DualGauge कहा जाता है। इसे एक "डबल-चेक किचन" की तरह समझें।
- पुराना तरीका: आप सैंडविच चखते हैं। यदि इसका स्वाद हैम जैसा है, तो आप टेस्ट पास कर लेते हैं।
- DualGauge का तरीका: आप सैंडविच का स्वाद लेते हैं (कार्यक्षमता/Functionality), और आप रसोई में जंग लगे चाकू, गंदे बोर्ड और ज़हर की जांच करते हैं (सुरक्षा/Security)।
2. बेंचमार्क: "307 सैंडविच ऑर्डर"
इसे टेस्ट करने के लिए, उन्होंने 307 अलग-अलग कार्यों का एक विशाल मेनू बनाया।
- प्रत्येक कार्य केवल एक सरल वाक्य था, जैसे "एक प्रोग्राम लिखें जो एक फ़ाइल को पढ़ता है।"
- उन्होंने AI को कोई संकेत, कोड स्निपेट या सुरक्षा चेतावनी नहीं दी। बस ऑर्डर दिया।
- हर ऑर्डर के लिए, उन्होंने दो प्रकार के टेस्ट बनाए:
- टेस्ट ऑफ टेस्ट (स्वाद परीक्षण): क्या प्रोग्राम वह करता है जो उसे करना चाहिए?
- सेफ्टी इंस्पेक्शन (सुरक्षा निरीक्षण): क्या प्रोग्राम फ़ाइलें चुराने, सिस्टम को क्रैश करने या हैकर्स को अंदर आने देने की कोशिश करता है?
3. चौंका देने वाले परिणाम
उन्होंने 10 सबसे स्मार्ट AI मॉडल्स (शेफ) से ये 307 सैंडविच बनाने को कहा। यहाँ क्या हुआ:
- "लुक्स गुड" स्कोर ऊँचा था: कई मॉडल्स ने लगभग 39% सैंडविच सही स्वाद वाले बनाए। उन्होंने रेसिपी का पालन किया!
- "सेफ" स्कोर कम था: सुरक्षा की जाँच करने पर, स्कोर गिर गया।
- "परफेक्ट" स्कोर बहुत छोटा था: जब उनसे पूछा गया, "क्या आपने एक ऐसा सैंडविच बनाया जो स्वाद में भी सही है और सुरक्षित भी है?" तो सबसे अच्छे AI मॉडल को 15% से भी कम सफलता मिली।
उपमा (Analogy): कल्पना कीजिए कि एक छात्र गणित की परीक्षा दे रहा है। वह 90% उत्तर सही देता है (Functional Correctness)। लेकिन यदि आप उससे पूछते हैं, "क्या आपने गणना की गलतियों के लिए अपना काम भी चेक किया?" तो वह फेल हो जाता है। पेपर में पाया गया कि कोडिंग में अच्छा होने का मतलब यह अपने आप में नहीं है कि आप सुरक्षित कोडिंग करने में भी अच्छे हैं।
4. "ज़्यादा सोचने" से भी मदद नहीं मिली
शोधकर्ताओं ने इस समस्या को ठीक करने की कोशिश की, जैसे कि शेफ को बेहतर चाकू या सोचने के लिए अधिक समय देना। उन्होंने प्रयास किया:
- बड़े मॉडल्स: "सुपर-शेफ" (बड़े AI दिमाग) का उपयोग करना।
- विस्तारित सोच (Extended Thinking): AI को यह बताना कि, "अपना समय लें और चरण-दर-चरण सोचें।"
- विशेष प्रशिक्षण (Specialized Training): AI को विशेष रूप से कोडर बनने के लिए सिखाना।
परिणाम: इनमें से किसी भी ट्रिक ने सुरक्षा के मुद्दे को भरोसेमंद तरीके से ठीक नहीं किया। कभी-कभी AI रेसिपी में बेहतर हो जाता, लेकिन फिर भी चॉपिंग बोर्ड धोना भूल जाता। कभी-कभी वह सुरक्षा में बेहतर हो जाता लेकिन रेसिपी भूल जाता। सुरक्षा और कार्यक्षमता दो अलग-अलग कौशल हैं जो हमेशा एक साथ विकसित नहीं होते।
5. "रोबोट असिस्टेंट" ने भी मदद नहीं की
ऐसे नए AI टूल्स हैं जो "एजेंट्स" की तरह काम करते हैं। केवल एक बार कोड लिखने के बजाय, वे अपनी गलतियों को सुधारने की कोशिश करते हैं। वे कोड लिखते हैं, उसे चलाते हैं, एक एरर देखते हैं, और फिर से कोशिश करते हैं।
शोधकर्ताओं ने पाया कि इन "शुद्ध रेसिपी" वाले कार्यों पर, एजेंटों ने साधारण रोबोट से बेहतर प्रदर्शन नहीं किया।
- क्यों? एजेंट अपना सारा समय रसोई में औजारों को खोजने में बिता रहे थे (जैसे कि एक विशिष्ट फ़ाइल खोजना या सर्वर सेटअप करना) बजाय इसके कि वे सैंडविच की सुरक्षा को ठीक करें। वे "रसोई का प्रबंधन" करने में व्यस्त थे लेकिन "सुरक्षित रूप से खाना पकाने" में नहीं।
6. "छिपा हुआ खतरा"
पेपर में यह पैटर्न मिला कि AI क्यों विफल हुआ।
- फंक्शनल फेल्योर (कार्यात्मक विफलता): AI आमतौर पर इसलिए विफल हुआ क्योंकि उसने उत्तर का "आकार" गलत कर दिया (उदाहरण के लिए, इसने गलत डेटा टाइप वापस किया)।
- सिक्योरिटी फेल्योर (सुरक्षा विफलता): AI आमतौर पर सुरक्षित होने की कोशिश करता था, लेकिन वह अधूरा था।
- उदाहरण: AI ने दरवाजे पर ताला तो लगाया (एक सुरक्षा गार्ड), लेकिन वह पीछे की खिड़की को लॉक करना भूल गया। गार्ड अच्छा दिख रहा था, लेकिन घर अभी भी असुरक्षित था।
निष्कर्ष (The Bottom Line)
पेपर यह निष्कर्ष निकालता है कि हम केवल इसलिए AI पर भरोसा नहीं कर सकते क्योंकि वह ऐसा कोड लिखता है जो "काम करता है।"
- फंक्शनल करेक्टनेस (कार्यात्मक शुद्धता) सुरक्षा के लिए एक बुरा झूठ पकड़ने वाला यंत्र (lie detector) है। सिर्फ इसलिए कि कोड बिना क्रैश हुए चलता है, इसका मतलब यह नहीं है कि वह सुरक्षित है।
- हमें एक नए मानक की आवश्यकता है। हमें सुरक्षा और फंक्शन को एक साथ, समान नियमों के साथ टेस्ट करने की आवश्यकता है।
- वर्तमान AI अभी तक वहां नहीं पहुँचा है। यहाँ तक कि सबसे स्मार्ट मॉडल्स भी लगातार उपयोगी और सुरक्षित कोड बनाने में विफल हो रहे हैं।
संक्षेप में: सिर्फ इसलिए कि रोबोट शेफ ने एक स्वादिष्ट दिखने वाला सैंडविच बनाया है, इसका मतलब यह नहीं है कि आपको उसे खाना चाहिए। हमें रसोई की भी जांच करनी होगी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।