Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks
यह शोध पत्र SUSEVIBES बेंचमार्क प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि वर्तमान LLM-आधारित "वाइब कोडिंग" एजेंट, हालांकि अक्सर कार्यात्मक रूप से सही होते हैं, वास्तविक दुनिया के सॉफ्टवेयर इंजीनियरिंग कार्यों में अत्यधिक असुरक्षित कोड उत्पन्न करते हैं, और प्रारंभिक शमन रणनीतियां अप्रभावी सिद्ध होती हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
"वाइब कोडिंग" (Vibe Coding) का सुरक्षा चेक: क्यों आपका AI इंटर्न एक सुरक्षा दुःस्वप्न हो सकता है
कल्पना कीजिए कि आपने एक प्रतिभाशाली, सुपर-फास्ट नया इंटर्न काम पर रखा है जो केवल आपसे प्राकृतिक भाषा में बात करके कोड लिख सकता है। आप कहते हैं, "हे, मेरे लिए एक लॉगिन सिस्टम बनाओ," और वह तुरंत एक चलता-फिरता प्रोग्राम बनाकर दे देता है। इसे ही "वाइब कोडिंग" (Vibe Coding) कहते हैं। यह ट्रेंडी है, तेज़ है, और जादू जैसा महसूस होता है।
लेकिन यहाँ वह डरावना सवाल है जो यह पेपर पूछता है: क्या यह जादू सुरक्षित है?
शोधकर्ताओं ने यह पता लगाने के लिए SUSVIBES नामक एक विशाल स्ट्रेस टेस्ट बनाया। उन्होंने इन AI कोडिंग एजेंट्स के साथ एक इंटर्न की तरह व्यवहार किया और उन्हें 200 वास्तविक दुनिया के कार्य दिए—जैसे किसी लोकप्रिय वेबसाइट में सुरक्षा छेद को ठीक करना या किसी विशाल सॉफ्टवेयर प्रोजेक्ट में एक नया फीचर जोड़ना।
यहाँ उन्होंने क्या पाया, जिसे सरल उपमाओं (analogies) के साथ समझाया गया है।
1. "परफेक्टली फ्लॉड" (पूर्णतः त्रुटिपूर्ण) इंटर्न
सबसे परेशान करने वाली खोज यह है कि AI काम करने में तो बहुत अच्छा है, लेकिन उसे सुरक्षित तरीके से करने में बहुत बुरा है।
- उपमा: कल्पना कीजिए कि आपने एक इंटर्न को बैंक का तिजोरी वाला दरवाजा बनाने के लिए कहा।
- कार्यक्षमता (Functionality): दरवाजा तब खुलता है जब आप हैंडल घुमाते हैं। जब आप बटन दबाते हैं तो यह लॉक हो जाता है। यह बिल्कुल एक तिजोरी जैसा दिखता है। दरवाजा काम करने के मामले में AI को A+ मिलता है।
- सुरक्षा (Security): दरवाजे में बाहर की तरफ एक छिपा हुआ की-होल है जिसे कोई भी चुरा सकता है, या इसके कब्जे कागज के बने हैं। सुरक्षा के मामले में AI को F मिलता है।
आंकड़े:
जब सबसे अच्छे AI (Claude 4 Sonnet) को एक कार्य दिया गया, तो उसने 61% बार सफलतापूर्वक फीचर बनाया। लेकिन उन सफल बिल्ड्स में से, 89% असुरक्षित थे।
- अनुवाद: यदि आप अपने AI इंटर्न को अपना सॉफ्टवेयर बनाने देते हैं, तो लगभग 9 में से 10 संभावना है कि वे हैकर्स के लिए पीछे का दरवाजा खुला छोड़ देंगे, भले ही सामने का दरवाजा पूरी तरह काम कर रहा हो।
2. "किचन" बनाम "पूरा रेस्टोरेंट"
AI कोडिंग के पिछले परीक्षण ऐसे थे जैसे AI को एक टेस्ट किचन में एक सिंगल कुकी बेक करने के लिए कहना। उन्होंने केवल कोड की एक छोटी सी फाइल को देखा।
- पुराना तरीका: "यह एक कुकी की रेसिपी है। इसे बनाओ।" (आसान, सुरक्षित, छोटा दायरा)।
- नया तरीका (वाइब कोडिंग): "यह पूरा रेस्टोरेंट, इसकी सप्लाई चेन, किचन और डाइनिंग रूम है। जाओ और फायर अलार्म को खराब किए बिना प्लंबिंग ठीक करो और एक नया मेनू आइटम जोड़ो।"
SUSVIBES "पूरे रेस्टोरेंट" का टेस्ट है। यह AI को जटिल, अव्यवस्थित वास्तविक दुनिया के कोडबेस में नेविगेट करने के लिए मजबूर करता है। AI उलझ जाता है और उन सुरक्षा जालों को मिस कर देता है जो इमारत के कोनों में छिपे होते हैं।
3. "सुरक्षा रिमाइंडर" काम नहीं आया
शोधकर्ताओं ने AI की मदद करने की कोशिश की, जैसे एक शिक्षक कहता है, "हे, सुरक्षा के प्रति सावधान रहना याद रखना!" उन्होंने AI को विशिष्ट सुरक्षा नियमों का एक 'चीट शीट' भी दिया।
- परिणाम: इससे ज्यादा मदद नहीं मिली। वास्तव में, इसने चीजों को और खराब कर दिया।
- उपमा: यह एक घबराए हुए ड्राइवर को बताने जैसा है, "सुरक्षित रूप से ड्राइव करें, लेकिन जल्दी भी पहुंचें।" ड्राइवर "सुरक्षित रूप से चलाने" (शीशे देखना, धीमा होना) पर इतना केंद्रित हो जाता है कि वह वास्तव में कार चलाना ही भूल जाता है, या वह ओवरथिंकिंग के कारण दुर्घटना कर बैठता है।
- परिणाम: जब AI बहुत अधिक "सुरक्षित" होने की कोशिश करता, तो वह सही ढंग से काम करना बंद कर देता। जब वह "काम करने" पर ध्यान केंद्रित करता, तो वह "सुरक्षित" रहना भूल जाता। वह दोनों चीजें एक साथ नहीं कर सका।
4. विभिन्न AIs के "ब्लाइंड स्पॉट्स" (अंध बिंदु)
पेपर ने अलग-अलग AI मॉडल्स (जैसे Claude, Kimi, और Gemini) का परीक्षण किया। उन्होंने पाया कि अलग-अलग AI अलग-अलग चीजों में खराब हैं।
- उपमा: कल्पना कीजिए कि तीन अलग-अलग सुरक्षा गार्ड हैं।
- गार्ड A बाड़ फांदने वाले लोगों को पकड़ने में माहिर है लेकिन सामने के दरवाजे से चुपके से आने वालों को मिस कर देता है।
- गार्ड B सामने के दरवाजे के लिए बेहतरीन है लेकिन पीछे की खिड़की को मिस कर देता है।
- गार्ड C सब कुछ मिस कर देता है।
- समस्या: अभी तक कोई "सुपर गार्ड" नहीं है। यहाँ तक कि सबसे स्मार्ट AI मॉडल्स के भी ब्लाइंड स्पॉट्स होते हैं। यदि आप केवल एक पर भरोसा करते हैं, तो आप कहीं न कहीं कमजोरी होने की गारंटी देते हैं।
5. वास्तविक दुनिया के परिणाम
पेपर ने केवल अमूर्त (abstract) कोड नहीं देखा; उन्होंने वास्तविक परिदृश्यों को देखा। यहाँ दो उदाहरण दिए गए हैं कि AI ने कहाँ गलती की:
- "टाइम-टेलिंग" लॉक: एक पासवर्ड सिस्टम में, AI ने ऐसा कोड लिखा जो पासवर्ड गलत होने पर तुरंत "नहीं" जवाब देता था, लेकिन अगर यूजरनेम मौजूद नहीं था तो यह एक सूक्ष्म सेकंड के बहुत छोटे हिस्से अधिक समय लेता था।
- क्यों मायने रखता है: एक हैकर यह माप सकता है कि कंप्यूटर जवाब देने में कितना समय लेता है। इस देरी को मापकर, वे अनुमान लगा सकते हैं कि कौन से यूजरनेम असली हैं। यह एक ऐसे ताले की तरह है जो गलत चाबी लगने पर जोर से क्लिक करता है, जिससे चोर को पता चल जाता है कि कौन सा दरवाजा चुनना है।
- "जहरीला" लिंक: एक कंटेंट मैनेजमेंट सिस्टम में, AI ने उपयोगकर्ताओं को खतरनाक लिंक पोस्ट करने की अनुमति दी बिना यह जांचे कि वे सुरक्षित हैं या नहीं।
- क्यों मायने रखता है: एक हैकर ऐसा लिंक पोस्ट कर सकता है जो सामान्य दिखता है लेकिन क्लिक करने पर आपके लॉगिन कुकीज़ चुरा लेता है। AI ने फीचर को पूरी तरह से बनाया, लेकिन वह "सेनिटी चेक" (sanity check) भूल गया जो बुरे लिंक्स को रोकता है।
निचोड़ (The Bottom Line)
"वाइब कोडिंग" वर्तमान में एक उच्च-जोखिम वाला जुआ है।
पेपर निष्कर्ष निकालता है कि जबकि AI सॉफ्टवेयर को चलाने में अद्भुत है, यह वर्तमान में सॉफ्टवेयर को सुरक्षित बनाने में बहुत बुरा है। यदि आप ऐसी कंपनी बना रहे हैं जो पैसे, स्वास्थ्य डेटा या निजी जानकारी को संभालती है, तो आप केवल AI को कोड "वाइब" करने और अच्छे की उम्मीद करने के भरोसे नहीं रह सकते।
सीख: AI द्वारा जनरेट किए गए कोड को एक ऐसी कार की तरह समझें जिसे एक ऐसे रोबोट ने बनाया है जिसने कभी ट्रैफिक लाइट नहीं देखी। वह सड़क पर चल तो सकती है, लेकिन किसी को भी सवारी करने से पहले आपको ब्रेक चेक करने के लिए एक मानव मैकेनिक की सख्त जरूरत है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।