← नवीनतम पेपर
💻 computer science

Does Teaming-Up LLMs Improve Secure Code Generation? A Comprehensive Evaluation with Multi-LLMSecCodeEval

यह शोध पत्र MULTI-LLMSECCODEEVAL फ्रेमवर्क प्रस्तुत करता है जो यह प्रदर्शित करता है कि स्टेटिक एनालिसिस और संरचित सहयोग के साथ एकीकृत सावधानीपूर्वक ऑर्केस्ट्रेटेड मल्टी-एलएलएम (multi-LLM) एन्सेम्बल्स, सुरक्षित कोड उत्पन्न करने में एकल बड़े लैंग्वेज मॉडल्स की तुलना में काफी बेहतर प्रदर्शन करते हैं, जो यह सिद्ध करता है कि सुरक्षा के लिए सिस्टम डिज़ाइन, मॉडल के स्केल से अधिक महत्वपूर्ण है।

मूल लेखक: Bushra Sabir, Shigang Liu, Seung Ick Jang, Sharif Abuadbba, Yansong Gao, Kristen Moore, SangCheol Kim, Hyoungshick Kim, Surya Nepal

प्रकाशित 2026-03-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bushra Sabir, Shigang Liu, Seung Ick Jang, Sharif Abuadbba, Yansong Gao, Kristen Moore, SangCheol Kim, Hyoungshick Kim, Surya Nepal

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक घर बना रहे हैं। आप चाहते हैं कि दरवाजे अपने आप लॉक हो जाएं, खिड़कियां टूटने से सुरक्षित (shatter-proof) हों, और बिजली की वायरिंग सुरक्षित हो। सॉफ्टवेयर की दुनिया में, इसे सुरक्षित कोड जनरेशन (secure code generation) कहा जाता है।

कुछ समय से, हम "AI आर्किटेक्ट्स" (लार्ज लैंग्वेज मॉडल्स या LLMs) का उपयोग ब्लूप्रिंट तैयार करने और दीवारें बनाने के लिए कर रहे हैं। ये AI मॉडल अविश्वसनीय रूप से स्मार्ट हैं; वे किसी भी इंसान से कहीं अधिक तेजी से कोड लिख सकते हैं। लेकिन समस्या यह है: वे अविश्वसनीय रूप से लापरवाह भी हैं।

ठीक उसी तरह जैसे एक प्रतिभाशाली आर्किटेक्ट जो स्मोक डिटेक्टर लगाना भूल जाता है या पीछे का दरवाजा खुला छोड़ देता है, ये AI अक्सर ऐसा कोड लिखते हैं जो दिखने में तो एकदम सही लगता है लेकिन इसमें सुरक्षा संबंधी छिपे हुए छेद (vulnerabilities) होते हैं जिनका फायदा हैकर्स उठा सकते हैं।

यह शोध पत्र एक सरल प्रश्न पूछता है: यदि हम AI आर्किटेक्ट्स की एक टीम को मिलकर काम करने के लिए कहें, तो क्या वे अकेले काम करने वाले एक AI की तुलना में अधिक सुरक्षित घर बनाएंगे?

प्रयोग: द "मल्टी-एलएलएम" कंस्ट्रक्शन क्रू (Multi-LLM Construction Crew)

शोधकर्ताओं ने MULTI-LLMSECCODEEVAL नामक एक विशाल निर्माण स्थल बनाया। केवल एक AI को काम पर रखने के बजाय, उन्होंने यह देखने के लिए विभिन्न टीम कॉन्फ़िगरेशन का परीक्षण किया कि कौन सा सबसे सुरक्षित कोड बनाता है।

यहाँ चार मुख्य टीमें दी गई हैं जिनका परीक्षण किया गया, जिन्हें उपमाओं (analogies) के माध्यम से समझाया गया है:

1. अकेला योद्धा (Single LLM)

  • उपमा: एक कमरा में अकेले काम करने वाला एक प्रतिभाशाली आर्किटेक्ट।
  • परिणाम: तेज़, लेकिन गलतियों के प्रति प्रवण। कभी-कभी वे दरवाजा लॉक करना भूल जाते हैं; अन्य समय में वे गलत प्रकार की लकड़ी का उपयोग करते हैं। अध्ययन में पाया गया कि यहाँ तक कि सबसे "स्मार्ट" एकल AI भी लगभग 30% से 60% समय खतरनाक खामियां छोड़ देता है।

2. साथियों की समिति (Ensemble)

  • उपमा: पांच अलग-अलग आर्किटेक्ट्स को काम पर रखना, उन सभी से एक ही ब्लूप्रिंट बनाने के लिए कहना, और फिर एक सुरक्षा निरीक्षक (Safety Inspector) (एक स्टैटिक एनालिसिस टूल जैसे CodeQL) द्वारा उनके हर एक ड्राइंग की जांच करवाना।
  • परिणाम: बहुत बेहतर! कई AI मॉडल्स को विचार उत्पन्न करने के लिए उपयोग करने और फिर एक सख्त, नियम-आधारित निरीक्षक का उपयोग करके असुरक्षित चीज़ों को खारिज करने से, टीम ने त्रुटियों को काफी कम कर दिया।
  • जादू: यह एक समिति द्वारा योजना पर वोट देने जैसा है, लेकिन अंतिम निर्णय एक ऐसे रोबोट द्वारा लिया जाता है जो बिल्डिंग कोड को कंठस्थ जानता है। इस दृष्टिकोण ने सुरक्षा में एकल योद्धा की तुलना में 47% तक सुधार किया।

3. डिबेट क्लब (Collaborative)

  • उपमा: एक मेज के चारों ओर बैठे आर्किटेक्ट्स का एक समूह जो आपस में बहस कर रहे हैं। "मुझे लगता है कि यह दरवाजा सुरक्षित है।" "नहीं, मुझे लगता है कि वह खिड़की कमजोर है।" वे बिना किसी सख्त निरीक्षक के एक-दूसरे को डिजाइन को ठीक करने के लिए मनाने की कोशिश करते हैं।
  • परिणाम: यह ठीक था, लेकिन बहुत अच्छा नहीं। AI कभी-कभी एक-दूसरे को यह विश्वास दिलाने में सफल हो जाते थे कि एक बुरा विचार वास्तव में अच्छा था। एक सख्त नियम-जांचकर्ता के बिना, वे बस गोल-गोल बहस करते रहे। इससे केवल मामूली सुधार (लगभग 9-22%) हुआ।

4. सुपर-टीम (Hybrid Pipeline)

  • उपमा: यह अंतिम ड्रीम टीम है।
    1. जनरेशन (Generation): पांच आर्किटेक्ट्स ब्लूप्रिंट बनाते हैं।
    2. निरीक्षण (Inspection): सुरक्षा निरीक्षक (CodeQL) उनकी जांच करता है और असुरक्षित ब्लूप्रिंट को खारिज कर देता है।
    3. बहस (Debate): शेष सुरक्षित-सा दिखने वाले ब्लूप्रिंट को बची हुई छोटी खामियों को ठीक करने के लिए एक "डिबेट क्लब" के पास भेजा जाता है।
    4. अंतिम पॉलिश (Final Polish): सबसे अच्छे संस्करण को चुना जाता है और दोबारा जांचा जाता है।
  • परिणाम: विजेता। इस टीम ने सबसे सुरक्षित कोड बनाया, जिसने कुछ परीक्षणों में लगभग 99% सुरक्षा प्राप्त की।

निर्माण स्थल से मिले मुख्य सबक

शोध पत्र ने कुछ आश्चर्यजनक सच्चाइयाँ खोजी हैं जो आमतौर पर AI के बारे में हम जो सुनते हैं उसके विपरीत हैं:

  • बड़ा होना हमेशा बेहतर नहीं होता: आप सोच सकते हैं कि सबसे महंगे, विशाल AI (जैसे कि एक "विशाल मस्तिष्क") को काम पर रखना सबसे अच्छा होगा। लेकिन अध्ययन में पाया गया कि काम करने के लिए छोटे, विशिष्ट AI की एक टीम अक्सर अकेले काम करने वाले एक विशाल AI की तुलना में बेहतर काम करती है। यह एक एकल "सुपर-जनरल कॉन्ट्रैक्टर" को हराने वाले विशेषज्ञ इलेक्ट्रीशियन, प्लंबर और बढ़ई की टीम जैसा है।
  • निरीक्षक (Inspector) अत्यंत महत्वपूर्ण है: सुरक्षा में सबसे बड़ी छलांग AI के आपस में बात करने से नहीं आई; बल्कि उनके काम की जांच करने के लिए एक सख्त, नियम-आधारित टूल (Static Analysis) का उपयोग करने से आई। AI रचनात्मकता में अच्छे हैं, लेकिन वे सख्त सुरक्षा नियमों का पालन करने में खराब हैं। उनकी गलतियों को पकड़ने के लिए आपको एक रोबोट निरीक्षक की आवश्यकता होती है।
  • जटिलता दुश्मन है: AI साधारण शेड बनाने में माहिर थे (आसान कार्य)। लेकिन जब उन्हें जटिल वायरिंग वाला गगनचुंबी इमारत बनाने के लिए कहा गया (कठिन कार्य), तो वे फिर से गलतियाँ करने लगे। काम जितना अधिक जटिल होगा, आपको उतनी ही अधिक टीम और सख्त निरीक्षक की आवश्यकता होगी।

निष्कर्ष

शोध पत्र यह निष्कर्ष निकालता है कि सुरक्षा AI को स्मार्ट बनाने से नहीं आती; यह इस बात से आती है कि हम टीम को कैसे व्यवस्थित करते हैं।

यदि आप सुरक्षित सॉफ्टवेयर चाहते हैं, तो केवल एक AI से "सुरक्षित कोड लिखें" न कहें। इसके बजाय:

  1. कई AI को प्रयास करने के लिए कहें।
  2. उनके काम को एक सख्त, स्वचालित सुरक्षा जांचकर्ता के माध्यम से चलाएं।
  3. शेष मुद्दों को ठीक करने के लिए AI को सहयोग करने दें।

एक सख्त निरीक्षक के साथ AI की टीम को संचालित करके, हम "लापरवाह जीनियस" को एक "विश्वसनीय सुरक्षा विशेषज्ञ" में बदल सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →