← नवीनतम पेपर
🤖 AI

SecRepoBench: Benchmarking Code Agents for Secure Code Completion in Real-World Repositories

यह शोध पत्र SecRepoBench को प्रस्तुत करता है, जो कोड एजेंटों का मूल्यांकन करने के लिए 27 वास्तविक दुनिया के C/C++ रिपॉजिटरीज़ में 318 कार्यों से बना एक बेंचमार्क है, जो यह प्रकट करता है कि जहाँ अत्याधुनिक LLMs सुरक्षित कोड पूर्णता (secure code completion) के साथ संघर्ष करते हैं, वहीं कोड एजेंट उनसे काफी बेहतर प्रदर्शन करते हैं और वास्तविक दुनिया के परिदृश्यों में सुरक्षित कोडिंग को बढ़ाने के लिए आशाजनक दिशाएँ प्रदान करते हैं।

मूल लेखक: Chihao Shen, Connor Dilgren, Purva Chiniya, Luke Griffith, Yu Ding, Yizheng Chen

प्रकाशित 2026-02-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chihao Shen, Connor Dilgren, Purva Chiniya, Luke Griffith, Yu Ding, Yizheng Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, जटिल किला (एक वास्तविक दुनिया का सॉफ्टवेयर प्रोजेक्ट) बना रहे हैं जो लाखों ईंटों से बना है। आपके पास एक बहुत ही बुद्धिमान, लेकिन कभी-कभी अति-आत्मविश्वासी प्रशिक्षु (एक AI) है जो एक विशिष्ट कमरे को पूरा करने के लिए कुछ नई ईंटें बिछाने में आपकी मदद करना चाहता है।

समस्या क्या है? यदि प्रशिक्षु ने ईंटें गलत तरीके से बिछाईं, तो पूरा कमरा ढह सकता है, या इससे भी बुरा, एक चोर एक छिपे हुए छेद के माध्यम से अंदर घुस सकता है जिसके बारे में आपको पता भी नहीं था।

यह शोध पत्र SecRepoBench पेश करता है, जो एक नया "फाइनल एग्जाम" है जिसे यह परीक्षण करने के लिए डिज़ाइन किया गया है कि आपके AI प्रशिक्षु किसी काम को पूरा करने में कितने कुशल हैं, बिना किसी चीज़ को तोड़े या हैकर्स के लिए दरवाजा खुला छोड़े।

यहाँ सरल उपमाओं का उपयोग करके शोध पत्र का विवरण दिया गया है:

1. समस्या: पुराने एग्जाम बहुत आसान थे

पहले, शोधकर्ता AI कोडर्स का परीक्षण छोटे, अलग-थलग पहेलियों पर करते थे (जैसे कि "दो संख्याओं को जोड़ने वाला एक फंक्शन लिखें")। यह ऐसा था जैसे प्रशिक्षु से वैक्यूम (निर्वात) में एक एकल, पूर्ण लेगो टावर बनाने के लिए कहना।

  • दोष: वास्तविक दुनिया में, आप वैक्यूम में लेगो टावर नहीं बना रहे होते हैं; आप एक 500 साल पुराने किले में एक नया विंग जोड़ रहे होते हैं। आपको यह जानने की आवश्यकता है कि पाइप कहाँ हैं, दीवारें कैसे जुड़ती हैं, और पुराना आधार कैसा दिखता है।
  • अंतराल (Gap): पुराने परीक्षणों ने यह जांच नहीं किया कि क्या AI पूरे किले के संदर्भ (context) को जानता था, और न ही उन्होंने यह जांचा कि क्या नए ईंट सुरक्षित थे या चोरों के लिए रास्ता खुला था (सुरक्षा संबंधी खामियां)।

2. समाधान: SecRepoBench (द "रियल कैसल" एग्जाम)

लेखकों ने SecotaRepoBench नामक एक बेंचमार्क बनाया।

  • सेटअप: उन्होंने 27 वास्तविक, लोकप्रिय सॉफ्टवेयर प्रोजेक्ट्स (जैसे FFmpeg या Hevc) को लिया और 318 विशिष्ट स्थान खोजे जहाँ एक मानव डेवलपर को सुरक्षा संबंधी छेद (security hole) को ठीक करना पड़ा था।
  • कार्य: उन्होंने उस सुधार (fix) को "मिटा" दिया और AI को खाली जगह भरने के लिए कहा।
  • नियम:
    1. कार्यात्मक शुद्धता (Functional Correctness): क्या नया कोड वास्तव में काम करता है? (क्या किले का दरवाजा खुलता है?)
    2. सुरक्षा (Security): क्या नए कोड में हैकर्स के लिए कोई छिपा हुआ ट्रैपडोर है? (क्या दरवाजा ठीक से लॉक होता है?)
    3. संदर्भ (Context): AI पूरे किले (रिपॉजिटरी) को देख सकता है ताकि वह काम करने का तरीका समझ सके, ठीक वैसे ही जैसे एक वास्तविक डेवलपर करता है।

3. दावेदार: सोलो आर्टिस्ट बनाम द क्रू

शोध पत्र ने दो प्रकार के AI का परीक्षण किया:

  • स्टैंडअलोन LLMs: ये एक अकेले, बहुत बुद्धिमान वास्तुकार (architect) की तरह हैं। उन्हें कमरे का विवरण और कुछ ब्लूप्रिंट मिलते हैं, लेकिन वे पाइपों की जांच करने के लिए किले के चारों ओर नहीं घूम सकते।
  • कोड एजेंट्स: ये एक बुद्धिमान वास्तुकार प्लस सहायकों की एक टीम की तरह हैं। AI उपकरणों का उपयोग करके किले के चारों ओर घूमने, ब्लूप्रिंट पढ़ने, वायरिंग की जांच करने और मदद मांगने में सक्षम है। यह एक अधिक उन्नत "एजेंट" फ्रेमवर्क है।

4. परिणाम: कड़वा सच

परिणाम आश्चर्यजनक और AI उत्साही लोगों के लिए थोड़े डरावने थे:

  • सोलो आर्टिस्ट संघर्ष करते रहे: सबसे स्मार्ट "सोलो" AI (GPT-5) भी केवल 39% कार्यों को सही और सुरक्षित रूप से कर पाया। वे अक्सर एक ऐसा दरवाजा बनाते थे जो दिखने में तो शानदार था लेकिन उसमें ताला नहीं था, या उन्होंने एक ऐसा दरवाजे का हैंडल बना दिया जो मौजूद ही नहीं था (hallucination)।
  • क्रू बेहतर था, लेकिन पूर्ण नहीं: "कोड एजेंट्स" (टीम दृष्टिकोण) काफी बेहतर थे, वे लगभग 53% तक पहुँच गए। वे किले के संदर्भ को समझने में बेहतर थे।
  • बड़ी पकड़ (The Big Catch): एजेंट्स कोड को काम करने के लिए बनाने में माहिर थे (दरवाजा खोलना ताकि वह खुल सके), लेकिन वे इसे सुरक्षित बनाने में (यह सुनिश्चित करने में कि इसमें लॉक करने के लिए कोई छेद न हो) अभी भी खराब थे। उन्होंने "काम पूरा करने" को "सुरक्षित बनाने" से ऊपर प्राथमिकता दी।

5. यह परीक्षा अन्य परीक्षाओं से कठिन क्यों है

लेखकों ने अपनी परीक्षा की तुलना एक पिछले कठिन परीक्षण BaxBench से की।

  • BaxBench ऐसा था जैसे AI को शुरू से एक नया, स्वतंत्र शेड बनाने के लिए कहना।
  • SecRepoBench ऐसा है जैसे किसी 10 मंजिला इमारत के अंदर एक विशिष्ट पाइप में रिसाव को ठीक करना जबकि इमारत अभी भी भरी हुई है।
  • निर्णय: AI ने SecRepoBench पर बहुत खराब प्रदर्शन किया। यह साबित करता है कि वास्तविक दुनिया के वातावरण में कोडिंग करना एक सैंडबॉक्स में कोडिंग करने की तुलना में बहुत कठिन है।

6. AI कहाँ विफल होता है (द "हैलुसिनेशन")

जब AI विफल हुआ, तो वह आमतौर पर दो मजेदार लेकिन खतरनाक तरीकों से हुआ:

  1. "फेक ब्रिक" की समस्या: AI एक ऐसा टूल या वेरिएबल नाम बना देता था जो सुनने में असली लगता था लेकिन वास्तव में मौजूद नहीं था। इसके कारण पूरा प्रोजेक्ट क्रैश हो गया (कंपाइलेशन एरर)।
  2. "लॉक भूल जाने" की समस्या: AI एक बेहतरीन दरवाजा बनाता था, लेकिन सुरक्षा जांच (जैसे कि क्या उपयोगकर्ता को प्रवेश की अनुमति है) जोड़ना भूल जाता था। उसने दरवाजे के फंक्शन पर ध्यान केंद्रित किया, उसकी सुरक्षा पर नहीं।

मुख्य निष्कर्ष (The Takeaway)

यह शोध पत्र हमें बताता है कि हालांकि AI कोड लिखने में बहुत अच्छा हो रहा है, लेकिन यह अभी भी वास्तविक दुनिया के सॉफ्टवेयर में सुरक्षा-महत्वपूर्ण कार्यों के लिए अकेले भरोसेमंद नहीं है। इसे मदद (एजेंट्स) की आवश्यकता है, और फिर भी, इसकी बारीकी से निगरानी करने की आवश्यकता है।

इस 'SecRepoBench' को एक कठोर सुरक्षा निरीक्षक के रूप में देखें जो कहता है: "आपने एक अच्छा दरवाजा बनाया, लेकिन आप डेडबोल्ट (deadbolt) लगाना भूल गए। फिर से प्रयास करें।" लक्ष्य अब इन AI प्रशिक्षुओं को हमेशा चाबियाँ सौंपने से पहले डेडबोल्ट की जांच करने के लिए सिखाना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →