← नवीनतम पेपर
💻 computer science

Insights into Security-Related AI-Generated Pull Requests

यह शोध पत्र 33,000 से अधिक AI-जनित पुल रिक्वेस्ट का विश्लेषण करता है जिससे यह पता चलता है कि जबकि एजेंटिक AI द्वारा किए गए सुरक्षा-संबंधी सबमिशन अक्सर इंजेक्शन दोषों जैसी आवर्ती कमजोरियों को पेश करते हैं, कई त्रुटिपूर्ण योगदान तकनीकी समीक्षा के बजाय सामाजिक या प्रक्रियात्मक कारकों के कारण मर्ज कर दिए जाते हैं, जो सुरक्षित सॉफ्टवेयर विकास में स्वायत्त कोडिंग प्रणालियों की शक्तियों और सीमाओं के बारे में नई अंतर्दृष्टि प्रदान करते हैं।

मूल लेखक: Md Fazle Rabbi, Asif K. Turzo, Arifa I. Champa, Minhaz F. Zibran

प्रकाशित 2026-04-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Md Fazle Rabbi, Asif K. Turzo, Arifa I. Champa, Minhaz F. Zibran

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक हलचल भरा निर्माण स्थल (construction site) है जहाँ मानव वास्तुकारों और बिल्डरों की एक टीम लगातार एक विशाल, ओपन-सोर्स शहर के लीकेज को ठीक कर रही है, दीवारों को मजबूत कर रही है, और प्लंबिंग को अपग्रेड कर रही है। वर्षों तक, यह काम पूरी तरह से मनुष्यों द्वारा किया गया है। लेकिन हाल ही में, एक नया क्रू आया है: AI रोबोट (जैसे Copilot, Devin, और Claude) जो कोड लिख सकते हैं, बग्स ठीक कर सकते हैं, और अपना काम स्वचालित रूप से सबमिट कर सकते हैं।

यह पेपर एक सुरक्षा निरीक्षक की रिपोर्ट (safety inspector's report) की तरह है कि क्या होता है जब ये AI रोबोट शहर की इमारतों में सुरक्षा खामियों को ठीक करने की कोशिश करते हैं। शोधकर्ताओं ने 33,000 से अधिक AI सबमिशन (जिन्हें "पुल रिक्वेस्ट" या PR कहा जाता है) का अध्ययन किया और उनमें से उन 675 पर ध्यान केंद्रित किया जो सुरक्षा से संबंधित होने चाहिए थे।

यहाँ उनके निष्कर्षों का विवरण दिया गया, जिसे रोजमर्रा की भाषा में अनुवादित किया गया है:

1. "रोबोट की गलतियाँ" (क्या गलत हुआ?)

जब इंसान सुरक्षा छेद को ठीक करते हैं, तो वे आमतौर पर सावधान रहते हैं। लेकिन AI रोबोट? वे एक ही तरह की कुछ गलतियाँ बार-बार करते हैं

  • उपमा (Analogy): कल्पना कीजिए कि एक रोबोट एक ताला ठीक करने की कोशिश कर रहा है। एक मजबूत ताला बनाने के बजाय, वह गलती से दरवाजे को थोड़ा खुला छोड़ देता है, या वह एक ऐसी चाबी का उपयोग करता है जो बहुत सारे दरवाजों में फिट हो जाती है (जिससे चोरों के लिए यह आसान हो जाता है)।
  • वास्तविकता: सबसे आम त्रुटियाँ थीं:
    • Regex अक्षमता (CWE-1333): AI ने एक ऐसा "सर्च पैटर्न" लिखा जो इतना जटिल था कि उसने कंप्यूटर को फ्रीज कर दिया (जैसे एक सुरक्षा गार्ड समुद्र के किनारे मौजूद हर रेत के कण की जांच करने के बजाय केवल एक विशिष्ट पत्थर को खोजने की कोशिश कर रहा हो)।
    • इंजेक्शन दोष (Injection Flaws): AI ने "बुरे लोगों" को सिस्टम में कमांड चुराने की अनुमति दी (जैसे एक डिलीवरी वाला सुरक्षित पैकेज में एक नोट डाल देता है जो गार्ड को दरवाजा खोलने का निर्देश देता है)।
    • पाथ ट्रैवर्सल (Path Traversal): AI ने लोगों को उन कमरों में जाने की अनुमति दी जहाँ उन्हें नहीं जाना चाहिए था (जैसे एक होटल में मेहमान को मैनेजर के ऑफिस के पीछे के दरवाजे का पता चल जाता है)।

डरावना हिस्सा: भले ही इन रोबनों ने नई सुरक्षा खामियां पैदा कीं, फिर भी उनके कई सुधारों को स्वीकृत और मर्ज कर दिया गया। यह वैसा ही है जैसे किसी रोबोट को फायर अलार्म ठीक करने के लिए छोड़ देना, और भले ही उसने गलती से अलार्म को स्प्रिंकलर सिस्टम से जोड़ दिया हो, बिल्डिंग मैनेजर ने फिर भी उस पर हस्ताक्षर कर दिए।

2. "गति और स्वीकृति" का खेल (क्यों कुछ को अंदर आने दिया गया और दूसरों को बाहर निकाल दिया गया?)

शोधकर्ताओं ने पूछा: एक मानव प्रबंधक "हाँ, इसे मर्ज करें" या "नहीं, घर जाओ" क्यों कहता है?

  • "प्रतिष्ठा" का कारक: यदि AI (या उस इंसान के पास जिसने प्रॉम्प्ट दिया था) के पास अच्छे काम का इतिहास था, तो उसे तेजी से स्वीकृति मिली। यह एक भरोसेमंद ठेकेदार की तरह है जिसे एक घंटे में परमिट मिल जाता है, जबकि एक अजनबी हफ्तों इंतजार करता है।
  • "व्यस्त शहर" का कारक: यदि प्रोजेक्ट पहले से ही अन्य कार्यों से भरा हुआ था, तो AI का अनुरोध ट्रैफिक में फंस गया।
  • "टेस्ट" का आश्चर्य: आमतौर पर, टेस्ट जोड़ना (यह प्रमाण कि सुधार काम करता है) आपको स्वीकृत होने में मदद करता है। लेकिन AI के लिए? टेस्ट जोड़ने से वास्तव में स्वीकृति मिलना कठिन हो गया।
    • क्यों? शोधकर्ताओं का मानना है कि AI के टेस्ट अक्सर "शोर वाले" या नकली थे—जैसे एक छात्र जो अदृश्य स्याही का उपयोग करके उत्तर लिखकर परीक्षा में नकल करने की कोशिश कर रहा हो। मानव समीक्षकों ने बिखरे हुए टेस्ट देखे और संदिग्ध हो गए, इसलिए उन्होंने पूरे काम को खारिज कर दिया।

3. "दरवाजे पर नोट" (कमिट संदेश/Commit Messages)

जब एक इंसान कोई सुधार सबमिट करता है, तो वह एक नोट लिखता है जिसमें बताया जाता है कि उसने क्या बदला और क्यों।

  • निष्कर्ष: इंसानों के लिए, एक बुरा नोट मतलब धीमी समीक्षा या अस्वीकृति। AI के लिए? इससे ज्यादा फर्क नहीं पड़ा।
  • उपमा: कल्पना कीजिए कि एक इंसान एक टूटी हुई कुर्सी लाता है और एक नोट लिखता है, "मैंने पैर ठीक कर दिया।" यदि उसने लिखा, "मैंने पैर ठीक किया क्योंकि वह डगमगा रहा था," तो मैनेजर खुश है। यदि उसने लिखा, "मैंने पैर ठीक किया," तो भी मैनेजर देखता है। यदि कुर्सी ठीक दिखती है, तो वह स्वीकार कर लेता है। यदि AI एक कुर्सी लाता है और एक अस्पष्ट नोट लिखता है, तो मैनेजर अभी भी कुर्सी को देखता है। यदि कुर्सी ठीक दिखती है, तो वे इसे स्वीकार कर लेते हैं। यदि यह खराब दिखती है, तो वे इसे अस्वीकार कर देते हैं। नोट ने परिणाम को नहीं बदला।

4. "अस्वीकृति के कारण" (उन्हें क्यों बाहर निकाला गया?)

लगभग 32% AI सुरक्षा सुधारों को खारिज कर दिया गया। लेकिन यहाँ एक मोड़ है: अधिकांश अस्वीकृतियाँ इसलिए नहीं थीं क्योंकि कोड खतरनाक था।

  • "अज्ञात" अस्वीकृतियाँ: सबसे बड़ा कारण (38%) "अज्ञात" (Unknown) था। मैनेजर ने बिना कोई कारण बताए अनुरोध को बंद कर दिया। यह एक हायरिंग मैनेजर की तरह है जो बिना कोई स्पष्टीकरण दिए "ना" लिखकर रिज्यूमे को खारिज कर देता है।
  • "आलसी" अस्वीकृतियाँ: एक बड़ा हिस्सा (12%) इसलिए था क्योंकि AI (या इंसान) ने कुछ दिनों तक प्रोजेक्ट के साथ बातचीत करना बंद कर दिया था। सिस्टम ने "निष्क्रियता" के कारण टिकट को स्वचालित रूप से बंद कर दिया।
  • "वास्तविक" अस्वीकृतियाँ: जब इंसानों ने वास्तव में कोई कारण दिया, तो वह आमतौर पर इसलिए था क्योंकि AI ने एक नया बग पेश किया, एक मौजूदा फीचर को तोड़ दिया, या पर्याप्त टेस्ट नहीं लिखे।

मुख्य निष्कर्ष (The Big Takeaway)

पेपर यह निष्कर्ष निकालता है कि हम वर्तमान में कुछ क्षेत्रों में AI पर बहुत अधिक भरोसा कर रहे हैं और कुछ में बहुत कम।

  • समस्या: मानव समीक्षक कभी-कभी उन खतरनाक सुरक्षा खामियों को मिस कर देते हैं जो AI पैदा करता है (जैसे रेगेक्स अक्षमताएं) क्योंकि वे अन्य चीजों पर ध्यान केंद्रित कर रहे होते हैं।
  • बेमेल (Mismatch): साथ ही, वे मामूली फॉर्मेटिंग मुद्दों के कारण या इसलिए कि AI ने पर्याप्त "बातचीत" नहीं की, अच्छे AI काम को खारिज कर रहे हैं।
  • समाधान: हमें बेहतर "सुरक्षा गार्डों" (टूल्स) की आवश्यकता है जो AI की विशिष्ट गलतियों को पकड़ सकें, इससे पहले कि कोई इंसान उन्हें देख सके। हमें AI को अपने काम को बेहतर ढंग से समझाने के लिए भी सिखाने की आवश्यकता है और उसे उन प्रोजेक्ट्स में सुधार सबमिट करने से रोकने की जरूरत है जो पहले से ही मृत या निष्क्रिय हैं।

संक्षेप में: AI एक शक्तिशाली नया प्रशिक्षु (apprentice) है, लेकिन फिलहाल, यह सुरक्षा के मामले में थोड़ा अनाड़ी है। इसे बेहतर पर्यवेक्षण की आवश्यकता है, और हमें इसे उन्हीं नियमों से आंकना बंद करना होगा जिनका उपयोग हम इंसानों के लिए करते हैं, क्योंकि यह अलग नियमों के साथ खेलता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →