← नवीनतम पेपर
💻 computer science

Beyond Bug Fixes: An Empirical Investigation of Post-Merge Code Quality Issues in Agent-Generated Pull Requests

यह शोध पत्र 1,210 मर्ज किए गए एजेंट-जनरेटेड बग-फिक्स पीआर (PR) का अनुभवजन्य विश्लेषण करता है जिससे यह पता चलता है कि हालांकि कच्चे कोड गुणवत्ता संबंधी मुद्दों की संख्या एजेंट के अनुसार भिन्न होती है, लेकिन वे मुख्य रूप से एजेंट की क्षमता के बजाय पीआर (PR) के आकार द्वारा संचालित होते हैं, और सफल मर्ज अक्सर महत्वपूर्ण पोस्ट-मर्ज कोड स्मेल्स (code smells) और गंभीर बग्स को छिपा देते हैं, जो केवल मर्ज सफलता से परे व्यवस्थित गुणवत्ता जांच की आवश्यकता को रेखांकित करते हैं।

मूल लेखक: Shamse Tasnim Cynthia, Al Muttakin, Banani Roy

प्रकाशित 2026-01-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shamse Tasnim Cynthia, Al Muttakin, Banani Roy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास घर की लीकेज (रिसाव) ठीक करने के लिए सुपर-फास्ट, AI-संचालित निर्माण कार्यकर्ता (एजेंट्स) की एक टीम है। आपने उन्हें काम करने दिया है, और उन सभी को बिना किसी मानवीय पर्यवेक्षण के आपके घर में स्वीकृत और मर्ज कर दिया गया है। कागजों पर सब कुछ शानदार दिखता है—लीकेज कथित तौर पर ठीक हो गई है, और कार्यकर्ता कुशल हैं।

लेकिन यह शोध पत्र एक महत्वपूर्ण प्रश्न पूछता है: सिर्फ इसलिए कि कार्यकर्ताओं ने काम पूरा कर लिया और उन्हें "ग्रीन लाइट" मिल गई, क्या इसका मतलब यह है कि घर वास्तव में अच्छी स्थिति में है?

लेखकों ने, जो सस्केचेवन विश्वविद्यालय के शोधकर्ता हैं, इन AI मरम्मतों के "परिणाम" की जांच करने का निर्णय लिया। उन्होंने केवल यह नहीं देखा कि लीकेज रुक गई या नहीं; उन्होंने उन नए पाइपों, दीवारों और वायरिंग की गुणवत्ता को भी देखा जो AI ने स्थापित किए थे।

यहाँ उन्होंने जो पाया, उसे सरल भाषा में समझाया गया है:

1. "बड़ा काम" बनाम "खराब काम" का भ्रम

शोधकर्ताओं ने पांच अलग-अलग AI एजेंटों (जैसे OpenAI Codex, Copilot और अन्य) द्वारा किए गए 1,200 से अधिक सुधारों का अध्ययन किया।

पहली नज़र में, ऐसा लग रहा था कि कुछ एजेंट गड़बड़ी कर रहे हैं। एक एजेंट (OpenAI Codex) सबसे अधिक "कोड स्मैल्स" (गंदा, पढ़ने में कठिन कोड) छोड़ रहा था, जबकि दूसरा (Claude) सबसे कम छोड़ता हुआ प्रतीत हो रहा था।

ट्विस्ट: जब शोधकर्ताओं ने काम के आकार के लिए समायोजन किया, तो तस्वीर बदल गई।

  • उपमा: कल्पना कीजिए कि एजेंट A ने एक विशाल गगनचुंबी इमारत बनाई और एजेंट B ने एक छोटा सा शेड बनाया। एजेंट A के पास अधिक "गंदे कोने" हैं क्योंकि उन्होंने एक बड़ा भवन बनाया है, न कि इसलिए कि वे एक खराब बिल्डर हैं।
  • निष्कर्ष: एक बार जब उन्होंने प्रति वर्ग फुट "गंदगी" (कोड डेंसिटी) को मापा, तो अधिकांश एजेंट गुणवत्ता में काफी समान थे। एकमात्र वास्तविक आउटलायर Cursor था, जो काम की प्रति इकाई थोड़ा अधिक कचरा छोड़ता था, यहाँ तक कि छोटे कामों में भी।

सीख: AI की गुणवत्ता का निर्णय केवल इस आधार पर न करें कि वह कितनी समस्याएँ पैदा करता है; बल्कि इस आधार पर करें कि वह कितना काम करने के सापेक्ष कितनी समस्याएँ पैदा करता है।

려 2. "अदृश्य" समस्याएँ (कोड स्मैल्स)

AI द्वारा पेश की गई सबसे आम समस्याएँ वे नहीं थीं जो घर को तुरंत गिरा देंगी (बग्स)। इसके बजाय, वे कोड स्मैल्स (Code Smells) थे।

  • उपमा: ये दीवार पर ऐसे रंग पेंट करने जैसे हैं जो फर्नीचर के साथ मेल नहीं खाते, या बुकशेल्फ़ को थामने के लिए डक्ट टेप का उपयोग करने जैसे हैं। घर खड़ा रहता है, और लाइटें भी चलती हैं, लेकिन यह परेशान करने वाला है, इसे साफ करना कठिन है, और अगले व्यक्ति के लिए जो इसे नया करने की कोशिश करेगा, यह एक बुरा सपना होगा।
  • निष्कर्ष: AI एजेंट तत्काल बग को ठीक करने में माहिर थे लेकिन अक्सर कोड को "बदसूरत" या अत्यधिक जटिल बना देते थे। वे डुप्लिकेट स्ट्रिंग्स (जैसे मैनुअल में एक ही वाक्य को दो बार लिखना) छोड़ देते थे और ऐसे फंक्शन बना देते थे जिन्हें समझना बहुत कठिन होता था। इन मुद्दों को अक्सर "क्रिटिकल" या "मेजर" के रूप में रेट किया गया था, जिसका अर्थ है कि ये गंभीर दीर्घकालिक सिरदर्द हैं।

3. "दुर्लभ लेकिन खतरनाक" बग्स

जबकि "गंदा कोड" आम था, वास्तविक बग्स (ऐसी चीजें जो घर को तोड़ देती हैं) दुर्लभ थे। हालाँकि, जब वे हुए, तो वे भयानक थे।

  • उपमा: अधिकांश समय, AI केवल गलत रंग पेंट कर देता है। लेकिन कभी-कभी, यह एक ऐसा दरवाजा लगा देता है जो सीधे खाई की ओर ले जाता है।
  • निष्कर्ष: AI द्वारा पेश किए गए कुछ बग्स अक्सर "ब्लॉकर्स" (Blockers) थे—ऐसी त्रुटियाँ जो सॉफ़्टवेयर को चलने से ही रोक देती हैं। एक सामान्य गलती फंक्शन को गलत संख्या में आर्गुमेंट्स के साथ कॉल करना था (जैसे चौकोर छेद में गोल कील डालने की कोशिश करना), जिससे प्रोग्राम तुरंत क्रैश हो जाता है।

4. सुरक्षा "टाइम बम"

AI ने सिक्योरिटी हॉटस्पॉट्स (Security Hotspots) भी पेश किए। ये अनिवार्य रूप से हैकर्स के लिए खुले दरवाजे नहीं हैं, लेकिन ये संदिग्ध क्षेत्र हैं जिन्हें करीब से देखने की आवश्यकता है।

  • उपमा: AI शायद एक ऐसा खिड़की का लॉक लगा सकता है जो दिखने में शानदार है लेकिन वास्तव में कमजोर प्लास्टिक से बना है, या एक सार्वजनिक कुंजी वाले कमरे में तिजोरी रख सकता है।
  • निष्कर्ष: AI अक्सर कमजोर एन्क्रिप्शन का उपयोग करता था या संवेदनशील डेटा को ऐसी जगहों पर छोड़ देता था जहाँ तक पहुँचना बहुत आसान था। ये हमेशा "कमज़ोरियाँ" (पुष्ट हैक) नहीं थे, लेकिन ये रेड फ्लैग थे जिनके लिए मानवीय समीक्षा की आवश्यकता थी।

मुख्य निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि "मर्ज" (अनुमोदन) प्राप्त करना गुणवत्ता की गारंटी नहीं है।

सिर्फ इसलिए कि एक AI एजेंट ने सफलतापूर्वक एक बग को ठीक किया और उसका कोड प्रोजेक्ट में मर्ज कर दिया गया, इसका मतलब यह नहीं है कि कोड साफ, सुरक्षित या बनाए रखने में आसान है। वास्तव में, इन सुधारों को मर्ज करने की जल्दबाजी "टेक्निकल डेट" (Technical Debt) के बढ़ते ढेर को छिपा सकती है—गंदा कोड जिसे बाद में मानवीय टीम को साफ करने के लिए बहुत अधिक समय और पैसा खर्च करना पड़ेगा।

सिफारिश:
AI की गति पर केवल भरोसा न करें। AI-जनरेटेड सुधारों को एक नए कर्मचारी की तरह मानें जो तेज़ है लेकिन अनुभवहीन है। आपको:

  1. विशेष रूप से "गंदगी" (कोड स्मेल्स) की जाँच करनी चाहिए।
  2. उन दुर्लभ लेकिन खतरनाक बग्स को पकड़ने के लिए अतिरिक्त सुरक्षा जाँच (स्टैटिक एनालिसिस) चलानी चाहिए।
  3. कोड को लाइव करने से पहले सुरक्षा "हॉटस्पॉट्स" की सावधानीपूर्वक समीक्षा करनी चाहिए।

संक्षेप में: AI एक तेज़ काम करने वाला है, लेकिन यह सुनिश्चित करने के लिए कि घर एक 'फिक्सर-अपपर' (सुधारने योग्य पुराना घर) न बन जाए, उसे एक सख्त मानवीय फोरमैन की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →