← नवीनतम पेपर
🤖 AI

Where Do AI Coding Agents Fail? An Empirical Study of Failed Agentic Pull Requests in GitHub

यह शोध पत्र GitHub पर 33,000 AI-जनित पुल रिक्वेस्ट (pull requests) के एक बड़े पैमाने के अनुभवजन्य अध्ययन को प्रस्तुत करता है, जो मात्रात्मक विश्लेषण और गुणात्मक वर्गीकरण (qualitative taxonomy) को जोड़कर यह प्रकट करता है कि जहाँ दस्तावेज़ीकरण और CI कार्य सबसे अधिक बार सफल होते हैं, वहीं एजेंटिक विफलताएं बड़े कोड परिवर्तनों, CI विफलताओं और मानव समीक्षक की अपेक्षाओं के साथ मिसअलाइनमेंट जैसे कारकों द्वारा संचालित होती हैं।

मूल लेखक: Ramtin Ehsani, Sakshi Pathak, Shriya Rawal, Abdullah Al Mujahid, Mia Mohammad Imran, Preetha Chatterjee

प्रकाशित 2026-01-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ramtin Ehsani, Sakshi Pathak, Shriya Rawal, Abdullah Al Mujahid, Mia Mohammad Imran, Preetha Chatterjee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक हलचल भरा निर्माण स्थल है जहाँ मानव वास्तुकार (architects) और इंजीनियर सॉफ्टवेयर बना रहे हैं। हाल ही में, एआई रोबोट्स (कोडिंग एजेंटों के नाम से जाने जाने वाले) की एक नई टीम वहाँ पहुँची है। ये रोबोट केवल इंसानों को सुझाव ही नहीं दे रहे हैं; वे अब पूरे कमरे बना रहे हैं, दीवारों पर पेंट कर रहे हैं, और इमारत में जोड़ने के लिए अपने स्वयं के ब्लूप्रिंट (जिन्हें 'पुल रिक्वेस्ट' या PR कहा जाता है) भी जमा कर रहे हैं।

आपके द्वारा दिया गया पेपर एक फोरेंसिक जांच की तरह है कि क्यों इन रोबोट-निर्मित कमरों को मंजूरी देकर इमारत में जोड़ा जाता है, जबकि कुछ को खारिज कर दिया जाता है और तोड़ दिया जाता है। शोधकर्ताओं ने यह समझने के लिए कि रोबोट कहाँ गलती कर रहे हैं, GitHub पर पांच अलग-अलग रोबोट टीमों द्वारा जमा किए गए 33,000 से अधिक ब्लूप्रिंट्स का अध्ययन किया।

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. "आसान जीत" बनाम "कठिन बिक्री"

शोधकर्ताओं ने पाया कि रोबोट साधारण, नियमित कार्यों को करने में बहुत अच्छे हैं लेकिन जटिल, उच्च-जोखिम वाले कार्यों में संघर्ष करते हैं।

  • रोबोट की सुपरपावर: जब बात डॉक्यूमेंटेशन (दस्तावेजीकरण), निर्माण के शेड्यूल (CI/Build) को ठीक करने और नियमों को अपडेट करने की आती है, तो वे विशेषज्ञ माली की तरह होते हैं। ये कार्य लगभग 80-90% बार स्वीकृत होते हैं। यह ऐसा है जैसे रोबोट फर्श साफ करने या बाड़ पर दोबारा पेंट करने में पूरी तरह कुशल हैं।
  • रोबोट की कमजोरी: वे टूटे हुए इंजन को ठीक करने (बग फिक्सिंग) या इमारत को तेज़ चलाने (परफॉरमेंस) में बहुत खराब हैं। ये कार्य सबसे अधिक बार खारिज किए जाते हैं। यह ऐसा है जैसे रोबोट एक लीक होते पाइप को ठीक करने की कोशिश करता है लेकिन अंत में बेसमेंट में बाढ़ ला देता है।

2. "संभालने से ज्यादा बड़ा" होने की समस्या

जब एक रोबोट ऐसा ब्लूप्रिंट जमा करता है जिसे खारिज कर दिया जाता है, तो अक्सर इसका कारण यह होता है कि उसने एक साथ बहुत कुछ करने की कोशिश की थी।

  • उपमा: कल्पना कीजिए कि आपने एक रोबोट से कहा "रसोई ठीक करो।" यदि वह वापस आता है और कहता है कि उसने पूरा घर ही फिर से बना दिया, नींव बदल दी और छत का नया डिज़ाइन बना दिया, तो मानव वास्तुकार कहेगा, "बिल्कुल नहीं, यह बहुत ज्यादा है।"
  • निष्कर्ष: खारिज किए गए ब्लूप्रिंट्स में स्वीकृत ब्लूप्रिंट्स की तुलना में कोड की अधिक लाइनें शामिल थीं और उन्होंने अधिक फाइलों को छुआ था। रोबोट अक्सर "अति-उत्साही" हो जाते हैं और बड़े बदलाव कर देते हैं जो मानव समीक्षकों को अभिभूत (overwhelm) कर देते हैं।

3. "टूटा हुआ टेस्ट" अलार्म

एक मानव वास्तुकार द्वारा ब्लूप्रिंट देखे जाने से पहले, इमारत की स्वचालित सुरक्षा प्रणाली एक जांच करती है।

  • निष्कर्ष: खारिज किए गए ब्लूप्रिंट्स अक्सर इन स्वचालित सुरक्षा जांचों (CI बिल्ड्स) में विफल रहे। यह ऐसा है जैसे रोबोट ने एक ऐसा प्लान जमा किया जो अग्नि सुरक्षा निरीक्षण (fire safety inspection) में पास नहीं हुआ। यदि रोबोट का कोड टेस्ट को तोड़ देता है, तो इंसान उसे करीब से देखने की जहमत भी नहीं उठाते।

4. इंसान "ना" क्यों कहते हैं? (4 कारण)

शोधकर्ताओं ने 600 खारिज किए गए ब्लूप्रिंट्स की गहराई से जांच की ताकि यह पता चल सके कि इंसान "ना" क्यों कहते हैं। उन्हें चार मुख्य कारण मिले, जो सबसे आम से लेकर सबसे कम आम के क्रम में हैं:

  • कारण #1: "भूतिया शहर" (The Ghost Town) (38%)

    • क्या हुआ: रोबोट ने एक ब्लूप्रिंट जमा किया, और किसी भी इंसान ने उसे कभी नहीं देखा। इंसान बहुत व्यस्त थे, या रोबोट को अनदेखा कर दिया गया, और वह अनुरोध वहीं पड़ा रहा जब तक कि उसे स्वचालित रूप से बंद नहीं कर दिया गया।
    • उपमा: रोबोट ने वास्तुकार की मेज पर एक नोट छोड़ा, लेकिन वास्तुकार छुट्टी पर था, और वह नोट अंततः कचरे में फेंक दिया गया।
  • कारण #2: "डबल बुकिंग" (The Double Booking) (31%)

    • क्या हुआ: रोबोट ने उस समस्या को ठीक करने की कोशिश की जिसे किसी और ने दूसरे ब्लूप्रिंट में पहले ही ठीक कर दिया था
    • उपमा: रोबोट ने एक नया पुल बनाने की योजना पेश की, यह जाने बिना कि दूसरी टीम कल ही वह बिल्कुल वैसा ही पुल बनाना शुरू कर चुकी है।
  • कारण #3: "टूटा हुआ ब्लूप्रिंट" (The Broken Blueprint) (22%)

    • क्या हुआ: कोड खुद टूटा हुआ था, टेस्ट में फेल हो गया, या उसने वास्तव में समस्या को हल नहीं किया।
    • उपमा: रोबोट ने एक दरवाजा बनाया, लेकिन दरवाजा खुलता नहीं है, या वह कांच से बना है जो छूते ही टूट जाता है।
  • कारण #4: "गलत निर्देश" (The Wrong Instructions) (2%)

    • क्या हुआ: रोबोट ने उन निर्देशों को अनदेखा कर दिया जो इंसान ने दिए थे या कानूनी नियमों (जैसे कॉपीराइट) का उल्लंघन किया।
    • उपमा: इंसान ने रोबोट से कहा "दीवार को नीला रंग दो," लेकिन रोबोट ने उसे लाल रंग दिया और ऐसे पेंट का उपयोग किया जिसकी इमारत की बीमा पॉलिसी अनुमति नहीं देती।

मुख्य निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि हालांकि ये AI रोबोट कोड लिखने में बेहतर हो रहे हैं, लेकिन वे अभी भी माहौल को समझने (reading the room) में खराब हैं।

वे नहीं जानते कि कब रुकना है (वे बहुत बड़े बदलाव कर देते हैं), वे नहीं जानते कि पहले से क्या किया जा चुका है (वे काम को दोहराते हैं), और वे जटिल मानवीय निर्देशों का पालन करने में संघर्ष करते हैं। भविष्य में इन रोबोटों को सफल होने के लिए, उन्हें छोटा, अधिक केंद्रित, और यह जांचने में बेहतर होना होगा कि क्या उनका काम वास्तव में आवश्यक है, इससे पहले कि वे इंसानों से निर्माण करने की अनुमति मांगें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →