← नवीनतम पेपर
💻 computer science

Beyond Final Code: A Process-Oriented Error Analysis of Software Development Agents in Real-World GitHub Scenarios

यह शोध पत्र SWE-Bench बेंचमार्क पर शीर्ष 8 सॉफ्टवेयर विकास एजेंटों का एक प्रक्रिया-उन्मुख अनुभवजन्य विश्लेषण प्रस्तुत करता है, जो यह प्रकट करता है कि पायथन निष्पादन त्रुटियां समाधान सफलता के साथ कैसे सह-संबंधित हैं, प्रचलित और चुनौतीपूर्ण त्रुटि प्रकारों की पहचान करता है, और स्वयं बेंचमार्क प्लेटफॉर्म में तीन पहले से अज्ञात बगों को उजागर करता है।

मूल लेखक: Zhi Chen, Wei Ma, Lingxiao Jiang

प्रकाशित 2026-04-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhi Chen, Wei Ma, Lingxiao Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने मशीनों को ठीक करने के लिए बेहद बुद्धिमान, AI-संचालित प्रशिक्षुओं (apprentices) की एक टीम को काम पर रखा है जो एक विशाल, जटिल फैक्ट्री में काम करते हैं (जो GitHub जैसे वास्तविक दुनिया के सॉफ्टवेयर प्रोजेक्ट्स का प्रतिनिधित्व करती है)।

ज्यादातर लोग इन प्रशिक्षुओं को केवल अंतिम परिणाम देखकर आंकते हैं: "क्या उन्होंने मशीन ठीक की? हाँ या नहीं?"

यह पेपर कहता है, "रुकिए! यह पूरी कहानी नहीं है।" लेखकों ने इन प्रशिक्षुओं के सिर पर एक कैमरा लगाया और उन सब चीजों को देखा जो वे मशीन को ठीक करने की कोशिश करते समय कर रहे थे। वे उन गलतियों, भ्रम, गलत रास्तों और "अहा!" (aha!) क्षणों को देखना चाहते थे जो अंतिम समाधान जमा करने से पहले होते हैं।

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. सेटअप: प्रक्रिया को देखना, न कि केवल उत्पाद को

शोधकर्ताओं ने 8 शीर्ष AI एजेंटों को सौंपे गए 500 वास्तविक दुनिया के मरम्मत कार्यों का अध्ययन किया। केवल यह जाँचने के बजाय कि काम पूरा हुआ या नहीं, उन्होंने एजेंटों के सोचने, टाइप करने और कोड चलाने के 3,977 "डायरी प्रविष्टियों" (trajectories) के साथ-साथ 3,931 टेस्ट लॉग्स (अंतिम रिपोर्ट कार्ड) का विश्लेषण किया।

बड़ी खोज:

  • एक गलती दुनिया का अंत नहीं है: यदि कोई एजेंट शुरुआत में गलती करता है लेकिन काम जारी रखता है, तो वह अक्सर सुधार कर सकता है और समस्या को हल कर सकता है। यह एक शेफ की तरह है जिसने टोस्ट जला दिया लेकिन एक नया बनाकर भोजन को बचा लिया।
  • बहुत अधिक गलतियाँ आपदा हैं: हालाँकि, यदि कोई एजेंट बार-बार गलतियाँ करता है (10 या 15 से अधिक), तो वह घबरा जाता है। वह बहुत अधिक "सोचने के चरणों" में फंस जाता है, भ्रमित हो जाता है, और अंतिम समाधान आमतौर पर विफल हो जाता है। यह एक ड्राइवर की तरह है जो बार-बार गड्ढों से टकराता है; अंततः उसका ईंधन खत्म हो जाता है या वह रास्ता भटक जाता है।

2. "सबसे आम" गलतियाँ (दैनिक संघर्ष)

लेखकों ने पाया कि ये AI एजेंट बार-बार उन्हीं कुछ चीजों में फंस जाते हैं। इन्हें सॉफ्टवेयर की दुनिया के "फ्लैट टायर" के रूप में सोचें:

  • लापता सामग्री (ModuleNotFoundError): एजेंट किसी ऐसे टूल या लाइब्रेरी का उपयोग करने की कोशिश करता है जो इंस्टॉल नहीं है। यह केक बनाने के लिए आटा न होने जैसा है।
  • गलत आकार (TypeError): एजेंट एक चौकोर टुकड़े को गोल छेद में डालने की कोशिश करता है (जैसे, एक शब्द में संख्या जोड़ने की कोशिश करना)।
  • डेटाबेस ड्रामा: एजेंट डेटाबेस (जहाँ डेटा संग्रहीत किया जाता है) के साथ बहुत संघर्ष करते हैं। वे अक्सर डेटा कैसे व्यवस्थित होना चाहिए, इसके नियमों को तोड़ देते हैं, जिससे "इंटीग्रिटी एरर" (Integrity Errors) होते हैं। यह टैक्स रिटर्न भरने की कोशिश करने जैसा है जिसमें नंबरों का योग सही नहीं बैठता।

3. "दुःस्वप्न" वाली गलतियाँ (कठिन वाली)

कुछ त्रुटियाँ इतनी पेचीदा होती हैं कि सबसे स्मार्ट एजेंट भी उनमें फंस जाते हैं और बार-बार एक ही गलती दोहराते रहते हैं।

  • "OSError" (सिस्टम त्रुटियाँ): ये कंप्यूटर के ऑपरेटिंग सिस्टम से संबंधित त्रुटियाँ हैं, जैसे कि ऐसी फ़ाइल खोलने की कोशिश करना जो मौजूद नहीं है या अनुमतियाँ (permissions) गलत होना। एजेंट यहाँ अन्य किसी भी त्रुटि की तुलना में अधिक बार फंसते हैं। यह एक रोबोट की तरह है जो बंद दरवाजे पर बार-बार टक्कर मार रहा है।
  • डेटाबेस इंटीग्रिटी: जब एजेंट डेटाबेस के नियमों के साथ गड़बड़ी करता है, तो उनके लिए इसे खुद ठीक करना बहुत कठिन होता है। वे अक्सर उस विशिष्ट डेटाबेस के लिए "खेल के नियमों" को नहीं समझ पाते।

4. "भूतिया" त्रुटियाँ (क्रॉस-फेज़ विफलताएं)

कभी-कभी, एक एजेंट कोड पर काम करते समय (सॉल्विंग फेज) एक गलती करता है, सोचता है कि उसने इसे ठीक कर दिया है, और काम जमा कर देता है। लेकिन वह गलती वास्तव में एक "भूत" थी—वह वास्तव में गायब नहीं हुई थी। जब अंतिम परीक्षण (टेस्टिंग फेज) चलते हैं, तो वह भूत वापस आता है, और पूरा प्रोजेक्ट विफल हो जाता है।

  • सबक: एजेंट यह जानने में खराब हैं कि उन्होंने वास्तव में समस्या को कब ठीक कर दिया है। वे अक्सर ऐसा काम जमा करते हैं जिसमें अभी भी छिपी हुई दरारें होती हैं।

5. प्लॉट ट्विस्ट: टेस्ट ही टूटा हुआ था!

यहाँ सबसे आश्चर्यजनक हिस्सा है। कुछ कार्यों के विफल होने के कारणों का विश्लेषण करते समय, शोधकर्ताओं ने टेस्टिंग प्लेटफॉर्म (SWE-Bench) में ही 3 बग्स पाए।

  • कल्पना कीजिए कि एक शिक्षक छात्र के टेस्ट को ग्रेड कर रहा है, लेकिन शिक्षक की उत्तर कुंजी (answer key) ही गलत है।
  • एक मामले में, AI एजेंटों ने समस्या को पूरी तरह से ठीक किया था, लेकिन टेस्ट प्लेटफॉर्म ने कहा, "नहीं, आप विफल रहे।"
  • लेखकों ने इन बग्स की रिपोर्ट प्लेटफॉर्म के रचनाकारों को दी, और प्लेटफॉर्म के मालिकों ने इनकी पुष्टि की। यह साबित करता है कि कभी-कभी, समस्या AI की नहीं होती; बल्कि जिस तरह से हम उनका परीक्षण कर रहे हैं, वह दोषपूर्ण है।

यह क्यों मायने रखता है?

यह पेपर एक मैकेनिक की तरह है जो कहता है, "हम कारों को केवल इस आधार पर आंक रहे हैं कि क्या वे गंतव्य तक पहुँचती हैं। लेकिन यदि हम इंजन लॉग को देखें, तो हम देखते हैं कि वे ईंधन बर्बाद कर रहे हैं, ओवरहीट हो रहे हैं और गड्ढों में फंस रहे हैं।"

भविष्य के लिए मुख्य बातें:

  1. उन्हें गलतियों को बेहतर ढंग से संभालने के लिए सिखाएं: हमें इन AI को त्रुटियों से तेजी से उबरने के लिए प्रशिक्षित करने की आवश्यकता है ताकि वे लूप में न फंसें।
  2. परीक्षण स्थल को ठीक करें: हमें यह सुनिश्चित करने की आवश्यकता है कि इन AI को ग्रेड करने के लिए उपयोग किए जाने वाले "टेस्ट" वास्तव में निष्पक्ष और बग-मुक्त हैं।
  3. ऊर्जा बचाएं: हर बार जब एक AI गलती करता है और उसे फिर से प्रयास करना पड़ता है, तो वह बिजली और कंप्यूटिंग पावर का उपयोग करता है। इन त्रुटियों को पहले ठीक करके, हम AI सॉफ्टवेयर विकास को "अधिक हरा-भरा" (greener) और सस्ता बना सकते हैं।

संक्षेप में: केवल अंतिम कोड को न देखें। यात्रा को देखें। असली समस्याएँ (और समाधान) वहीं छिपे होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →