← नवीनतम पेपर
💻 computer science

ChainSWE: Benchmarking Coding Agents on Multi-Bug Software Maintenance

यह शोध पत्र ChainSWE को प्रस्तुत करता है, जो एक साझा कोडबेस के भीतर अनुक्रमिक, आश्रित बग सुधारों (sequential, dependent bug fixes) पर कोडिंग एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, जो यह प्रकट करता है कि पारंपरिक पृथक बग-फिक्सिंग मूल्यांकनों की तुलना में चेन की लंबाई बढ़ने के साथ एजेंटों का प्रदर्शन काफी कम हो जाता है।

मूल लेखक: Qirui Jin, Lingching Tung, Kenan Li, Qiyang Shi, Yushi She, Huanzhong Jia, Harrison Zhao, Kejing Xia, Zhenbang Du, Yikai Zhang, Jiaxin Pei, Zhenyu Zhang, Zhen Qi, Yuyan Duan, Wenke Lee, Zijian Jin

प्रकाशित 2026-07-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qirui Jin, Lingching Tung, Kenan Li, Qiyang Shi, Yushi She, Huanzhong Jia, Harrison Zhao, Kejing Xia, Zhenbang Du, Yikai Zhang, Jiaxin Pei, Zhenyu Zhang, Zhen Qi, Yuyan Duan, Wenke Lee, Zijian Jin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रचनात्मक उपमाओं का उपयोग करके CHAINSWE पेपर की व्याख्या दी गई है।

मुख्य विचार: "एक बार और बस" से "लंबी दौड़" तक

कल्पना कीजिए कि आप कारों के एक बेड़े को ठीक करने के लिए सुपर-स्मार्ट रोबोट मैकेनिकों की एक टीम को काम पर रख रहे हैं।

पुराना तरीका (वर्तमान बेंचमार्क):
हर बार जब आप किसी मैकेनिक को कोई समस्या देते हैं, तो आप उन्हें एक बिल्कुल नई, चमकती हुई कार सौंप देते हैं। वे टायर का पंचर ठीक करते हैं, आप उनके काम की जाँच करते हैं, और फिर उन्हें घर भेज देते हैं। अगले दिन, आप उन्हें एक अलग कार देते हैं जिसमें एक अलग समस्या होती है।

  • समस्या: यह इस बात का परीक्षण नहीं करता कि क्या वे समय के साथ कार का रखरखाव करने में अच्छे हैं। वास्तविक दुनिया में, मैकेनिकों को हर दिन नई कार नहीं मिलती। वे एक ही कार पर काम करते हैं, पहले टायर का पंचर ठीक करते हैं, फिर ब्रेक की आवाज़, फिर इंजन की अजीब आवाज़, सब उसी एक वाहन पर।

नया तरीका (CHAINSWE):
शोधकर्ताओं ने CHAINSWE नामक एक नया परीक्षण बनाया है। मैकेनिकों को नई कारें देने के बजाय, वे उन्हें एक कार और 304 समस्याओं की एक सूची देते हैं जो कई वर्षों में हुई हैं।

  • मैकेनिक पहली समस्या को ठीक करता है।
  • फिर, कार को रीसेट किए बिना, उन्हें पहली मरम्मत के बाद कार की स्थिति के आधार पर दूसरी समस्या को ठीक करना होता है।
  • फिर तीसरी, और इसी तरह।

रोबोट दो मुख्य तरीकों से विफल होते हैं

पेपर में पाया गया कि जब रोबोट एक ही कोड ( "कार") पर समस्याओं की एक लंबी सूची को ठीक करने की कोशिश करते हैं, तो वे दो विशिष्ट प्रकार की गलतियाँ करते हैं जो वे एकल समस्याओं को ठीक करते समय नहीं करते हैं:

1. "ओवर-डेकोरेटर" की गलती (Overshoot/ज़रूरत से ज़्यादा करना)

  • परिदृश्य: रोबोट से एक टपकते हुए नल को ठीक करने के लिए कहा जाता है। वह नल को पूरी तरह से ठीक कर देता है। लेकिन, अपने उत्साह में, वह रसोई की अलमारियों को भी पेंट कर देता है और फर्श की टाइलें भी बदल देता है, जबकि किसी ने ऐसा करने के लिए नहीं कहा था।
  • परिणाम: बाद में, एक इंसान बिजली का स्विच ठीक करने आता है। क्योंकि रोबंतु ने पहले फर्श की टाइलें और अलमारियां बदल दी थीं, इसलिए लाइट स्विच के निर्देश अब समझ में नहीं आते। रोबोट के "अतिरिक्त" काम ने अगले कार्य को खराब कर दिया।
  • पेपर में: रोबोट उन फाइलों को बदल देता है जिन्हें उसे नहीं छूना चाहिए था, जिससे भविष्य के बग्स के टेस्ट फेल हो जाते हैं।

2. "अधूरा छोड़ा" की गलती (Undershoot/कम छोड़ देना)

  • परिदृश्य: रोबोट से एक टपकते हुए नल को ठीक करने के लिए कहा जाता है। उसे एहसास होता है कि नल को ठीक होने के लिए एक नए पाइप और एक नए वाल्व की आवश्यकता है। वह केवल नल का हैंडल बदल देता है (क्योंकि नोट में वही लिखा था) और टूटे हुए पाइप और वाल्व को वैसे ही छोड़ देता है।
  • परिणाम: नल ठीक दिखता है, लेकिन वह अभी भी टपक रहा है। बाद में, एक इंसान पानी के दबाव को ठीक करने की कोशिश करता है। क्योंकि रोबोट ने पहले पाइप को ठीक नहीं किया था, इसलिए पानी के दबाव वाला सुधार पूरी तरह से विफल हो जाता है।
  • पेपर में: रोबोट उस विशिष्ट फ़ाइल को ठीक करता है जिसका बग रिपोर्ट में उल्लेख किया गया है, लेकिन वह सहायक फ़ाइलों को अपडेट करना भूल जाता है जिनका बग रिपोर्ट में स्पष्ट रूप से उल्लेख नहीं किया गया था, जिससे अगली बग के लिए कोड की स्थिति खराब रह जाती है।

जब उन्होंने रोबोटों का परीक्षण किया तो क्या हुआ?

शोधकर्ताओं ने इस नए "लॉन्ग हॉल" (लंबी दौड़) परीक्षण का उपयोग करके 7 अलग-अलग "AI मैकेनिकों" (भाषा मॉडल) का परीक्षण किया।

  • परिणाम: जब रोबोट एकल बग्स पर काम कर रहे थे (पुराना तरीका), तो वे काफी अच्छे थे (लगभग 60% सफलता)। लेकिन जब उन्हें बग्स की एक श्रृंखला (चेन) पर काम करना पड़ा (नया तरीका), तो उनका प्रदर्शन 70% तक गिर गया
  • "चेन रिएक्शन": वे बग्स की सूची में वे जितने गहरे उतरते गए, उनका प्रदर्शन उतना ही खराब होता गया। जब तक वे लगातार 3 या 4 बग्स तक पहुँचे, वे लगभग लगातार विफल हो रहे थे।
  • क्यों? रोबोट अपने ही पिछले काम से भ्रमित हो रहे थे। वे यह याद नहीं रख पा रहे थे कि उन्होंने किन फाइलों को बदला है, या वे भूल जाते थे कि उनके पिछले "त्वरित सुधारों" ने अगले कार्य के लिए आधार को कैसे तोड़ दिया था।

क्या "मेमोरी" (याददाश्त) से मदद मिली?

शोधकर्ताओं ने रोबोटों को यह याद दिलाने के लिए कि उन्होंने क्या किया था, उन्हें अलग-अलग तरीके देकर मदद करने की कोशिश की:

  1. पूर्ण मेमोरी (Full Memory): उन्होंने जो कुछ भी पहले कहा था उसका पूरा इतिहास पढ़ना।
  2. सारांशित मेमोरी (Summarized Memory): रोबोट को पहले किए गए अपने काम का एक छोटा सारांश लिखने के लिए कहना।
  3. सहायक रोबोट (Helper Robots): एक छोटे रोबोट का उपयोग करना जो फ़ाइल एडिटिंग करे जबकि मुख्य रोबोट केवल निर्देश दे।

चौंकाने वाली बात: इनमें से किसी भी ट्रिक ने वास्तव में ज्यादा मदद नहीं की। वास्तव में, रोबोट को अपने काम का सारांश देने या सहायक का उपयोग करने के लिए कहना अक्सर चीज़ों को और खराब कर देता था। रोबोट कोड में अपने द्वारा बनाई गई "गड़बड़ी" को संभालने में सक्षम नहीं थे, चाहे वे कितना भी याद रखने की कोशिश करें।

निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि हम वर्तमान में AI कोडर्स का परीक्षण ऐसे कर रहे हैं जैसे वे "वन-हिट वंडर्स" (एक काम करके छोड़ देने वाले) हों। लेकिन वास्तविक दुनिया में, सॉफ्टवेयर रखरखाव एक मैराथन है, स्प्रिंट (तेज दौड़) नहीं।

ऐसे AI बनाने के लिए जो वास्तव में सॉफ्टवेयर का रखरखाव कर सकें, हमें उन्हें अलग-थलग कार्यों पर टेस्ट करना बंद करना होगा और उन्हें कार्यों की श्रृंखला (chains of tasks) पर टेस्ट करना शुरू करना होगा, जहाँ उन्हें अपने द्वारा बनाए गए खुद के अधूरे और त्रुटिपूर्ण कोड से जूझना पड़े। फिलहाल, सबसे स्मार्ट AI मॉडल भी कोडबेस को साफ रखने में संघर्ष कर रहे हैं जब उन्हें एक के बाद एक बग्स को ठीक करना होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →