← नवीनतम पेपर
💻 computer science

ReProAgent: Tool-Augmented Multi-Stage Agentic Generation of Bug Reproduction Tests from Issue Reports

ReProAgent एक बहु-चरणीय, टूल-संवर्धित एजेंट फ्रेमवर्क है जो बग पुनरुत्पादन परीक्षण जनरेशन को बग पहचान, मूल कारण विश्लेषण, योजना और जनरेशन के स्थानीयकृत चरणों में विभाजित करके मौजूदा प्रॉम्प्ट-आधारित दृष्टिकोणों से बेहतर प्रदर्शन करता है, जिससे विविध बेंचमार्क में काफी उच्च सफलता दर प्राप्त होती है।

मूल लेखक: Quanjun Zhang, Yi Zheng, Ye Shang, Weifeng Sun, Haichuan Hu, Chunrong Fang, Zhenyu Chen, Liang Xiao

प्रकाशित 2026-07-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Quanjun Zhang, Yi Zheng, Ye Shang, Weifeng Sun, Haichuan Hu, Chunrong Fang, Zhenyu Chen, Liang Xiao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य सुलझाने की कोशिश कर रहे हैं, लेकिन आपके पास एकमात्र सुराग एक धुंधला, हाथ से लिखा हुआ नोट है जिसमें एक गवाह ने कहा है, "रसोई में कुछ अजीब हुआ!" सॉफ्टवेयर की दुनिया में, यह नोट एक इश्यू रिपोर्ट (issue report) है। आमतौर पर, डेवलपर्स को अनुमान लगाना पड़ता है कि क्या गलत हुआ, इसे साबित करने के लिए एक टेस्ट लिखना पड़ता है, और फिर इसे ठीक करने की कोशिश करनी पड़ती है। लेकिन अक्सर, उनके पास कोई टेस्ट नहीं होता, जिससे पूरी प्रक्रिया धीमी और निराशाजनक हो जाती है।

कुछ समय के लिए, स्मार्ट कंप्यूटर प्रोग्राम (जिन्हें लार्ज लैंग्वेज मॉडल्स या LLMs कहा जाता है) इन टेस्टों को स्वचालित रूप से लिखने की कोशिश करते रहे। वे उन जासूसों की तरह थे जिन्होंने केवल नोट पढ़ा और तुरंत चिल्लाकर कहा, "मुझे लगता है कि अपराधी टोस्टर है!" उन्होंने कोड के कुछ आस-पास के सुराग (कोड का टेक्स्ट) पकड़े और उत्तर का अनुमान लगाया। लेकिन यह पेपर तर्क देता है कि यह दृष्टिकोण बहुत सरल है। यह एक जटिल मर्डर मिस्ट्री को केवल अपराध स्थल की फोटो देखकर सुलझाने की कोशिश करने जैसा है, बिना संदिग्धों का इंटरव्यू लिए या उनके अलबी (alibi) की जांच किए। ये पुराने तरीके अक्सर वास्तविक समस्या को मिस कर देते थे क्योंकि वे यह नहीं समझ पाते थे कि कोड के विभिन्न हिस्से (जैसे "रसोई," "लिविंग रूम," और "बेसमेंट") एक-दूसरे से कैसे जुड़े हुए हैं।

एंट्री रीप्रोएजेंट (ReProAgent): सुपर-डिटेक्टिव टीम

इस पेपर के लेखकों ने RePro-Agent नामक एक नया सिस्टम बनाया है। एक अकेले जासूस के अनुमान लगाने के बजाय, ReProAgent विशेष एजेंटों की एक टीम है जो एक सख्त, चार-चरणीय जांच प्रक्रिया में काम करती है। वे केवल अनुमान नहीं लगाते; वे जांच करते हैं, विश्लेषण करते हैं, योजना बनाते हैं और फिर कार्य करते हैं।

यहाँ उनका "डिटेक्टिव वर्कफ्लो" कैसे काम करता है:

  1. खोज (बग लोकलाइजेशन): सबसे पहले, टीम पूरी इमारत को नहीं देखती है। वे एक लाइब्रेरियन की तरह विशिष्ट पुस्तक खोजने के लिए विशेष उपकरणों का उपयोग करके कोड के माध्यम से खोज करते हैं। वे कीवर्ड्स (keywords) ढूंढते हैं और "ब्रेडक्रंब्स" (dependencies) का पीछा करते हैं ताकि ठीक उसी फ़ाइल और कोड की लाइन तक पहुँचा जा सके जहाँ गड़बड़ी हो रही है।
  2. पूछताछ (रूट कॉज एनालिसिस): एक बार जब वे संदिग्ध को ढूंढ लेते हैं, तो वे केवल उसे गिरफ्तार नहीं करते। वे उस सटीक पथ (path) का पता लगाते हैं जिससे बग गुजरा है। वे पूछते हैं, "त्रुटि (error) सामने के दरवाजे से पीछे की खिड़की तक कैसे पहुँची?" वे बग क्यों हुआ, यह समझने के लिए निष्पादन पथ (execution path) का एक मानचित्र बनाते हैं, न कि केवल यह कि वह कहाँ हुआ।
  3. जाल बिछाना (टेस्ट प्लानिंग): जाल बिछाने से पहले, वे योजना बनाते हैं। वे ठीक से समझते हैं कि बग को दोबारा प्रकट करने के लिए किन स्थितियों का पूरा होना आवश्यक है। यह एक विशिष्ट परिदृश्य सेट करने जैसा है जहाँ संदिग्ध को अपना अपराध प्रकट करना ही होगा।
  4. स्टिंग ऑपरेशन (टेस्ट जनरेशन और रिव्यू): अंत में, वे टेस्ट (जाल) लिखते हैं और उसे एक सुरक्षित, अलग सैंडबॉक्स (डिजिटल प्लेपेन) में चलाते हैं। लेकिन दिलचस्प बात यह है कि यदि टेस्ट बग को पकड़ने में विफल रहता है, या यदि यह गलत चीज़ को पकड़ लेता है, तो टीम हार नहीं मानती। वे परिणाम की समीक्षा करते हैं, पूछते हैं, "क्या हमने सही अपराधी को पकड़ा?" और फिर अपने टेस्ट को परिष्कृत (refine) करते हैं। वे इस प्रक्रिया को तब तक दोहराते रहते हैं जब तक कि टेस्ट पूरी तरह से बग को दोबारा उत्पन्न (reproduce) न कर दे।

परिणाम: क्या यह काम आया?

टीम ने वास्तविक दुनिया की सॉफ्टवेयर समस्याओं के दो बड़े सेटों (SWT-bench-lite और SWT-bench-verified) पर ReProAgent का परीक्षण किया। परिणाम प्रभावशाली थे।

  • छोटे सेट (SWT-bench-lite) पर, ReProAgent ने 58.43% मामलों में सफलतापूर्वक बग को दोबारा बनाया।
  • कठिन, सत्यापित सेट (SWT-bench-verified) पर, यह 70.30% मामलों में सफल रहा।

इसे समझने के लिए, अगला सबसे अच्छा तरीका (एक सिस्टम जिसे AssertFlip कहा जाता है) केवल छोटे सेट पर लगभग 38.0% समस्याओं को हल कर पाया। ReProAgent ने केवल प्रतिस्पर्धा को हराया ही नहीं; इसने उन्हें पीछे छोड़ दिया, एक ही "दिमाग" (एक मॉडल जिसे GPT-5-mini कहा जाता है) का उपयोग करते हुए अगले सबसे अच्छे सिस्टम की तुलना में लगभग 20 प्रतिशत अंक अधिक मामले हल किए।

पेपर ने यह भी जांचा कि क्या यह टीम विभिन्न "दिमागों" (अन्य AI मॉडल जैसे Qwen3-Coder और DeepSeek-V3.2) के साथ काम करती है। इसने किया! सिस्टम उन सभी के साथ अच्छी तरह से काम करता है, जो यह सुझाव देता है कि एक स्मार्ट सिंगल डिटेक्टिव होने से ज्यादा महत्वपूर्ण एक उचित "प्रोसेस" का होना है।

यह क्या नहीं है

पेपर स्पष्ट रूप से बताता है कि ReProAgent क्या नहीं है। यह कोई जादुई छड़ी नहीं है जो खुद बग्स को ठीक करती है। इसका काम सख्ती से वह टेस्ट लिखना है जो यह साबित करे कि बग मौजूद है। हालाँकि, लेखकों ने पाया कि जब उन्होंने ये टेस्ट उन अन्य सिस्टमों को दिए जो वास्तव में बग्स को ठीक करते हैं, तो उन सिस्टमों में सुधार हुआ। उदाहरण के लिए, जब ReProAgent के टेस्ट का उपयोग SWE-agent जैसे सिस्टम की मदद करने के लिए किया गया, तो सफलतापूर्वक ठीक किए गए मुद्दों की संख्या 143 से बढ़कर 153 हो गई।

लागत

सुपर-डिटेक्टिव बनने की एक कीमत चुकानी पड़ती है। पेपर ने गणना की कि ReProAgent को चलाने की लागत प्रति केस लगभग 0.14है।यहकुछसरलतरीकों(जोलगभग0.14** है। यह कुछ सरल तरीकों (जो लगभग **0.11 खर्च करते हैं) की तुलना में थोड़ा महंगा है, लेकिन पेपर का तर्क है कि यह अतिरिक्त कुछ सेंट्स के लायक है क्योंकि यह वास्तव में समस्या को बहुत अधिक बार हल करता है। अधिकांश समय, सिस्टम को सही होने से पहले औसतन लगभग 1.29 बार अपना "स्टिंग ऑपरेशन" चलाने की आवश्यकता पड़ी।

निष्कर्ष

पेपर का सुझाव है कि जटिल सॉफ्टवेयर रहस्यों को सुलझाने के लिए, आप केवल कुछ शब्दों के आधार पर त्वरित अनुमान पर भरोसा नहीं कर सकते। आपको एक संरचित, बहु-चरणीय जांच की आवश्यकता है जो पूरी तस्वीर को देखे, त्रुटि के पथ का पता लगाए और साक्ष्यों की दोबारा जांच करे। ReProAgent दिखाता है कि जब आप AI एजेंटों को पालन करने के लिए एक उचित वर्कफ्लो देते हैं, तो वे अविश्वसनीय रूप से प्रभावी हो सकते हैं, जो एक धुंधले गवाह के नोट को एक स्पष्ट केस फाइल में बदल देते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →