← नवीनतम पेपर
💻 computer science

Agentic AI for Code Quality: A Four-Agent Machine Learning System for Repository Refactoring, Public RAG, Groq Reasoning, and Reinforcement Learning

यह शोध पत्र एक मल्टी-एजेंट एआई फ्रेमवर्क प्रस्तुत करता है जो सॉफ्टवेयर रिपॉजिटरीज़ में तकनीकी ऋण (टेक्निकल डेब्ट) को कम करने और कार्यात्मक शुद्धता को बनाए रखते हुए कोड गुणवत्ता सुधारों का स्वायत्त रूप से पता लगाने, उन्हें रिफैक्टर करने और मान्य करने के लिए नियम-आधारित विश्लेषण, पब्लिक RAG, Groq-संचालित LLM रीजनिंग और Q-लर्निंग सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) को एकीकृत करता है।

मूल लेखक: Abhishek Prithvi Tejs

प्रकाशित 2026-07-15
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abhishek Prithvi Tejs

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

अपनी कोड रिपॉजिटरी की कल्पना एक बिखरे हुए, अराजक अटारी के रूप में करें जो पुराने डिब्बों, उलझे हुए तारों और डुप्लिकेट औजारों से भरी हुई है। वर्षों से, आपके पास एक "कोड इंस्पेक्टर" (पारंपरिक टूल्स जैसे Pylint या SonarQube) रहा है जो अंदर आता है, गंदगी की ओर इशारा करता है, और आपको शिकायतों की एक लंबी सूची थमा देता है। लेकिन समस्या यह है कि इंस्पेक्टर कभी सफाई नहीं करता। वे बस आपको बताते हैं कि क्या गलत है और चले जाते हैं।

यह पेपर चार AI एजेंट्स की एक नई टीम पेश करता है जो केवल शिकायत नहीं करते; वे वास्तव में अपनी आस्तीनें चढ़ाते हैं, अटारी की सफाई करते हैं, और यह साबित करते हैं कि काम करते समय उन्होंने कुछ भी तोड़ा नहीं है। शोधकर्ताओं ने एक "सेल्फ-हीलिंग" (स्व-उपचार) प्रणाली बनाई है जहाँ ये चार अलग-अलग पात्र एक ही बिखरे हुए कोड को ठीक करने की कोशिश करते हैं, और सिस्टम विजेता का चयन इस आधार पर करता है कि किसने वास्तव में जगह को बेहतर बनाया बिना किसी आपदा के।

चार एजेंट्स: विशेषज्ञों की एक टीम

शोधकर्ताओं ने केवल एक रोबोट नहीं बनाया; उन्होंने चार का एक समूह बनाया, जिनमें से प्रत्येक का एक अलग व्यक्तित्व और कौशल सेट है, यह देखने के लिए कि विभिन्न प्रकार की गंदगी के लिए कौन सा सबसे अच्छा काम करता है।

  1. द रूल-बेस्ड एजेंट (एक सख्त लाइब्रेरियन): यह एजेंट एक सख्त, अपरिवमान्य चेकलिस्ट का पालन करता है। यह स्पष्ट, उबाऊ समस्याओं जैसे डुप्लिकेट इम्पोर्ट्स, अतिरिक्त स्पेस, या गायब कमेंट्स को देखता है। यह सुरक्षित और विश्वसनीय है, जैसे एक लाइब्रेरियन जिसे पता है कि हर किताब कहाँ रखनी है, लेकिन यह गहरी, अधिक भ्रमित करने वाली संरचनात्मक समस्याओं को मिस कर सकता है।
  2. द RAG एजेंट (लाइब्रेरी कार्ड वाला एक रिसर्चर): यह एजेंट स्मार्ट है, लेकिन यह केवल अपनी याददाश्त पर निर्भर नहीं रहता। कोई सुधार सुझाने से पहले, यह बाहर जाता है और सार्वजनिक लाइब्रेरी से नवीनतम "सॉफ्टवेयर इंजीनियरिंग बेस्ट प्रैक्टिसेज" प्राप्त करता है (वेब पर खोजने के लिए Tavily नामक टूल और नियमों के स्थानीय डेटाबेस का उपयोग करके)। यह अपनी सलाह को वास्तविक, सार्वजनिक ज्ञान पर आधारित करता है, जिससे इसके मनगढ़ंत बातें (हैलुसिनेशन) बनाने की संभावना कम हो जाती है।
  3. द Groq LLM एजेंट (एक रचनात्मक आर्किटेक्ट): यह एजेंट कोड के बारे में "सोचने" के लिए एक शक्तिशाली लार्ज लैंग्वेज मॉडल (जो गति के लिए Groq पर चलता है) का उपयोग करता है। यह बड़े चित्र को देखता है और गहरे, संरचनात्मक बदलावों का सुझाव देता है, जैसे कि पूरे भवन के लेआउट को पुनर्गठित करना। यह जटिल, सिमेंटिक समस्याओं के लिए बेहतरीन है लेकिन इसे सावधानी से देखने की आवश्यकता है ताकि यह बहुत अधिक रचनात्मक होकर चीजों को तोड़ न दे।
  4. द Q-Learning एजेंट (ट्रायल-एंड-एरर लर्नर): यह एजेंट रीइन्फोर्समेंट लर्निंग का एक छात्र है। इसके पास कोई निश्चित नियम पुस्तिका या लाइब्रेरी कार्ड नहीं है। इसके बजाय, यह अलग-अलग क्रियाएं (जैसे "इम्पोर्ट्स को साफ करना" या "एक्सेप्शंस को ठीक करना") करने का प्रयास करके और इस आधार पर एक स्कोर प्राप्त करके सीखता है कि कोड में कितना सुधार हुआ है। समय के साथ, यह सीख जाता है कि विशिष्ट प्रकार के बिखरे हुए कोड के लिए कौन सी चालें सबसे अच्छी होती हैं।

"सेल्फ-हीलिंग" पाइपलाइन: वे कैसे काम करते हैं

सिस्टम केवल इन एजेंट्स को बेकाबू नहीं छोड़ता है। यह एक सख्त रेफरी की तरह कार्य करता है जिसके पास एक बहुत ही विशिष्ट गेम प्लान है:

  1. सुरक्षित कॉपी: किसी भी एजेंट द्वारा कोड को छूने से पहले, सिस्टम रिपॉजिटरी की एक परफेक्ट, सुरक्षित कॉपी बनाता है। किसी को भी मूल (ओरिजिनल) को छूने की अनुमति नहीं है।
  2. निदान (डायग्नोसिस): सिस्टम कोड को स्कैन करता है ताकि "कोड स्मेल्स" (बुरी आदतें जैसे बहुत लंबे मेथड्स, बहुत अधिक नेस्टेड लूप्स, या उच्च जटिलता) का पता लगाया जा सके।
  3. सफाई (क्लीनअप): प्रत्येक एजेंट अपनी कॉपी पर कोड को ठीक करने की कोशिश करता है।
  4. सेफ्टी नेट (सबसे महत्वपूर्ण हिस्सा): यहीं पर यह पेपर बहुत सावधान है। सिर्फ इसलिए कि एक एजेंट ने कोड को "साफ" दिखाया है, इसका मतलब यह नहीं है कि वह बेहतर है। सिस्टम नए कोड पर स्वचालित परीक्षण (ऑटोमेटेड टेस्ट) चलाता है। यदि परीक्षण विफल हो जाते हैं, तो सुधार को तुरंत खारिज कर दिया जाता है। कोड को परीक्षण पास करने चाहिए और गुणवत्ता मेट्रिक्स (जैसे कम जोखिम या बेहतर रखरखाव) में सुधार दिखाना चाहिए तभी उसे स्वीकार किया जाएगा।
  5. विजेता: सिस्टम परिणामों की तुलना करता है। यह उस एजेंट को चुनता है जिसने परीक्षणों को तोड़े बिना कोड में सबसे अधिक सुधार किया।

प्रयोगों ने क्या दिखाया

शोधकर्ताओं ने इस सिस्टम का परीक्षण चार प्रसिद्ध "रिफैक्टरिंग काटास" (अभ्यास कोड रिपॉजिटरी जिन्हें बिखरा हुआ बनाया गया है) पर किया: GildedRose, ExpenseReport, Theatrical Players, और Dependency Breaking

परिणाम दिलचस्प थे क्योंकि कोई भी एक एजेंट हर बार नहीं जीता। "सबसे अच्छा" एजेंट पूरी तरह से गंदगी के प्रकार पर निर्भर था:

  • GildedRose: इस रिपॉजिटरी में सरल, दोहराव वाली समस्याएं थीं। रूल-बेस्ड एजेंट (सख्त लाइब्रेरियन) यहाँ जीत गया, जिसने गुणवत्ता स्कोर में 11 अंकों का सुधार किया (61 से 72)। यह सरल, नियत सफाई के लिए एकदम सही था।
  • ExpenseReport: इसमें बेहतर संरचना और जोखिम प्रबंधन की आवश्यकता थी। RAG एजेंट (रिसर्चर) ने बढ़त ली, जिससे स्कोर 68 तक पहुँच गया। यह पाया गया कि सार्वजनिक रिफैक्टरिंग गाइड्स तक पहुंच होना ही सफलता की कुंजी थी।
  • Theatrical Players: इस कोड को गहरे, सिमेंटिक पुनर्गठन की आवश्यकता थी। Groq LLM एजेंट (रचनात्मक आर्किटेक्ट) हीरो बना, जिसने स्कोर को 69 तक पहुँचा दिया। इसने दूसरों की तुलना में जटिल लॉजिक को बेहतर ढंग से समझा।
  • Dependency Breaking: यह उलझी हुई डिपेंडेंसीज के साथ एक कठिन मामला था। Q-Learning एजेंट (लर्नर) सबसे अच्छा प्रदर्शन करने वाला रहा, जिसने स्कोर को 45 से 74 तक पहुँचा दिया (एक विशाल 64.44% का सुधार!)। इसने सीखा कि इस विशिष्ट गांठ को सुलझाने के लिए अनुकूलन योग्य, स्टेट-आधारित क्रियाएं ही एकमात्र तरीका थीं।

यह पेपर किन चीजों को "ना" कहता है

लेखक स्पष्ट रूप से कहते हैं कि यह सिस्टम क्या नहीं है।

  • यह हर बार सब कुछ पूरी तरह से ठीक करने वाला कोई जादुई डंडा नहीं है।
  • यह स्पष्ट रूप से इस विचार को अस्वीकार करता है कि एक एकल AI मॉडल सभी स्थितियों के लिए "सर्वश्रेष्ठ" है। पेपर तर्क देता है कि विभिन्न समस्याओं के लिए विभिन्न रणनीतियों की आवश्यकता होती है।
  • यह इस विचार को खारिज करता है कि आप बस AI को यह देखे बिना कोड फिर से लिखने के लिए छोड़ सकते हैं कि क्या यह अभी भी काम करता है। पेपर इस बात पर जोर देता है कि "मेट्रिक गेट" (टेस्ट और स्कोर चेक) के बिना, एक एजेंट कोड को सुंदर बना सकता है लेकिन उसकी कार्यक्षमता को तोड़ सकता है।
  • पेपर यह दावा नहीं करता कि यह सभी सॉफ्टवेयर के लिए एक हल की हुई समस्या है। यह स्वीकार करता है कि ये परिणाम चार विशिष्ट सार्वजनिक रिपॉजिटरीज पर आधारित हैं और वर्तमान में यह सिस्टम केवल Python कोड पर काम करता है।

हम कितने आश्वस्त हैं?

पेपर इन परिणामों को एक विशिष्ट प्रयोग से प्राप्त मापे गए परिणामों के रूप में प्रस्तुत करता है। लेखक ठोस संख्याएं दिखाते हैं: उदाहरण के लिए, Dependency Breaking रिपॉजिटरी में Q-Learning एजेंट का उपयोग करने पर 66.67% की कमी और 39.56% का जोखिम कम हुआ।

हालाँकि, लेखक सावधानीपूर्वक नोट करते हैं कि ये सीमित टेस्ट केस पर किए गए सिमुलेशन हैं। वे सुझाव देते हैं कि हालांकि परिणाम आशाजनक हैं, लेकिन यह सुनिश्चित करने के लिए कि यह हर जगह काम करता है, सिस्टम को कई और रिपॉजिटरी (वे 25-50 और प्रस्तावित करते हैं) पर परीक्षण करने की आवश्यकता है। वे यह भी उल्लेख करते हैं कि "क्वालिटी स्कोर" एक मिश्रित संख्या है जिसे उन्होंने बनाया है, जो उपयोगी तो है लेकिन सॉफ्टवेयर गुणवत्ता के हर सूक्ष्म पहलू को कैप्चर नहीं कर सकती है।

मुख्य निष्कर्ष

यह पेपर सुझाव देता है कि कोड को ठीक करने का भविष्य केवल एक सुपर-इंटेलिजेंट रोबोट नहीं है। इसके बजाय, यह विशेषज्ञों की एक विशेषज्ञ टीम है जो समानांतर में काम करती है, जिनमें से प्रत्येक एक अलग रणनीति (नियम, अनुसंधान, रचनात्मकता, या सीखना) का उपयोग करती है, और यह सब एक सख्त रेफरी की देखरेख में होता है जो यह सुनिश्चित करता है कि कुछ भी टूटे नहीं। "विजेता" काम के प्रकार के आधार पर बदल जाता है, जो यह साबित करता है कि कोड की गुणवत्ता की दुनिया में, विविधता ही सफलता की कुंजी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →