← नवीनतम पेपर
🤖 AI

One Tool Is Enough: Reinforcement Learning for Repository-Level LLM Agents

यह शोध पत्र RepoNavigator को प्रस्तुत करता है, जो एक सुदृढीकरण लर्निंग (reinforcement learning) आधारित LLM एजेंट है, जो सिंबल डेफिनिशन जंपिंग के लिए एक एकल निष्पादन-जागरूक (execution-aware) टूल का उपयोग करके रिपॉजिटरी-स्तरीय इश्यू लोकलाइजेशन में अत्याधुनिक प्रदर्शन प्राप्त करता है, जिससे मॉडल नियंत्रण सरल हो जाता है और यह बड़े बेसलाइन और क्लोज्ड-सोर्स मॉडल्स से बेहतर प्रदर्शन करता है।

मूल लेखक: Zhaoxi Zhang, Yitong Duan, Yanzhi Zhang, Yiming Xu, Zhixiang Wang, Kun Liang, Weikang Li, Jiahui Liang, Deguo Xia, Jizhou Huang, Jiyan He, Yunfang Wu

प्रकाशित 2026-05-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhaoxi Zhang, Yitong Duan, Yanzhi Zhang, Yiming Xu, Zhixiang Wang, Kun Liang, Weikang Li, Jiahui Liang, Deguo Xia, Jizhou Huang, Jiyan He, Yunfang Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: घास के ढेर में सुई ढूँढना (जो एक भूलभुलैया भी है)

कल्पना कीजिए कि आप एक जासूस हैं जो एक टूटी हुई मशीन को ठीक करने की कोशिश कर रहे हैं, लेकिन वह मशीन इतनी विशाल है कि वह पूरे गोदाम को भर देती है। आप एक बार में पूरी चीज़ को नहीं देख सकते। आप केवल एक समय में एक छोटे से हिस्से को ही देख सकते हैं।

अधिकांश वर्तमान AI सहायक (लार्ज लैंग्वेज मॉडल्स, या LLMs) इन विशाल "गोदामों" (कोड रिपॉजिटरी) में सॉफ्टवेयर बग्स को ठीक करने के लिए कई अलग-अलग उपकरणों का उपयोग करते हैं। वे "क्लास खोजने" का टूल, "फंक्शन खोजने" का टूल और "इंपोर्ट्स चेक करने" का टूल इस्तेमाल कर सकते हैं। यह एक टॉर्च, मेटल डिटेक्टर और मैप के साथ गोदाम में रास्ता खोजने जैसा है, लेकिन उपकरण बार-बार खराब हो जाते हैं या आपको भ्रमित करने वाले परिणाम देते हैं। क्योंकि उपकरण बहुत अधिक हैं, AI अभिभूत (overwhelmed) हो जाता है, गलतियाँ करता है और समय बर्बाद करता है।

समाधान: "फॉलो द थ्रेड" (धागे का पीछा करना) टूल

शोधकर्ताओं ने एक नया AI एजेंट बनाया जिसे RepoNavigator कहा जाता है। उसे अलग-अलग गैजेट्स से भरा टूलबॉक्स देने के बजाय, उन्होंने उसे केवल एक बहुत शक्तिशाली टूल दिया: "जंप" (Jump)

"जंप" टूल को हर हिस्से से जुड़ी एक जादुई धागे की तरह समझें। यदि आप एक गियर को देख रहे हैं और आप जानना चाहते हैं कि वह कहाँ बना था या वह किससे जुड़ा है, तो आप बस उस धागे को खींचते हैं। वह धागा आपको तुरंत सटीक ब्लूप्रिंट या अगले जुड़े हुए गियर तक ले जाता है।

कंप्यूटर की भाषा में, यह टूल एक "लैंग्वेज सर्वर" (एक प्रोग्राम जो कोड की संरचना को समझता है) का उपयोग करता है ताकि कोड के एक टुकड़े से उसके परिभाषा (definition) तक जंप किया जा सके। यदि कोड कहता है calculate_tax(), तो "जंप" टूल तुरंत आपको calculate_tax() के अंदर का वास्तविक कोड दिखा देता है।

क्यों एक टूल बेहतर है

पेपर का तर्क है कि कम ही अधिक है (less is more)। यहाँ बताया गया है कि क्यों:

  1. सरलता: यदि आपके पास 10 अलग-अलग उपकरण हैं, तो आपके विफल होने के 10 अलग-अलग तरीके हैं। यदि आपके पास एक उपकरण है, तो इसे पूरी तरह से सीखना बहुत आसान है।
  2. यथार्थवाद: जब एक कंप्यूटर प्रोग्राम चलाता है, तो वह चीजों को "खोजता" नहीं है; वह एक पथ का अनुसरण करता है। वह एक फंक्शन से दूसरे फंक्शन तक जाता है। "जंप" टूल इस प्राकृतिक प्रवाह की नकल करता है। यह घर में बिजली के तारों का पीछा करने जैसा है, बजाय इसके कि आप अनुमान लगाएं कि तार कहाँ जा रहे हैं।
  3. फोकस: AI को केवल परिभाषाओं पर "जंप" करने तक सीमित करके, शोधकर्ताओं ने खोज के दायरे को कम कर दिया। पूरे गोदाम में हर फाइल को देखने के बजाय, AI केवल उन फाइलों को देखता है जो वास्तव में समस्या से जुड़ी हुई हैं।

यह कैसे सीखता है: पुरस्कारों के साथ प्रशिक्षण (रीइन्फोर्समेंट लर्निंग)

AI इस टूल का उपयोग अच्छी तरह से करना शुरू में नहीं जानता था। शोधकर्ताओं ने इसे रीइन्फोर्समेंट लर्निंग (RL) का उपयोग करके प्रशिक्षित किया।

कल्पना कीजिए कि एक कुत्ते को गेंद लाना सिखा रहे हैं। आप कुत्ते के लिए कोई मैनुअल नहीं लिखते। आप गेंद फेंकते हैं, और यदि कुत्ता उसे वापस लाता है, तो आप उसे एक ट्रीट (पुरस्कार) देते हैं। यदि वह असफल होता है, तो उसे कोई ट्रीट नहीं मिलता।

RepoNavigator को इसी तरह प्रशिक्षित किया गया था:

  • यह सिंबल से सिंबल पर जंप करके टूटे हुए कोड को खोजने की कोशिश करता है।
  • यदि यह सही फाइल/फंक्शन ढूंढ लेता है, तो इसे एक "रिवॉर्ड" (पॉइंट्स) मिलता है।
  • यदि यह कोई गलती करता है या टूल को गलत तरीके से कॉल करता है, तो इसे कोई रिवॉर्ड नहीं मिलता।
  • समय के साथ, यह सबसे अधिक पॉइंट्स पाने के लिए सबसे अच्छा रास्ता चुनना सीख जाता है।

महत्वपूर्ण बात यह है कि उन्होंने इस AI को ओपन-सोर्स मॉडल का उपयोग करके शुरू से प्रशिक्षित किया, बिना महंगे, क्लोज्ड-सोर्स AI मॉडल (जैसे GPT या Claude) की तरकीबों की नकल किए।

परिणाम: छोटा लेकिन शक्तिशाली

प्रयोगों ने दिखाया कि यह सरल दृष्टिकोण अविश्वसनीय रूप से अच्छा काम करता है:

  • छोटा AI, बड़ा प्रदर्शन: इस पद्धति के साथ प्रशिक्षित एक छोटा AI मॉडल (7 बिलियन पैरामीटर्स) पुराने तरीकों का उपयोग करने वाले बड़े, अधिक जटिल मॉडल्स (14 बिलियन पैरामीटर्स) से बेहतर प्रदर्शन करता है।
  • दिग्गजों को पछाड़ना: उनके सबसे बड़े मॉडल (32 बिलियन पैरामीटर्स) ने अधिकांश परीक्षणों में उन्नत क्लोज्ड-सोर्स मॉडल्स (जैसे GPT-5) को भी पीछे छोड़ दिया।
  • दक्षता: क्योंकि यह केवल एक टूल का उपयोग करता है, यह अन्य तरीकों की तुलना में कम कंप्यूटिंग संसाधनों और टोकन (शब्दों) का उपयोग करता है। यह तेज़ और सस्ता है।

एनालॉजी सारांश

  • पुराना तरीका: एक विशाल लाइब्रेरी में एक विशिष्ट पुस्तक खोजने की कोशिश करना जिसमें कैटलॉग, एक मैप, एक लाइब्रेरियन और एक सर्च इंजन का उपयोग किया जाता है, लेकिन विभिन्न प्रणालियों के कारण भ्रमित हो जाना।
  • नया तरीका (RepoNavigator): आपको एक एकल, जादुई बुकमार्क दिया गया है। आप विषय सूची (table of contents) से शुरू करते हैं, और बुकमार्क आपको तुरंत उसी पेज पर टेलीपोर्ट कर देता है जिसकी आपको आवश्यकता है। आप उत्तर खोजने तक बस टेलीपोर्ट होते रहते हैं।

निष्कर्ष

पेपर यह सिद्ध करता है कि विशाल सॉफ़्टवेयर प्रोजेक्ट्स को नेविगेट करने के लिए आपको जटिल उपकरणों के सेट की आवश्यकता नहीं है। एक AI एजेंट को एक स्मार्ट, निष्पादन-जागरूक (execution-aware) टूल ("जंप") देने और रिवॉर्ड्स के साथ प्रशिक्षित करने से, आप एक ऐसा सिस्टम बना सकते हैं जो पिछले तरीकों की तुलना में तेज़, सस्ता और अधिक सटीक है। यह एक याद दिलाता है कि कभी-कभी, सबसे अच्छा समाधान सबसे सरल वाला होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →