Exploration Structure in LLM Agents for Multi-File Change Localization
यह शोध पत्र सॉफ़्टवेयर रिपॉजिटरीज़ में मल्टी-फाइल परिवर्तनों को स्थानीयकृत करने के लिए एक नॉन-लीनियर, डोमेन-स्कोपड पैरेलल एजेंटिक एक्सप्लोरेशन फ्रेमवर्क प्रस्तावित और मूल्यांकित करता है, जो यह प्रदर्शित करता है कि यह लीनियर सीक्वेंशियल दृष्टिकोणों की तुलना में काफी बेहतर प्रदर्शन करता है और SWE-Bench Pro जैसे बेंचमार्क पर बहुत बड़े मॉडलों के मुकाबले प्रतिस्पर्धी परिणाम प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो एक टूटी हुई मशीन को ठीक करने की कोशिश कर रहे हैं। वह मशीन एक विशाल सॉफ़्टवेयर प्रोजेक्ट है (जैसे कोड का एक बहुत बड़ा पुस्तकालय) और किसी ने एक बग (खराबी) की रिपोर्ट दी है। आपका काम यह पता लगाना है कि ठीक करने के लिए पुस्तकालय के कौन से पन्नों को फिर से लिखने की आवश्यकता है।
यह पेपर इस बारे में है कि कैसे अलग-अलग "AI जासूस" उन पन्नों को खोजने के लिए काम करते हैं। शोधकर्ताओं ने यह देखना चाहा कि क्या जासूस कितना "स्मार्ट" है उससे ज़्यादा यह मायने रखता है कि जासूस कैसे खोजता है।
यहाँ उनके अध्ययन का सरल उपमाओं (analogies) के साथ विवरण दिया गया है:
समस्या: "एक बार में एक कदम" का जाल
अधिकांश वर्तमान AI उपकरण एक ऐसे जासूस की तरह काम करते हैं जो पुस्तकालय में एक बार में एक गलियारा (aisle) करके चलता है। वह एक शेल्फ चुनता है, एक किताब पढ़ता है, और फिर अगले शेल्फ पर चला जाता है।
- दोष: यदि बग वास्तव में पुस्तकालय के तीन अलग-अलग हिस्सों (जैसे रसोई, बगीचा और अटारी) में समस्याओं का मिश्रण है, तो एक जासूस जो एक समय में केवल एक ही गलियारे में चलता है, वह रसोई में ही फंस सकता है, उसका समय (या पैसा) खत्म हो सकता है, और वह कभी बगीचे या अटारी की जांच नहीं कर पाएगा।
- पेपर का विचार: क्या होगा अगर हम चलने के बजाय, तीन अलग-अलग विशेषज्ञों को एक ही समय में रसोई, बगीचे और अटारी की जांच करने के लिए भेज दें?
प्रयोग: "Ansible" पुस्तकालय
शोधकर्ताओं ने इस परीक्षण के लिए Ansible नामक एक विशिष्ट सॉफ़्टवेयर प्रोजेक्ट का उपयोग किया (इसे एक बहुत बड़े, व्यवस्थित पुस्तकालय के रूप में सोचें)। उन्होंने एक परीक्षण बनाया जहाँ उन्होंने AI को एक बग रिपोर्ट दी और उससे उन फाइलों की सूची मांगी जिन्हें ठीक करने की आवश्यकता है।
उन्होंने चार प्रकार के जासूसों की तुलना की:
- "किताबी कीड़ा" (Plain LLM): एक स्मार्ट AI जिसने कई किताबें पढ़ी हैं लेकिन वह इस विशिष्ट पुस्तकालय के अंदर कभी नहीं रहा है। उसे अपनी याददाश्त के आधार पर अनुमान लगाना पड़ता है।
- "अकेला खोजकर्ता" (RLM): एक AI जिसे पुस्तकालय की चाबी और एक नोटबुक दी जाती है। वह अंदर जाता है, दरवाजे खोलता है, और एक-एक करके फाइलें पढ़ता है, और जाते-जाते नोट्स लिखता है।
- "विशेषज्ञों की टीम" (Domain Agents - नया विचार): एक AI मैनेजर जो पहले पुस्तकालय के खंडों (रसोई, बगीचा, अटारी) का मानचित्र बनाता है। जब कोई बग आता है, तो मैनेजर तुरंत संबंधित प्रत्येक खंड में एक अलग विशेषज्ञ को समानांतर (parallel) काम करने के लिए भेज देता है।
- "सुपर-एक्सपर्ट" (Codex): एक बेंचमार्क के रूप में उपयोग किया जाने वाला एक बहुत बड़ा, महंगा और शक्तिशाली AI जासूस।
मुख्य निष्कर्ष
1. टीम वर्क अकेले चलने से बेहतर है
"विशेषज्ञों की टीम" वाला दृष्टिकोण बहुत बड़े अंतर से जीता, भले ही उन्होंने एक छोटा और सस्ता AI मॉडल इस्तेमाल किया हो।
- उपमा: कल्पना कीजिए कि आप एक स्टेडियम में खोई हुई चाबी ढूंढने की कोशिश कर रहे हैं। "अकेला खोजकर्ता" पूरे स्टेडियम में अकेला घूमता है और थक जाता है। "टीम" एक साथ स्टैंड, मैदान और फूड स्टॉल में लोग भेजती है। वे चाबी को बहुत तेज़ी से और अधिक सटीकता से ढूंढ लेते हैं।
- परिणाम: टीम के दृष्टिकोण ने गलत फाइलों को खोजने की तुलना में सही फाइलों को बहुत बेहतर तरीके से खोजा, भले ही अकेले चलने वाले के पास एक बड़ा दिमाग (अधिक शक्तिशाली AI मॉडल) था।
2. जासूस को चाबी देना उल्टा भी पड़ सकता है
शोधकर्ताओं ने सोचा था कि AI को फ़ाइल सिस्टम तक सीधी पहुँच (चाबी के साथ "अकेला खोजकर्ता") देने से मदद मिलेगी। आश्चर्यजनक रूप से, इसने अक्सर चीज़ों को और खराब कर दिया।
- उपमा: यदि आप एक जासूस को एक विशाल गोदाम की चाबी देते हैं, तो वे हजारों अप्रासंगिक बक्सों (जैसे टेस्ट फाइल या पुराने ड्राफ्ट) को देखने में विचलित हो सकते हैं और वास्तविक टूटे हुए हिस्से को देखना भूल सकते हैं। वे "शोर" (noise) से अभिभूत हो जाते हैं।
- परिणाम: सीधे एक्सेस वाला AI अक्सर बहुत अधिक गलत फाइलें अनुमानित कर देता था, जिससे उसकी सटीकता कम हो गई। "टीम" का दृष्टिकोण अधिक स्मार्ट था क्योंकि उन्हें पता था कि किन विशिष्ट खंडों को देखना है और उन्होंने फालतू चीजों को अनदेखा कर दिया।
3. अधिक एजेंटों का मतलब हमेशा बेहतर परिणाम नहीं होता
उन्होंने सुरक्षा के लिए टीम को ज़रूरत से ज़्यादा विशेषज्ञों से परामर्श करने के लिए मजबूर करके देखा।
- उपमा: यह एक छोटी सी मोमबत्ती बुझाने के लिए पूरी फायर ब्रिगेड को बुलाने जैसा है। इससे आग तेज़ी से नहीं बुझती; यह बस अधिक पैसा (कंप्यूटर टोकन) खर्च करती है और बहुत भ्रम पैदा करती है।
- परिणाम: अधिक एजेंटों को बुलाने के प्रति "आक्रामक" होने से बग खोजने में मदद नहीं मिली; इसने केवल संसाधनों को बर्बाद किया।
4. "डॉक्यूमेंटेशन ब्लाइंड स्पॉट" (दस्तावेज़ीकरण की अनदेखी)
AI चाहे कितना भी स्मार्ट क्यों न हो, वे सभी डॉक्यूमेंटेशन फाइलों (निर्देश मैनुअल) को खोजने में संघर्ष करते रहे।
- उपमा: यदि कोई उपयोगकर्ता कहता है, "लाल बटन काम नहीं कर रहा है," तो AI जानता है कि लाल बटन को ठीक करना है। लेकिन AI को शायद ही कभी यह एहसास होता है कि निर्देश मैनुअल को भी अपडेट करने की आवश्यकता है ताकि यह बताया जा सके कि "लाल बटन अब टूटा हुआ है।" बग रिपोर्ट में मैनुअल का ज़िक्र नहीं था, इसलिए AI ने इसे अनदेखा कर दिया।
- परिणाम: यह एक छिपा हुआ डिपेंडेंसी (dependency) है। AI को एक नियम की आवश्यकता है जो कहता है, "यदि आप एक बटन ठीक करते हैं, तो आपको मैनुअल भी चेक करना होगा," भले ही उपयोगकर्ता ने इसके लिए नहीं पूछा हो।
निष्कर्ष
यह पेपर निष्कर्ष निकालता है कि एक AI कैसे खोज (explore) करता है, यह उतना ही महत्वपूर्ण है जितना कि वह कितना स्मार्ट है।
- विशेषज्ञों की एक छोटी, अच्छी तरह से संगठित टीम (Domain Agents) एक विशाल, शक्तिशाली AI को हरा सकती है जो बिना लक्ष्य के भटक रहा है।
- हालाँकि, यहाँ तक कि सबसे अच्छे AI टीमें भी "अदृश्य" परिवर्तनों, जैसे निर्देश मैनुअल को अपडेट करने के साथ संघर्ष करती हैं, क्योंकि बग रिपोर्ट में उनके बारे में स्पष्ट रूप से नहीं पूछा जाता है।
संक्षेप में: कच्ची शक्ति (raw power) से बेहतर संरचना (structure) है। जटिल सॉफ़्टवेयर बग को ठीक करने की कुंजी खोज प्रक्रिया को व्यवस्थित करना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।