← नवीनतम पेपर
💻 computer science

Agentic Repository Mining: A Multi-Task Evaluation

यह शोध पत्र प्रदर्शित करता है कि बाश (bash) कमांड के माध्यम से सॉफ्टवेयर रिपॉजिटरीज़ को गतिशील रूप से एक्सप्लोर करने में सक्षम एलएलएम (LLM) एजेंट, पूर्व-अभियांत्रित संदर्भ दृष्टिकोणों की तुलना में प्रतिस्पर्धी वर्गीकरण सटीकता प्राप्त करते हैं, जबकि संदर्भ-विंडो (context-window) की सीमाओं के विरुद्ध बेहतर मजबूती और आर्टिफैक्ट के आकार से स्वतंत्र रूप से स्केलिंग की क्षमता भी प्रदान करते हैं।

मूल लेखक: Johannes Härtel

प्रकाशित 2026-05-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Johannes Härtel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह समझने की कोशिश कर रहे हैं कि एक विशाल सॉफ़्टवेयर प्रोजेक्ट में कोड का एक विशिष्ट हिस्सा वास्तव में क्या करता है। क्या यह किसी बग को ठीक कर रहा है? क्या यह सिर्फ एक टाइपो (लिखने की गलती) है? क्या यह एक सुरक्षा जोखिम है?

अतीत में, इंसानों को यह जासूसी वाला काम करना पड़ता था। वे कोड को पढ़ते थे, संबंधित फ़ाइलों को देखते थे, इतिहास की जाँच करते थे और एक निर्णय लेते थे। यह धीमा है, महंगा है, और कभी-कभी लोग थक जाते हैं और गलतियाँ कर देते हैं।

हाल ही में, हमने इसे करने के लिए AI (लार्ज लैंग्वेज मॉडल्स, या LLMs) का उपयोग करने की कोशिश की है। लेकिन एक पेंच है: संदर्भ ही राजा है (Context is King)।

दो जासूस: "ब्रीफकेस" बनाम "एक्सप्लोरर"

यह पेपर AI का उपयोग करके इन पहेलियों को हल करने के दो तरीकों की तुलना करता है:

1. "ब्रीफकेस" जासूस (सिंपल LLM)
एक ऐसे जासूस की कल्पना करें जिसे एक एकल, पहले से पैक किया गया ब्रीफकेस सौंपा गया है। इसके अंदर एक विशिष्ट फ़ाइल, एक विशिष्ट टिप्पणी और शायद प्रोजेक्ट का सारांश है। जासूस को बताया जाता है, "केवल वही पढ़ें जो इस ब्रीफकेस में है और मुझे बताएं कि क्या हो रहा है।"

  • समस्या: यदि ब्रीफकेस बहुत भारी है (बहुत अधिक टेक्स्ट), तो जासूस का दिमाग भर जाता है, और वह उत्तर नहीं दे पाता। यदि ब्रीफकेस में कोई महत्वपूर्ण सुराग गायब है (जैसे तीन फोल्डर ऊपर की एक फ़ाइल), तो जासूस को अनुमान लगाना पड़ता है, और अक्सर वह गलत होता है।
  • पेपर का निष्कर्ष: ये जासूस सस्ते और तेज़ हैं, लेकिन वे संघर्ष करते हैं जब "ब्रीफकेस" बहुत बड़ा हो जाता है या जब उन्हें बॉक्स के बाहर देखने की आवश्यकता होती है।

2. "एक्सप्लोरर" जासूस (एजेंटिक LLM)
अब, एक ऐसे जासूस की कल्पना करें जिसे उपकरणों के एक सेट (जैसे टॉर्च, मैग्नीफाइंग ग्लास और एक मानचित्र) के साथ वास्तविक सॉफ़्टवेयर फैक्ट्री में छोड़ दिया गया है। उन्हें एक शुरुआती बिंदु दिया जाता है (जैसे, "कोड की इस विशिष्ट पंक्ति को देखें")।

  • वे कैसे काम करते हैं: वे ब्रीफकेस का इंतज़ार नहीं करते। वे इधर-उधर घूमते हैं। वे अगले कमरे का दरवाज़ा खोलते हैं (ls), ज़रूरत के अनुसार विशिष्ट पृष्ठ पढ़ते हैं (cat), एक कीवर्ड खोजते हैं (grep), और इतिहास लॉग की जाँच करते हैं (git log)। वे केवल वही पढ़ते हैं जिसकी उन्हें पहेली सुलझाने के लिए आवश्यकता होती है।
  • पेपर का निष्कर्ष: ये जासूस थोड़े महंगे हैं (उन्हें सोचने के लिए अधिक समय और "टोकन" लगते हैं) और वे चलने के कारण धीमे चलते हैं। हालाँकि, वे कभी भी एक विशाल फैक्ट्री से अभिभूत (overwhelmed) नहीं होते क्योंकि वे केवल उन छोटे सुरागों को उठाते हैं जिनकी उन्हें आवश्यकता होती है। वे बहुत अधिक मजबूत (robust) हैं।

बड़ा प्रयोग

शोधकर्ताओं ने इन दो जासूसों का परीक्षण सॉफ़्टवेयर में पाए जाने वाले चार अलग-अलग प्रकार के "पहेलियों" पर किया:

  1. तंगल कमिट्स (Tangled Commits): क्या कोड की यह पंक्ति वास्तव में एक बग को ठीक कर रही है, या यह सिर्फ व्हाइटस्पेस की सफाई है?
  2. सुरक्षा समीक्षा (Security Reviews): क्या कोड समीक्षा में यह टिप्पणी किसी सुरक्षा छेद (security hole) के बारे में बात कर रही है?
  3. रखरखाव (Maintenance): क्या यह अपडेट एक बग को ठीक कर रहा है, एक नए सिस्टम के अनुकूल हो रहा है, या बस चीजों को सुंदर बना रहा है?
  4. प्रोजेक्ट का प्रकार: क्या यह GitHub रिपॉजिटरी एक वास्तविक सॉफ़्टवेयर प्रोजेक्ट है, या केवल एक छात्र का होमवर्क असाइनमेंट है?

उन्होंने लगभग 5,000 परीक्षण किए।

परिणाम: कौन जीता?

सटीकता (Accuracy): यह एक बराबरी का मुकाबला था।
आश्चर्यजनक रूप से, "एक्सप्लोरर" (एजेंट) उतना ही सटीक था जितना कि "ब्रीफकेस" (सिंपल LLM), भले ही एक्सप्लोरर को अपने सुराग खुद खोजने पड़े जबकि ब्रीफकेस को सुराग सौंप दिए गए थे। यह एक बड़ी बात है क्योंकि इसका मतलब है कि AI यह पता लगा सकता है कि उसे क्या खोजना है, बिना किसी इंसान द्वारा फ़ाइलों को पहले से चुनने के।

मजबूती (Robustness - असली विजेता):
"ब्रीफकेस" जासूस तब विफल होने लगे जब फ़ाइलें बहुत बड़ी थीं। उनके "ब्रीफकेस" बहुत भारी हो गए, और वे क्रैश हो गए (इसे "कॉन्टेक्स्ट ओवरफ्लो" कहा जाता है)।
"एक्सप्लोरर" जासूस कभी क्रैश नहीं हुए। वे बस चलते रहे, केवल उन छोटे हिस्सों को पढ़ते रहे जिनकी उन्हें आवश्यकता थी, चाहे सॉफ़्टवेयर प्रोजेक्ट कितना भी बड़ा क्यों न हो।

लागत (Cost):
एक्सप्लोरर्स अधिक महंगे थे (लगभग 1.2 से 3 गुना लागत), लेकिन केवल इसलिए क्योंकि उन्होंने अधिक कदम उठाए। हालाँकि, यदि प्रोजेक्ट बहुत बड़ा है, तो एक्सप्लोरर्स वास्तव में सस्ते हो जाते हैं क्योंकि ब्रीफकेस जासूस क्रैश हो जाते हैं और पूरी तरह से विफल हो जाते हैं।

"ग्राउंड ट्रुथ" का आश्चर्य

शोधकर्ताओं ने उन मामलों को भी देखा जहाँ दोनों जासूसों ने मानव विशेषज्ञों (द "ग्राउंड ट्रुथ") से असहमति जताई थी।
उन्होंने पाया कि अक्सर मानव विशेषज्ञ गलत थे या नियम भ्रमित करने वाले थे।

  • उदाहरण: कभी-कभी एक इंसान ने किसी बदलाव को "अस्पष्ट" के रूप में लेबल किया क्योंकि उनके पास पर्याप्त संदर्भ नहीं था। "एक्सप्लोरर" AI ने, पूरी फैक्ट्री में घूमकर, गायब सबूत को ढूंढ लिया और एक स्पष्ट उत्तर दिया।
  • सबक: "सही" उत्तर वह हो सकता है जो AI ने पाया, न कि वह जो इंसान ने मूल रूप से लिखा था। AI की पूरी तस्वीर देखने की क्षमता ने खुलासा किया कि मूल लेबल कभी-कभी सीमित जानकारी पर आधारित थे।

एक वाक्य में सारांश

AI एजेंटों का उपयोग करना जो स्वयं कोड रिपॉजिटरी को "खोज" सकते हैं, उतना ही स्मार्ट है जितना कि AI को एक पूर्व-पैक्ड सारांश देना, लेकिन यह बड़े कोड के मामले में बहुत अधिक विश्वसनीय है, और यह अक्सर यह प्रकट करता है कि मूल मानवीय लेबल में महत्वपूर्ण संदर्भ की कमी थी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →