← नवीनतम पेपर
💬 NLP

Agent Retrieval Bench: Evaluating Repository Context Retrieval for Coding Agents

यह शोध पत्र 'एजेंट रिट्रीवल बेंच' (Agent Retrieval Bench) को प्रस्तुत करता है, जो वास्तविक वर्कफ़्लो संकेतों का उपयोग करके कोडिंग एजेंटों में कॉन्टेक्स्ट रिट्रीवल के मूल्यांकन के लिए एक व्यापक फ़ाइल-स्तरीय बेंचमार्क है, जो यह प्रकट करता है कि विविध कार्यों में कोई भी एकल रिट्रीवल विधि प्रभावी नहीं है और वर्तमान एजेंटों की आवश्यक रिपॉजिटरी फ़ाइलों की पहचान करने की क्षमता में महत्वपूर्ण अंतराल को उजागर करता है।

मूल लेखक: Bowen Qin, Yi Xie

प्रकाशित 2026-07-29
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Bowen Qin, Yi Xie

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अराजक पुस्तकालय में एक रहस्य सुलझाने की कोशिश कर रहे एक जासूस हैं। आपके पास एक सुराग है—एक फटा हुआ पन्ना, एक फुसफुसाहट, या एक अजीब सी आवाज़—लेकिन इस मामले को सुलझाने के लिए, आपको पहले शेल्फ पर सही किताब ढूँढनी होगी। कंप्यूटर विज्ञान की दुनिया में, यह "पुस्तकालय" एक सॉफ़्टवेयर प्रोजेक्ट का कोड है, और ये "जासूस" कोड लिखने और ठीक करने के लिए डिज़ाइन किए गए AI एजेंट हैं। लंबे समय से, हम इन AI जासूसों को मुख्य रूप से इस आधार पर परखते रहे हैं कि क्या वे अंततः एक सटीक समाधान लिख पाते हैं। लेकिन यह शोध पत्र तर्क देता है कि किसी सुधार (fix) के बारे में सोचने से पहले, एक AI को कोड के भीतर "वल्डो कहाँ है?" (Where's Waldo?) का खेल सफलतापूर्वक खेलना होगा। यदि वह गलत किताब उठा लेता है, तो वह अपनी बुद्धिमत्ता के बावजूद कभी भी रहस्य को नहीं सुलझा पाएगा। यह नया अध्ययन, जिसे एजेंट रिट्रीवल बेंच (Agent Retrieval Bench) कहा गया है, विशेष रूप से यह देखने के लिए बनाया गया एक विशाल परीक्षण है कि टाइप करना शुरू करने से पहले ये AI जासूस एक रिपॉजिटरी में सही फ़ाइलों को खोजने में कितने कुशल हैं।

शोधकर्ताओं ने 25 अलग-अलग सॉफ़्टवेयर प्रोजेक्ट्स से लिए गए 427 वास्तविक दुनिया के कोडिंग परिदृश्यों का उपयोग करके एक कठोर परीक्षण क्षेत्र बनाया। उन्होंने पाँच अलग-अलग प्रकार के "सुराग" बनाए ताकि यह देखा जा सके कि AI कैसे प्रतिक्रिया देता है। कभी सुराग एक नए फीचर का विवरण होता है (AI से संबंधित टेस्ट खोजने के लिए कहना); कभी यह किसी विशिष्ट फ़ाइल पर एक रिव्यूअर की टिप्पणी होती है (AI को उन अन्य फ़ाइलों को खोजने के लिए कहना जिन्हें टिप्पणी समझने के लिए आवश्यक है); कभी यह एक क्रैश रिपोर्ट होती है (AI को मूल कारण वाले कोड को खोजने के लिए कहना); और कभी यह एक छोटा सा बदलाव होता है (AI को उन सभी अन्य फ़ाइलों को खोजने के लिए कहना जो इसके कारण टूट सकती हैं)। यहाँ तक कि सुरागों का एक पेचीदा समूह भी था जहाँ उत्तर पुस्तकालय में मौजूद ही नहीं था, यह परीक्षण करने के लिए कि क्या AI जानता था कि कब कहना है, "मैं इसे यहाँ नहीं ढूँढ सकता।"

परिणाम "बड़ा हमेशा बेहतर होता है" या "एक प्रकार का खोज उपकरण हर बार जीतता है" के विचार के लिए एक झटका थे। अध्ययन में पाया गया कि कोई भी एकल विधि निर्विवाद चैंपियन नहीं है। यह सुई को घास के ढेर में ढूँढने जैसा है: कभी-कभी एक चुंबक (सिमेंटिक सर्च, जो अर्थ खोजता है) सबसे अच्छा काम करता है; अन्य समय में, पुस्तकालय के लेआउट का एक नक्शा (स्ट्रक्चरल सर्च, जो देखता है कि फ़ाइलें आपस में कैसे जुड़ी हैं) ही सुई को खोजने का एकमात्र तरीका होता है। वास्तव में, "सर्वश्रेष्ठ" उपकरण सुराग के विशिष्ट प्रकार और AI के पास उपलब्ध "पढ़ने की जगह" (कॉन्टेक्स्ट बजट) के आधार पर बदल जाता था।

सबसे दिलचस्प खोजों में से एक यह थी कि भले ही AI जासूसों को अधिक मदद मांगने और इंटरैक्टिव रूप से इधर-उधर देखने की अनुमति दी जाए, फिर भी वे लगभग 27% से 35% मामलों में सही फ़ाइलों को चूक जाते हैं। यह स्पष्ट है कि केवल इसलिए कि एक AI खोज कर सकता है, इसका मतलब यह नहीं है कि वह जानता है कि कहाँ खोजना है। अध्ययन ने एक आशावादी विचार को भी खारिज कर दिया: सरल कॉन्फिडेंस स्कोर (confidence scores) AI को यह बताने के लिए पर्याप्त नहीं हैं कि कब खोजना बंद करना है और यह स्वीकार करना है कि, "यह इस पुस्तकालय में नहीं है।"

अंततः, यह शोध पत्र सुझाव देता है कि एक वास्तव में सहायक कोडिंग AI बनाने का अर्थ एक जादुई सर्च इंजन खोजना नहीं है। इसके बजाय, यह विभिन्न रणनीतियों को मिलाने के बारे में है—जैसे कि एक सिमेंटिक मैप और एक स्ट्रक्चरल मैप दोनों का एक साथ उपयोग करना—यह सुनिश्चित करने के लिए कि AI कोड को ठीक करने का प्रयास करने से पहले सही संदर्भ (context) ढूँढ ले। लेखक सावधानी बरतते हुए कहते हैं कि हालांकि यह AI को सही फ़ाइलें खोजने में मदद करता है, लेकिन यह गारंटी नहीं देता कि AI एक आदर्श समाधान लिखेगा, लेकिन सही फ़ाइलें ढूँढे बिना, समाधान असंभव है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →