← नवीनतम पेपर
🤖 AI

Beyond Code Snippets: Benchmarking LLMs on Repository-Level Question Answering

यह शोध पत्र StackRepoQA प्रस्तुत करता है, जो 134 जावा प्रोजेक्ट्स के 1,318 वास्तविक डेवलपर प्रश्नों से प्राप्त पहला रिपॉजिटरी-स्तरीय प्रश्न उत्तर डेटासेट है, और इसका उपयोग यह प्रदर्शित करने के लिए करता है कि जबकि रिट्रीवल-ऑगमेंटेड विधियाँ LLM के प्रदर्शन में सुधार करती हैं, वर्तमान मॉडल अभी भी वास्तविक रिपॉजिटरी-स्केल समझ के लिए संघर्ष करते हैं, और अक्सर वास्तविक तर्क के बजाय याद किए गए Stack Overflow उत्तरों पर निर्भर रहते हैं।

मूल लेखक: Yoseph Berhanu Alebachew, Hunter Leary, Swanand Vaishampayan, Chris Brown

प्रकाशित 2026-03-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yoseph Berhanu Alebachew, Hunter Leary, Swanand Vaishampayan, Chris Brown

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, 100 साल पुरानी लाइब्रेरी को ठीक करने की कोशिश कर रहे हैं। आपको केवल एक किताब पढ़ना जानने की ज़रूरत नहीं है; आपको यह समझने की ज़रूरत है कि इतिहास अनुभाग की 'बुक A', भूगोल अनुभाग के एक मानचित्र से कैसे जुड़ती है, जो फिर जीवनी विंग की एक डायरी से जुड़ती है।

यह रिपॉजिटरी-लेवल क्वेश्चन-आन्सरिंग (Repository-Level Question Answering) की चुनौती है। यह इस बारे में है कि कंप्यूटर को एक पूरे सॉफ़्टवेयर प्रोजेक्ट (एक "रिपॉजिटरी") को समझने के लिए कैसे कहा जाए, न कि केवल कोड के एक छोटे से टुकड़े को।

यहाँ सरल उपमाओं (analogies) का उपयोग करके पेपर "बियॉन्ड कोड स्निपेट्स" (Beyond Code Snippets) का विवरण दिया गया है।

1. समस्या: "सिंगल-पेज" का जाल

वर्तमान अधिकांश AI मॉडल (लार्ज लैंग्वेज मॉडल्स या LLMs) फ्लैशकार्ड पढ़ने वाले प्रतिभाशाली छात्रों की तरह हैं। वे कोड की एक एकल पंक्ति या एक छोटे पैराग्राफ के बारे में उत्तर देने में अद्भुत हैं।

लेकिन वास्तविक दुनिया का सॉफ़्टवेयर एक विशाल, परस्पर जुड़े हुए शहर की तरह है। एक ट्रैफिक लाइट को ठीक करने के लिए, आपको पावर ग्रिड, शहर नियोजन कानूनों और ट्रैफिक सेंसरों के बारे में जानने की आवश्यकता हो सकती है।

  • समस्या: जब डेवलपर्स अपने पूरे प्रोजेक्ट के बारे में AI से प्रश्न पूछते हैं, तो AI अक्सर खो जाता है क्योंकि वह केवल एक "फ्लैशकार्ड" (एक एकल फ़ाइल) देखने का अभ्यस्त है, न कि पूरे "शहर के मानचित्र" का।

2. नया टूल: स्टैक-रेपो-क्यूए (StackRepoQA)

शोधकर्ताओं ने एक नया परीक्षण मैदान बनाया जिसे StackRepoQA कहा गया।

  • उपमा: कल्पना कीजिए कि उन्होंने एक विशाल फोरम (Stack Overflow) पर डेवलपर्स द्वारा पूछे गए 1,318 वास्तविक प्रश्नों को लिया और उन्हें 134 अलग-अलग सॉफ़्टवेयर प्रोजेक्ट्स के वास्तविक "ब्लूप्रिंट्स" (GitHub रिपॉजिटरी) के साथ मिलाया।
  • महत्व: इससे पहले, हम केवल अलग-थलग पहेलियों पर AI का परीक्षण करते थे। अब, हम उनका परीक्षण उन वास्तविक, जटिल, मल्टी-फाइल प्रोजेक्ट्स पर कर रहे हैं जिनका सामना वे वास्तविक दुनिया में करेंगे।

3. प्रयोग: मेमोरी बनाम रीजनिंग (स्मृति बनाम तर्क)

शोधकर्ताओं ने दो प्रश्न पूछे:

  1. क्या AI इन सवालों के जवाब अपने आप दे सकता है?
  2. क्या AI को एक "सर्च टूल" (रिट्रीवल-ऑगमेंटेड जनरेशन या RAG) देना मदद करता है?

उन्होंने "सर्च टूल" के लिए दो मुख्य रणनीतियों का परीक्षण किया:

  • फ़ाइल-लेवल सर्च (कीवर्ड सर्च): जैसे लाइब्रेरी में किसी शब्द को कैटलॉग में टाइप करके खोजना। यह उस शब्द वाले दस्तावेज़ ढूंढ लेता है, लेकिन शायद सही अध्याय नहीं।
  • ग्राफ-आधारित सर्च (मैप सर्च): जैसे एक ऐसा लाइब्रेरियन जिसके पास लाइब्रेरी की संरचना की समझ हो। वह जानता है कि "अध्याय 3", "अध्याय 1" पर निर्भर है, भले ही शब्द अलग हों। यह ग्राफ RAG है।

4. बड़ी हैरानी: "चीट शीट" का प्रभाव

यहाँ सबसे चौंकाने वाला निष्कर्ष है: AI ज्यादातर नकल (cheating) कर रहा था।

जब AI बिना किसी मदद के सवालों के जवाब दे रहा था, तो उसने एक अच्छा स्कोर (लगभग 10 में से 6) प्राप्त किया। लेकिन जब शोधकर्ताओं ने पूछा: "हे, अपनी मेमोरी का उपयोग मत करो। केवल उन्हीं फ़ाइलों को देखो जो हमने तुम्हें अभी दी हैं," तो AI का स्कोर बहुत गिर गया

  • रूपक: यह पता चला कि AI ने इन विशिष्ट प्रश्नों को अपनी ट्रेनिंग डेटा के कारण याद कर लिया था (जैसे कोई छात्र जो अभ्यास परीक्षण के उत्तर कुंजी को रट लेता है)। वह वास्तव में कोड के माध्यम से "सोच" या "तर्क" नहीं कर रहा था; वह केवल वही दोहरा रहा था जो उसने पहले देखा था।
  • प्रमाण: जब उन्होंने उन प्रश्नों का परीक्षण किया जो AI के प्रशिक्षित होने के बाद पूछे गए थे (नए प्रश्न), तो AI का प्रदर्शन बहुत खराब हो गया। इसने साबित कर दिया कि उसकी पिछली सफलता केवल याद रखने (memorization) की थी, न कि वास्तविक समझ की।

5. समाधान: "आर्किटेक्ट" बनाम "लाइब्रेरियन"

जब उन्होंने AI को "सर्च टूल्स" पर भरोसा करने के लिए मजबूर किया:

  • कीवर्ड सर्च (File-RAG): इसने थोड़ी मदद की। यह AI को यादृच्छिक (random) पृष्ठों का एक ढेर देने जैसा था। इसने कुछ प्रासंगिक जानकारी ढूँढ ली लेकिन शोर (noise) से विचलित हो गया।
  • मैप सर्च (Graph-RAG): यह विजेता रहा। संरचना (क्लासेस कैसे जुड़ती हैं, कौन किसे कॉल करता है) को समझकर, AI का प्रदर्शन काफी बेहतर रहा।
    • उपमा: यदि आप एक इंसान से पूछते हैं, "मैं इंजन को कैसे ठीक करूँ?" और वह केवल "तेल" के बारे में एक मैनुअल पेज पढ़ता है, तो वह मुख्य बात चूक सकता है। लेकिन यदि उसके पास एक आरेख (diagram) है जो दिखाता है कि ऑयल पंप इंजन ब्लॉक से कैसे जुड़ता है, तो वह वास्तव में समस्या को हल कर सकता है। ग्राफ RAG ने वही आरेख प्रदान किया।

6. वास्तविक दुनिया के लिए सीख

पेपर एक चेतावनी और एक आशा के साथ समाप्त होता है:

  • चेतावनी: हम अभी भी AI पर हमारे सॉफ़्टवेयर प्रोजेक्ट्स को ठीक करने के लिए भरोसा नहीं कर सकते। यदि AI ने उस प्रोजेक्ट को पहले नहीं देखा है, या यदि प्रोजेक्ट निजी (इंटरनेट पर उपलब्ध नहीं) है, तो AI गलत जानकारी (hallucinate) दे सकता है या पुराना सुझाव दे सकता है। यह वर्तमान में वास्तविक तर्क के बजाय "चीट शीट्स" (याद किए गए डेटा) पर बहुत अधिक निर्भर है।
  • आशा: यदि हम AI को सही उपकरण दें—विशेष रूप से स्ट्रक्चरल मैप्स (Graph RAG) जो दिखाते हैं कि कोड के हिस्से एक साथ कैसे फिट होते हैं—तो यह जटिल प्रणालियों को समझने में बहुत बेहतर हो सकता है।

संक्षेप में:
वर्तमान AI उस छात्र की तरह है जो उत्तर रटकर अभ्यास परीक्षण में तो पास हो जाता है, लेकिन जब प्रश्न थोड़े अलग होते हैं, तो वास्तविक परीक्षा में असफल हो जाता है। AI को एक विश्वसनीय इंजीनियर बनाने के लिए, हमें इसे फ्लैशकार्ड पर टेस्ट करना बंद करना होगा और इसे ब्लूप्रिंट और मानचित्र देने होंगे ताकि यह वास्तव में सीख सके कि पूरा सिस्टम कैसे काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →