SWE-QA: Can Language Models Answer Repository-level Code Questions?
यह शोध पत्र SWE-QA को प्रस्तुत करता है, जो 77,100 GitHub इश्यूज से व्युत्पन्न एक रिपॉजिटरी-स्तरीय कोड प्रश्न उत्तर बेंचमार्क है, जो 576 प्रश्नों के एक क्यूरेटेड सेट और एक संबद्ध एजेंटिक फ्रेमवर्क के माध्यम से जटिल, बहु-फ़ाइल तर्क कार्यों पर LLMs का मूल्यांकन करके मौजूदा स्निपेट-आधारित डेटासेट्स की सीमाओं को संबोधित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप यह समझने की कोशिश कर रहे हैं कि एक विशाल, 10-मंजिला पुस्तकालय कैसे काम करता है।
समस्या: "स्निपेट" (Snippet) का जाल
अब तक, AI के "कोड मस्तिष्क" के लिए अधिकांश परीक्षण एक किताब के एकल, अलग पन्ने को दिखाने और पूछने जैसे थे, "इस वाक्य का क्या अर्थ है?" जबकि AI इसे सही ढंग से समझ सकता है, वास्तविक दुनिया का सॉफ़्टवेयर एकल पन्ने जैसा नहीं होता। यह पूरी लाइब्रेरी की तरह है। "सूरज ढलने पर सामने का दरवाज़ा अपने आप क्यों लॉक हो जाता है?" जैसे प्रश्न का उत्तर देने के लिए, आपको बेसमेंट में जाना होगा, अटारी में वायरिंग की जाँच करनी होगी, और मैनेजर के कार्यालय में ब्लूप्रिंट पढ़ना होगा। आपको कई अलग-अलग फाइलों में बिंदुओं (dots) को जोड़ना होगा।
पिछले AI परीक्षण विफल रहे क्योंकि उन्होंने AI को यह "लाइब्रेरी वॉक" करने के लिए मजबूर नहीं किया। उन्होंने केवल यह परीक्षण किया कि क्या AI एक एकल पन्ना पढ़ सकता है।
समाधान: SWE-QA (लाइब्रेरी टूर)
इस शोध पत्र के लेखकों ने एक नया परीक्षण बनाया जिसे SWE-QA कहा जाता है। इसे AI के लिए एक कठोर "लाइब्रेरी टूर" परीक्षा के रूप में समझें।
- स्रोत सामग्री (The Source Material): उन्होंने केवल मनगढ़ंत प्रश्न नहीं बनाए। वे 15 वास्तविक, लोकप्रिय सॉफ़्टवेयर "लाइब्रेरीज़" (GitHub रिपॉजिटरी) में गए और उन 77,000 वास्तविक प्रश्नों को देखा जो मानव डेवलपर्स ने वास्तव में एक-दूसरे से पूछे थे।
- वर्गीकरण (The Taxonomy - द मैप): उन्होंने इन प्रश्नों को एक मानचित्र में व्यवस्थित किया। उन्होंने पूछा: क्या हम पूछ रहे हैं कि यह क्या है? यह क्यों इस तरह बनाया गया था? यह कोड कहाँ छिपा है? या यह कैसे काम करता है?
- निर्माण (The Construction): उन्होंने 720 उच्च-गुणवत्ता वाले प्रश्न बनाए। इनका उत्तर देने के लिए, एक AI केवल अनुमान नहीं लगा सकता। उसे:
- सही फ़ाइल ढूँढनी होगी (जैसे सही शेल्फ ढूँढना)।
- उस फ़ाइल में कोड को पढ़ना होगा।
- यह देखने के लिए कि वे कैसे जुड़ते हैं, एक दूसरी फ़ाइल पर जाना होगा (मल्टी-हॉप रीजनिंग)।
- एक उत्तर तैयार करना होगा जो पूरे सिस्टम की व्याख्या करे।
प्रयोग: AI लाइब्रेरियन का परीक्षण
शोधकर्ताओं ने छह सबसे स्मार्ट उपलब्ध AI मॉडल (जैसे GPT-5.1, Gemini, और अन्य) को यह "लाइब्रेरी टूर" परीक्षा दी। उन्होंने उन्हें तीन अलग-अलग तरीकों से परखा:
- "याद करने वाला" (The "Memorizer" - डायरेक्ट प्रॉम्प्टिंग): उन्होंने AI को लाइब्रेरी की किताबें दिए बिना सीधे प्रश्न पूछ लिया।
- परिणाम: AI बुरी तरह विफल रहा। यह किसी ऐसे व्यक्ति से लाइब्रेरी का वर्णन करने के लिए पूछने जैसा था जिसने कभी उस लाइब्रेरी का दौरा ही नहीं किया।
- "इंडेक्स खोजने वाला" (The "Index Finder" - RAG): उन्होंने AI को उत्तर देने से पहले प्रासंगिक पन्ने खोजने के लिए एक टूल दिया।
- परिणाम: बहुत बेहतर! AI सही पन्ने ढूँढ सका, लेकिन कभी-कभी वह उनके बीच के कनेक्शन को मिस कर देता था।
- "जासूस एजेंट" (The "Detective Agent" - एजेंट फ्रेमवर्क): उन्होंने AI को एक "डिटेक्टिव किट" (OpenHands जैसे टूल्स) दिया जो उसे सोचने, खोजने, पढ़ने, फिर से खोजने और अपने आप बिंदुओं को जोड़ने की अनुमति देता है।
- परिणाम: यह विजेता रहा। वह AI जो एक जासूस की तरह व्यवहार कर रहा था, सक्रिय रूप से कोडबेस की खोज कर रहा था, उसे उच्चतम स्कोर (100 में से लगभग 70) मिला।
निष्कर्ष: AI क्या कर सकता है और क्या नहीं
- अच्छी खबर: AI इस बारे में समझाने में बहुत अच्छा हो रहा है कि चीजें क्यों इस तरह बनाई गई हैं (डिज़ाइन राशनल) या कोई विशिष्ट फीचर कैसे काम करता है, खासकर यदि स्पष्टीकरण कोड कमेंट्स में स्पष्ट रूप से लिखा गया हो।
- बुरी खबर: AI अभी भी "कहाँ" वाले प्रश्नों (10 फाइलों में एक विशिष्ट वेरिएबल कहाँ परिभाषित है, यह ढूँढना) और जटिल "क्या" वाले प्रश्नों के साथ संघर्ष करता है जिनमें निर्भरताओं (dependencies) की एक लंबी श्रृंखला को ट्रैक करने की आवश्यकता होती है। यह ऐसा है जैसे AI लाइब्रेरी की कहानी तो समझ सकता है, लेकिन वह पिछले दरवाजे की विशिष्ट चाबी खोजने के प्रयास में भटक जाता है।
- लागत: "डिटेक्टिव" दृष्टिकोण सबसे अच्छा काम करता है, लेकिन यह महंगा है। यह अनुमान लगाने की तुलना में 100 गुना अधिक कंप्यूटिंग पावर (टोकन) का उपयोग करता है। यह एक त्वरित नज़र और एक पूर्ण फोरेंसिक जांच के बीच का अंतर है।
निष्कर्ष
यह शोध पत्र एक नया, कठिन और अधिक यथार्थवादी परीक्षण पेश करता है। यह दिखाता है कि हालांकि AI सॉफ़्टवेयर को समझने के लिए आशाजनक है, फिर भी इसे वास्तविक दुनिया के परस्पर जुड़े कोड के माध्यम से नेविगेट करने के लिए मदद की आवश्यकता है। सबसे अच्छे परिणाम उन AI एजेंटों से आते हैं जो केवल एक स्निपेट पढ़ने के बजाय कोड फाइलों के माध्यम से सक्रिय रूप से "चल" सकते हैं।
संक्षेप में: हमने एक कठिन परीक्षण बनाया है यह देखने के लिए कि क्या AI वास्तव में एक पूरे सॉफ़्टवेयर प्रोजेक्ट को समझ सकता है, न कि केवल उसके एक छोटे से हिस्से को। AI बेहतर हो रहा है, लेकिन कठिन पहेलियों को सुलझाने के लिए उसे अभी भी एक अच्छे मानचित्र और एक जासूसी मानसिकता की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।