SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks
SWE-bench जैसे मौजूदा बेंचमार्क में गंभीर डेटा संदूषण (data contamination) और अपर्याप्त टेस्ट केसों को संबोधित करने के लिए, यह शोध पत्र SWE-MERA पेश करता है, जो एक गतिशील और निरंतर अपडेट होने वाला बेंचमार्क है जो वास्तविक दुनिया के GitHub इश्यूज़ को क्यूरेट करने के लिए एक स्वचालित पाइपलाइन का लाभ उठाता है, जिससे सॉफ्टवेयर इंजीनियरिंग कार्यों पर लार्ज लैंग्वेज मॉडल्स के लिए एक कठोर और विश्वसनीय मूल्यांकन ढांचा प्रदान किया जा सके।