Delulu: A Verified Multi-Lingual Benchmark for Code Hallucination Detection in Fill-in-the-Middle Tasks
यह शोधपत्र Delulu को प्रस्तुत करता है, जो 1,951 प्रतिकूल रूप से क्यूरेट किए गए नमूनों से बना एक कठोरता से सत्यापित बहुभाषी बेंचमार्क है, जो फिल-इन-द-मिडल (Fill-in-the-Middle) कार्यों में विश्वसनीय किंतु त्रुटिपूर्ण मतिभ्रम (hallucinations) उत्पन्न करने के प्रति अत्याधुनिक कोड जनरेशन मॉडलों की निरंतर भेद्यता को उजागर करता है।