INCARBench: A Benchmark for Scientific Configuration in VASP INCAR by Large Language Models
यह शोध पत्र INCARBench प्रस्तुत करता है, जो VASP सिमुलेशन के लिए वैज्ञानिक कॉन्फ़िगरेशन उत्पन्न करने और उन्हें सुधारने पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए एक बेंचमार्क है, जो यह दर्शाता है कि जबकि फ्रंटियर मॉडल्स उच्च सिमेंटिक सटीकता प्राप्त करते हैं, वे जटिल पदार्थ विज्ञान (मटेरियल्स साइंस) परिदृश्यों में भौतिक रूप से वैध सेटिंग्स के लिए आवश्यक कार्य-महत्वपूर्ण शुद्धता (टास्क-क्रिटिकल करेक्टनेस) के लिए अभी भी संघर्ष करते हैं।