FEM-Bench: A Structured Scientific Reasoning Benchmark for Evaluating Code-Generating LLMs
यह शोध पत्र FEM-Bench प्रस्तुत करता है, जो कम्प्यूटेशनल मैकेनिक्स कार्यों पर आधारित एक संरचित बेंचमार्क है जिसे वैज्ञानिक रूप से वैध फाइनाइट एलीमेंट मेथड कोड उत्पन्न करने की बड़े भाषा मॉडलों (LLMs) की क्षमता का कड़ाई से मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि अत्याधुनिक मॉडल भी इन गैर-तुच्छ समस्याओं को लगातार हल करने में संघर्ष करते हैं।