FEM-Bench: A Structured Scientific Reasoning Benchmark for Evaluating Code-Generating LLMs
تقدم هذه الورقة FEM-Bench، وهو معيار مرجعي مهيكل يعتمد على مهام الميكانيكا الحسابية صُمم لتقييم قدرة النماذج اللغوية الكبيرة بدقة على توليد كود طريقة العناصر المحدودة صالح علمياً، مما يكشف أن حتى النماذج الأكثر تطوراً تواجه صعوبة في حل هذه المشكلات غير البديهية باستمرار.