TLA-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA+ Specification Generation
يقدم TLA-Bench معياراً اختبارياً قائماً على التنفيذ يتضمن 403 مواصفات تم التحقق منها برمجياً، وهو ما يكشف عن "غلاف صحة" واسع عند تقييم كود TLA الذي تولده النماذج اللغوية الكبيرة، مما يثبت أن النماذج الحالية تنتج مواصفات صالحة من الناحية التركيبية ولكنها غير صحيحة من الناحية الدلالية بشكل أكثر تكراراً مما تنتج مواصفات صحيحة حقاً.