Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Linguistically Grounded Dimensions
تقدم هذه الورقة معياراً للتقييم الميتافيزيقي القائم على الأبعاد والمستند إلى الأسس اللغوية لأنظمة تحويل النص إلى كلام، لتكشف أن المقيمات الآلية الحالية، بما في ذلك متنبئات متوسط درجة التفضيل (MOS) وقضاة النماذج اللغوية الكبيرة الصوتية (Audio-LLM)، تفشل في رصد كامل نطاق أبعاد الإدراك الصوتي بما يتجاوز الجودة الصوتية الأساسية بشكل موثوق.