KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs
تقدم هذه الورقة إطارين عمل بشريين-آليين لبناء معايير مرجعية للكلام باللغة المستهدفة للتغلب على قيود التقييم المتمحور حول اللغة الإنجليزية، مما أدى إلى إصدار ثلاث مجموعات بيانات كورية (KVoiceBench وKOpenAudioBench وKMMAU) تكشف عن فجوات كبيرة ونقاط ضعف تكميلية في نماذج اللغات الكلامية (SpeechLMs) الحديثة عند تقييمها في مهام الأسئلة والأجوبة المنطوقة باللغة الكورية وفهم الصوت.