Do Spoken Language Models Hear Speech as They Read Text? Bridging Structural Gaps Between Speech and Text
تحدد هذه الورقة أنه على الرغم من الأداء القوي في المهام اللاحقة، تعاني نماذج اللغة المنطوقة الحالية من ضعف المحاذاة بين التمثيلات الكلامية والنصية بسبب الاختلافات الهيكلية، وتقترح إطار عمل يفصل عدم تطابق الطول عن المحاذاة الدلالية لسد هذه الفجوة وتحسين اتباع التعليمات والتعميم.