Adapting Text LLMs to Speech via Multimodal Depth Up-Scaling
تقترح الورقة البحثية "رفع دقة العمق متعدد الوسائط" (Multimodal Depth Upscaling)، وهي طريقة تقوم بإدراج وتدريب طبقات محولة جديدة (مثل E-Branchformer) داخل نموذج لغوي كبير (LLM) نصي مجمد لتكييفه مع مهام الكلام، مما يحقق أداءً تنافسياً في التعرف التلقائي على الكلام (ASR) مع الحفاظ بشكل كبير على القدرات النصية الأصلية وتقليل المعلمات القابلة للتدريب مقارنة بالضبط الدقيق الكامل و(LoRA).