Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios with Synthetic Visual Data
تقترح هذه الورقة إطار عمل بصفر من الموارد السمعية البصرية للتعرف على الكلام السمعي البصري، والذي يقوم بتوليد فيديوهات لرؤوس متحدثة اصطناعية عبر مطابقة حركة الشفاه لصور وجه ثابتة مع صوت حقيقي، مما يُمكّن بنجاح من تدريب نماذج عالية الأداء للغات ذات الموارد المحدودة مثل الكتالونية دون الحاجة إلى مجموعات بيانات فيديو مصنفة.