DoubleHelix: Structured Cross-Modal Fusion for Audio-Visual Speech Recognition with LLMs
تقدم الورقة البحثية DoubleHelix، وهو إطار عمل لدمج الوسائط المتعددة مهيكل يعيد صياغة التعرف على الكلام السمعي البصري كعملية تفاعل متبادل بين الوسائط بشكل تكراري مع تعزيز تكيفي مدرك للتدهور، محققاً أداءً هو الأفضل في فئته وتحسناً في المتانة على مجموعة بيانات LRS3.