Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs
تقترح هذه الورقة البحثية "انتباه الوسائط المتبادل" (Modality-Mutual Attention - MMA)، وهو تعديل هيكلي خالٍ من المعلمات يستبدل الانتباه السببي في النماذج اللغوية الكبيرة متعددة الوسائط لتمكين رموز الصور من الانتباه إلى رموز النصوص، مما يؤدي إلى حل مشكلة عدم الاتساق بين الرؤية واللغة وتحقيق أداء هو الأفضل حالياً عبر 12 معياراً مرجعياً.