LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
تقدم الورقة البحثية إطار عمل LaViT، الذي يسد فجوة الإدراك في التقطير متعدد الوسائط من خلال محاذاة الأفكار البصرية الكامنة ومسارات الانتباه بدلاً من التضمينات الثابتة، مما يمكن النماذج المدمجة من تحقيق أداء متفوق في الاستدلال البصري يضاهي الأنظمة المملوكة الأكبر حجماً.