Caption First, VQA Second: Knowledge Density, Not Task Format, Drives Multimodal Scaling
تجادل هذه الورقة بأن العائق الأساسي في توسيع نطاق النماذج اللغوية الكبيرة متعددة الوسائط ليس تنوع تنسيق المهام، بل هو كثافة المعرفة في بيانات التدريب، حيث تُثبت أن إثراء التعليقات التوضيحية للصور بمعرفة مهيكلة يحقق تحسينات أكثر اتساقاً في الأداء من إضافة الإشراف الخاص بالمهام مثل الإجابة على الأسئلة البصرية.