M-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering
تقدم هذه الورقة البحثية M-VQA، وهو معيار مرجعي مبتكر مصمم لتقييم النماذج اللغوية الكبيرة متعددة الوسائط في الفهم الدقيق للكيانات والاستدلال المعقد متعدد الخطوات من خلال مطالبتها بتوليف المعلومات من مصادر بصرية ونصية متعددة، مما يكشف عن قيود حالية كبيرة في اكتساب المعرفة ويسلط الضوء على تفوق طرق الاسترجاع المدركة للاستدلال.