What We are Missing in Multimodal LLM Evaluation?
यह शोध पत्र तर्क देता है कि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) के लिए वर्तमान मूल्यांकन बेंचमार्क अपर्याप्त हैं क्योंकि वे टेम्पोरल-स्पेशियल कोहेरेंस (temporal-spatial coherence), भौतिक दुनिया की समझ (physical world understanding), मल्टीमॉडल निरंतरता (multimodal consistency) और चयनात्मक ध्यान (selective attention) जैसी महत्वपूर्ण क्षमताओं का आकलन करने के बजाय अलग-थलग कार्यों पर ध्यान केंद्रित करते हैं, और यह इन कमियों को दूर करने तथा वास्तविक मल्टीमॉडल बुद्धिमत्ता को बेहतर ढंग से मापने के लिए एक संशोधित वर्गीकरण (taxonomy) प्रस्तावित करता है।