I Came, I Saw, I Explained: Benchmarking Multimodal LLMs on Figurative Meaning in Memes
यह शोध पत्र इंटरनेट मीम्स में लाक्षणिक अर्थों का पता लगाने और उन्हें समझाने की उनकी क्षमता पर आठ अत्याधुनिक मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का बेंचमार्किंग करता है, जिससे यह पता चलता है कि हालांकि मॉडल ऐसे अर्थों की पहचान कर सकते हैं, वे लाक्षणिक सामग्री मौजूद होने का अनुमान लगाने की ओर एक मजबूत पूर्वाग्रह प्रदर्शित करते हैं और अक्सर उनके पूर्वानुमान सही होने पर भी निष्ठापूर्ण स्पष्टीकरण प्रदान करने में विफल रहते हैं।