LaViSA: A Language and Vision Structural Ambiguity Benchmark
यह शोध पत्र LaViSA को प्रस्तुत करता है, जो सात श्रेणियों में अस्पष्ट वाक्यों और उनके संगत स्पष्टीकरण देने वाले चित्रों से बना एक बेंचमार्क है, ताकि संरचनात्मक अस्पष्टता को हल करने की विजन-लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन किया जा सके, जिससे यह पता चलता है कि हालांकि वर्तमान मॉडल कुछ क्षमता प्रदर्शित करते हैं, फिर भी वे विशिष्ट अस्पष्टता प्रकारों और सूक्ष्म दृश्य अंतरों के साथ संघर्ष करते हैं।