Can MLLMs "Read" What is Missing?
यह शोध पत्र MMTR-Bench प्रस्तुत करता है, जो एक नवीन बेंचमार्क है जो स्पष्ट प्रॉम्प्ट के बिना सीधे दृश्य संदर्भ से मास्क किए गए टेक्स्ट को पुनर्गठित करने की मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की अंतर्निहित क्षमता का मूल्यांकन करता है, जिससे उनके लेआउट समझ, विजुअल ग्राउंडिंग और ज्ञान एकीकरण क्षमताओं को अलग करके और उनका आकलन करके देखा जा सकता है।