Can Multimodal Large Language Models Understand OCT?
यह शोध पत्र OCT-Bench प्रस्तुत करता है, जो धारणा (perception), संज्ञान (cognition) और तर्क (reasoning) के आयामों में 10,000 से अधिक सूक्ष्म-स्तरीय प्रश्नों वाला एक व्यापक बेंचमार्क है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का व्यवस्थित रूप से मूल्यांकन करता है, और यह प्रकट करता है कि वर्तमान मॉडल—चिकित्सा-अनुकूलित और बड़े पैमाने के वेरिएंट्स सहित—नैदानिक रूप से आधारित OCT इमेज समझ करने की अपनी क्षमता में काफी सीमित हैं।