Source-Modality Monitoring in Vision-Language Models
यह शोध पत्र "स्रोत-मोडालिटी निगरानी" (source-modality monitoring)—दृष्टि-भाषा मॉडलों (vision-language models) की यह क्षमता कि वे पहचान सकें कि जानकारी पाठ (text) से उत्पन्न हुई है या छवियों (images) से—की जांच करता है, और यह पाता है कि मॉडल इस बाइंडिंग समस्या (binding problem) को हल करने के लिए वाक्यात्मक (syntactic) और अर्थगत (semantic) दोनों संकेतों पर निर्भर करते हैं, जिसमें अर्थगत संकेत तब अधिक प्रभावी हो जाते हैं जब मोडालिटीज़ अत्यधिक भिन्न होती हैं।