Common Objects Out of Context (COOCo): Investigating Multimodal Context and Semantic Scene Violations in Referential Communication
यह शोध पत्र कॉमन ऑब्जेक्ट्स आउट-ऑफ-कॉन्टेक्स्ट (COOCo) डेटासेट प्रस्तुत करता है ताकि यह जांचा जा सके कि विजन-लैंग्वेज मॉडल्स (VLMs) संदर्भ उत्पन्न करते समय स्थानीय ऑब्जेक्ट फीचर्स और वैश्विक दृश्य संदर्भ के बीच कैसे संतुलन बनाते हैं, जो यह प्रकट करता है कि मॉडल सिमेंटिक कॉन्ग्रुएंसी और शोर के स्तर के आधार पर संदर्भ का अनुकूल रूप से उपयोग करते हैं।