When Does Context Help Machine Vision? Decomposing the Risk and Reliability of Contextual Conditioning in Vision-Language Models
Diese Arbeit analysiert systematisch die kontextuelle Konditionierung in Vision-Language-Modellen über verschiedene Architekturen und Datensätze hinweg und zeigt auf, dass, während Domain-Level-Prompting durchweg vorteilhaft ist, eine vollständige pro-Bild erfolgende kontextuelle Konditionierung eine hohe Varianz und Overfitting-Risiken birgt, wobei ihr Nutzen primär durch die Modellgröße und die Basisgenauigkeit getrieben wird.