When Does Context Help Machine Vision? Decomposing the Risk and Reliability of Contextual Conditioning in Vision-Language Models
Este artigo analisa sistematicamente o condicionamento contextual em modelos de visão-linguagem através de diversas arquiteturas e conjuntos de dados, revelando que, embora o prompting em nível de domínio seja consistentemente benéfico, o condicionamento contextual completo por imagem carrega alta variância e riscos de sobreajuste, com sua utilidade sendo primariamente impulsionada pela escala do modelo e pela precisão basal.