When Does Context Help Machine Vision? Decomposing the Risk and Reliability of Contextual Conditioning in Vision-Language Models
Cet article analyse systématiquement le conditionnement contextuel dans les modèles vision-langage à travers diverses architectures et jeux de données, révélant que si le prompting au niveau du domaine est systématiquement bénéfique, le conditionnement contextuel complet par image présente une variance élevée et des risques de surapprentissage, son utilité étant principalement pilotée par l'échelle du modèle et la précision de base.