When Does Context Help Machine Vision? Decomposing the Risk and Reliability of Contextual Conditioning in Vision-Language Models
Este artículo analiza sistemáticamente el condicionamiento contextual en los modelos de visión y lenguaje a través de diversas arquitecturas y conjuntos de datos, revelando que, si bien el prompting a nivel de dominio es consistentemente beneficioso, el condicionamiento contextual completo por imagen conlleva altos riesgos de varianza y sobreajuste, siendo su utilidad impulsada primordialmente por la escala del modelo y la precisión base.