When Does Context Help Machine Vision? Decomposing the Risk and Reliability of Contextual Conditioning in Vision-Language Models
Dit artikel analyseert systematisch contextuele conditionering in vision-language-modellen over diverse architecturen en datasets heen, waarbij wordt onthuld dat hoewel prompting op domeinniveau consistent voordelig is, volledige per-afbeelding contextuele conditionering een hoge variantie en risico's op overfitting met zich meebrengt, waarbij de nuttigheid er primair door worden gedreven door model schaal en baseline nauwkeurigheid.