When Does Context Help Machine Vision? Decomposing the Risk and Reliability of Contextual Conditioning in Vision-Language Models
本文系统地分析了不同架构和数据集下视觉语言模型中的上下文条件化现象,揭示了虽然领域级提示(domain-level prompting)始终具有益处,但全量单图上下文条件化(full per-image contextual conditioning)存在高方差和过拟合风险,且其效用主要受模型规模和基准准确率的驱动。