When Does Context Help Machine Vision? Decomposing the Risk and Reliability of Contextual Conditioning in Vision-Language Models
本論文は、多様なアーキテクチャとデータセットにわたる視覚言語モデルにおける文脈的条件付けを体系的に分析し、ドメインレベルのプロンプティングは一貫して有益である一方で、画像ごとの完全な文脈的条件付けは高い分散と過学習のリスクを伴い、その有用性は主にモデルのスケールとベースラインの精度に依存することを明らかにしている。