When Does Context Help Machine Vision? Decomposing the Risk and Reliability of Contextual Conditioning in Vision-Language Models
Questo articolo analizza sistematicamente il condizionamento contestuale nei modelli visione-linguaggio attraverso diverse architetture e dataset, rivelando che mentre il prompting a livello di dominio è costantemente vantaggioso, il condizionamento contestuale completo per singola immagine comporta un'elevata varianza e rischi di overfitting, con la sua utilità guidata principalmente dalla scala del modello e dall'accuratezza di base.