Attention-guided local dynamic alignment: Boosting zero-shot classification of vision-language models
Questo articolo propone l'Attention-guided Local Dynamic Alignment (ALDA), un metodo privo di addestramento che migliora la classificazione visione-linguaggio zero-shot impiegando un campionamento multi-scala adattivo guidato dall'attenzione per ridurre il rumore di fondo e una propagazione iterativa bidirezionale su un grafo bipartito regione-descrizione per modellare le correlazioni semantiche reciproche, ottenendo così significativi miglioramenti di accuratezza attraverso diversi benchmark.