Attention-guided local dynamic alignment: Boosting zero-shot classification of vision-language models
Cet article propose l'Attention-guided Local Dynamic Alignment (ALDA), une méthode sans entraînement qui améliore la classification vision-langage en zéro étape en employant un échantillonnage multi-échelle adaptatif piloté par l'attention pour réduire le bruit de fond et une propagation bidirectionnelle itérative sur un graphe bipartite région-description pour modéliser les corrélations sémantiques mutuelles, atteignant ainsi des améliorations de précision significatives à travers divers benchmarks.