Attention-guided local dynamic alignment: Boosting zero-shot classification of vision-language models
本論文は、アテンション駆動のアダプティブなマルチスケールサンプリングを用いて背景ノイズを低減し、領域・記述二部グラフ上での双方向反復伝播によって相互の意味的相関をモデル化することにより、ゼロショットの視覚言語分類を強化する、学習不要の手法であるAttention-guided Local Dynamic Alignment(ALDA)を提案し、多様なベンチマークにおいて大幅な精度向上を実現する。