Attention-guided local dynamic alignment: Boosting zero-shot classification of vision-language models
Dit artikel stelt Attention-guided Local Dynamic Alignment (ALDA) voor, een methode die zonder training werkt en zero-shot visuele-linguïstische classificatie verbetert door gebruik te maken van aandachtgestuurde adaptieve multi-schaal bemonstering om achtergrondruis te verminderen en bidirectionele iteratieve propagatie op een regio-beschrijving bipartiete graaf om wederzijdse semantische correlaties te modelleren, waardoor significante nauwkeurigheidsverbeteringen over diverse benchmarks worden bereikt.