Attention-guided local dynamic alignment: Boosting zero-shot classification of vision-language models
Dieses Paper schlägt Attention-guided Local Dynamic Alignment (ALDA) vor, eine trainingsfreie Methode, die die Zero-Shot-Vision-Language-Klassifizierung durch den Einsatz von aufmerksamkeitsgesteuerter adaptiver Multi-Skalen-Abtastung zur Reduzierung von Hintergrundrauschen sowie bidirektionaler iterativer Propagation auf einem Region-Beschreibung-Bipartit-Graphen zur Modellierung gegenseitiger semantischer Korrelationen verbessert und dadurch signifikante Genauigkeitssteigerungen über verschiedene Benchmarks hinweg erzielt.