VIP: Visual-guided Prompt Evolution for Efficient Dense Vision-Language Inference
تقدم هذه الورقة البحثية VIP، وهي طريقة لا تتطلب تدريباً تستفيد من إطار عمل DINO المدرك مكانياً والمعزز بالتطور الموجه بصرياً للمطالبات، للتغلب على الانحياز المكاني والغموض الدلالي في نموذج CLIP، محققةً بذلك أداءً هو الأفضل في مجال التجزئة الدلالية مفتوحة المفردات بكفاءة وقدرة عالية على التعميم.