Retrieve and Segment: Are a Few Examples Enough to Bridge the Supervision Gap in Open-Vocabulary Segmentation?
تقترح هذه الورقة مُكيِّفًا وقتيًّا معززًا بالاسترجاع يستفيد من مجموعة دعم قليلة العينات من الصور الموضحة بالبكسل لدمج الميزات النصية والبصرية، مما يجسّر بفعالية فجوة الأداء بين التجزئة مفتوحة المفردات في حالة عدم وجود بيانات مسبقة (zero-shot) والتجزئة الخاضعة للإشراف الكامل، مع الحفاظ على القدرة على التعرف على فئات عشوائية.