CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
تقترح الورقة البحثية CLIP-Joint-Detect، وهو إطار عمل غير مرتبط بكاشف محدد يعزز أداء كشف الكائنات في المجموعات المغلقة عبر بنيات متنوعة من خلال دمج الإشراف البصري اللغوي التبايني بأسلوب CLIP مع خسائر الكشف القياسية عبر التدريب المشترك النهائي من طرف إلى طرف.