CanViT: Toward Active-Vision Foundation Models
تقدم الورقة البحثية CanViT، وهو أول نموذج رؤية نشطة تأسيسي (AVFM) مستقل عن المهام والسياسات، والذي يستخدم بنية مبتكرة من "التمثيل الشبكي الشبكي إلى التمثيل المكاني" (retinotopic-to-spatiotopic) وتدريباً مسبقاً خالياً من الملصقات لتحقيق أداء رائد في التجزئة الدلالية وتصنيف الصور بتكاليف حوسبة أقل بكثير من نماذج الرؤية النشطة الحالية.