Frozen Vision Transformers for Dense Prediction on Small Datasets: A Case Study in Arrow Localization
تثبت هذه الورقة أن نظاماً يجمع بين التصحيح القائم على اللون، ونموذج "Vision Transformer" (DINOv3) ذاتي الإشراف والمجمد، ورؤوس كشف خفيفة الوزن، يمكنه تحقيق تحديد دقيق لمواقع السهام وتسجيل النقاط على أهداف الرماية الداخلية باستخدام 48 صورة موسومة فقط، مما يثبت أن النماذج التأسيسية المجمدة مع حد أدنى من التكيف فعالة للتنبؤ الكثيف في ظل ظروف البيانات المحدودة.