Inducing Spatial Locality in Vision Transformers through the Training Protocol
تُثبت هذه الورقة أن تقنية تعزيز البيانات CutMix ضمن بروتوكولات التدريب الحديثة تُحدث موضعية مكانية وانتباهاً مركزاً في الطبقات الأولى من نماذج "رؤية المحولات" (Vision Transformers) التي يتم تدريبها من الصفر، دون الحاجة إلى تدريب مسبق واسع النطاق.