ViTaPEs: Visuotactile Position Encodings for Cross-Modal Alignment in Multimodal Transformers
تقدم الورقة البحثية ViTaPEs، وهي بنية قائمة على المحولات (transformer) تستخدم استراتيجية ترميز موضعي مبتكرة ثنائية المرحلة لدمج الوسائط البصرية واللمسية بفعالية، محققةً أداءً هو الأفضل في فئتها وقدرة على التعميم الصفري عبر مهام التعرف والإمساك الروبوتي المتنوعة دون الاعتماد على نماذج الرؤية واللغة سابقة التدريب.