2D Rotary Position Embedding for Scene Text Recognition with Transformers
تقدم هذه الورقة \method{}، وهو تكييف خالٍ من المعلمات لتمثيل الموضع الدوراني ثنائي الأبعاد (2D Rotary Position Embedding) للتعرف على النصوص في المشاهد، والذي يعالج أوجه القصور في الطرق الحالية من خلال تخصيص الأبعاد بشكل متباين لتتناسب مع نسب أبعاد النص وتوسيع الاقتران الدوراني ليشمل الانتباه المتقاطع بين المشفر وفك التشفير (encoder-decoder cross-attention)، مما يؤدي إلى تحسين الدقة بشكل كبير في تخطيطات النصوص المنحنية، والمائلة، والمشوهة من منظور المنظور.