AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention
تقدم الورقة البحثية AVA-VLA، وهو إطار عمل يعزز نماذج الرؤية واللغة والعمل (Vision-Language-Action) للتحكم الروبوتي من خلال إعادة صياغة تعلم السياسات كعملية ماركوف لاتخاذ القرار تحت حالة الملاحظة الجزئية (Partially Observable Markov Decision Process) وتوظيف الانتباه البصري النشط للتركيز ديناميكياً على المناطق البصرية ذات الصلة بناءً على تاريخ المهمة، محققاً أداءً هو الأفضل في فئته (state-of-the-art) في الاختبارات المعيارية والمهام الواقعية.