ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models
يعزز ProGAL-VLA نماذج الرؤية واللغة والعمل من خلال دمج رسم بياني ثلاثي الأبعاد متمحور حول الكيانات، وتخطيط الأهداف الفرعية الرمزية، وفقد التباين في محاذاة التأسيس لتحقيق وكلاء روبوتيين أقوياء وحساسين للتعليمات ومدركين للغموض يتفوقون بشكل كبير على الأساليب الحالية في التعامل مع الاضطرابات والفروق اللغوية الدقيقة.