Cross-View Action Consistency for Camera-Robust Vision-Language-Action Policies
تقترح هذه الورقة طريقة لاتساق الأفعال عبر الرؤى المتعددة تعمل على تنظيم سياسات الرؤية-اللغة-الأفعال القائمة على التدفق لتحقيق المتانة ضد تغيرات زوايا رؤية الكاميرا والمشهد باستخدام الصور اللونية (RGB) والبيانات الحسية الخاصة فقط، مما يحسن الأداء بشكل كبير في مهام الروبوتات المحاكاتية والواقعية دون الحاجة إلى تسميات الكاميرا أو مدخلات العمق.