MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation
تقدم هذه الورقة البحثية نموذج MLA، وهو نموذج لغوي-حركي متعدد الحواس يعزز التلاعب الروبوتي في البيئات المعقدة الغنية بالتلامس عبر إعادة توظيف النماذج اللغوية الكبيرة من أجل المحاذاة متعددة الوسائط الخالية من المشفرات وتوظيف استراتيجية توليد متعددة الحواس مستقبلية لتحسين نمذجة العالم الفيزيائي، مما يؤدي إلى مكاسب كبيرة في الأداء مقارنة بطرق الفعل-اللغة-الرؤية الحديثة.