Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting
تقدم هذه الورقة إطار عمل للتجسيد متعدد الوسائط يدمج تقنية "النمذجة الغاوسية ثلاثية الأبعاد الدلالية" (Semantic 3D Gaussian Splatting) النشطة متعددة المشاهد مع سياسة رؤية-لغة-حركة قائمة على الانتشار، وذلك لتحسين معدلات نجاح المناولة المتنقلة ذات المفردات المفتوحة بشكل كبير في البيئات المنزلية المزدحمة والمحتجبة والمتغيرة من حيث زوايا الرؤية مقارنة بالنهج الحالية المتطورة.