Pri4R: Learning World Dynamics for Vision-Language-Action Models with Privileged 4D Representation
تُعد Pri4R طريقة بسيطة وفعالة تعزز نماذج الرؤية واللغة والعمل (Vision-Language-Action) بفهم ضمني لديناميكيات العالم من خلال تدريبها على التنبؤ بمسارات النقاط ثلاثية الأبعاد باستخدام معلومات رباعية الأبعاد متميزة، مما يحسن بشكل كبير من أداء المناولة الفيزيائية دون إضافة أي عبء إضافي عند الاستنتاج.