PACT-WAM: Predicting Actions and Visual Foresight with Compact Temporal Encoding for Robot Manipulation
يُعد PACT-WAM نموذجاً مدمجاً للعمل في العالم يتنبأ بكفاءة بمسارات حركة مكونة من 16 خطوة وتوقعات بصرية متعددة المشاهد باستخدام الترميز الزمني الهرمي وأخذ عينات التدفق الشرطي، محققاً معدلات نجاح عالية في مهام التلاعب الروبوتي مع تمكين مراجعة المقترحات القائمة على الرؤية واللغة لتعزيز الأداء بشكل أكبر.