AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction
يُعد AcrossVAM1.0 نموذجاً خفيفاً للفيديو المعتمد على النصوص والمساعد في الأفعال، يعمل على تحسين التنبؤ بالفيديو للروبوتات من خلال تحليل الإطارات المستقبلية إلى ديناميكيات جسيمات متمحورة حول الأشياء ومظهر كثيف، مما يثبت أن نمذجة الجسيمات الصريحة تقلل من خطأ المسار رغم القيود الحالية في الربط اللغوي والجودة الإدراكية.