Learning Visual Feature-Based World Models via Residual Latent Action
تقدم هذه الورقة نموذج العالم RLA، الذي يستفيد من تمثيل "الفعل الكامن المتبقي" (Residual Latent Action) المبتكر المستخلص من بقايا DINO والمُتنبأ به عبر مطابقة التدفق (flow matching) لتحقيق تنبؤ عالي الدقة وفعالية في الميزات المرئية، وتمكين تعلم الروبوتات المتقدم من مقاطع الفيديو غير المتصلة (offline) دون تفاعل مباشر أو مكافآت مصممة يدويًا.