Target-Aware Video Diffusion Models
تقدم هذه الورقة نموذج انتشار فيديو مدرك للهدف يقوم بتوليد فيديوهات لممثلين يتفاعلون مع أشياء محددة عبر أقنعة التجزئة والمطالبات النصية، وذلك باستخدام رمز متخصص وآلية انتباه تقاطعي مضبوطة بدقة لتمكين التخطيط الدقيق للتفاعل بين الإنسان والشيء لتطبيقات مثل تخليق الحركة ثلاثية الأبعاد وإنشاء الفيديو طويل الأمد.