Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing
تقترح الورقة البحثية RVEDiT، وهو إطار عمل جديد لنموذج "Diffusion Transformer" لتحرير الفيديو القائم على التعليمات، والذي يعزز الأداء من خلال تنفيذ تكييف الرموز الموجه بالتجزئة (granularity-routed token conditioning) للمعالجة من الخشن إلى الناعم، ومحاذاة الانتباه المرتكز على المرجع (reference-anchored attention alignment) لضبط الاستدلال الضمني دون زيادة تكاليف الاستدلال.