Place-it-R1: Unlocking Environment-aware Reasoning Potential of MLLM for Video Object Insertion
إن Place-it-R1 هو إطار عمل متكامل يستفيد من النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) مع تسلسل التفكير (Chain-of-Thought) لتنسيق انتشار الفيديو عبر نموذج "فكر ثم ضع" (Think-then-Place)، مما يضمن إدراج كائنات الفيديو بشكل متسق فيزيائياً ومدرك للبيئة من خلال التحسين المتكرر والموازنة بين واقعية المظهر ودقة التفاصيل التي يمكن للمستخدم التحكم بها.