← أحدث الأبحاث
💻 computer science

Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation

يُعد Vorch-IR إطار عمل موحداً متعدد الوسائط مبنياً على LTX2 يتيح استبدال الهوية بمرونة لشخص واحد أو شخصين مع إمكانية تحرير الخلفية في مقاطع الفيديو طويلة المدى من خلال التكييف المشترك مع فيديوهات القيادة، والصور المرجعية، والتعليمات النصية، مع التغلب على ندرة البيانات عبر مسار توليد تلقائي وتوسيع النطاق ليشمل عمليات توليد تمتد لدقيقة كاملة عبر استراتيجية استدلال زمني متداخل.

المؤلفون الأصليون: Yaole Wang, Xiaoyu Chen, Xin Ma, Yang Ding, Gang Yue, Jingjing Chen, Lin Ma, Yaohui Wang

نُشر 2026-08-07
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yaole Wang, Xiaoyu Chen, Xin Ma, Yang Ding, Gang Yue, Jingjing Chen, Lin Ma, Yaohui Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تمسك بجهاز تحكم عن بعد للواقع، ولكن بدلاً من تغيير القناة، تريد استبدال الممثلين في فيلم مع الحفاظ على السيناريو، وزوايا الكاميرا، وحركات الرقص تماماً كما هي. هذا هو حلم "استبدال هوية الفيديو"، وهو موضوع ساخن في عالم الذكاء الاصطناعي. لفترة طويلة، كان بإمكان الذكاء الاصطناعي إنشاء فيديوهات جديدة من الصفر، لكن تعديل فيديو موجود كان يشبه محاولة تغيير وجه شخصية في فيلم واقعي دون إفساد الإضاءة أو الحركة. تطلبت المحاولات المبكرة من الذكاء الاصطناعي أن يُقدم له خريطة مفصلة لمكان وقوف الشخص، أو رسم هيكلي لوضعيته، أو قناع لتغطية وجهه. كان الأمر أشبه بطلب طباخ ليطهو وجبة بشرط أن تعطيه قائمة مكونات مقطعة مسبقاً ومخططاً للمطبخ. كانت هذه الأساليب جامدة وصعبة الاستخدام. السؤال الكبير الذي يطرحه الباحثون الآن هو: هل يمكننا تعليم الذكاء الاصطناعي فهم جملة بسيطة مثل "استبدل الراقص على اليسار بهذه الصورة" وفهمها فحسب، دون الحاجة إلى خريطة معقدة أو هيكل عظمي؟

إليك Vorch-IR، نظام ذكاء اصطناعي جديد يعمل كمحرر أفلام سحري فائق الذكاء. فكر فيه كمخرج لا يحتاج إلى مشرف سيناريو أو منسق مشاهد خطيرة. أنت تعطي Vorch-IR ثلاثة أشياء: الفيديو الأصلي (الفيديو المحرك)، وبعض الصور للأشخاص الجدد الذين تريد إدراجهم (المراجع)، وملاحظة نصية بسيطة تخبر الذكاء الاصطناعي بمن يذهب إلى أين. السحر يكمكن في أن الصور لا تحتاج إلى مطابقة وضعية أو موقع الفيديو. إذا كان الفيديو يظهر شخصاً يرقص ويداه مرفوعتان، وصورتك تظهره جالساً، فإن Vorch-IR يكتشف كيفية جعل الشخص الجالس يرقص رغم ذلك. إنه يتعامل مع الأشخاص المنفردين، واثنين يرقصان معاً، وحتى استبدال خلفيات المشاهد، كل ذلك باستخدام نموذج واحد فقط.

بنى الباحثون وراء Vorch-IR هذا النظام فوق مولد فيديو قوي يسمى LTX2. لقد علموه كيف ينظر إلى الفيديو، والصور، والتعليمات النصية جميعها في وقت واحد. بدلاً من استخدام خرائط جامدة، يستخدم الذكاء الاصطناعي "دماغاً بصرياً لغوياً" (نوع من الذكاء الاصطناعي الذي يفهم الصور والكلمات معاً) لفهم الرابط. الأمر يشبه أن يقرأ الذكاء الاصطناعي ملاحظتك، وينظر إلى الصورة، ثم يقول: "آه، أنت تريد هذا الشخص أن يأخذ مكان الشخص الذي على اليسار"، ومن ثم يستخدم "الانتباه الذاتي" الداخلي لديه لدمج الوجه الجديد على الجسم المتحرك بشكل مثالي.

أحد أكبر العقبات في هذا المجال هو البيانات. لتعليم الذكاء الاصطناعي كيفية استبدال الوجوه، تحتاج إلى آلاف الأمثلة من فيديوهات "قبل" و"بعد". وبما أن هذه الفيديوهات لا توجد في العالم الحقيقي، فقد بنى الفريق مساراً آلياً (pipeline) روبوتياً لصنعها. لقد أخذوا فيديوهات حقيقية، واستخدموا أدوات ذكاء اصطناعي أخرى لاستبدال الوجوه في الإطار الأول، ثم استخدموا روبوتاً موجهاً بالحركة لجعل بقية الفيديو يتبع الوجوه الجديدة. ثم قاموا بتصفية المحاولات السيئة (مثل عندما يعطي الذكاء الاصطناعي الراقص ثلاثة أذرع بالخطأ) لإنشاء مجموعة تدريب مثالية. سمح هذا بتدريب نموذج واحد للقيام بكل شيء: استبدال شخص واحد، استبدال شخصين، وحتى تغيير الخلفية، وكل ذلك دون الحاجة إلى أدوات منفصلة لكل مهمة.

ولكن ماذا عن صنع فيلم كامل؟ معظم مولدات الفيديو بالذكاء الاصطناعي تصاب بالارتباك أو تصبح ضبابية بعد بضع ثرنات. يستخدم Vorch-IR حيلة ذكية تسمى "الاستدلال الزمني المتداخل". تخيل أنك تحاول رسم جدارية طويلة. بدلاً من رسم مربع صغير، وتجفيفه، ثم رسم المربع التالي (مما قد يجعل الألوان تبدو مختلفة)، يقوم Vorch-IR برسم أقسام متداخلة في نفس الوقت ودمجها معاً بسلاسة. هذا يسمه بإنشاء فيديوهات تصل مدتها إلى دقيقة كاملة دون أن تنحرف وجوه الشخصيات أو تصبح الحركة غريبة، وكل ذلك دون الحاجة إلى توليد الفيديو مقطعاً تلو الآخر.

اختبر الفريق Vorch-IR مقابل نماذج ذكاء اصطناعي رائدة أخرى. في المقارنات المباشرة، أشار Vorch-IR إلى أنه أفضل في الحفاظ على شكل وجه الشخص الجديد تماماً كما في الصورة (الحفاظ على الهوية) وفي الحفاظ على اتساق الخلفية، مع التحرك بسلاسة في الوقت نفسه. وفي الاختبارات البشرية، فضل الناس نتائج Vorch-IR على الطرق الأخرى، خاصة عندما يتعلق الأمر بجعل الشخصية الجديدة تبدو حقيقية ومنطقية جسدياً. تشير الورقة البحثية إلى أنه بينما قد تكون بعض النماذج القديمة أفضل قليلاً في أمور محددة مثل مطابقة الوضعية المثالية في سيناريوهات معينة جداً، فإن Vorch-IR يقدم طريقة أكثر مرونة وتوحيداً لتحرير الفيديوهات، مما يثبت أنك لست بحاجة إلى خرائط معقدة للحصول على نتائج رائعة. إنها خطوة نحو مستقبل يكون فيه تحرير الفيديو سهلاً مثل كتابة جملة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →