← أحدث الأبحاث
💻 computer science

MoCoTalk: Multi-Conditional Diffusion with Adaptive Router for Controllable Talking Head Generation

يُعد MoCoTalk إطار عمل جديد لانتشار الفيديو متعدد الشروط يحقق أداءً فائقاً في توليد الرؤوس المتحدثة القابلة للتحكم من خلال توحيد ملامح الهوية، والوضعية، والتعبيرات، وإشارات الصوت عبر موجه متعدد الشروط تكيفي وشبكة تظليل معززة للفم متخصصة لحل التداخل وتعزيز المحاذاة السمعية البصرية.

المؤلفون الأصليون: Xinyan Ye, Jiankang Deng, Abbas Edalat

نُشر 2026-05-12
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xinyan Ye, Jiankang Deng, Abbas Edalat

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد إنشاء فيديو لشخص يتحدث، ولكن ليس لديك سوى صورة ثابتة واحدة له. تريد لهذه الصورة أن تدب فيها الحياة، بحيث يحرك رأسه، وتتغير تعبيرات وجهه، وتتحرك شفتاه لتتطابق مع تسجيل صوتي محدد. هذا هو تحدي "توليد الرؤوس المتحدثة" (talking head generation).

تقدم الورقة البحثية نظامًا جديدًا يسمى MoCoTalk يعمل مثل لاعب الدمى الماهر، ولكن بدلاً من استخدام الخيوط، يستخدم "لوحة تحكم" متطورة للتحكم في الرسوم المتحركة.

إليك كيفية عمله، مقسمًا إلى مفاهيم بسيطة:

1. المشكلة: مدخلات كثيرة، وعقل مشوش

كانت الطرق السابقة تشبه الطباخ الذي يمتلك وصفة واحدة فقط. إذا أردت أن يتحدث الشخص، يمكنه فعل ذلك. وإذا أردت أن يحرك رأسه، يمكنه فعل ذلك. ولكن إذا أردت منه القيام بـ الأمرين معًا في نفس الوقت مع الحفاظ على ملامح وجهه تمامًا كما في الصورة الأصلية، فإن الأنظمة القديمة كانت تصاب بالارتباك. كانت تحاول دمج التعليمات باستخدام "وصفة ثابتة" (مثل خلط 50% من حركة الرأس و50% من حركة الفم)، مما يؤدي غالبًا إلى فيديو فوضوي وغير طبيعي حيث يبدو الوجه مشوهًا أو لا تتطابق الشفاه مع الصوت.

2. الحل: "الموجه التكيفي" (المايسترو الذكي)

يحل MoCoTalk هذه المشكلة من خلال قبول أربعة أنواع مختلفة من التعليمات في وقت واحد:

  1. الصورة المرجعية: للحفاظ على مظهر الشخص كما هو.
  2. النقاط المفتاحية للوجه (Facial Keypoints): لإخبار النظام أين يجب أن تتحرك العينان والأنف والحواجب (وضعية الرأس والتعبيرات).
  3. شبكة التظليل ثلاثية الأبعاد (3D Shading Mesh): نموذج ثلاثي الأبعاد للوجه للتعامل مع الإضاءة والشكل العام.
  4. الصوت: التسجيل الصوتي الذي يقود حركات الفم.

بدلاً من خلط هذه المدخلات الأربعة بشكل عشوائي، يستخدم MoMoTalk مكونًا خاصًا يسمى الموجه متعدد الشروط التكيفي (Adaptive Multi-Condition Router). فكر في الأمر كأنه مايسترو ذكي في أوركسترا.

  • في الأوركسترا العادية، تعزف كل آلة بنفس مستوى الصوت طوال الوقت.
  • في MoCoTalk، يستمع المايسترو إلى الموسيقى (الفيديو الذي يتم إنشاؤه) وإلى النوتة الموسيقية (المدخلات الأربعة).
  • إذا قال الصوت "افتح فمك على اتساعه"، يقوم المايسترو برفع مستوى صوت آلة الصوت (Audio) ويخفض مستوى آلة حركة الرأس (Head Motion) في تلك اللحظة تحديدًا.
  • إذا كان الفيديو يحتاج إلى ابتسامة خفيفة، يقوم المايسترو بتعزيز إشارة النقاط المفتاحية (Keypoints).

عملية "القيادة" هذه تحدث فورًا، إطارًا تلو الآخر، مما يضمن أن التعليمات الصحيحة هي التي تقود في الوقت المناسب، ويمنع الإشارات من التداخل أو التضارب.

3. "الشبكة المعززة للفم" (إصلاح الشفاه الضبابية)

أحد أصعب أجزاء تحريك الرأس المتحدث هو الفم. النماذج ثلاثية الأبعاد القياسية (مثل تلك المستخدمة في الأدوات السابقة) جيدة في التقاط شكل الوجه، لكنها غالبًا ما تكون "كسولة" عندما يتعلق الأمر بالفم؛ فهي تميل إلى جعل الشفاه تبدو ضبابية ومتداخلة، مما يجعل الأمر يبدو وكأن الشخص يمضغ علكة بدلاً من التحدث بوضوح.

يقدم MoCoTalk شبكة معززة للفم (Mouth-Augmented Mesh).

  • تخيل أخذ منحوتة طينية قياسية للوجه (تمتلك شكل رأس جيد ولكن فمًا ضبابيًا).
  • الآن، تخيل أخذ ماسح ضوئي عالي الدقة ومتخصص ينظر فقط إلى الأفواه والشفاه.
  • يأخذ MoCoTalk المنحوتة الطينية ويضع فيها قطعًا (patches) من بيانات الفم عالية الدقة من الماسح الضوئي.
  • النتيجة هي نموذج ثلاثي الأبعاد يمتلك شكل الرأس المثالي للشخص الأصلي، ولكن لديه حركات شفاه حادة وواقعية تتطابق تمامًا مع الكلام.

4. "خسارة اتساق الشفاه" (اختبار قراءة الشفاه)

للتأكد من أن حركات الفم تتطابق بالفعل مع الصوت، يستخدم النظام "خسارة اتساق الشفاه" (Lip Consistency Loss).

  • فكر في هذا كأنه معلم صارم وهو أيضًا قارئ للشفاه.
  • بينما يقوم الذكاء الاصطناعي بتوليد الفيديو، ينظر هذا المعلم إلى الفم المولد والصوت.
  • إذا لم يكن شكل الفم يبدو وكأنه ينتمي لهذا الصوت المحدد، يعطي المعلم للذكاء الاصطناعي "إشارة سلبية" (عقوبة)، مما يجبره على المحاولة مرة أخرى حتى تتطابق الشفاه والصوت بشكل مثالي.

5. النتيجة: فيديو مرن وعالي الجودة

تزعم الورقة البحثية أنه من خلال استخدام هذا "المايسترو الذكي" و"الفم المعزز"، ينتج MoCoTalk فيديوهات تتميز بـ:

  • واقعية أكثر: يبدو الوجه مثل الصورة الأصلية، وتكون الحركات سلسة.
  • تزامن أفضل: تتحرك الشفاه في وقت مثالي مع الصوت.
  • قابلية التحكم: يمكنك المزج والتبديل. على سبيل المثال، يمكنك أخذ حركة الرأس من فيديو، والصوت من آخر، والوجه من صورة، وسيقوم النظام بدمجهم معًا دون كسر الإيهام بالواقع.

باخت-صار، MoCoTalk هو طريقة جديدة لبث الحياة في الصور الثابتة باستخدام نظام ذكي يعرف بالضبط أي تعليمات يجب الاستماع إليها في كل لحظة، مما يضمن أن يبدو الفيديو النهائي طبيعيًا، ومتزامنًا، وحقيقيًا للشخص الأصلي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →