CETalk: Continuous Valence-Arousal Control for Audio-Driven 3D Talking Head Generation
تقدم هذه الورقة البحثية CETalk، وهو إطار عمل لتوليد الرؤوس المتحدثة ثلاثية الأبعاد المدفوعة بالصوت، والذي يستفيد من تمثيلات التكافؤ والاستثارة المستمرة وبنية نمذجة زمنية متعددة المقاييس لتحقيق تحكم عاطفي دقيق ومزامنة دقيقة لحركة الشفاه مع التغلب على قيود فئات العواطف المنفصلة.
المؤلفون الأصليون:Peng Jia, Li Dai, Zhen Xiao, Xueliang Liu, Jia Li
في عالم الوسائط الرقمية سريع التطور، انتقلت القدرة على إنشاء بشر افتراضيين واقعيين من مجال الخيال العلمي إلى التطبيق العملي. تُستخدم هذه الشخصيات الرقمية (الأفاتار) بشكل متزايد كمساعدين افتراضيين، وفي التواصل عبر الواقع الافتراضي، وللترفيه التفاعلي. ويتمثل التحدي المركزي في هذا المجال في جعل هذه الشخصيات تتحدث بوجوهها، وليس فقط بأفواهها. وبينما نجحت الأنظمة المبكرة في مطابقة حركات الشفاه مع الكلمات المنطوقة، إلا أنها غالبًا ما عانت في نقل العواطف الدقيقة والمتغيرة التي تجعل المحادثة البشرية تبرة واقعية. لقد تعاملت النهج التقليدية مع العواطف كصناديق منفصلة ومتميزة، مثل "سعيد" أو "حزين" أو "غاضب". وقد نجحت هذه الطريقة في رسم الخطوط العريضة، لكنها فشلت في التقاط الطبيعة الانسيابية والمستمرة للمشاعر الإنسانية، حيث قد تتلاشى الابتسامة ببطء لتتحول إلى نظرة قلق، أو حيث قد يغلي الحماس بهدوء قبل أن ينفجر. علاوة على ذلك، فإن توقيت الكلام وتوقيت العاطفة مختلفان جوهريًا؛ إذ يجب أن يتحرك الفم بسرعة لمطابقة الأصوات السريعة للكلمات، بينما تتطور التعبيرات العاطفية غالبًا بشكل أبطأ عبر الوجه بأكه.
قام باحثون في جامعة هيفي للتكنولوجيا بتطوير نظام جديد يسمى CETalk لحل هذه المشكلات المحددة. وبدلاً من حصر العواطف في فئات جامدة، يستخدم هذا النظام خريطة ثنائية الأبعاد مستمرة لوصف المشاعر، حيث يتتبع مدى إيجابية أو سلبية الشعور، ومدى نشاطه أو خموله. يسمح هذا النهج للكمبيوتر بتوليد رسوم متحركة للوجه تتغير بسلاسة، مما يحاكي المد والجزر الطبيعي في المحادثة البشرية. وقد بنى الفريق مجموعة بيانات ضخمة جديدة لتدريب نظامهم، حيث أعادوا بناء حركات الوجه ثلاثية الأبعاد من تسجيلات فيديو موجودة وقاموا تلقائيًا بتقدير هذه القيم العاطفية المستمرة لكل إطار. وفرت هذه البيانات الأساس اللازم لتعليم الكمبيوتر التمييز بين الحركات السريعة والدقيقة المطلوبة للكلام، وبين التغييرات الأبطأ والأوسع التي تنقل الحالة المزاجية.
يكمن جوهر النظام الجديد في كيفية تعامله مع الوقت. فقد أدرك الباحثون أن الكلام والعاطفة يعملان بسرعات مختلفة، تمامًا كما يحافظ الطبال على إيقاع ثابت وسريع بينما يمد المغني نوتة طويلة وبطيئة. ولإدارة ذلك، يقسم النظام المعالجة إلى مسارين متوازيين. يركز أحد المسارين على التفاصيل عالية السرعة للفم والفك، مما يضمن مزامنة كل مقطع لفظي بدقة مع الصوت. بينما يركز المسار الآخر على الحركات الأبطأ والأوسع للوجه التي تعبر عن العاطفة، مثل تقطيب الحاجبين أو اتساع العينين. ثم يتم دمج هذين المسارين من المعلومات بواسطة نظام دمج ذكي يقرر، لحظة بلحظة، مقدار الوزن الذي يجب إعطاؤه لحركات الكلام مقابل التعبير العاطفي. وهذا يسمح للرسوم المتحركة النهائية بأن تكون دقيقة في مزامنة الشفاه وغنية في عمقها العاطفي في آن واحد.
لاختبار عملهم، قارن الفريق نظامهم بعدة طرق موجودة باستخدام ثلاث مجموعات مختلفة من بيانات الفيديو. وأظهرت النتائج أن نهجهم أنتج حركات شفاه أكثر دقة وتعبيرات وجه أكثر واقعية من أفضل الطرق السابقة. وفي الاختبارات على مجموعة بيانات MEAD، قلل نظامهم من أخطاء حركة الشفاه إلى حوالي 7.48 مليمترًا ومن أخطاء حركة الوجه الإجمالية إلى حوالي 9.91 مليمترًا، متفوقًا بذلك على جميع التقنيات الأخرى التي تم اختبارها في ذلك المعيار المحدد. وبعيدًا عن الدقة، أظهر النظام قدرة فائقة على اتباع التعليمات العاطفية المستمرة. فعندما طُلب منه توليد وجه ينتقل تدريجيًا من حالة سلبية إلى حالة إيجابية، اتبع النظام المسار بدقة عالية، محققًا المسار العاطفي المنشود بشكل أفضل بكثير من منافسيه.
كما أظهر الباحثون أن النظام يسمح بالتحكم الدقيق في شدة العاطفة. فمن خلال ضبط قيم المدخلات، استطاعوا جعل تعبير الشخصية أكثر حدة أو أكثر هدوءًا دون كسر التزامن مع الصوت. هذا المستوى من التحكم أمر بالغ الأهمية لإنشاء بشر رقميين يشعرون حقًا بأنهم أحياء، قادرين على التحولات العاطفية الدقيقة والمستمرة التي تحدد التفاعل البشري الحقيقي. ومن خلال الابتعاد عن الفئات المنفصلة وتبني الطبيعة المستمرة للتأثر البشري، تمثل هذه العمل خطوة مهمة للأمام لجعل التواصل الافتراضي يبدو أقل شبهاً بمشاهدة آلة وأكثر شبهاً بالتواصل مع شخص حقيقي.
ملخص تقني: CETalk – التحكم المستمر في التكافؤ والاستثارة لتوليد الرؤوس المتحدثة ثلاثية الأبعاد الموجهة بالصوت
1. بيان المشكلة
يهدف توليد الرؤوس المتحدثة ثلاثية الأبعاد الموجهة بالصوت إلى تخليق رسوم متحركة للوجه متماسكة زمنياً وواقعية بصرياً من الكلام. وبينما حققت الطرق الحديثة مزامنة دقيقة لحركة الشفاه، إلا أنها تواجه عقبتين رئيسيتين في توليد صور رمزية (Avatars) معبرة عاطفياً:
محدودية العواطف المنفصلة: تعتمد النهج الحالية غالباً على فئات عاطفية منفصلة (مثل: سعيد، حزين). وهذا يفشل في التقاط التطور المستمر والدقيق للمشاعر والتحولات السلسة التي تحدث بشكل طبيعي في المحادثات البشرية.
عدم تطابق التردد الزمني: هناك تباين جوه-ري في المقاييس الزمنية بين النطق الصوتي والتعبير العاطفي. تتطلب حركات الشفاه مزامنة عالية التردد على مستوى الإطار مع الصوت، بينما تتطور التعبيرات العاطفية ببطء عبر فترات زمنية أطول. غالباً ما تعاني النماذج الحالية من صعوبة في فصل هذه الديناميكيات، مما يؤدي إلى رسوم متحركة إما جامدة أو تفتقر إلى اللمسة العاطفية الدقيقة.
2. المنهجية: إطار عمل CETalk
يقترح المؤلفون CET_alk، وهو إطار عمل مشروط بتمثيلات "التكافؤ والاستثارة" (Valence–Arousal) المستمرة لتمكين التحكم الدقيق في العواطف. يتنبأ النظام بتسلسل معاملات FLAME (P) بناءً على المدخلات الصوتية (A)، وهوية المتحدث (S)، وشرط عاطفي مستمر (Econd). تتكون البنية من ثلاثة مكونات أساسية:
وحدة تعديل العاطفة الديناميكية (DEMM): هذه الوحدة تسد الفجوة بين المواصفات العاطفية الثابتة والتعبيرات الوجهية الديناميكية. وهي تأخذ شرط التكافؤ والاستثارة الثابت (Econd) وتعدله باستخدام إشارات مستمدة من الصوت.
يقوم مشفر التعبير بتحويل إشارات التكافؤ والاستثارة إلى تمثيل عاطفي أساسي (EVA).
يقوم مشفر الصوت-العاطفة (المعتمد على Emotion2Vec) باستخراج إشارات عاطفية على مستوى الإطار من الصوت (Eaudio).
تقوم وحدة تعديل الكثافة الديناميكية بالتنبؤ بمعاملات القياس الزمني (α) بناءً على Eaudio.
يتم الحصول على التضمين الديناميكي النهائي (Emod) عبر القياس العنصري: Emod=α⊙EVA.
النمذجة الزمنية متعددة المقاييس (MSTM): لمعالجة عدم تطابق التردد الزمني، يستخدم CETalk فروعاً متوازية لفصل الحركات النطقية عالية التردد (HF) عن الديناميكيات العاطفية منخفضة التردد (LF).
فرع التردد العالي (HF): يركز على النطق الدقيق المتزامن بإحكام مع الصوت. ويستخدم الانتباه المتقاطع (Cross-attention) بين تضمين المتحدث وميزات الصوت عالية الدقة (المستخرجة عبر HuBERT).
فرع التردد المنخفض (LF):की: ينمذج الديناميكيات العاطفية التي تتغير ببطء. ويطبق خفض العينات الزمني لكل من ميزات الصوت وتضمين العاطفة الديناميكي، ويجري عملية الانتباه المتقاطع على مقياس خشن، ثم يعيد رفع النتيجة إلى الدقة الزمنية الأصلية.
آلية الدمج الديناميكي (DFM): تدمج هذه الوحدة الميزات عالية التردد ومنخفضة التردد بشكل تكيفي. تقوم شبكة بوابة خفيفة الوزن بحساب أوزان تكيفية لقنوات الميزات (g) بناءً على دمج مجموعتي الميزات. التمثيل الموحد النهائي (F~) هو مجموع موزون: F~=g⊙FHF+(1−g)⊙FLF. يتم بعد ذلك إسقاط هذا التمثيل للتنبؤ بمعاملات التعبير والفك.
3. بناء مجموعة البيانات: 3D-VA-MEAD
لدعم التدريب والتقييم، قام المؤلفون ببناء مجموعة بيانات 3D-VA-MEAD الضخمة والمستمدة من مجموعة بيانات MEAD.
العملية: استخدموا نموذجاً مدرباً مسبقاً للتعرف على العواطف لتقدير معاملات التكافؤ والاستثارة على مستوى الإطار من الفيديوهات، وطريقة إعادة بناء الوجه ثلاثية الأبعاد أحادية الكاميرا (EMOCA) لاستعادة معاملات FLAME.
التحسين: للتخفيف من عدم الاستقرار الزمني، تم تطبيق مرشح متوسط متحرك أحادي البعد لتنعيم ناقلات العاطفة المسترجعة.
النتيجة: توفر مجموعة البيانات حركات وجه ثلاثية الأبعاد معاد بناؤها مقترنة بتعليقات توضيحية مستمرة للتكافؤ والاستثارة على مستوى الإطار.
4. النتائج التجريبية
تم تقييم النموذج على مجموعات بيانات MEAD وRAVDESS وHDTF مقابل النماذج المرجعية الرائدة (بما في ذلك FaceFormer وCodeTalker وEMOTE وUniTalker).
دقة حركة الوجه: حقق CETalk أدنى مستويات الخطأ عبر جميع مجموعات البيانات. في MEAD، سجل خطأ رأس الشفاه (LVE) قدره 7.4772 مم وخطأ الرأس المتوسط (MVE) قدره 9.9059 مم، متفوقاً على جميع النماذج المرجعية. كما أظهر قدرة قوية على التعميم على مجموعة بيانات HDTF الواقعية.
القدرة على التحكم في العاطفة: باستخدام مقاييس جذر متوسط مربع الخطأ (RMSE) واتفاق الإشارة (SAGR) للتنبؤ بالتكافؤ والاستثارة، حقق CETalk أفضل أداء (RMSE: 0.1223 للتكافؤ، 0.0747 للاستثارة؛ SAGR: 0.9247 للتكافؤ، 0.9906 للاستثارة).
التحليل النوعي: أظهرت المقارنات البصرية أن CETalk ينتج ديناميكيات تعبيرية أكثر ثراءً وتماسكاً وانتقالات أكثر سلاسة مقارنة بالطرق التي تظهر رسوماً متحركة مفرطة في التنعيم أو جامدة.
دراسة الاستئصال (Ablation Study): أدى إزالة وحدة تعديل العاطفة الديناميكية (DEMM) إلى أكبر تدهور في الأداء (ارتفع EVE من 1.3256 إلى 2.4367)، مما يؤكد ضرورة التعديل الديناميكي للكثافة.
5. الأهمية والادعاءات
يزعم البحث أن CETalk يمثل خطوة كبيرة للأمام من خلال الانتقال من فئات العواطف المنفصلة إلى فضاء عاطفي مستمر. وتتمثل مساهماته الرئيسية في:
التحكم المستمر: يتيح تحكماً عاطفياً دقيقاً ومتماسكاً زمنياً عبر شرط التكافؤ والاستثارة، مما يسمح بانتقالات سلسة بين الحالات العاطفية.
الفصل الزمني: تقوم آلية النمذجة الزمنية متعددة المقاييس بفصل الديناميكيات الزمنية المتباينة للنطق الصوتي والتعبير العاطفي بشكل صريح، مما يعالج تحدياً جوهرياً في هذا المجال.
توافر الموارد: يوفر بناء 3D-VA-MEAD مورداً ضرورياً للأبحاث المستقبلية في توليد الرؤوس المتحدثة المدركة للعواطف، مما يسد الفجوة في مجموعات البيانات المتاحة علناً ذات التعليقات التوضيحية المستمرة للتكافؤ والاستثارة.
يخلص المؤلفون إلى أنه من خلال الجمع بين النطق الموجه بالصوت والديناميكيات العاطفية عبر الدمج التكيفي، يحقق CETalk دقة فائقة في مزامنة الشفاه وتعبيراً عاطفياً غنياً، مما يثبت فعالية النمذجة العاطفية المستمرة لتوليد الرؤوس المتحدثة ثلاثية الأبعاد.