Learning to Generate Conditional Tri-plane for 3D-aware Expression Controllable Portrait Animation
تقدم هذه الورقة Export3D، وهي طريقة لتحريك الصور الشخصية ثلاثية الأبعاد بلمحة واحدة (one-shot) تعتمد على الوعي ثلاثي الأبعاد، وتستخدم إطار تدريب مسبق تبايني ومولد ثلاثي المستويات (tri-plane generator) لتحقيق توليد صور قابل للتحكم في التعبيرات ومتغير من حيث زوايا الرؤية، مع القضاء بفعالية على عمليات تبديل المظهر غير المرغوب فيها أثناء نقل التعبيرات عبر الهويات المختلفة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك صورة ثابتة واحدة لصديق لك. الآن، تخيل أنك تريد جعل تلك الصورة تنبض بالحياة، تجعل صديقك يرمش، يبتسم، أو يتحدث، ولكنك تريد استخدام تعبيرات وجه شخص آخر (مثل ممثل سينمائي) كدليل.
هذا هو التحدي الذي تعالجه ورقة بحثية بعنوان Export3D. الأمر يشبه محاولة وضع روح جديدة في جسد قديم دون تغيير ملامح الجسد بالخطأ (مثل إعطاء صديقك أنف الممثل أو شكل عينيه).
إليك شرح بسيط لكيفية قيامهم بذلك، باستخدام تشبيهات من الحياة اليومية:
المشكلة: "النسخ واللصق السيئ"
كانت الطرق السابقة لتحريك الوجوه تشبه استخدام أداة "النسخ واللصق" في برامج تحرير الصور. كانت تحاول شد وتشويه الصورة المصدر لتتطابق مع حركة الشخص القائد للحركة.
- المشكلة: عندما تقوم بشد الصورة كثيرًا، تصبح مشوشة أو غريبة. والأسوأ من ذلك، عندما تحاول نسخ تعبير من شخص مختلف، غالبًا ما ينسخ البرنامج ملامحه أيضًا. الأمر يشبه محاولة وضع ابتسامة على وجهك، لكن فجأة يتحول وجهك ليصبح وجه صديقك لأن البرنامج ارتبك بين "الابتسامة" وبين "من أنت".
الحل: "المخطط ثلاثي الأبعاد" (المستوى الثلاثي - Tri-Plane)
بدلاً من مجرد تشويه صورة ثنائية الأبعاد مسطحة، يقوم Export3D ببناء مخطط ذهني ثلاثي الأبعاد للوجه.
- التشبيه: فكر في الصورة المسطحة كقطعة من الورق. يقوم Export3D بتحويل تلك الورقة إلى منحوتة طينية ثلاثية الأبعاد.
- كيف يعمل: يستخدمون "المستوى الثلاثي" (Tri-plane)، وهو يشبه امتلاك ثلاث طبقات شفافة من الزجاج متراكمة معًا (مشاهد أمامية، جانبية، وعلوية). هذه الطبقات تحمل المعلومات ثلاثية الأبعاد للوجه. ولأن هذا نموذج ثلاثي الأبعاد، فإن الكمبيوتر يعرف تمامًا كيف يجب أن يبدو الوجه من أي زاوية، وليس من الأمام فقط.
السر الصغير: تنقية "إشارة التعبير"
العقبة الكبرى هي أن البيانات المستخدمة لوصف تعبيرات الوجه (المعروفة بمعاملات 3DMM) تكون فوضوية. إنها تشبه إشارة الراديو التي تحتوي على كل من الموسيقى (التعبير) وصوت المذيع (هوية الشخص) مختلطين معًا. إذا قمت بتشغيل الإشارة فحسب، فستحصل على صوت المذيع الخاطئ.
1. "سماعات إلغاء الضجيج" (التدريب التبايني المسبق - Contrastive Pre-training)
ابتكر المؤلفون طريقة تدريب خاصة تسمى CLeBS.
- التشبيه: تخيل أن لديك قائمة تشغيل لمغني يغني أغاني مختلفة. أنت تريد تعليم الروبوت التعرف على اللحن فقط (التعبير) دون الاهتمام بصوت المغني (الهوية).
- كيف يعمل: عرضوا على الذكاء الاصطناعي فيديوهات كثيرة لنفس الشخص وهو يصنع وجوهًا مختلفة. تعلم الذكاء الاصطناعي تجاهل الملامح الفريدة للشخص والتركيز فقط على الحركة. الأمر يشبه تدريب طباخ على تمييز طعم "الحرارة" بغض النظر عما إذا كان الطعام في وعاء أحمر أو أزرق. هذا ينتج إشارة تعبير "نقية" خالية من تلوث الهوية.
2. "جهاز التحكم الذكي" (EAdaLN)
بمجرد حصولنا على إشارة التعبير "النقية"، نحتاج إلى تطبيقها على الصورة المصدر.
- التشبيه: بدلاً من محاولة إعادة بناء المنحوتة الطينية بالكامل من الصرض، نستخدم "جهاز تحكم عن بعد" يقوم بتعديل الطين الموجود بالفعل.
- كيف يعمل: يستخدمون طبقة خاصة تسمى EAdaLN. فكر في هذا كقرص تحكم في لوحة مزج الأصوات. تأخذ إشارة التعبير "النقية" وتدور الأقراص لتعديل الوجه المصدر. هي تخبر المخطط ثلاثي الأبعاد: "حسنًا، حافظ على الأنف والعينين كما هما تمامًا، ولكن غير شكل الفم ليتناسب مع هذه الابتسامة".
النتيجة: رسوم متحركة سلسة
أخيرًا، يأخذ الكمبيوتر هذا المخطط ثلاثي الأبعاد المعدل ويقوم بـ "رندرة" (Rendering) أو معالجة العودة إلى فيديو ثنائي الأبعاد.
- السحر: نظرًا لأن النظام يفهم المساحة ثلاثية الأبعاد، يمكنك تدوير الكاميرا، وسيبدو الوجه طبيعيًا من الجانب، أو الأعلى، أو الأسفل.
- لا تبديل للهوية: نظرًا لأنهم قاموا بتنقية إشارة التعبير أولاً، سيظل صديقك يبدو مثل صديقك، حتى لو كان يقوم بتعبيرات وجه الممثل.
الملخص
Export3D يشبه محرك الدمى عالي التقنية.
- يبني نموذجًا طينيًا ثلاثي الأبعاد لصورتك.
- يستخدم سماعات إلغاء الضجيج لعزل الحركة "النقية" عن "الشخص" في الفيديو القائد.
- يستخدم جهاز تحكم ذكي لتطبيق تلك الحركة على نموذجك الطيني دون تغيير ملامح النموذج.
- النتيجة هي فيديو حيث تنبض صورتك بالحياة بتعبيرات جديدة، وتبدو طبيعية من أي زاوية، دون أن تتحول إلى شخص آخر.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.