EmbedTalk: Triplane-Free Talking Head Synthesis using Embedding-Driven Gaussian Deformation
يقدم EmbedTalk طريقة لتخليق الرؤوس المتحدثة خالية من المستويات الثلاثية (triplane-free) تستفيد من التضمينات المتعلمة (learned embeddings) لتوجيه تشوهات غاوس ثلاثية الأبعاد (3D Gaussian deformations)، محققةً جودة رندر فائقة، وتزامناً دقيقاً لحركة الشفاه، واتساقاً في الحركة، مع تمكين الأداء في الوقت الفعلي (أكثر من 60 إطاراً في الثانية) على وحدات معالجة الرسومات للهواتف المحمولة من خلال نماذج أكثر إيجازاً بشكل كبير.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تريد إنشاء دمية رقمية يمكنها التحدث، والابتسام، وتبدو تماماً مثل شخص حقيقي، وكل ذلك مدفوع بتسجيل صوتي. يُطلق على هذا العملية اسم "تخليق الرأس المتكلم" (Talking Head Synthesis). لفترة طويلة، كانت الطريقة الأفضل للقيام بذلك في الفضاء ثلاثي الأبعاد هي استخدام تقنية تسمى "تشتت غاوس ثلاثي الأبعاد" (3D Gaussian Splatting). فكر في "الغاوس" (Gaussian) كأنه سحابة صغيرة وضبابية من اللون والضوء ثلاثية الأبعاد. ولصنع وجه كامل، ستحتاج إلى الملايين من هذه السحب.
المشكلة في الطرق القديمة هي كيفية إخبار هذه السحب بكيفية التحرك.
الطريقة القديمة: خريطة "المستوى الثلاثي" (Tri-Plane)
استخدمت الطرق السابقة ما يسمى بـ "المستويات الثلاثية" (Tri-planes). تخيل أن لديك جسماً ثلاثي الأبعاد (وجهاً)، وتحاول وصف شكله وحركته عن طريق تسطيحه على ثلاث ورقات منفصلة ثنائية الأبعاد (مثل المنظر الأمامي، والجانبي، والعلوي).
- التشبيه: الأمر يشبه محاولة وصف حركة رقص معقدة من خلال النظر فقط إلى ثلاثة ظلال مسطحة تُلقى على الحائط. أنت تفقد بعض العمق والدقة.
- المشكلة: نظرًا لأن الكمبيوتر يحاول تخمين كيف تتناسب الحركة ثلاثية الأبعاد مع هذه الأوراق ثنائية الأبعاد، فإنه يرتكب أخطاء صغيرة. هذه الأخطاء تجعل الفم يبدو "متذبذباً" أو غير متزامن مع الصوت. كما أن تخزين هذه الخرائط الثلاث الكبيرة يستهلك الكثير من الذاكرة، كأنك تحمل ثلاثة كتب مدرسية ثقيلة بينما تحتاج واحداً فقط.
الطريقة الجديدة: EmbedTalk (نهج "بطاقة الهوية")
قرر مؤلفو هذه الورقة البحثية، EmbedTalk، التخلص من الخرائط ثنائية الأبعاد تماماً. بدلاً من ذلك، منحوا كل سحابة صغيرة (Gaussian) على الوجه "بطاقة هوية" خاصة بها (تضمين/Embedding).
- التشبيه: تخيل بدلاً من النظر إلى خريطة لإخبار الراقص أين يذهب، أنك تعطي كل راقص جهاز راديو ذكياً صغيراً. عندما تعمل الموسيقى (الصوت)، يخبر الراديو ذلك الراقص تحديداً كيف يحرك ذراعه أو ساقه.
- كيف يعمل:
- تعليمات مخصصة: لكل سحابة "بطاقة هوية" فريدة (تضمين قابل للتعلم) تتذكر وظيفتها المحددة.
- اتصال مباشر: عندما يسمع الكمبيوتر صوتاً (مثل حرف "O" أو "M")، فإنه لا ينظر إلى خريطة مسطحة، بل يرسل إشارة مباشرة إلى أجهزة الراديو الموجودة في السحب حول الفم.
- تفاصيل التردد العالي: أضافوا "معزز تردد" خاصاً (ترميز موضعي) لهذه الأجهزة. يساعد هذا السحب القريبة من الشفاه على التحرك بسرعة ودقة عالية، مما يلتقط الحركات الصغيرة والسريعة للكلام التي فاتتها الخرائط القديمة.
لماذا يعد هذا أمراً مهماً؟
1. حركة الفم أفضل (تزامن الشفاه)
لأن السحب تتلقى تعليمات مباشرة بدلاً من التخمين من خريطة مسطحة، فإن الفم يفتح ويغلق تماماً عندما ينطق الصوت. إنه الفرق بين محرك الدمى الذي يسحب الخيوط من مسافة بعيدة (الطريقة القديمة) وبين دمية تمتلك جهازها العصبي الخاص (الطريقة الجديدة).
2. أخف وزناً وأسرع بكثير
كانت الطريقة القديمة (المستويات الثلاثية) تشبه حمل حقيبة ظهر ثقيلة مليئة بالخرائط. أما الطريقة الجديدة (التضمينات/Embeddings) فهي تشبه حمل ميدالية مفاتيح صغيرة وخفيفة.
- النتيجة: النموذج الجديد أصغر بمقدار 2 إلى 6 مرات في حجم الملف.
- السرعة: نظرًا لخفته، فهو يعمل بسرعة هائلة. تظهر الورقة البحثية أنه يمكنه العمل بسرعة 61 إطاراً في الثانية على بطاقة رسوميات لجهاز كمبيوتر محمول عادي. هذا أكثر سلاسة من معظم الأفلام!
3. لا مزيد من "التذبذب"
غالباً ما كانت الطرق القديمة تجعل الرأس يبدو وكأنه يهتز أو يرتعش قليلاً، خاصة حول خط الشعر أو الفك. أما EmbedTalk فيخلق رأساً ثابتاً وصخرياً لأن السحب مثبتة بهوياتها الخاصة بدلاً من الإسقاط المهتز.
المقايضة
العيب الوحيد هو أنه لكي يعمل هذا النظام، يجب عليك "تدريب" النظام على شخص معين أولاً. الأمر يشبه تعليم ممثل معين كيفية لعب دور ما. لا يمكنك استخدامه على أي شخص فوراً دون ذلك التدريب، ولكن بمجرد تدريبه، سيبدو هذا الشخص الرقمي المحدد واقعياً بشكل لا يصدق.
باختصار
EmbedTalk يشبه الترقية من نظام ملاحة يعتمد على الخرائط البدائية إلى نظام GPS يعطي توجيهات خطوة بخطوة مباشرة لكل سيارة في المدينة. والنتيجة؟ رأس رقمي متكلم أسرع، أخف، لا يهتز، ويتحدث بتوقيت مثالي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.