FHAvatar: Fast and High-Fidelity Reconstruction of Face-and-Hair Composable 3D Head Avatar from Few Casual Captures
يُعد FHAvatar إطار عمل مبتكرًا يتيح إعادة بناء سريعة وعالية الدقة لصور رمزية ثلاثية الأبعاد للرأس قابلة للتركيب، مع مكونات منفصلة للوجه والشعر من خلال لقطات عفوية قليلة، وذلك عبر فك الارتباط بين تمثيلاتهما في مساحة النسيج والاستفوتادة من هيكل محول مجمع لتعلم الميزات عبر الرؤى بكفاءة.
تخيل أنك تريد إنشاء توأم رقمي لنفسك لاستخدامه في لعبة فيديو أو اجتماع افتراضي. عادةً ما تكون هذه العملية أشبه بمحاولة بناء تمثال بحجم إنسان حقيقي باستخدام صورة واحدة ضبابية والكثير من الآلات الثقيلة والمكلفة؛ فهي تستغرق ساعات، وتتطلب استوديو احترافيًا مع عشرات الكاميرات، وغالبًا ما تبدو النتيجة جامدة أو "بلاستيكية"، خاصة عندما يتعلق الأمر بالشعر.
FHAvatar يشبه طابعة ثلاثية الأبعاد سحرية وعالية السرعة، يمكنها أخذ بضع صور عفوية التقطتها بهاتفك وبناء نسخة ثلاثية الأبعاد فائقة الواقعية ومتحركة لرأسك في لحظات.
إليك كيف يعمل الأمر، مقسماً عبر تشبيهات إبداعية:
١. مشكلة "الوجه مقابل الشعر": الجلد الناعم مقابل العشب البري
حاولت معظم الطرق السابقة التعامل مع وجهك وشعرك ككتلة واحدة فوضوية. تخيل أنك تحاول رسم لوحة عبر لطخ الطلاء في كل مكان؛ ستحصل على الشكل العام، لكن التفاصيل ستضيع.
الطريقة القديمة: التعامل مع الشعر كخوذة صلبة أو سحابة ضبابية. يبدو الأمر جيداً من بعيد، ولكن عند الاقتراب منه، يصبح مجرد كتلة ضبابية. لا يمكنك تغيير تسريحة الشعر لأن الشعر "ملتصق" بالرأس.
طريقة FHAvatar: تدرك أن الوجه يشبه الخزف الناعم (متوقع وصلب)، بينما الشعر يشبه آلاف السيقان الفردية من العشب (بري، متدفق، ومعقد).
الوجه: يبني الوجه باستخدام بلاطات مسطحة وناعمة (تسمى "gaussians" مستوية).
الشعر: يبني الشعر باستخدام آلاف العصي الصغيرة المتصلة (تسمى "gaussians" قائمة على الخيوط). هذا يشبه بناء باروكة من ألياف فردية بدلاً من كتلة صلبة من الطين.
٢. "الدماغ": المحول المجمع (Aggregated Transformer)
كيف يعرف الكمبيوتر كيف يبدو جانبك الآخر المفقود إذا كنت قد التقطت صوراً من الأمام فقط؟
التشبيه: تخيل أنك تحاول تخمين شكل جسم مخفي بناءً على بعض الأدلة. قد يخمن الكمبيوتر العادي بشكل عشوائي، لكن FHAvatar يستخدم أميناً للمكتبة فائق الذكاء (المحول المجمع).
هذا الأمين قد قرأ ملايين الكتب (صور لآلاف الأشخاص المختلفين) ويعرف "القواعد" لكيفية ظهور الرؤوس والشعر عادةً. عندما تعطيه صورك القليلة، يسترجع فوراً: "آه، إذا كان جانب الأنف الأيسر يبدو هكذا، فلا بد أن يكون الجانب الأيمن هكذا"، ويملأ الفجوات بتفاصيل عالية الدقة.
٣. السرعة: من "الطهي البطيء" إلى "الميكروويف"
الطرق القديمة: تشبه طهي الحساء ببطء. عليك الانتظار لساعات حتى يقوم الكمبيوتر بـ "تحسين" النموذج، وتعديله بكسل تلو الآخر حتى يبدو صحيحاً.
FHAvatar: يشبه استخدام الميكروويف. إنه يستخدم مساراً "للتغذية الأمامية" (feed-forward). تضع الصور، تضغط على الزر، وبعد دقائق معدودة (أو حتى ثوانٍ)، يبرز التوأم ثلاثي الأبعاد جاهزاً للاستخدام. لقد تعلم القواعد العامة مسبقاً، لذا لا يحتاج لإعادة تعلمها لكل شخص جديد.
٤. الخدع السحرية: ماذا يمكنك أن تفعل به؟
لأن FHAvatar يفصل الوجه والشعر إلى طبقتين متميزتين، فإنه يفتح آفاقاً لبعض الإمكانيات الرائعة:
"تبديل الشعر" (نقل تسريحة الشعر): تخيل أن لديك توأماً رقمياً لنفسك بشعر قصير، وتريد تجربة تسريحة طويلة ومجعدة. مع FHAvatar، يمكنك ببساً "قص ولصق" طبقة الشعر من توأم شخص آخر على توأمك. ولأن الشعر مبني على خيوط فردية، فإنه يناسب فروة رأسك تماماً دون أن يبدو كخوذة.
تأثير "الملصق" (التعديل الأسلوبي): بما أن التوأم مبني على خريطة ثلاثية الأبعاد (مثل خريطة نسيج UV)، يمكنك رسم شارب أو أنف مهرج على الصورة ثنائية الأبعاد، وسوف يلتف فوراً حول الرأس ثلاثي الأبعاد. إنه يشبه وضع ملصق على بالون؛ مهما دار البالون، يظل الملصق ملتصقاً بالسطح.
التحريك في الوقت الفعلي: النموذج فعال جداً لدرجة أنه يمكنه العمل على جهاز كمبيوتر عادي وتحريك توأمك في الوقت الفعلي. يمكنك التحدث، الابتسام، وتحريك رأسك، وسيقوم النسخة ثلاثية الأبعاد بتقليدك فوراً وبسرعة عالية (مثل شخصية في لعبة فيديو).
الملخص
FHAvatar هو الفرق بين محاولة نحت رأس بشري واقعي من الطين الرطب باستخدام ملعقة (الطرق القديمة)، وبين استخدام طابعة ثلاثية الأبعاد ذكية وعالية السرعة تعرف تماماً كيفية تجميع الجلد الناعم والشعر البري من مجرد لقطات عفوية. إنه يجعل إنشاء توأمك الرقمي سريعاً، رخيصاً، وممتعاً، مما يسمح لك بتبديل تسريحات الشعر وتعديل مظهرك في ثوانٍ.
1. بيان المشكلة
يواجه إعادة بناء الصور الرمزية (avatars) ثلاثية الأبعاد للرأس ذات الواقعية الفوتوغرافية والقابلة للتحريك ثلاثة تحديات رئيسية في الأبحاث الحالية:
نقص الفصل بين المكونات: غالبًا ما تعامل الطرق الحالية الشعر كأنه مجرد تشوه بسيط لفروة الرأس أو نسيج موحد، مما يفشل في التقاط الاختلافات الهندسية الجوهرية بين جلد الوجه (بنيته ثابتة) والشعر (عالي التباين في النمط والكثافة والطول). يؤدي هذا إلى جودة بصرية ضعيفة ويحد من التطبيقات اللاحقة مثل نقل تسريحات الشعر.
ندرة البيانات وكفاءتها: تعتمد الطرق عالية الدقة عادةً على أجهزة التقاط متعددة المشاهد كثيفة أو تتطلب تحسينًا مكلفًا ومستهلكًا للوقت لكل هوية (ساعات إلى أيام)، مما يجعلها غير عملية للتطبيقات الاستهلاكية التي تستخدم لقطات الهاتف المحمول العادية.
التعميم والمتانة: بينما توجد بعض النماذج ذات التغذية الأمامية (feed-forward)، إلا أنها غالبًا ما تعاني مع المدخلات الشحيحة (عدد قليل من الصور)، وتفتقر إلى الاتساق ثلاثي الأبعاد عبر المشاهد الجديدة، أو تفشل في الحفاظ على تشابه الهوية عند توليد تعبيرات جديدة.
2. المنهجية
يقترح FHAvatar إطار عمل مبتكر يعيد بناء صور رمزية ثلاثية الأبعاد بنظام Gaussian (3D Gaussian avatars) ذات مكونات وجه وشعر قابلة للتركيب بشكل صريح من أي عدد من الصور العادية (من 1 إلى 6 مشاهد) في غضون دقائق.
البنية الأساسية
يتبع النظام خط إنتاج (pipeline) يعتمد على المُشفر-المفكك (Encoder-Decoder) بتصميم ثنائي المسار (Dual-Branch):
ترميز الميزات (المُشفر):
رموز الصور (Image Tokens): يتم استخراجها باستخدام هيكل DINOv2 مجمد وتنقيتها بواسطة DPTHead لالتقاط تفاصيل المظهر والنسيج متعددة المقاييس.
رموز هندسة الرأس (Head Geometric Tokens): مشتقة من شبكة FLAME نموذجية مسقطة في مساحة UV، مما يوفر أولويات هيكلية للوجه.
رموز الشعر (Hair Tokens): يتم توليدها عن طريق ترميز عرض أمامي باستخدام DiffLocks (متنبئ شعر أحادي العدسة) وتنقيتها عبر الانتباه المتقاطع (cross-attention) مع رموز الصور لضمان الاتساق عبر المشاهد المتعددة.
هيكل المحول المجمع (Aggregated Transformer Backbone):
مستوحى من محولات الرؤية (Vision Transformers مثل VGGT)، يقوم هذا النموذج بتجميع الميزات من أي عدد من مشاهد الإدخال.
يستخدم الانتباه المتقاطع (Cross-Attention) حيث تقوم رموز الرأس/الشعر بالاستعلام من رموز الصور لاستنتاج علاقات الإسقاط والتماسك الهيكلي.
يستخدم الانتباه الذاتي (Self-Attention) عبر الإطارات لدمج معلومات المشاهد المتعددة، مما يسمح للنموذج بتعلم الأولويات المدركة للهندسة من مجموعات بيانات واسعة النطاق.
مسار الوجه: يفكك نماذج Gaussian المستوية مباشرة من خريطة UV. هذه النماذج مرتبطة بمثلثات شبكة FLAME، مما يسمح بتحريك "blendshape" القياسي.
مسار الشعر: بدلاً من نماذج Gaussian المفردة، يقوم هذا المسار بتوليد نماذج Gaussian قائمة على الخصلات (strand-based Gaussians). يستخدم مولد خصلات مجمد (يعتمد على طبقات SIREN من DiffLocks) للتنبؤ بتسلسل من ناقلات الاتجاه (d1…dS) من جذور فروة الرأس. تشكل هذه الناقلات قطع خط مستقيمة متصلة، كل منها ممثل بنموذج Gaussian.
أخذ العينات التكيفي (Adaptive Sampling): لموازنة الكفاءة والجودة، يتنبأ النموذج بخريطة كثافة لخفض عينات عدد الخصلات ونماذج Gaussian لكل خصلة بشكل تكيفي بناءً على طول الشعر (قصير، متوسط، طويل)، مما يقلل العدد الإجمالي لـ Gaussian دون التضحية بالدقة البصرية.
التحسين (Refinement):
تسمتمل مرحلة تحسين سريع (Fast Refinement) اختيارية تتيح تحسينًا خفيف الوزن للمفككات (مع تجميد الهيكل الأساسي) على صور المدخلات المحددة، مما يعزز التفاصيل الخاصة بالموضوع خلال دقائق.
خسارة منطقة الشعر (Hair Region Loss): تفرض الفصل بين نماذج Gaussian للوجه والشعر باستخدام أقنعة التحليل الدلالي لمنع نماذج Gaussian الخاصة بالوجه من احتلال مناطق الشعر.
التنظيم (Regularization): تقيد إزاحات الموقع وعوامل القياس لمنع العيوب الهندسية أثناء التحريك.
3. المساهمات الرئيسية
تمثيل قابل للتركيب للوجه والشعر: أول إطار عمل يفصل صراحة بين الوجه والشعر في مساحة النسيج، باستخدام نماذج Gaussian مستوية للوجه ونماذج Gaussian قائمة على الخصلات للشعر. وهذا يتيح نقل تسريحة الشعر والتعديل الأسلوبي دون إعادة تدريب.
هيكل المحول المجمع: بنية تغذية أمامية مبتكرة قادرة على التعامل مع أي عدد من مشاهد الإدخال (من 1 إلى N)، وتتعلم أولويات قوية مدركة للهندسة من مجموعات بيانات متعددة المشاهد واسعة النطاق للتعامل مع المدخلات الشحيحة بفعالية.
الكفاءة والسرعة: يحقق إعادة بناء عالية الدقة في دقائق (تمريرة واحدة أمامية) ويدعم الرندرة في الوقت الفعلي (تصل إلى ~250 إطار في الثانية)، مما يتفوق بشكل كبير على الطرق القائمة على التحسين التي تستغرق ساعات.
التعميم القوي: أظهر أداءً رائدًا في حالات الهويات غير المرئية من كل من مجموعات البيانات المنضبطة (NeRSemble) واللقطات "في الواقع" (in-the-wild) الملتقطة بهواتف محمولة.
4. النتائج التجريبية
الأداء الكمي: على مجموعة بيانات NeRSemble، يتفوق FHAvatar على الطرق الرائدة (بما في ذلك GaussianAvatars وFlashAvatar وDiffusionRig) عبر جميع المقاييس (PSNR وSSIM وLPIPS وAKD).
مثال: مع 3 إطارات مدخلة، يحقق FHAvatar قيمة PSNR تبلغ 23.40، مقارنة بـ 21.68 لـ GaussianAvats و18.10 لـ FlashAvatar.
اتساق الهوية: يحقق أعلى درجات تشابه جيب التمام (CSIM)، مما يشير إلى حفظ أفضل للهوية عبر المشاهد الجديدة.
الأداء النوعي:
نجح في إعادة بناء التفاصيل الدقيقة مثل محاجر العين والأسنان حتى مع المدخلات الشحيحة.
يحافظ على الاتساق ثلاثي الأبعاد حيث تفشل الطرق الأخرى (مثل انهيار الهندسة عند الزوايا غير المرئية).
يتيح نقل تسريحة الشعر بسلاسة (تبديل الشعر بين الرموز) والتعديل الأسلوبي (تطبيق تعديلات نسيج ثنائية الأبعاد ترتقي لتصبح ثلاثية الأبعاد).
الكفاءة:
وقت النمذجة: حوالي 3 ثوانٍ (تمريرة واحدة) إلى ~50 ثانية (مع التحسين)، مقارنة بساعات للطرق المرجعية القائمة على التحسين.
الرندرة: أداء في الوقت الفعلي (>240 إطار في الثانية).
5. الأهمية والأثر
يسد FHAvatar الفجوة بين إعادة البناء ثلاثي الأبعاد عالي الدقة والتطبيقات الاستهلاكية العملية. ومن خلال حل التحديات المحددة لنمذجة الشعر والتعميم مع المدخلات الشحيحة، فإنه يمهد الطريق لـ:
ديمقراطية إنشاء الرموز (Avatar Creation): يمكن للمستخدمين إنشاء رموز عالية الجودة وقابلة للتحريك من بضع صور للهاتف في دقائق.
تطبيقات جديدة: الطبيعة القابلة للتركيب للنموذج تفتح الأبواب للبث الافتراضي، والألعاب، ووسائل التواصل الاجتماعي حيث يمكن للمستخدمين تغيير تسريحات شعرهم ديناميكيًا أو تطبيق فلاتر أسلوبية دون مهارات معقدة في النمذجة ثلاثية الأبعاد.
التقدم التقني: يضع نموذجًا جديدًا لفصل الأولويات الهندسية (الوجه) عن الهياكل شديدة التباين (الشعر) ضمن إطار عمل موحد لـ Gaussian Splatting، مما يقدم مخططًا لبناء كائنات معقدة في المستقبل.
باخت-صار، يمثل FHAvatar قفزة نوعية في جعل البشر الرقميين ثلاثيي الأبعاد، عالي الجودة والقابل للتحكم والتعديل، متاحين للاستخدام الواقعي العادي.