DiffSwap++: 3D Latent-Controlled Diffusion for Identity-Preserving Face Swapping
يُعد DiffSwap++ إطار عمل جديد للانتشار المعتمد على الكامن ثلاثي الأبعاد، يعزز الحفاظ على الهوية والاتساق الهندسي في عملية تبديل الوجوه من خلال الاستفضاء في استخدام البنية الوجهية ثلاثية الأبعاد لفصل الهوية عن الوضعية والتعبير، متفوقاً بذلك على الأساليب الحالية في العديد من المعايير المرجعية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في مجال التصوير الرقمي، لطالما كانت القدرة على استبدال وجه شخص بجسد آخر مصدر شغف، حيث تمزج بين الفن والرياضيات المعقدة. لسنوات طويلة، اعتمدت الأدوات المستخدمة لإنشاء هذه الصور على نوع من الذكاء الاصطناعي يُعرف باسم "الشبكات التنافسية التوليدية" (GAN). تعمل هذه الأنظمة مثل فنانين متنافسين: أحدهما يحاول إنشاء صورة مزيفة، بينما يحاول الآخر كشف التزوير. ومع مرور الوقت، تجبر هذه المنافسة المبتكر على أن يصبح ماهراً للغاية. ومع ذلك، فإن هذه العملية غير مستقرة بشكل ملحوظ، وغالباً ما تؤدي إلى صور تبدو غريبة بعض الشيء، مع ملامح ضبابية أو تشوهات غريبة يمكن للعين البشرية رصدها بسهولة. ومؤخراً، ظهر نهج مختلف يسمى "الانتشار" (diffusion). وبدلاً من اللعبة التنافسية، تعمل نماذج الانتشار مثل النحات الذي يصقل كتلة حجرية ببطء، حيث يزيل الضجيج تدريجياً ليكشف عن صورة واضحة. وبينما تنتج هذه النماذج الأحدث صوراً أكثر حدة، إلا أنها لا تزال تعاني من مشكلة محددة: الحفاظ على الهوية الحقيقية للشخص عند وضعه في وضعية أو تعبير جديد. فبدون فهم عميق للهيكل ثلاثي الأبعاد للوجه، غالباً ما يخلط الكمبيوتر بين الميزات الفريدة للشخص وبين زاوية رأسه أو شكل ابتسامته، مما يؤدي إلى نتائج تبدو واقعية ولكنها تنتمي للشخص الخطأ.
قام فريق من الباحثين في جامعة نورث كارولاينا في شارلوت بتطوير طريقة جديدة تسمى "DiffSwap++" لحل هذا اللغز تحديداً. يركز عملهم على تعليم الكمبيوتر فهم الهيكل العظمي ثلاثي الأبعاد غير المرئي للوجه، رغم أن الصورة النهائية التي ينشئها تكون مسطحة وثنائية الأبعاد. أدرك الباحثون أنه لتبديل وجه بشكل مثالي، يحتاج النظام ليس فقط لمعرفة كيف يبدو الوجه من الأمام، بل كيف تترتب الملامح في الفراغ. ولتحقيق ذلك، قاموا بتدريب نموذجهم باستخدام نوع خاص من الخرائط الرقمية التي تلتقط عمق وحجم الوجه. خلال مرحلة التدريب، يتعلم الكمبيوتر إسقاط صورة مسطحة في هذا الفضاء ثلاثي الأبعاد، وتحليل البنية الأساسية قبل تحويلها مرة أخرى إلى صورة قياسية. وتسمح هذه العملية للنموذج بفصل هوية الشخص —بنيته العظمية الفريدة وملمس جلده— عن الوضعية والتعبير، اللذين يمثلان مجرد مواضع مؤقتة لتلك البنية.
يكمن الابتكار في كيفية استخدام هذه المعرفة ثلاثية الأبعاد. لا يتطلب الباحثون من الكمبيوتر بناء نموذج ثلاثي الأبعاد كامل في كل مرة يقوم فيها بتبديل وجه؛ بدلاً من ذلك، يستخدمون المعلومات ثلاثية الأبعاد فقط أثناء تعلم النظام. وبمج-بمج انتهاء التدريب، يمكن للنموذج إجراء عملية التبديل باستخدام صور ثنائية الأبعاد قياسية فقط، مما يجعل العملية سريعة وعملية. يأخذ النظام صورة مصدر لشخص ما وصورة هدف لشخص آخر في وضعية مختلفة، ثم يستخدم الدروس المستفادة من التدريب ثلاثي الأبعاد لإعادة بناء وجه الهدف، مستبدلاً ملامحه بملامح الشخص المصدر مع الحفاظ بدقة على زاوية رأس الهدف وتعبيرات وجهه. وهذا يضمن أن تبدو الصورة النهائية وكأن الشخص المصدر موجود بشكل طبيعي في المشهد، وليس مجرد ملصق موضوع فوق وجه آخر.
لاختبار ما إذا كانت طريقتهم قد نجحت بالفعل، أجرى الباحثون تجارب مكثفة باستخدام آلاف الصور من مجموعات بيانات عامة تحتوي على صور بورتريه عالية الجودة لأشخاص حقيقيين. وقارنوا نظامهم الجديد بعدة طرق موجودة حالياً، بما في ذلك أدوات GAN القديمة ونماذج الانتشار الأحدث. وأظهرت النتائج تفوقاً واضحاً لـ DiffSwap++. فعندما قاس الباحثون مدى جودة احتفاظ الوجوه المستبدلة بهوية الشخص الأصلي، سجلت طريقتهم باستمرار درجات أعلى من أي نهج سابق. وفي الاختبارات المصممة لمعرفة ما إذا كانت الوجوه المستبدلة يمكن أن تخدع نظام التعرف البيومتري، كان Diff-Swap++ أكثر نجاحاً بشكل ملحوظ في الحفاظ على هوية المصدر مقارنة بمنافسيه. وفي الوقت نفسه، لم يضح بالمنظر الطبيعي لوضعية الهدف أو تعبيره. وبينما أنتجت الطرق الأخرى غالباً وجوهاً تبدو مشوهة قلياً أو فشلت في نقل الهوية بالكامل، أنتج DiffSwap++ صوراً كانت في غاية الواقعية والأمانة للشخص الأصلي.
كما أجرى الفريق دراسة مع متطوعين بشريين لمعرفة مدى إقناع الصور للعين المجردة. عُرضت على المشاركين مجموعات من الوجوه المستبدلة وطُلب منهم تقييم مدى الحفاظ على الهوية والتعبير والوضعية. وأكدت النتائج ما أشارت إليه القياسات الحاسوبية: وجد الناس أن الصور التي أنشأها DiffSwap++ هي الأكثر واقعية وإقناعاً. بدت الوجوت طبيعية، دون وجود آثار غريبة أو دمج غير طبيعي غالباً ما يكشف التلاعب الرقمي. في المقابل، تركت الطرق الأخرى أحياناً علامات واضحة على التزوير، مثل العيون الغائرة أو الأنسجة غير المنتظمة حول الفم. ومن خلال دمج الوعي الهيكلي ثلاثي الأبعاد في عملية التعلم، أثبت الباحثون أنه من الممكن تحقيق مستوى من التفاصيل والدقة كان بعيد المنال سابقاً، مما يخلق عمليات تبديل وجوه ليست مذهلة بصرياً فحسب، بل أيضاً قوية علمياً في الحفاظ على الهوية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.