FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation
تُعد FaithfulFaces إطار عمل مبتكر لتوليد الفيديو من النصوص يعالج تشوه الهوية في المشاهد الديناميكية المعقدة عبر تقديم أداة محاذاة للهوية مشتركة مع الوضعية ومجموعة بيانات متنوعة ومنسقة للحفاظ على اتساق هوية الوجه القوي عبر التباينات الكبيرة في الوضعيات والانسدادات.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تريد إنشاء فيلم قصير يظهر فيه شخص محدد (لنسمه "بوب") وهو يمارس الملاكمة. لديك صورة واحدة فقط لبوب، وتريد من الذكاء الاصطناي أن يولد فيديو له وهو يوجه لكمات، ويتفادى الضربات، ويتحرك في الأرجاء.
المشكلة في أدوات الذكاء الاصطناي الحالية هي أنها تشبه مرضى فقدان الذاكرة؛ فعندما يلتفت بوب جهة اليسار، ينسى الذكاء الاصطناي شكل بوب من تلك الزاوية، مما قد يحوله فجأة إلى شخص آخر، أو يجعل وجهه يذوب ليصبح كتلة غريبة. وإذا وضع يده أمام وجهه، يصاب الذكاء الاصطناي بالذعر وتتشوه ملامحه.
تقدم ورقة بحثية بعنوان "FaithfulFaces" نظاماً جديداً صُمم لحل هذه المشكلة. إليك كيف يعمل، مشروحاً ببساة:
١. المشكلة الجوهرية: فخ "الرؤية الواحدة"
تعتمد معظم نماذج الذكاء الاصطناي الموجودة حالياً على النظر إلى صورتك المرجعية وتقول: "حسناً، أنا أرى وجه بوب من الأمام مباشرة". لكنها لا تدرك أن وجه بوب هو جسم ثلاثي الأبعاد يمكن أن يلتفت، ويميل، ويلتوي. وعندما يطلب الفيديو لقطة جانبية، يحاول الذكاء الاصطناي التخمين، وغالباً ما يخطئ في التخمين، مما يؤدي إلى تشوه الوجه.
٢. الحل: مترجم "مخلص للوضعية"
قام المؤلفون ببناء إطار عمل جديد يسمى FaithfulFaces. تخيل هذا الإطار كأنه مترجم ذكي جداً يجلس بين صورتك ومولد الفيديو.
- الطريقة القديمة: المترجم يقول فقط: "هذا هو وجه بوب".
- طريقة FaithfulFaces: المترجم يقول: "هذا هو وجه بوب، وهذا هو بالضبط كيف يميل رأسه، ويلتفت، ويدور في الفضاء ثلاثي الأبعاد".
٣. كيف يعمل: "قاموس الوضعيات"
السر وراء FaithfulFaces هو مكون يسمى "مُحاذي الهوية المشترك للوضعية" (Pose-Shared Identity Aligner).
تخيل مكتبة ضخمة (قاموساً) مليئة بالبطاقات.
- المكتبة القديمة: كانت تحتوي على بطاقات لـ "وجه بوب"، ولكن لا توجد بطاقات لـ "وجه بوب ملتف لليسار" أو "وجه ببب ينظر للأعلى".
- مكتبة FaithfulFaces: تحتوي على "قاموس وضعيات" خاص. لقد تعلمت أن "وجه بوب" هو نفس الشخص سواء كان ينظر لليسار، أو اليمين، أو الأعلى، أو الأسفل.
عندما يرى النظام صورتك، فإنه لا يكتفي بنسخ البكسلات (Pixels)، بل يقوم بما يلي:
١. قياس الوضعية: يحسب الزاوية الدقيقة للرأس (مثل استخدام منقلة ثلاثية الأبعاد لقياس الميل).
٢. استشارة القاموس: يبحث عن كيفية ظهور "بوب" عند تلك الزاوية المحددة.
٣. محاذاة الهوية: يضمن أنه حتى لو تغيرت الزاوية، فإن "جوهر" الوجه (الهوية) يظل ثابتاً.
٤. "صالة التدريب الرياضية"
لتعليم هذا النظام، لم يستطع الباحثون استخدام فيديوهات عشوائية؛ بل احتاجوا إلى فيديوهات يحرّك فيها الأشخاص رؤوسهم بحركات جامحة.
- قاموا ببناء مسار بيانات خاص (خط إنتاج) بحث عن آلاف الفيديوهات.
- استبعدوا الفيديوهات المملة حيث يقف الناس بلا حراك.
- احتفظوا فقط بالفيديوهات التي يمارس فيها الأشخاص الملاكمة، أو الرقص، أو يحركون رؤوسهم بشكل كبير.
- غدوا هذه الفيديوهات ذات "الحركة الجامحة" للذكاء الاصطناي ليتعلم: "حسناً، عندما يلتفت الرأس ٩٠ درجة، يتحرك الأنف إلى هنا، لكن العينين لا تزالان تبدوان مثل بوب".
٥. النتيجة: ممثل مخلص
في تجاربهم، طلبوا من الذكاء الاصطناي إنشاء فيديو لشخص يمارس الملاكمة (سيناريو مليء بحركات الرأس السريعة والأيدي التي تحجب الوجه).
- المنافسون (مثل Kling أو ConsisID): وجه الملاكم يتغير شكله، أو يبدو كشخص آخر، أو يفقد ملامحه عندما يلتفت برأسه.
- FaithfulFaces: ظل الملاكم يبدو كأنه نفس الشخص، بملامح واضة، حتى عندما كان يوجه لكمات، أو يتفادى الضربات، أو ينظر للأعلى.
ملخص التشبيه
إذا كان صنع فيديو باستخدام الذكاء الاصطناي الحالي يشبه محاولة رسم شخص من صورة واحدة ثم التخمين كيف يبدو من الجانب (مما ينتج عنه غالباً رسم كاريكاتوري)، فإن FaithfulFaces يشبه امتلاك نحات ثلاثي الأبعاد يعرف تماماً كيف بُني وجه الشخص. مهما تحرك الشخص، يضمن النحات أن يحتفظ الطين بالشكل والهوية الصحيحين.
وتزعم الورقة البحثية أن هذه الطريقة هي الأفضل في الحفاظ على مظهر وجه الشخص واقعياً ومتسقاً، حتى عندما يقوم بأفعال ديناميكية ومعقدة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.