A Large-scale Evaluation of Text-guided Models for Facial Editing
تقدم هذه الورقة أول تقييم واسع النطاق لستة نماذج لتعديل الوجوه بتوجيه نصي، حيث تقدم مجموعة بيانات جديدة تضم ١٦٩ سمة وتكشف أنه بينما تتفوق هذه النماذج في تعديلات الشعر والإكسسوارات، فإنها تعاني في تغييرات الوضعية وتظهر تحيزات ديموغرافية كبيرة في الإفراط في تعديل الوجوه الداكنة للذكور والوجوه الأكبر سناً.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل فناناً رقمياً يمكنه تغيير لون شعر شخص ما، أو إضافة نظارة طبية، أو جعل رأسه يلتفت نحو الأفق، كل ذلك بمجرد كتابة جملة بسيطة في جهاز الكمبيوتر. هذا هو الوعد الذي يقدمه تحرير الصور الموجه بالنص، وهو مجال ينمو بسرعة حيث يتعلم الذكاء الاصطناعي فهم اللغة البشرية وتطبيق تلك التعليمات على الصور الفوتوغرافية. لسنوات، بنى الباحثون أنظمة قادرة على تحقيق هذه الإنجازات، لكنها غالباً ما كانت تعاني من تحدٍ محدد: الحفاظ على مظهر الشخص في الصورة ليبدو كما هو بينما يتم إجراء التغييرات المطلوبة. كانت الأساليب القديمة إما تغير الوجه كثيراً، مما يجعله غير قابل للتعرف عليه، أو تكتفي بإجراء تعديلات محدودة للغاية، مثل تغيير زاوية الرأس. والآن، ظهر جيل جديد من الأدوات التي تدعي حل هذه المشكلات، مقدمة القدرة على إجراء تعديلات معقدة وواقعية بناءً على مطالبات نصية. ولكن مع ازدياد قوة هذه الأدوات، يظل هناك سؤال جوههرى: هل تعمل هذه الأدوات بشكل متساوٍ للجميع، أم أن بها عيوباً خفية تعامل مجموعات مختلفة من الناس بشكل غير عادل؟
لقد وضع فريق من الباحثين حداً لهذا السؤال من خلال وضع ستة من أكثر نماذج التحرير الموجه بالنص شيوعاً تحت الاختبار. لم يطلبوا من أجهزة الكمبيوتر إجراء بعض التغييرات العشوائية فحسب؛ بل أجروا تقييماً منهجياً ضخماً شمل ما يقرب من مليون عملية تحرير للصور. كان الهدف هو معرفة مدى قدرة هذه النماذج على التعامل مع تسلسل من أربعة تعليمات مختلفة على التوالي، مثل تغيير لون الشعر، ثم إضافة قبعة، ثم تغيير القبعة، وأخيراً تغيير اتجاه الرأس. وللقيام بذلك، أنشأ الباحثون مكتبة جديدة واسعة تضم 169 مهمة تحرير محددة تركز على الشعر، والإكسسوارات، ووضعية الرأس. واختبروا النماذج على مجموعتين كبيرتين من صور المشاهير، لضمان وجود مزيج متنوع من الرجال والنساء، والشباب وكبار السن، والأشخاص ذوي البشرة الفاتحة والداكنة.
كشفت النتائج عن صورة واضحة لمكانة هذه التقنيات اليوم. فقد أثبتت النماذج قدرة جيدة على التعامل مع التغييرات في الشعر والإكسسوارات. فعندما طُلب منها تغيير تسريحة الشعر أو إضافة نظارات شمسية، أدى معظم الأنظمة أداءً جيداً، حيث اتبعت التعليمات بنجاح مع الحفاظ على ملامح الشخص قابلة للتعرف عليها. ومع ذلك، واجهت النماذج نفسها صعوبة كبيرة عندما طُلب منها تغيير وضعية الجسم، مثل جعل الشخص ينظر إلى اليسار أو اليمين. وفي هذه الحالات، غالباً ما فشلت الأنظمة في اتباع الأمر أو غيرت الوجه بطرق جعلت الشخص غير قابل للتعرف عليه.
ولعل الأمر الأكثر إثارة للقلق هو الاكتشاف بأن جميع النماذج تميل إلى "التحرير الزائد". وهذا يعني أنه عندما تُعطى تعليمات محددة، فإن الكمبيوتر غالباً ما يغير أشياء لم يُطلب منه تغييرها. على سبيل المثال، إذا طلب مستخدم من النموذج تغيير تسريحة شعر الشخص إلى قصة "البوب"، فقد يقوم النموذج أيضاً بتغيير لون الشعر إلى البني، رغم أن المستخدم لم يطلب أبداً تغيير اللون. ووجد الباحثون أن هذا يحدث بشكل متكرر، حيث تقوم النماذج بنحو 25 تغييراً إضافياً غير مرغوب فيه لكل 100 تعليمات تُعطى لها. ولم تكن هذه الأخطاء عشوائية؛ بل كانت تنبع غالباً من تعلم النماذج لارتباطات خاطئة، مثل الاعتقاد بأن تسريحة شعر معينة تترافق دائماً مع لون شعر محدد.
كما كشفت الدراسة عن تحيزات كبيرة في كيفية تعامل هذه النماذج مع مختلف الأشخاص. فقد كان "التحرير الزائد" غير موزع بالتساوي عبر جميع الوجوه؛ إذ كانت النماذج أكثر عرضة لإجراء تغييرات غير مرغوب فيها عند تحرير وجوه الرجال، وخاصة أولئك ذوي البشرة الداكنة، وعند تحرير وجوه كبار السن. فعلى سبيل المثال، عندما طُلب تحرير شعر رجل ذي بشرة داكنة، كان النظام أكثر عرضة لتغيير ملامح أخرى بالخطأ، مثل إضافة شعر الوجه أو تغيير لون البشرة، مقارنة بتحرير وجه امرأة ذات بشرة فاتحة. وبالمثل، كانت النماذج أقل نجاحاً في الحفاظ على هوية الوجوه المسنة، حيث جعلتها تبدو أصغر سناً أو غيرت ملامحها بشكل جذري أكثر من الوجاء الأصغر سناً.
تشير هذه النتائج إلى أنه على الرغم من أن أدوات التحرير الموجهة بالنص أصبحت قوية بما يكفي للاستخدام في العالم الحقيقي، إلا أنها ليست مثالية بعد. فهي تعمل جيداً في المهام البسيطة مثل إضافة قبعة أو تغيير لون الشعر، لكنها لا تزال تعاني مع الحركات الأكثر تعقيداً وتحمل تحيزات خفية يمكن أن تؤدي إلى نتائج غير عادلة أو غير دقيقة لمجموعات معينة. ويؤكد الباحثون أن العمل المستقبلي يجب أن يركز على إصلاح عادات "التحرير الزائد" هذه وضمان أن تتعامل هذه التكنولوجيا مع كل وجه بنفس المستوى من الدقة والاحترام، بغض النظر عن العمر أو الجنس أو لون البشرة. وإلى أن يتم حل هذه المشكلات، يجب على المستخدمين أن يدركوا أن هؤلاء الفنانين الرقميين لا يزالون في مرحلة التعلم، وقد يغيرون أحياناً أكثر مما طُلب منهم.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.