FashionPose: Unified Text-Driven Fashion Synthesis with Joint Geometric and Photometric Control
يُعد FashionPose إطار عمل موحداً مدفوعاً باللغة يتغلب على قيود التوليد التقليدي الموجه بالوضعية من خلال توظيف بنية متتالية لتوليد أوضاع خالية من القوالب وإعادة إضاءة مدركة للمشهد بشكل مشترك، مما يتيح توليد ملابس واقعي وقابل للتحكم لأغراض التجارة الإلكترونية في مجال الأزياء.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك مخرج في موقع تصوير فيلم، ولكن بدلاً من توظيف ممثلين، أنت تعطي أوامر لفنان رقمي لرسم شخص يرتدي زياً معيناً. في عالم الرؤية الحاسوبية - وهو علم تعليم الحواسيب كيف "ترى" وتنشئ الصور - تعتبر هذه مهمة صعبة. عادةً، إذا أردت من الكمبيوتر رسم شخص في وضعية جديدة، عليك تزويده بهيكل عظمي صلب، مثل مانيكان سلكي، ليمسك بالملابس. الأمر يشبه محاولة إلباس دمية لا يمكنك تحريك مفاصلها إلا إذا كان لديك مخطط جاهز مسبقاً. علاوة على ذلك، يعمل معظم هؤلاء الفنانين الرقميين في "استوديو" ذي إضاءة مسطحة ومملة. إذا طلبت منهم رسم شخص يقف في حديقة مشمسة عند الغروب، فقد يرتبك الكمبيوتر، مما يجعل الشخص يبدو كملصق مسطح تم لصقه على خلفية لا تتناسب مع الإضاءة. تعالج هذه الورقة البحثية مشكلة كيفية إخبار الكمبيوتر بإنشاء صورة أزياء واقعية باستخدام كلماتك فقط، مع التعامل مع حركات الجسم المعقدة والإضاءة المعقدة دون الحاجة إلى هيكل عما مسبق أو إعدادات استوديو.
يقترح الباحثون وراء هذا العمل، بقيادة تشوان تشنغ شي وزملائه، نظاماً جديداً يسمى FashionPose. فكر في الأمر كـ "مترجم سحري" يحول أوصافك باللغة الطبيعية مباشرة إلى عرض أزياء جاهز للثلاثي الأبعاد، متجاوزاً الحاجة إلى الهياكل السلكية الصلبة. هم يجادلون بأن الطريقة القديمة في القيام بالأشياء -الاعتماد على هياكل عظمية محددة مسبقاً وتجاهل البيئة- هي طريقة محدودة للغاية. بدلاً من ذلك، يستخدم نظامهم عملية "متتالية" مكونة من ثلاث خطوات لتحويل جملة بسيطة مثل "فتاة تقف بجانب نافذة مشمسة في غرفة دافئة" إلى صورة عالية الجودة حيث تتوافق وضعية الفتاة مع الكلمات، وتصطدم أشعة الشمس بملابسها تماماً كما هو موصوف.
أولاً، يعمل النظام مثل مخرج إبداعي يستمع إلى قصتك ويرسم وضعية (pose). فبدلاً من البحث عن هيكل عظمي جاهز، يستخدم آلية "محاذاة تباينية ثنائية الاتجاه". تخيل هذا كلعبة "ساخن وبارد" حيث يتعلم الكمبيوتر مطابقة شعور كلماتك (مثل "أرجل متقاطعة" أو "أذرع مرفوعة") مباشرة مع هندسة الجسم، دون الحاجة إلى قالب. ولتعليم الكمبيوتر كيفية القيام بذلك، بنى الفريق مكتبة ضخمة جديدة تسمى PoseCap، تحتوي على أكثر من 40,000 زوج من الأوصاف النصية ونقاط مفصلية للجسم. وهذا يسمح للذكاء الاصطناعي بأن يتعلم أن "الوقوف بجانب نافذة مشمسة" ليس مجرد تفصيل في الخلفية؛ بل هو دليل لكيفية سقوط الضوء على الشخص.
بعد ذلك، ينتقل النظام إلى مرحلة "مصمم الأزياء". بمجرد تحديد الوضعية، يقوم بإنشاء صورة عالية الدقة للشخص. ومن الأهمية بمكان أنه يستخدم استراتيجية "مرتكزة على الهوية". تخيل أن لديك صورة لعارضة محددة ترتدي سترة معينة. يأخذ النظام تلك السترة ووجه العارضة، ويثبتهما في مكانهما، ثم يقوم بتمطيطهما وطيّهما لتناسب الوضعية الجديدة التي وصفتها. هذا يضمن أنه حتى لو كانت الشخصية تقوم بحركة رقص معقدة، فإن أزرار السترة ووجه العارضة سيبقيان كما هما تماماً، مما يمنع حدوث أخطاء "الوجه الذائب" أو "الملابس المشوهة" الشائعة في أدوات فن الذكاء الاصطناعي الأخرى.
أخيراً، يتولى النظام مهمة "فريق الإضاءة". وهنا يتفوق FashionPose على الطرق القديمة. فهو يتضمن وحدة "إعادة إضاءة مشروطة بالوصف". إذا قال نصك "الساعة الذهبية" أو "إضاءة استوديو ناعمة"، تقوم هذه الوحدة بتعديل الظلال والإضاءة على الشخص المُنتج لتناسب ذلك الجو المحدد. إنه يشبه وجود فني إضاءة يقرأ السيناريو الخاص بك ويحرك كشافات الضوء حوله ليتناسب مع الحالة المزاجية، مما يضمن عدم ظهور الشخص وكأنه قُص من صورة أخرى ولُصق في مكان آخر.
اختبر الفريق نظامهم بصرامة. ووجدوا أن FashionPose يتفوق على الأساليب الحالية في كل من الدقة والواقعية. في اختباراتهم، حقق النظام خطأ في النقاط المفصلية (MSE) قدره 243.8، وهو أقل (أفضل) من أفضل الأساليب التالية التي كانت تحوم حول 262.2. وعندما تعلق الأمر بالمظهر العام للصور، مقاساً بمقياس يسمى FID (حيث الأقل أفضل)، سجل FashionPose نتيجة 5.6690، متفوقاً على أفضل مجموعة أدوات سابقة والتي سجلت 6.3671. وفي الدراسات المستخدمة، حيث صوت أشخاص حقيقيون على الصور التي بدت الأفضل، فضل الناس FashionPose في 46.8% من الحالات من حيث اتساق الوضعية و55.9% من حيث الجودة الجمالية العامة.
تستبعد الورقة البحثية صراحةً فكرة أنك بحاجة إلى هيكل عظمي موجود مسبقاً أو خلفية "شبيهة بالاستوديو" محايدة للحصول على نتائج جيدة. هم يجادلون بأن الاعتماد على مقدرات وضعية خارجية يحد مما يمكن للذكاء الاصطناعي فعله، وأن تجاهل البيئة يؤدي إلى صور غير واقعية حيث لا تتناسب الإضاءة مع الوضعية. ومن خلال إثبات أن وصفاً نصياً واحداً يمكنه التحكم في كل من الهندسة (geometry) والضوئية (photometry - الإضاءة) في آن واحد، فإنهم يقترحون طريقاً جديداً لعرض الأزوت الافتراضي. وبينما لا يدعون أنهم حلوا كل مشكلات الكون، إلا أن تجاربهم تشير إلى أن هذا النهج الموحد يخلق حلاً أكثر قوة ومرونة لعرض الأزياء الشخصي والمدرك للمشهد، مما يجعل من السهل على أي شخص تصور الملابس في أي إعداد بمجرد كتابة جملة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.