PaletteGAN: Palette-Guided Controllable Colorization for Fashion Sketches
تقترح هذه الورقة البحثية PaletteGAN، وهو إطار عمل لشبكات الخصومة التوليدية (GAN) الموجهة بلوحة الألوان، والذي يعزز الحفاظ على الهيكل والتحكم في الألوان في تلوين رسومات الأزماط من خلال دمج تعزيز البيانات المحافظ على السطوع، وبناء لوحة ألوان مكونة من ستة ألوان محسنة إدراكياً، وبنية متخصصة للمولد والمميز، محققاً أداءً فائقاً في الواقعية البصرية واتساق التصميم على مجموعة بيانات ميريلاند المنقحة (Cleaned Maryland Dataset).
المؤلفون الأصليون:Jingyi Zhu, Jinxing Liang, Hang Luo, Xinrong Hu
في عالم تصميم الأزياء، لا يعدو الرسم التخطيطي كونه مجرد هيكل عظمي؛ فهو يجسد شكل قطعة الملابس، أو انسيابية الكم، أو انحناءة الياقة، لكنه يفتقر إلى الحياة التي يمنحها اللون. لعقود من الزمن، تطلب تحويل هذه الرسومات بالأبيض والأسود إلى رؤى ملونة كاملة يدًا بشرية متأنية ودقيقة، كانت تختبر تركيبات لا حصر لها لإيجاد التناغم المثالي. واليوم، تتعلم الحواسيب القيام بهذا العمل، لكنها تواجه تحديًا فريدًا: فخلافًا للصورة الفوتوغرافية البسيطة، يعد رسم الأزياء خريطة معقدة من الطيات والدرزات والخطوط الزخرفية التي يجب أن تظل سليمة تمامًا بينما يبتكر الكمبيوتر الألوان. فإذا نجح الجهاز في ضبط اللون ولكن أدى ذلك إلى طمس الخطوط، تصبح النتيجة عديمة الفائدة للمصمم. والهدف هو إنشاء نظام يمكنه أخذ خيارات الألوان المحددة للمصمم وتطبيقها على الرسم التخطيطي بدقة اليد البشرية، مع الحفاظ على كل تفصيل هيكلي واستكشاف إمكانيات بصرية جديدة.
لقد طور باحثون في جامعة ووهان للتكنولوجيا النسيجية أداة جديدة تسمى PaletteGAN لحل هذه المشكلة تحديدًا. وبدلاً من ترك الكمبيوتر يخمن الألوان التي قد تبدو جيدة، يطلب هذا النظام من المصمم تقديم مجموعة محددة من ستة ألوان أولاً. فكر في هذه المجموعة كصندوق صغير ومنسق من الأصباغ. بعد ذلك، يأخذ الكمبيوتر رسمًا تخطيطيًا للأزياء وهذه المجموعة المحددة من الألوان ويعمل على تلوين قطعة الملابس، مما يضمن أن تبدو الصورة النهائية واقعية وأن تظل الألوان في مكانها الذي أراده المصمم تمامًا. ووجد الفريق أنه من خلال الجمع بين طريقة محددة لرسم خطوط الرسم التخطيطي وطريقة ذكية لاختيار تلك الألوان الستة، استطاعوا توليد صور أكثر دقة واستقرارًا من المحاولات السابقة.
تبدأ العملية بالبيانات نفسها. بدأ الباحثون بمجموعة كبيرة من صور الأزياء الحقيقية. ولتعليم الكمبيوتر كيفية التعامل مع مختلف مستويات الإضاءة والظلال، أنشأوا آلاف المتغيرات من هذه الصور عن طريق تغيير الألوان ببراعة مع الحفاظ على السطوع كما هو تمامًا. ومن كل صورة، استخرجوا رسمًا تخطيطيًا، ولكن ليس أي رسم عشوائي؛ فقد اختبروا أربع طرق مختلفة لرسم خطوط قطعة الملابس. اعتمدت إحدى الطرق على تتبع الحواف ببساطة، بينما حاولت طريقة أخرى الحفاظ على الطيات والدرزات الداخلية مرئية. واكتشف الباحثون أن النهج الأكثر نجاحًا كان تقنية هجينة تحافظ على الخط الخارجي القوي للملابس مع الحفاظ أيضًا على الخطوط الدقيقة والضعيفة في الداخل التي توضح كيفية طي القماش. هذا النوع المحدد من الرسم التخطيطي، الذي أطلقوا عليه اسم DC-HED-Contour، وفر أوضح خريطة يمكن للكمبيوتر اتباعها.
بعد ذلك جاء اختيار الألوان. إن الطريقة الشائعة لاختيار الألوان من صورة ما هي تجميع الظلال المتشابهة معًا، لكن هذا غالبًا ما يغفل التفاصيل الصغيرة والمهمة مثل زر صغير أو حاشية محددة. طور الفريق استراتيجية جديدة لضمان أن تكون الألوان الستة في لوحة الألوان ليست فقط الألوان الأكثر شيوعًا، بل تتضمن أيضًا ظلالًا متميزة ومتباينة تمنح قطعة الملابس طابعها الخاص. استخدموا قاعدة رياضية لضمان أنه بمجرد اختيار لون رئيسي، يجب أن يكون اللون التالي المختار مختلفًا قدر الإمكان عن اللون الأول من حيث الإدراك البشري. وقد ضمن ذلك أن تحتوي لوحة الألوان النهائية دائمًا على لون مهيمن إلى جانب تنوع كافٍ لالتقاط التفاصيل الثانوية والتفاصيل التكميلية للتصميم.
جوهر ابتكارهم هو الشبكة العصبية، وهي نوع من البرامج الحاسوبية المصممة للتعلم من الأمثلة. يتكون هذا النظام من جزأين رئيسيين يعملان بالتوازي؛ الجزء الأول هو "المولد" (generator)، الذي يأخذ الرسم التخطيطي ولوحة الألوان المكونة من ستة ألوان ويحاول رسم الصورة. أما الجزء الثاني فهو "المميز" (discriminator)، الذي يعمل كناقد صارم؛ فهو لا ينظر فقط إلى الصورة النهائية ليرى ما إذا كانت تبدو حقيقية، بل يتحقق أيضًا مما إذا كانت الخطوط تطابق الرسم التخطيطي الأصلي وما إذا كانت الألوان تطابق اللوحة المقدمة. ومن خلال مقارنة عمله باستمرار مع هذه القواعد الصارمة، يتعلم المولد إنتاج صور ليست ملونة فحية فحسب، بل مثالية من الناحية الهيكلية أيضًا. وقد اختبر الباحثون هذا النظام مقابل عدة طرق موجودة بالفعل ووجدوا أن نهجهم أنتج نتائج أكثر واقعية. وعندما قاسوا مدى قرب الصور المولدة من الصور الفوتوغرافية الحقيقية، سجلت طريقتهم درجات أفضل بكثير من المنافسين.
ولعل الاكتشاف الأهم لم يكن يتعلق فقط بجودة الصور المتوسطة، بل بالاستمرارية. فالأنظمة الأخرى قد تنتج أحيانًا بعض الصور المثالية ولكن الكثير غيرها تكون ضبابية أو تحتوي على بقع لونية غريبة. ومع ذلك، قدم النظام الجديد نتيجة ثابتة وعالية الجودة في معظم الحالات الاختبارية. لقد نجح في الحفاظ على الطيات المعقدة للفستان والخطوط الحادة للياقة مع تطبيق الألوان التي اختارها المصمم دون تلطيخ أو تداخل. ورغم أن النظام ليس مثاليًا — إذ يمكنه أحيانًا مواجهة صعوبة مع الأنسجة المعقدة للغاية أو التدرجات اللونية الدقيقة جدًا — إلا أنه يمثل خطوة كبيرة للأمام. فهو يثبت أنه من خلال منح الكمبيوتر خريطة هيكلية واضحة ومجموعة مختارة بعناقة من الألوان، يمكننا أتمتة العملية الإبداعية لتصميم الأزياء دون فقدان اللمسة البشرية التي تمنح الرسم التخطيطي حياته.
ملخص تقني: PaletteGAN
بيان المشكلة يهدف تلوين رسومات الأزياء إلى توليد صور أزياء ملونة وقابلة للاستخدام من معلومات لونية محددة مع الحفاظ الصارم على هيكل الملابس. تعاني الطرق الحالية غالبًا من ثلاث مشكلات رئيسية: عدم اكتمال الحفاظ على التفاصيل الهيكلية، وعدم استقرار التحكم في الألوان (صعوبة الالتزام بلوحات الألوان التي يحددها المصمم)، والعيوب البصرية في مناطق الأزياء المعقدة. بخلاف تلوين الصور العام، يتطلب تصميم الأزياء احتفاظًا دقيقًا بعناصر هيكلية محددة مثل الياقات، والأساور، وخطوط الخصر، وحواف الملابس، والطيات، والخطوط الزخرفية المحلية. علاوة على ذلك، فإن طرق التلوين القابلة للتحكم الحالية، والتي صُممت غالبًا للأيقونات البسيطة أو الصور العامة، تفتقر إلى القدرة على التعامل مع الطيات المعقدة، والأنسجة، والزخارف المحلية المتأصلة في رسومات الأزياء مع الالتزام بلوحة ألوان محددة.
المنهجية تقترح الورقة البحثية PaletteGAN، وهي شبكة خصومة توليدية (GAN) موجهة بلوحة ألوان، تأخذ رسمًا تخطيطيًا للأزياء ولوحة ألوان مخصصة مكونة من ستة ألوان كمدخلات مشتركة لتعلم الربط بين المعلومات الهيكلية والبدائل اللونية (color priors). تتكون المنهجية من أربعة مكونات أساسية:
بناء البيانات وتعزيزها:
تم بناء مجموعة بيانات ثلاثية تتكون من رسم تخطيطي للأزياء، ولوحة ألوان من ستة ألوان، وصورة أزياء ملونة.
لتوسيع بيانات التدريب، تم تطبيق تقنية تعزيز الألوان مع الحفاظ على السطوع؛ ويتضمن ذلك تغيير تدرج اللون (Hue) في فضاء HSV مع الحفاظ على قناة الإضاءة الأصلية في فضاء Lab، مما يولد 18 متغيرًا لونيًا لكل صورة.
تم اشتقاق مجموعة البيانات من فئة "الفساتين" (Dresses) من مجموعة بيانات "Cleaned Maryland"، مما نتج عنه 10,076 ثلاثية للتدريب.
توليد لوحة الألوان المخصصة:
تستخدم طريقة مبتكرة لتوليد لوحة الألوان تجمع بين تجميع K-means واستراتيجية اختيار MAXMIN في فضاء ألوان CIELAB.
يستخرج K-means مراكز الألوان المرشحة من قطعة الملابس. ويتم اختيار اللون المهيمن بناءً على نسبة البكسلات.
يتم اختيار الألوان اللاحقة باستخدام مبدأ MAXMIN: حيث يتم اختيار المرشح الذي يمتلك أقصى مسافة لأقرب جار للمجموعة المختارة مسبقًا. يضمن ذلك تضمين ألوان ثانوية وألوان زينة محلية متميزة بصريًا مع الحفاظ على اللون المهيمن، دون الحاجة إلى تسميات دلالية صريحة.
استخراج الرسم التخطيطي المحسن (DC-HED-Contour):
لمعالجة فقدان الحواف الضعيفة والتفاصيل الداخلية في اكتشاف الحواف القياسي، استخدم المؤلفون طريقة DC-HED-Contour المحسنة.
تعتمد هذه الطريقة على شبكة اكتشاف الحواف الهيكلية (HED) من خلال تقليل طبقات التجميع (pooling layers) وإدخال التلافيف المتسعة (dilated convolutions) للحفاظ على تفاصيل الحواف.
تُستخدم قناع منطقة الملابس لاستخراج المخطط الخارجي، والذي يتم دمجه فوق نتائج DC-HED لإزالة ضوضاء الخلفية، مما ينتج رسمًا تخطيطيًا يوازن بين الحدود الرئيسية الواضحة والمعلومات الهيكلية الداخلية الكافية.
بنية شبكة PaletteGAN:
المولد (Generator): يستخدم بنية (مشفر–دمج الميزات–فك التشفير). يستخرج المشفر الميزات الهيكلية متعددة المقاييس من الرسم التخطيطي، بينما تقوم وحدة منفصلة بتشفيد لوحة الألوان إلى ميزة بديلة لونية. يتم دمج هذه الميزات (دمج الميزات) قبل تمريرها إلى فك التشفير، الذي يعيد استعادة الدقة المكانية عبر رفع العينات (upsampling) والوصلات المتخطية (skip connections).
المميز (Discriminator): تم تصميم بنية Multi-branch PatchGAN لإجراء تمييز مشترك. يأخذ ثلاثة مدخلات: الرسم التخطيطي (لميزات الخطوط)، والصورة (لميزات اللون/النسيج)، ولوحة الألوان (للميزات البديلة). يتم دمج هذه المدخلات وتغذيتها في هيكل PatchGAN لفرض الاتساق الهيكلي، والمحاذاة اللونية، والواقعية البصرية في آن واحد.
دوال الخسارة (Loss Functions): يتم تحسين النموذج باستخدام دالة خسارة متعددة الأبعاد تجمع بين خسارة الخصومة، وخسارة إعادة البناء L1، وخسارة اللون الإدراكية، وخسارة البنية SSIM، وخسارة النمط (style loss)، وخسارة الإدراك عالي المستوى.
المساهمات الرئيسية
بناء مجموعة بيانات ثلاثية: إنشاء مجموعة بيانات مخصصة لتلوين رسومات الأزياء باستخدام تعزيز الحفاظ على السطوع ودمج توليد الرسم التخطيطي/لوحة الألوان.
استراتيجية توليد لوحة الألوان: طريقة هجينة تستخدم K-means واختيار MAXMIN لتوليد لوحات ألوان من ستة ألوان توازن بين الألوان المهيمنة والألوان الثانوية/الزينة المتميزة بصريًا.
بنية PaletteGAN: إطار عمل GAN يتميز بمولد يدمج ميزات لوحة الألوان ومميز Multi-branch PatchGAN الذي يفرض قيودًا مشتركة على البنية واللون والنسيج.
التحقق الشامل: دراسات استئصال (ablation studies) واسعة النطاق على أنواع الرسومات ودوال الخسارة، إلى جانب المقارنات مع النماذج الرائدة (IconFlow، FlexIcon، Comicolorization).
النتائج
الأداء الكمي: حقق PaletteGAN مسافة فريدشيه للإنتروبيا (FID) قدرها 8.6578، وهي الأقل بين جميع طرق المقارنة (أقل بكثير من 12.3338 لـ FlexIcon و27.8700 لـ IconFlow).
دقة البنية والبكسل: حقق النموذج نسبة إشارة إلى الضوضاء (PSNR) تبلغ 33.02 ومقياس تشابه بنيوي (SSIM) قدره 0.9047. وبينما أظهر FlexIcon قيمًا أعلى قليلاً في متوسط PSNR وSSIM، أظهر PaletteGAN تشابهًا توزيعيًا متفوقًا مع الصور الحقيقية (FID أقل).
الاتساق: أظهر PaletteGAN انحرافًا معياريًا أقل في SSIM (0.0370 مقابل 0.0433 لـ FlexIcon) وأنتج عينات أقل جودة (222 عينة بـ SSIM < 0.85 مقابل 931 لـ FlexIcon)، مما يشير إلى جودة بصرية أكثر استقرارًا عبر مجموعة الاختبار.
نتائج الاستئصال: حقق نوع الرسم التخطيطي DC-HED-Contour أفضل النتائج، مما يؤكد الحاجة إلى كل من الحدود الخارجية الواضحة والخطوط الهيكلية الداخلية. كما تبين أن إعداد دالة الخسارة الكاملة يوفر الأداء الأكثر توازنًا؛ حيث أدى حذف مصطلحات معينة (مثل SSIM أو خسارة النمط) إلى تدهور في الحدود الهيكلية أو تفاصيل النسيج.
الأهمية والادعاءات تزعم الورقة أن PaletteGAN ينجح في توليد صور أزياء واضحة هيكليًا، ومتسقة لونيًا، ومعقولة بصريًا، مما يدعم الاستكشاف اللوني الفعال في التصميم الرقمي للأزياء. ومن خلال دمج توجيه لوحة الألوان الصريح مع القيود الهيكلية، تعالج الطريقة قيود الأدوات الحالية التي غالبًا ما تفشل في الالتزام بمخططات الألوان التي يحددها المصمم أو الحفاظ على تفاصيل الملابس المعقدة. ويؤكد المؤلفون أن النموذج يحقق أداءً متوازنًا عبر الحفاظ على البنية، والتحكم في اللون، والاتساق عبر العينات، مما يجعله أداة قابلة للتطبيق في سير عمل تصميم الأزوات المؤتمت.
القصور يشير المؤلفون بتواضع إلى أن النموذج قد ينتج تحولات لونية طفيفة للملابس ذات التدرجات الواضحة أو الأنسجة شديدة التعقيد. بالإضافة إلى ذلك، بالنسبة للعينات التي تشغل فيها ألوان الزينة نسبة صغيرة جدًا، قد تضعف النتائج المولدة هذه المناطق الزخرفية الصغيرة. تُعزى هذه القيود إلى قيود لوحة الألوان المكونة من ستة ألوان منفصلة، وتكوين مجموعة البيانات، والافتقار إلى القيود الدلالية على مستوى أجزاء الملابس. ويُقترح في العمل المستقبلي دمج تقسيم أجزاء الملابس وآليات الانتباه المحلي (local attention mechanisms).