PROMO: Promptable Outfitting for Efficient High-Fidelity Virtual Try-On
إن PROMO هو إطار عمل تجربة قياس افتراضية قابل للاستجابة للمطالبات، مبني على هيكل Flow Matching DiT مع تكييف متعدد الوسائط كامن وآليات مرجعية ذاتية، يحقق تركيب صور عالي الدقة وفعال من خلال التعامل مع تجربة القياس الافتراضية (VTON) كمسألة تحرير مهيكلة، متجاوزاً بذلك الأساليب الحالية في كل من الجودة البصرية وسرعة الاستدلال.
تخيل أنك تتسوق عبر الإنترنت للحصول على زي جديد. وجدت كنزة جميلة وزوجًا من الجينز، لكنك لست متأكدًا كيف سيبدوان عليك. تود حقًا رؤية صورة لنفسك وأنت ترتدي هذه الملابس، لكنك لا تريد الانتظار حتى يأتي الخياط أو التعامل مع عناء إرجاع الأشياء التي لا تناسبك.
هذه هي المشكلة التي يحلها PROMO. إنه أداة ذكاء اصطناعي جديدة تعمل بمثابة غرفة قياس رقمية سحرية. تقوم برفع صورة لنفسك وصورة للملابس التي تريدها، وسيقوم فورًا بإنشاء صورة واقعية لك وأنت ترتدي تلك القطع تحديدًا.
إليك كيف يعمل PROMO، مشروحًا من خلال تشبيهات بسيطة:
1. "الخياط الذكي" مقابل "آلة الخياطة القديمة"
الطريقة القديمة: كانت أدوات الذكاء الاصطناعي السابقة مثل آلات الخياطة القديمة؛ حيث كانت تحاول "تحريف" أو مط صورة الملابس لتناسب جسمك. وغالبًا ما كان يؤدي ذلك إلى تشوهات غريبة، مثل كنزة تبدو وكأنها ذائبة أو قميص لا يتناسب طول أكمامه مع ذراعك.
طريقة PROMO: PROMO يشبه الخياط الرقمي الماهر الذي يفهم القماش، والقصة، والأسلوب تمامًا. فبدلاً من مط الصورة، يقوم "بطلاء" الملابس الجديدة عليك، بكسل تلو الآخر، مما يضمن أن الملمس (مثل حياكة الكنزة) والإضاءة يبدوان واقعيين تمامًا.
2. "كتاب الوصفات" (الأسلوب القابل للتوجيه)
أحيانًا، لا تريد مجرد ارتداء قميص؛ بل تريد ارتداءه بطريقة محددة. ربما تريد طي الأكمام، أو إدخال القميص داخل البنطال، أو رفع الياقة.
الابتكار: يمتلك PROMO "نظام توجيه الأسلوب" الخاص به. فكر في هذا كأنه مساعد ذكي ينظر إلى الملابس ويكتب وصفة مفصلة لكيفية ظهورها.
كيف يساعد: يمكنك أن تقول للذكاء الاصطناعي: "اجعل الأكمام قصيرة" أو "اجعل المظهر يبدو غير رسمي". يقرأ الذكاء الاصطناعي هذه التعليمات ويعدل الزي الرقمي وفقًا لذلك، مما يمنحك التحكم في المظهر النهائي دون الحاجة لالتقاط صورة جديدة.
3. "الطاهي الكفء" (السرعة والذاكرة)
عادةً، يستغرق إنشاء هذه الصور عالية الجودة وقتًا طويلاً ويتطلب حاسوبًا خارقًا لأن الذكاء الاصطناعي يجب أن يدير الكثير من المكونات (جسمك، الملابس، الخلفية، الوضعية).
الحيلة: يستخدم PROMO حيلة ذكية تسمى "المرجع الذاتي الزمني" (Temporal Self-Reference). تخيل طاهيًا، بدلًا من إعادة قراءة كتاب الوصفات بالكامل عند كل خطوة من خطوات الطبخ، يتذكر المكونات الرئيسية من الخطوة الأولى ويعيد استخدامها لبقية الوجبة.
النتيجة: يتيح ذلك لـ PROMO "طهي" صورة عالية الجودة بسرعة أكبر بكثير من منافسيه، مما يوفر الوقت وقوة الحوسبة دون فقدان الجودة.
4. "القناع الذكي" (عدم الارتباك)
عندما تجرب قميصًا جديدًا، يحتاج الذكاء الاصطناعي إلى معرفة أين ينتهي قميصك القديم وأين يبدأ الجديد بالضبط. إذا ارتبك، فقد يقوم بالخطأ بطلاء القميص الجديد فوق وجهك أو فوق خلفيتك.
الحل: يستخدم PROMO استراتيجية "الفقد الواعي بالمنطقة" (Region-Aware Loss). فكر في هذا كأنه قلم تحديد ذكي. هو يحدد جسمك والملابس التي تقوم بتغييرها، ويخبر الذكاء الاصطناعي: "ركز كل طاقتك هنا! تجاهل الخلفية وبقية الغرفة." هذا يضمن أن تبدو الملابس واضحة وحادة بينما تظل الخلفية كما هي تمامًا.
5. "منسق الأزياء" (تعدد الملابس)
معظم الأدوات القديمة كانت تستطيع تجربة قطعة واحدة فقط في كل مرة (مثل قميص فقط). إذا كنت تريد تجربة طقم كامل (قميص + بنطال + حذاء)، كان عليك القيام بذلك في ثلاث خطوات منفصلة ومعقدة.
التطوير: PROMO هو منسق أزياء كامل. يمكنك رفع صورة لفستان، وزوج من الأحذية، وحقيبة يد جميعها في وقت واحد. إنه يدرك كيف تتناسب جميعها مع جسمك في آن واحد، مما يخلق مظهرًا كاملًا ومتناسقًا في خطوة واحدة.
لماذا يهم هذا؟
للمتسوقين: يمكنك تجربة مئات الأزياء في ثوانٍ، ورؤية كيف تناسبك وكيف تبدو تمامًا قبل الشراء. وهذا يعني تقليل عمليات الإرجاع وزيادة الثقة.
للمتاجر: يمكنهم إظهار كيف تبدو ملابسهم على نوع جسمك أنت، وليس فقط على عارض أزياء عام، مما يجعل التسوق عبر الإنترنت يبدو شخصيًا وواقعيًا.
باختًا، يأخذ PROMO الرياضيات المعقدة للذكاء الاصطناعي ويحولها إلى طريقة بسيطة وسريعة وسحرية لرؤية نفسك في أي زي، في أي وقت، وفي أي مكان. إنه الفرق بين التخمين حول كيفية ملاءمة القميص لك وبين رؤيته فعليًا عليك.
إليك ملخص تقني مفصل لورقة البحث بعنوان "PROMO: PROMO: Promptable Outfitting for Efficient High-Fidelity Virtual Try-On".
1. بيان المشكلة
تعد تجربة الملابس الافتراضية (VTON) تقنية بالغة الأهمية في التجارة الإلكترونية، حيث تهدف إلى عرض الملابس المستهدفة على صورة شخص بدقة عالية. وعلى الرغم من التطورات الأخيرة، تواجه الطرق الحالية ثلاثة تحديات مستمرة:
المفاضلة بين الدقة والكفاءة: تحقق الأساليب القائمة على الانتشار (Diffusion-based methods) (مثل استخدام شبكات UNet أو Transformers مع شبكات مرجعية مساعدة) واقعية فوتوغرافية، لكنها تعاني من بنى معقدة، وبطء في سرعة أخذ العينات، وعبء استدلال مرتفع.
التحكم المحدود: تفتقر العديد من النماذج إلى التحكم الدقيق في "أنماط الارتداء" (مثل إدخال القميص داخل البنطال، أو طول الأكمام) أو تواجه صعوبة في التعامل مع سيناريوهات الملابس المتعددة (مثل تجربة قميص وبنطال في آن واحد).
القوة في مواجهة سيناريوهات الواقع: غالبًا ما تفشل النهج الحالية في السيناريوهات "الواقعية" (in-the-wild) التي تتضمن ملابس فضفاضة، أو عوائق، أو مدخلات غير مكتملة (مثل فقدان صور الملابس أو صور العارضين).
2. المنهجية
يقترح المؤلفون إطار عمل PROMO، وهو مبني على هيكل Flow Matching Diffusion Transformer (DiT). يعامل PROMO عملية تجربة الملابس الافتراضية كمسأًلة تحرير صور مهيكلة تتطلب الحفاظ على الموضوع، ونقل الأنسجة بأمانة، والتناغم السلس.
المكونات الهيكلية الأساسية:
الدمج الشرطي متعدد الوسائط في الفضاء الكامن (Latent Multi-Modal Conditional Concatenation): بدلاً من استخدام شبكات مرجعية منفصلة (مما يضاعف عدد المعلمات)، يقوم PROMO بدمج الشروط (الشخص، الملابس، الأقنعة، الوضعية) مباشرة في الفضاء الكامن.
الاشتراط المكاني الفعال:
توليد القناع غير المرتبط (Agnostic Mask Generation): يستخدم مزيجًا من تحليل جسم الإنسان (human body parsing) و DWPose لتوليد أقنعة تلقائيًا، مما يمنع تسرب المعلومات من الملابس الأصلية.
الضغط الهرمي: لتقليل عدد الرموز (tokens)، يتم تقليل عينات الوضعية والأقنعة (بنسبة 2x) ودمجها. يؤدي هذا إلى تقليل عدد الرموز إلى 12.5% من التمثيل الأصلي للشرط المزدوج، مما يعزز كفاءة التدريب والاستدلال بشكل كبير.
توزين الخسارة القائم على المنطقة: يتم تطبيق دالة خسارة موزونة حيث تحصل مناطق الجسم على أوزان أعلى (1+λ) بينما تحصل الخلفيات على أوزان أقل (1−λ)، مما يجبر النموذج على التركيز على تفاصيل الملابس.
آلية خالية من المعلمات تستخدم 3D-RoPE (التمثيل الموضعي الدوار) للتمييز بين مجموعات الشروط المختلفة (مثل الملابس المتعددة).
آلية التخزين المؤقت (Caching Mechanism): يتم تخزين أزواج المفتاح-القيمة (KV pairs) للشروط المكانية عند الخطوة الزمنية الأولى وإعادة استخدامها للخطوات الزمنية اللاحقة. يتجنب هذا الحاجة إلى شبكة مرجعية منفصلة، مما يقلل وقت الاستدلال بشكل كبير مع الحفاظ على الجودة.
نظام نمط الارتداء القابل للتحكم عبر المطالبات (Promptable Dressing Style System):
نظام مطالبات نمط يعتمد على نموذج Qwen2.5-VL-7B الذي تم ضبطه بدقة.
يقوم بتحويل صور العارضين الذين يرتدون الملابس إلى أوصاف JSON مهيكلة (باستخدام مخططات Pydantic) ثم إلى مطالبات لغوية طبيعية.
يسمح هذا للمستخدمين بالتحكم في سمات محددة (مثل "ضيق"، "عند الخصر"، "بدون أكمام") عبر النص، متجاوزًا قيود طرق استخراج الملابس المغلقة أو أحادية القطعة السابقة.
نظام للسيناريوهات الواقعية:
يتضمن PROMO وحدات مساعدة للتعامل مع المدخلات غير المكتملة:
نموذج TryOff: يستخرج قطعة الملابس من صورة عارض إذا كانت صورة الملابس المنفردة مفقودة.
نظام مطالبات النمط (Style Prompt System):: يولد أوصاف الأنماط من كتالوجات الملابس إذا كانت صورة العارض مفقودة.
3. المساهمات الرئيسية
إطار عمل PROMO: إطار عمل لتجربة الملابس الافتراضية متعدد الملابس وقابل للتحكم عبر المطالبات باستخدام هيكل Flow Matching DiT مع دمج شرطي متعدد الوسائط في الفضاء الكامن. يحقق توازنًا فائقًا بين الدقة البصرية وسرعة الاستدلال.
ابتكارات الكفاءة: تقديم المرجع الذاتي الزمني (Temporal Self-Reference) و دمج الرموز المكانية (Spatial Token Merging)، واللذان يلغيان الحاجة إلى شبكات مرجعية مساعدة ويقللان عدد الرموز بنسبة تصل إلى 87.5%، مما يتيح استدلالًا سريعًا للنماذج ذات المعلمات الضخمة.
نظام مطالبات النمط: خط معالجة مبتكر يستخدم نموذج Qwen2.5-VL-7B المقطر لتوليد أوصاف نمط موثوقة لملابس متعددة، مما يتيح التحكم في أنماط الارتداء عبر المطالبات دون الاعتماد على واجهات برمجة التطبيقات (APIs) مغلقة المصدر.
القوة والصلابة: أظهر قدرة على التعامل مع السيناريوهات "الواقعية"، بما في ذلك تجربة الملابس المتعددة والسيناريوهات التي تفتقر إلى بعض المدخلات (صورة العارض أو صورة الملابس).
4. النتائج التجريبية
قام المؤلفون بتقييم PROMO على مجموعات بيانات VITON-HD و DressCode ومجموعة بيانات In-The-Wild التي جمعوها بأنفسهم.
الأداء الكمي:
تفوق PROMO على نماذج VTON الحديثة (مثل OOTDiffusion، وCatVTON، وAny2AnyTryon) ونماذج تحرير الصور العامة (مثل Seedream، وQwen Image Edit) في المقاييس القياسية (SSIM، وLPIPS، وFID، وKID).
في مجموعة بيانات DressCode (المزدوجة)، حقق PROMO قيمة FID بلغت 3.3103 و LPIPS بلغت 0.0887، متفوقًا على المنافسين.
تفوق بشكل ملحوظ على نماذج تحرير الصور العامة، التي غالبًا ما تعاني من عدم اتساق الألوان والشوائب في مهام VTON.
الأداء النوعي:
تظهر التصورات أن PROMO يحافظ على الأنسجة المعقدة، وأنماط النصوص، وهندسة جسم الإنسان الطبيعية بشكل أفضل من النماذج المرجعية.
نجح في التعامل مع السيناريوهات المعقدة مثل الملابس الفضفاضة وتشكيلات الملابس المتعددة.
دراسة المستخدم:
في مجموعة بيانات "In-the-wild"، حقق PROFO أعلى معدل تميز إجمالي (84.42%) مقارنة بالخدمات التجارية (Huiwa، وKling، وDouyin)، لا سيما في اتساق نسيج الملابس والنمط.
الكفاءة:
قلل المرجع الذاتي الزمني (Temporal Self-Reference) وقت الاستدلال من 22 ثانية إلى **9.2 ثانية** (على GPU H800) مع الحفاظ على الجودة.
ساهم دمج الرموز المكانية (Spatial Token Merging) في تحسين السرعة بشكل أكبر مع فقدان ضئيل جداً في الجودة.
5. الأهمية
تحول في النموذج المعرفي: يثبت PROMO أن محولات مطابقة التدفق (Flow Matching Transformers)، جنباً إلى جنب مع الاشتراط متعدد الوسائط في الفضاء الكامن و تسريع المرجع الذاتي، يمكن أن تحل محل البنى متعددة الشبكات والمعقدة لإنتاج تجربة ملابس افتراضية عالية الجودة.
القابلية للتطبيق العملي: من خلال حل مشكلة "المدخلات المفقودة" (عبر وحدات TryOff/Style Prompt) وتمكين التحكم في النمط عبر المطالبات، يسد PROMO الفجوة بين البحث الأكاديمي وتطبيقات التجارة الإلكترونية في العالم الحقيقي.
كفاءة التدريب: الإطار عام ويمكن نقله إلى مهام تحرير الصور الأوسع، مما يشير إلى أن بيانات VTON يمكن أن تعمل كمورد إشرافي غني لتدريب المحررات العامة.
ختاماً، يضع PROMO معياراً جديداً (SOTA) من خلال تقديم تجربة ملابس افتراضية عالية الدقة ومتعددة الملابس مع إمكانية التحكم عبر المطالبات وتقليل التكاليف الحسابية بشكل كبير.