NanoFLUX: Distillation-Driven Compression of Large Text-to-Image Generation Models for Mobile Devices
إن NanoFLUX هو نموذج تحويل النص إلى صورة بـ 2.4 مليار معلمة، تم استخلاصه من نموذج FLUX.1-Schnell المكون من 17 مليار معلمة عبر مسار ضغط تدريجي يتميز بتقليم المحولات، وخفض عينات الرموز القائم على شبكات ResNet، واستخلاص تشفير النصوص الموجه بالإشارات البصرية، مما يتيح توليد صور عالية الجودة على الأجهزة المحمولة في حوالي 2.5 ثانية.
المؤلفون الأصليون: Ruchika Chavhan, Malcolm Chadwick, Alberto Gil Couto Pimentel Ramos, Luca Morreale, Mehdi Noroozi, Abhinav Mehrotra
المؤلفون الأصليون: Ruchika Chavhan, Malcolm Chadwick, Alberto Gil Couto Pimentel Ramos, Luca Morreale, Mehdi Noroozi, Abhinav Mehrotra
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
ملخص تقني: NanoFLUX
بيان المشكلة
حققت نماذج الانتشار (Diffusion Models) لتحويل النص إلى صورة (T2I) واسعة النطاق، مثل عائلة FLUX (التي تصل إلى 17 مليار معلمة) وQwen-Image (20 مليار معلمة)، جودة بصرية رائدة. ومع ذلك، فإن حجمها الهائل يخلق عائقًا كبيرًا أمام النشر على الأجهزة، مما يتطلب بنية تحتية مكلفة من وحدات معالجة الرسومات (GPU) أو الاستنتاج القائم على السحابة. تعتمد الحلول الحالية للأجهزة غالباً على نماذج أصغر تفتقر إلى الجودة المماثلة، أو تستخدم تقنيات الضغط (مثل التقليم، والكمية، وتقليل الخطوات) التي لا تعالج بشكل كامل الفائض الهيكلي في نماذج محولات الانتشار (DiTs) الضخمة والمشفرات النصية المرتبطة بها. يكمن التحدي في ضغط هذه النماذج الضخمة للأجهزة المحمولة مع الحفاظ على جودة التوليد وتقليل زمن استجابة الاستنتاج.
المنهجية: NanoFLUX
قدم المؤلفون NanoFLUX، وهو نموذج T2I بـ 2.4 مليار معلمة، تم استخلاصه عبر عملية تقطير (Distillation) من النموذج المعلم FLUX.1-Schnell المكون من 17 مليار معلمة. يتم تحقيق الضغط من خلال مسار تدريجي مدفوع بالتقطير يستهدف المكونين الأثقل: محول الانتشار (DiT) بسعة 12 مليار معلمة، والمشفر النصي T5-XXL بسعة 5 مليار معلمة.
1. ضغط المحول (12 مليار → 2 مليار)
استخدم المؤلفون استراتيجية ضغط تدريجية من أربع مراحل لتقليل حجم الـ DiT:
المرحلة C1: تقليم رؤوس الانتباه (12 مليار → 5 مليار):
- التحليل: كشف تحليل تفكيك القيم المفردة (SVD) لمخرجات رؤوس الانتباه أن ليس كل الرؤوس مستقلة؛ حيث يحتوي الكثير منها على معلومات زائدة.
- الإجراء: تم تقليل عدد رؤوس الانتباه (H) بشكل موحد من 24 إلى 16.
- التقطير: تم إدخال فقدان على مستوى الميزات (Feature-level loss) لضمان أن الرؤوس المتبقية تحافظ مجتمعة على معلومات الرؤوس التي تم تقليمها. تم تهيئة النموذج الطالب باستخدام أول 16 رأساً من النموذج المعلم.
المرحلة C2: تقليل أبعاد الرأس (5 مليار → 3 مليار):
- التحليل: تم تطبيق SVD مرة أخرى على ميزات النموذج بسعة 5 مليار معلمة.
- الإجراء: تم تقليل بُعد الرأس (dH) من 128 إلى 96، مع الاحتفاظ بالمكونات المفردة الأعلى. نتج عن ذلك نموذج بسعة 3 مليار معلمة.
المرحلة C3: تقليم العمق عبر دمج الكتل (3 مليار → 2.5 مليار):
- التحليل: تم حساب تشابه جيب التمام (Cosine similarity) بين المدخلات والمخرجات لكتل المحول. أظهرت كتل التدفق الأحادي (Single-Stream SS) تشابهاً عالياً (>0.85)، مما يشير إلى وجود فائض وظيفي.
- الإجراء: بدلاً من حذف هذه الكتل، قام المؤلفون بدمج سلسلة من 15 كتلة SS زائدة في كتلة واحدة عن طريق متوسط معاملاتها. أدى ذلك إلى تقليل عمق المحول من 38 إلى 24 كتلة.
المرحلة C4: التسوية الطبقية الثابتة (2.5 مليار → 1.8 مليار):
- التحليل: أظهرت معاملات التسوية الطبقية التكيفية (AdaLN) التي يتنبأ بها النموذج تباينًا منخفضًا عبر العينات، مما يشير إلى أن التكييف الديناميكي من إسقاطات CLIP كان زائداً.
- الإجراء: تم استبدال معاملات AdaLN الديناميكية بمتوسطات ثابتة محسوبة مسبقاً (Static-LN). أدى ذلك إلى إزالة حوالي 0.7 مليار معلمة. تم إجراء ضبط دقيق قصير للنموذج مع معاملات ثابتة لاستعادة الجودة.
2. خفض عينات التوكنات التدريجي (Progressive Token Downsampling)
لمعالجة التعقيد التربيعي للانتباه الذاتي دون التضحية بالتفاصيل:
- الآلية: تم إدراج وحدة خفض عينات (Downsampling) تعتمد على ResNet (D) ووحدة رفع عينات (U) داخل المحول.
- الاستراتيجية الهجينة: يعمل النموذج بمخطط دقة هجين. خطوات الانتشار المبكرة (التي تلتقط البنية العالمية) تعالج توكنات مخفضة العينات (تقليل عدد التوكنات بمقدار 4 أضعاف)، بينما تعالج الخطوات المتأخرة (التي تصقل التفاصيل) توكنات الدقة الكاملة.
- التدريب: تم استخدام استراتيجية "خفض عينات التوكنات التدريجي" (PTD) لاستقرار التدريب. تم إدراج الوحدات وتدريبها بشكل تدريجي، مع نقل نقطة خفض العينات إلى مرحلة أبكر في الشبكة عبر التكرارات.
- النتيجة: تعمل 23 من أصل 43 كتلة محول على توكنات مخفضة العينات، مما يقلل زمن الاستجابة بشكل كبير مع الحفاظ على معالجة الدقة العالية عند الضرورة.
3. تقطير المشفر النصي (5 مليار → 330 مليون)
- الهدف: تقطير مشفر T5-XXL بسعة 5 مليار معلمة إلى نموذج T5-Large بسعة 330 مليون معلمة.
- الطريقة: عملية تقطير من مرحلتين:
- مطابقة التضمين (Embedding Matching): تمت إضافة MLP إلى الطالب لمطابقة أبعاد مخرجات المعلم، مما يقلل من متوسط مربع الخطأ (MSE) بين تضمينات النصوص (Prompts).
- التقطير على مستوى الكتل: يتم تدريب الطالب لمطابقة الحالات الخفية للنصوص للمعلم عند طبقات محددة من المحول. ومن المهم أن الطريقة تستفيد من الإشارات البصرية من الطبقات المبكرة للمزيل (عبر الانتباه المشترك) لتوجيه المشفر النصي، مما يخفف من تراكم الخطأ.
- الاستقرار: يتم فصل التدرجات (Gradients are detached) للخطوات ذات الضجيج العالي (t<t^) لتجنب الإشراف غير المستقر، مع التركيز على تقطير الخطوات المتأخرة والطبقات الثلاث الأولى من المحول.
النتائج الرئيسية
- حجم النموذج: يبلغ حجم نموذج NanoFLUX النهائي 2.4 مليار معلمة (2 مليار للـ DiT + 330 مليون للمشفر النصي)، وهو اختزال بمقدار 7 أضعاف من النموذج المعلم FLUX.1-Schnell المكون من 17 مليار معلمة.
- الأداء:
- على الأجهزة المحمولة، يقوم NanoFLUX بتوليد صور بدقة 512 × 512 في حوالي 2.5 ثانية.
- تُظهر الاختبارات الكمية (One-IG, DPG, GenEval, HPDv3) أن NanoFLUX يحافظ على أداء مماثل للنموذج المعلم، مع انخفاض طفيف فقط في مقاييس معينة (على سبيل المثال، ينخفض HPSv3 من 11.45 إلى 10.41).
- تشير النتائج النوعية إلى أن النموذج يحافظ على جودة الصورة والالتزام بالنص بشكل مماثل لنموذج 17 مليار معلمة الأصلي.
- الكفاءة: نجحت استراتيجية خفض عينات التوكنات التدريجي في الموازنة بين زمن استجابة الاستنتاج وجودة التوليد، مما سمح للنموذج بالعمل بكفاءة على الأجهزة محدودة الموارد.
الأهمية والادعاءات
يدعي البحث أن NanoFLUX هو أول إطار عمل يدرس بشكل شامل ضغط النماذج واسعة النطاق لتوليد الصور من النصوص، وتحديداً النماذج مثل FLUX. وتكمن أهميته في:
- إمكانية التوليد على الأجهزة: إثبات أن توليد الصور عالية الجودة من النصوص أمر ممكن على الأجهزة المحمولة دون الاعتماد على البنية التحتية السحابية.
- الرؤية الهيكلية: توفير مسار عملي لتقليص حجم النماذج التوليدية الكبيرة من خلال تحديد واستغلال فوائض هيكلية محددة (رؤوس الانتباه، عمق الكتل، ديناميكيات التسوية) بدلاً من الاعتماد فقط على الكمية العامة أو تقليل الخطوات.
- القابلية للتعميم: تقديم رؤى وعملية تقطير تدريجية قد تعمم على النماذج التوليدية المستقبلية واسعة النطاق.
يضع المؤلفون هذا العمل كخطوة نحو تعزيز إمكانية الوصول إلى الذكاء الاصطناعي التوليدي عالي الجودة للمستخدمين ذوي الموارد الحسابية المحدودة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.
تصلك أفضل أبحاث AI كل أسبوع.
يحظى بثقة باحثين في ستانفورد وكامبريدج والأكاديمية الفرنسية للعلوم.
تفقّد بريدك لتأكيد الاشتراك.
حدث خطأ ما. تعيد المحاولة؟
لا رسائل مزعجة، ويمكنك إلغاء الاشتراك متى شئت.