Learnable Sparsity for Vision Generative Models
تقترح هذه الورقة إطار عمل للتقليم الهيكلي غير معتمد على إعادة التدريب ومستقل عن النموذج لنماذج الانتشار، يستخدم قناعاً قابلاً للتعلم والاشتقاق وهدفاً جديداً من طرف إلى طرف مع فحص نقاط التفتيش لتدرج الخطوة الزمنية لتحقيق خفض في المعلمات يصل إلى 20% في نماذج مثل SDXL وFLUX مع الحفاظ على الأداء وتقليل تكاليف الذاكرة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك فناناً موهوباً للغاية وضخماً يدعى FLUX أو SDXL. هذا الفنان يمكنه رسم صور واقعية مذهلة بمجرد الاستماع إلى وصفك. لكن هناك عقبة؛ فهو عملاق، يتطلب حاسوباً خارقاً للتشغيل، ويشغل مساحة هائلة من الذاكرة، ويكلف ثروة في استهلاك الكهرباء لتشغيله. لا يمكنك ببساطة حمله في جيبك أو تشغيله على حاسوب محمول عادي.
تقدم الورقة البحثية التي شاركتها طريقة جديدة تسمى EcoDiff. فكر في EcoDiff كـ "نحات" ماهر للغاية يمكنه أخذ هذا الفنان العملاق ونحت الأجزاء غير الضرورية منه لجعله أصغر وأسرع، دون إفساد قدرته على رسم صور جميلة.
إليك كيف يعمل ذلك، مقسماً إلى مفاهيم بسيطة:
1. المشكلة: الفنان "العملاق"
تصبح مولدات الصور بالذكاء الاصطناعي الحالية أكبر فأكبر. ولجعلها أسرع أو لتناسب الأجهزة الأصغر، حاول الناس "تقليمها" (pruning) (أي قص أجزاء منها).
- الطريقة القديمة: تخيل أنك تحاول تقليص حجم عملاق عن طريق قطع أذرع وأرجل بشكل عشوائي، ثم إجباره على إعادة تعلم كيفية المشي لشهور. إنها عملية بطيئة، مكلفة، وغالباً ما تترك العملاق أخرقاً.
- الطريقة الجديدة (EcoDiff): بدلاً من التخمين حول الأجزاء التي يجب قصها، يستخدم EcoDiff "ليزر" رياضياً ذكياً للعثور بدقة على الخلايا العصبية (خلايا دماغ الفنان) التي لا تفعل شيئاً مهماً وإيقاف تشغيلها.
2. السر الخفي: التفكير "من البداية إلى النهاية" (End-to-End)
معظم الطرق السابقة كانت تنظر إلى عمل الفنان خطوة بخطوة. كانوا يقولون: "حسناً، الخطوة 1 تبدو جيدة، الخطوة 2 تبدو جيدة نوعاً ما"، ثم يقطعون بناءً على ذلك.
- التشبيه: تخيل سباق تتابع. إذا تحققت فقط مما إذا كان العداء يركض بسرعة في بداية السباق، فقد تغفل عن حقيقة تعثره عند خط النهاية.
- نهج EcoDiff: هذه الطريقة تنظر إلى السباق بأكمله دفعة واحدة. إنها تحاكي عملية الرسم بأكملها من البداية إلى النهاية. وتتساءل: "إذا أطفأت هذه الخلية العصبية المحددة، هل ستبدو الصورة النهائية سيئة؟" إذا كانت الصورة النهائية لا تزال رائعة، يتم قص تلك الخلية. هذا يضمن عدم فقدان الفنان لرؤيته "للصورة الكبيرة".
3. عقبة الذاكرة: خدعة "حقيبة الظهر"
النظر إلى عملية الرسم بأكملها في وقت واحد هو أمر مستحيل عادةً للحواسيب لأن ذلك يتطلب ذاكرة ضخمة (مثل محاولة حمل كتاب من 1000 صفحة في حقيبة ظهر صغيرة جداً).
- الابتكار: ابتكر المؤلفون خدعة تسمى "نقاط فحص تدرج الخطوات الزمنية" (Time Step Gradient Checkpointing).
- التشبيه: تخيل أنك تسير في طريق طويل وتحتاج لتذكر كل خطوة لتعود إلى المنزل. عادةً، سيتعين عليك تدوين كل خطوة في دفتر ملاحظات (مما يستهلك الكثير من الورق/الذاكرة).
- خدعة EcoDiff: بدلاً من تدوين كل شيء، تقوم فقط بتدوين بعض "نقاط الفحص" (المعالم الرئيسية). وعندما تحتاج لمعرفة ما حدث بين هذه النقاط، تقوم بسرعة بإعادة "المشي" في ذلك الجزء القصير من الطريق.
- النتيجة: يقلل هذا من الذاكرة المطلوبة بمقدار 50 ضعفاً. فجأة، الحاسوب الذي كان قادراً فقط على التعامل مع رسم تخطيطي صغير، أصبح بإمكانه الآن التعامل مع نموذج FLUX الضخم الذي يحتوي على 12 مليار معلمة (parameter).
4. النتائج: أصغر، أسرع، ولا يزال مذهلاً
اختبر الفريق هذه الطريقة على اثنين من أشهر مولدات الصور: SDXL و FLUX.
- القص: نجحوا في إزالة 20% من دماغ النموذج (المعلمات).
- التكلفة: فعلوا ذلك باستخدام مجموعة بيانات صغيرة جداً (100 صورة) وكمية ضئيلة من وقت الحوسبة (10 ساعات على وحدة معالجة رسوميات واحدة قوية). قارن هذا بالطرق الأخرى التي قد تتطلب أسابيع من الحوسبة.
- الجودة: النماذج "المتقلصة" الناتجة لا تزال تنتج صوراً تبدو متطابقة تقريباً مع العمالقة الأصليين. في الواقع، بالنسبة لبعض الأوامر المعقدة، كانت النماذج المقلمة أفضل في التقاط معنى الأمر من الأصل، حتى لو تغيرت تفاصيل البكسل الدقيقة قليلاً.
5. لمسة "الضبط الدقيق" (Fine-Tuning)
أحياناً، بعد قص 20% من الدماغ، قد يصبح الفنان "متصلباً" قليلاً.
- الحل: تظهر الورقة البحثية أنه يمكنك إجراء "تحسين سريع" (إعادة تدريب) باستخدام تقنية تسمى LoRA. إنها تشبه إعطاء الفنان جلسة إحماء سريعة لمدة 10 دقائق بدلاً من معسكر تدريبي لمدة 6 أشهر. هذا يستعيد الجودة إلى مستويات شبه مثالية دون تكلفة إضافية تذكر.
لماذا يهم هذا الأمر؟
هذا أمر بالغ الأهمية للبيئة وللناس العاديين.
- التكنولوجيا الخضراء: النماذج الأصغر تعني أن هناك حاجة لكهرباء أقل لتوليد الصور، مما يقلل من البصمة الكربونية.
- سهولة الوصول: بما أن هذه النماذج أصغر وأرخص في التشغيل، فقد نرى قريباً مولدات فن ذكاء اصطناعي عالية الجودة تعمل على أجهزة الكمبيوتر المحمولة، أو الأجهزة اللوحية، أو حتى الهواتف، بدلاً من الاعتماد فقط على مراكز البيانات الضخمة.
باختاً، EcoDiff هو طريقة ذكية وفعالة لتقليص أحجام عمال الذكاء الاصطناعي لتوليد الصور. إنه يستخدم استراتيجية "النظر إلى الصورة الكاملة" وخدعة ذكية لتوفير الذاكرة لقص الزوائد دون فقدان القوة، مما يجعل الذكاء الاصطناعي القوي متاحاً للجميع.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.