Diffusion Blend: Inference-Time Multi-Preference Alignment for Diffusion Models
تقدم هذه الورقة Diffusion Blend، وهو إطار عمل جديد عند الاستنتاج يُمكّن نماذج الانتشار من التوافق ديناميكيًا مع أي مزيج خطي يحدده المستخدم من دوال مكافأة متعددة وقيود تنظيمية، وذلك عن طريق مزج عمليات الانتشار العكسي من نماذج تم ضبطها بدقة، مما يلغي الحاجة إلى تكرار عملية الضبط الدقيق ويتفوق على النماذج المرجعية الحالية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك شيفاً ماهراً (نموذج الانتشار - Diffusion Model) موهوب للغاية في طهي أي طبق تطلبه، من شطيرة بسيطة إلى "سوفليه" معقد. لقد تدرب هذا الشيف على ملايين الوصفات وهو يعرف كيف يطهو كل شيء بشكل جيد عموماً.
ومع ذلك، في بعض الأحيان تريد شيئاً محدداً:
- "اجعل هذه الشطيرة تبدو فنية وجميلة."
- "تأكد من أن هذه الشطيرة تبدو تماماً مثل الصورة التي أرسلتها لك."
- "اجعلها صحية (قليلة السعرات الحرارية) ولكن لذيذة أيضاً."
المشكلة هي أن الشيف عادة ما يضطر لاختيار أسلوب واحد فقط. فإذا دربت الشيف ليكون "خبيراً في الجمال"، فقد ينسى كيفية اتباع تعليمات الصورة التي أرسلتها. وإذا دربتهم ليكونوا "متبعين للصور بدقة"، فقد تبدو الوجبة قبيحة.
تقليدياً، إذا كنت تريد مزيجاً مختلفاً (مثلاً: 50% جمال، و50% دقة في محاكاة الصورة)، فسيتعين عليك إرسال الشيف للعودة إلى مدرسة الطهي لأسابد ليتعلم هذا المزيج المحدد. وإذا أردت مزيجاً جديداً غداً، فسيتعين عليك إرساله للعودة إلى المدرسة مرة أخرى. هذا الأمر بطيء، ومكلف، وغير عملي.
الحل: "مزيج الانتشار" (Diffusion Blend)
تقدم هذه الورقة البحثية خدعة ذكية تسمى Diffusion Blend. فبدلاً من إرسال الشيف للعودة إلى المدرسة، قاموا بإنشاء "محطة خلط" عند طلبك للطعام (وقت الاستنتاج - inference time).
إليك كيف يعمل الأمر، باستخدام بعض التشبيهات:
1. "الشيفات المتخصصون" (مرحلة التدريب)
قبل أن تطلب أي شيء، يقوم الباحثون بتدريب عدد قليل من "الشيفات المتخصصين" لمرة واحدة وإلى الأبد:
- الشيف (أ) هو خبير في جعل الطعام يبدو جميلاً (الجماليات - Aesthetics).
- الشيف (ب) هو خبير في جعل الطعام يبدو تماماً مثل الصورة (المحاذاة بين النص والصورة - Text-Image Alignment).
- الشيف (ج) هو خبير في جعل الطعام صحياً (تفضيلات البشر - Human Preference).
هؤلاء الشيفات هم نماذج "مُعدلة بدقة" (fine-tuned). إنهم جاهزون للانطلاق.
2. "الخلاط السحري" (مرحلة الاستنتاج)
الآن، تتقدم نحو المنصة وتقول: "أريد شطيرة تكون 70% جميلة و30% مطابقة للصورة."
في الأيام الخوالي، كان على الشيف أن يتوقف، ويتعلم من جديد، ويبدأ من الصفر.
أما مع Diffusion Blend، فإن النظام يأخذ "عملية التفكير" (الوصفة الرياضية) الخاصة بالشيف (أ) والشيف (ب) ويقوم بخلطهما معاً في الوقت الفعلي.
- هو لا يكتفي بمتوسط صورهما النهائية فحسب.
- بل يخلط تعليمات الطهي خطوة بخطوة أثناء عملية صنع الطعام.
- الأمر يشبه وجود شيفين يهمسان بالتعليمات لبعضهما البعض في وقت واحد، والنظام يستمع إليهما بالنسب الدقيقة التي طلبتها (70% من الشيف أ، و30% من الشيف ب).
النتيجة: ستحصل على شطيرة متوازنة تماماً بين الجمال والدقة، تم إنشاؤها فوراً، دون أن يحتاج الشيف للعودة إلى المدرسة أبداً.
"الأدوات السحرية الثلاث"
تقترح الورقة البحثية ثلاث طرق محددة لاستخدام هذا الخلاط:
DB-MPA (الخلاط متعدد النكهات):
هذه هي الأداة الرئيسية. تتيح لك خلط أي عدد من المتخصصين. هل تريد 40% جمال، 40% دقة، و20% صحة؟ فقط اضبط النسب. يقوم النظام بخلط "همسات" جميع الشيفات الثلاثة فوراً.DB-KLA (مقبض "الصرامة"):
أحياناً، تريد أن يكون الطعام إبداعياً، لكنك لا تريد للشيف أن يصبح "جامحاً" جداً لدرجة نسيان الوصفة الأصلية تماماً. هذه الأداة تتيح لك التحكم في مدى قدرة الشيف على "الانحراف" عن تدريبه الأصلي.- المقبض المنخفض: يبقى الشيف قريباً جداً من أسلوبه الأصلي والآمن.
- المقبض العالي: يُسمح للشيف بأن يكون مبدعاً وجريئاً جداً.
يمكنك رفع أو خفض هذا المقبض فوراً دون الحاجة لإعادة التدريب.
DB-MPA-LS (الخلاط "خفيف الوزن"):
خلط ثلاثة شيفات في وقت واحد قد يكون ثقيلاً من الناحية الحسابية (مثل طلب التحدث من ثلاثة أشخاص في آن واحد). هذا الإصدار هو اختصار ذكي. فبدلاً من الاستماع إلى جميع الشيفات في كل ثانية، فإنه يختار عشوائياً شيفاً واحداً ليستمع إليه في كل خطوة، بناءً على نسبك المئوية.- التشبيه: بدلاً من جوقة تغني معاً، الأمر يشبه قائد أوركسترا يشير إلى مغنين مختلفين واحداً تلو الآخر بسرعة كبيرة بحيث تسمع أذنك مزيجاً مثالياً.
- الفائدة: يعمل بنفس سرعة الشيف الأصلي، ولكنه يمنحك النتيجة الممزوجة أيضاً.
لماذا يعد هذا أمراً هاماً؟
- لا مزيد من الانتظار: لست بحاجة للانتظار أياماً لتدريب نموذج جديد لذوقك الخاص.
- تخصيص لا نهائي: يمكنك تعديل تفضيلاتك أثناء العمل. "اجعلها أكثر زرقة قليلاً"، "اجعلها أقل واقعية"، "اجعلها أكثر فنية".
- حل النزاعات: يتعامل مع الحالات التي تتضارب فيها الأهداف (مثل: "اجعلها تبدو كصورة فوتوغرافية" مقابل "اجعلها تبدو كلوحة فنية") بشكل أفضل بكثير من الطرق السابقة، حيث يجد الحل الوسط المثالي.
باختصار: يحول Diffusion Blend مولد صور الذكاء الاصطناعي الجامد الذي يتبع مبدأ "مقاس واحد يناسب الجميع" إلى أداة مرنة وتحت سيطرة المستخدم. فهو يسمح لك بأن تكون المخرج، حيث تمزج وتطابق بين أساليب "الخبراء" المختلفة فوراً للحصول على الصورة التي تتخيلها بالضبط، الآن.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.