RBF-Solver: A Multistep Sampler for Diffusion Probabilistic Models via Radial Basis Functions
تقترح الورقة البحثية RBF-Solver، وهو أداة عينات انتشار متعددة الخطوات مبتكرة تستخدم دوال القاعدة الشعاعية الغاوسية القابلة للتعلم لاستكمال تقييمات النموذج، مما يؤدي إلى تحسين مسارات أخذ العينات لتحقيق دقة صور فائقة ودرجات FID أقل مقارنة بالطرق القائمة على كثيرات الحدود في كل من أنظمة تقييم الدوال المنخفضة والعالية.
المؤلفون الأصليون:Soochul Park, Yeon Ju Lee, SeongJin Yoon, Jiyub Shin, Juhee Lee, Seongwoon Jo
تخيل أنك تحاول رسم لوحة فنية رائعة، ولكن لديك قاعدة صارمة للغاية: لا يمكنك سوى استخدام عدد محدود من ضربات الفرشاة لإنهاء اللوحة. إذا استخدمت ضربات قليلة جدًا، ستبدو الصورة ضبابية أو مشوهة. وإذا استخدمت الكثير منها، فسيستغرق الأمر وقتًا طويلاً لإنهائها.
هذا هو التحدي الذي تواجهه نماذج الانتشار (Diffusion Models) (الذكاء الاصطناي خلف أدوات مثل Midjouney أو DALL-E). تقوم هذه النماذج بإنشاء الصور عن طريق البدء من ضجيج (static noise) عشوائي ثم "إزالة الضجيج" (denoising) تدريجيًا خطوة بخطوة حتى تظهر صورة واضحة. المشكلة هي أنه للحصول على صورة عالية الجودة، يحتاج الذكاء الاصطناعي عادةً إلى اتخاذ مئات الخطوات الصغيرة، وهذا أمر بطيء ومكلف.
لتسريع هذه العملية، ابتكر الباحثون "عينات سريعة" (fast samplers) (مثل DPM-Solver أو UniPC) تحاول اتخاذ خطوات أكبر وأكثر ذكاءً؛ فهي تعمل من خلال النظر إلى الخطوات القليلة الأخيرة التي اتخذها الذكاء الاصطناعي وتخمين المسار الذي يجب أن تسلكه الخطوة التالية، تمامًا كما ترسم خطًا مستقيمًا عبر عدة نقاط للتنبؤ بالنقطة التالية.
المشكلة في الطرق الحالية: تستخدم معظم هذه العينات السريعة كثيرات الحدود (polynomials) (منحنيات بسيطة) لجعل توقعاتها.
التشبيه: تخيل أنك تحاول رسم طريق جبلي متعرج ومنحنٍ باستخدام مساطر مستقيمة أو منحنيات بسيطة فقط. إذا كان الطريق يلتف بشكل حاد، فإن توقعك المعتمد على المسطرة سيفقد المسار، وستخرج عن الطريق وتصطدم بالمنحدر (مما يؤدي إلى إفساد جودة الصورة).
القصور: كلما حاولت اتخاذ خطوات أقل (ترتيب أعلى)، تصبح هذه المنحنيات البسيطة غير مستقرة؛ حيث تتذبذب بشكل عشوائي، مما يتسبب في ظهور خلل في الصورة أو جعلها تبدو غريبة.
الحل: RBF-Solver يقترح مؤلفو هذه الورقة البحثية طريقة جديدة تسمى RBF-Solver. فبدلاً من استخدام خطوط مستقيمة بسيطة أو منحنيات أساسية، يستخدمون ما يسمى دوال الأساس الشعاعي (Radial Basis Functions - RBFs).
التشبيه: فكر في الـ RBFs ليس كمسطرة، بل كـ مغانط.
تخيل أن لديك بعض نقاط البيانات (خطوات سابقة من عملية توليد الصورة).
بدلاً من رسم خط عبرها، تضع "مغناطيسًا" عند كل نقطة.
لكل مغناطيس "قوة" أو "شكل" (يسمى معامل الشكل - shape parameter) يمكنك ضبطه.
إذا كان الطريق ينحني بلطف، تجعل المغانط ضعيفة ومنتشرة. أما إذا كان الطريق يلتف بشكل حاد، فتجعل المغانط قوية ومركزة تمامًا عند المنعطف.
كيف يعمل RBF-Solver (الخدعة السحرية):
تعلم الشكل: الابتكار الرئيسي هو أن RBF-Solver لا يكتفي بتخمين شكل المغانط فحسب، بل يتعلم الشكل المثالي للصورة التي ينشئها. فهو ينظر إلى "الهدف" (كيف يجب أن تبدو الصورة) ويضبط المغانط بحيث يكون المسار بين النقاط سلسًا تمامًا.
أفضل ما في العالمين:
إذا جعلت المغانط مسطحة وواسعة جدًا، فإنه يعمل مثل "طريقة أويلر" (Euler method) الموثوقة والقديمة (خطوة بسيطة وآمنة).
إذا جعلت المغانط حادة ومركزة جدًا، فإنه يعمل مثل "طريقة آدمز" (Adams method) (خطوة معقدة وعالية السرعة).
النقطة المثالية: من خلال إيجاد القوة الدقيقة للمغناطيس في المنتصف، فإنه يخلق مسارًا أكثر سلاسة ودقة مما يمكن لأي من الطرق القديمة تحقيقه.
الاستقرار: نظرًا لأن هذه "المغانط" محلية (فهي تهتم فقط بالنقاط المجاورة لها مباشرة)، فإنها لا تضطرب عندما يصبح المسار معقدًا. وهذا يعني أن RBF-Solver يمكنه اتخاذ خطوات ضخمة (ترتيب عالٍ) دون أن تنهار الصورة، بينما قد تفشل الطرق الأخرى.
النتائج:
في "منطقة السرعة العالية" (خطوات قليلة): عندما تحتاج إلى إنشاء صورة بسرعة كبيرة (على سبيل المثال، 5 إلى 10 خطوات)، ينتج RBF-Solver صورًا أكثر وضوحًا وحدة من المنافسين، خاصة عندما يُطلب من الذكاء الاصطناعي أن يكون دقيقًا للغاية (توجيه عالٍ).
في "منطقة الجودة العالية" (خطوات أكثر): عندما يكون لديك متسع من الوقت (15 خطوة فأكثر)، فإنه يتفوق باستمرار على أفضل العينات الموجودة، منتجًا صورًا تحتوي على عيوب أقل وتفاصيل أفضل.
الملخص: إذا كانت عينات السرعة الحالية تشبه سائقًا يحاول التنقل في طريق متعرج باستخدام خريطة مكونة من خطوط مستقيمة، فإن RBF-Solver يشبه سائقًا لديه نظام GPS يمكنه إعادة تشكيل الطريق فورًا ليتناسب مع سرعة السيارة وتضاريس الأرض. إنه يستخدم "مغانط" مرنة وقابلة للتعلم لربط المسار، مما يضمن انتقال الذكاء الاصطناعي من "الضجيج" إلى "اللوحة الفنية" بشكل أسرع وبجودة أعلى، دون الاصطدام بالحائط.
إليك ملخص تقني مفصل لورقة البحث بعنوان "RBF-Solver: A Multistep Sampler for Diffusion Probabilistic Models via Radial Basis Functions."
1. بيان المشكلة
تحقق نماذج الانتشار الاحتمالي (DPMs) دقة توليدية هي الأفضل في مجالها، ولكنها تعاني من تكاليف حوسبة عالية بسبب الحاجة إلى خطوات تنقيح (Denoising) تكرارية عديدة (تقييمات الدالة، أو NFE) لحل معادلة الانتشار التفاضلية العادية (ODE) العكسية.
بينما تستخدم أجهزة أخذ العينات السريعة الحالية (مثل DPM-Solver++ وUniPC) طرق متعددة الخطوات تعتمد على كثيرات الحدود (توسيع تايلور أو استكمال لاجرانج) لتسريع الاستنتاج، إلا أنها تواجه قيودًا محددة:
الجمود: تتبع مخططات محددة مسبقًا بمعاملات ثابتة، مما لا يوفر المرونة اللازمة لتحسين مسار أخذ العينات لنماذج أو ظروف معينة.
عدم الاستقرار العددي: غالبًا ما تعاني تقريبات كثيرات الحدود عالية الرتبة من ظاهرة رونج (Runge phenomenon) (التذبذبات) وعدم الاستقرار العددي مع زيادة الرتبة (عادةً ما تتدهور بعد الرتبة الرابعة).
المسارات غير المثلى: لا تتكيف صراحةً مع الميزات المحلية لتوزيع البيانات أثناء عملية أخذ العينات.
2. المنهجية: RBF-Solver
يقترح المؤلفون RBF-Solver، وهو جهاز أخذ عينات جديد متعدد الخطوات يستبدل استكمال كثيرات الحدود بـ استكمال الدوال الشعاعية الأساسية الغاوسية (Gaussian Radial Basis Function - RBF) لتقريب تقييمات النموذج (x^θ) ضمن حل معادلة الانتشار التفاضلية (ODE).
الآلية الجوهرية
استكمال Gaussian RBF: بدلاً من ملاءمة كثيرة حدود لتقييمات النموذج السابقة، يقوم RBF-Solver بملاءمة مزيج خطي من دوال Gaussian RBF: R(λ)=j=0∑p−1wti,jϕti,j(λ)+wconst حيث أن ϕti,j(λ)=exp[−(γtihtiλ−λti−j)2].
معلمات الشكل القابلة للتعلم (γ): الابتكار الرئيسي هو تضمين معلمة شكلγti لكل دالة Gaussian. على عكس كثيرات الحدود، يمكن ضبط عرض دالة Gaussian. وهذا يسمح لجهاز أخذ العينات بالتكيف مع المسار بناءً على ميزات البيانات المحلية.
إطار عمل المتنبئ والمصحح (Predictor-Corrector): يتم تنفيذ الطريقة ضمن إطار عمل الخطوات المتعددة الخطية القياسي:
المتنبئ (Predictor): يستخدم p من التقييمات السابقة للتنبؤ بالخطوة التالية.
المصحح (Corrector): يستخدم p+1 من التقييمات (بما في ذلك التقييم المتنبأ به) لتحسين الخطوة.
شرط مجموع المعاملات: تم تصميم الطريقة لتفي بشرط مجموع المعاملات، مما يضمن الاتساق مع طريقة Euler (طريقة DDIM) عند الرتبة الأولى.
الخصائص النظرية
التقارب إلى طريقة Adams: عندما تقترب معلمة الشكل γ→∞، تصبح دوال Gaussian RBF مسطحة، ويتقارب استكمال RBF إلى استكمال لاجرانج القياسي. وبالتالي، يتقارب RBF-Solver إلى طريقة Adams (وهي الأساس لـ UniPC)، مما يضمن التوافق مع الإصدارات السابقة.
التقارب إلى عينة المعاملات المتساوية: عندما تقترب γ→0، تتقارب الطريقة إلى جهاز أخذ عينات بمعاملات متساوية.
الاستقرار عالي الرتبة: نظرًا لـ المحلية (Locality) لدوال Gaussian RBF (حيث يتلاشى تأثيرها بسرعة مع المسافة)، يحافظ RBF-Solver على الاستقرار والدقة حتى في الرتب العالية (الرابعة، الخامسة، السادسة وما فوق)، حيث تميل أجهزة أخذ العينات القائمة على كثيرات الحدود عادةً إلى التباعد أو التذبذب.
استراتيجية التحسين
تقدم الورقة خوارزمية تحسين لإيجاد معلمات الشكل γ المثلى لنموذج معين:
توليد الهدف: يتم توليد "مسار هدف" عالي الجودة باستخدام جهاز أخذ عينات موجود (مثل UniPC) مع عدد كبير من التقييمات (NFE ≥ 200 خطوة).
تقليل الخسارة: يتم تحسين معلمات الشكل عن طريق تقليل متوسط مربع الخطأ (MSE) بين تنبؤ RBF-Solver ومسار الهدف في الخطوات المتوسطة.
الكفاءة: لا يتطلب هذا التحسين أي تقييمات إضافية للشبكة، بل يتطلب فقط بحثًا شبكيًا (Grid Search) عبر معلمات الشكل، مما يجعله رخيصًا حوسبيًا مقارنة بطرق التقطير (Distillation-based methods).
3. المساهمات الرئيسية
مخطط استكمال مبتكر: أول تطبيق لاستكمال Gaussian RBF في حلول معادلة انتشار ODE، مستبدلاً تقريبات كثيرات الحدود الجامدة بدوال أساسية مرنة وقابلة للتعلم.
التوحيد النظري: يثبت أن RBF-Solver يوحد طريقة Euler (عند γ→0 أو حدود معينة) وطريقة Adams (عند γ→∞)، مما يوفر طيفًا مستمرًا من الحلول.
متانة عالية الرتبة: يثبت أن RBF-Solver يظل مستقرًا ودقيقًا عند الرتب p≥4، متغلبًا على عدم الاستقرار العددي المتأصل في أجهزة أخذ العينات ذات كثيرات الحدود عالية الرتبة.
التكيف بدون تدريب: يوفر آلية خفيفة الوزن ولا تتطلب تدريبًا لتحسين معلمات جهاز أخذ العينات لنماذج سابقة التدريب محددة، مما يحسن جودة العينات بشكل كبير دون إعادة تدريب نموذج الانتشار.
4. النتائج التجريبية
تم تقييم الطريقة في مهام التوليد غير المشروط والمشروط عبر CIFAR-10، وImageNet (64x64, 128x128, 256x256)، وStable Diffusion.
التوليد غير المشروط (CIFAR-10, ImageNet 64x64):
في نظام NFE العالي (NFE ≥ 15)، يتفوق RBF-Solver باستمرار على النماذج المرجعية المتطورة (DPM-Solver++, UniPC).
في CIFAR-10 (Score-SDE)، حقق FID قدره 2.87 عند 15 NFE و 2.48 عند 40 NFE، متفوقًا على الطرق القائمة على كثيرات الحدود.
في ImageNet 64x64، حقق درجات FID أقل من المنافسين لجميع قيم NFE ≥ 10.
التوليد المشروط (ImageNet, Stable Diffusion):
يظهر RBF-Solver مكاسب كبيرة في نظام NFE المنخفض (5–10 خطوات)، خاصة عند مقاييس التوجيه (Guidance Scales) العالية (6.0 و 8.0).
في ImageNet 256x256 مع مقياس توجيه 8.0، قلل FID بنسبة 16.12%–33.73% مقارنة بأجهزة أخذ العينات القائمة على كثيرات الحدود.
في Stable Diffusion v1.4، حقق تشابه CLIP cosine أعلى وRMSE أقل مقارنة بالنماذج المرجعية.
الاستقرار عالي الرتبة:
بينما يتدهور أداء UniPC بشكل حاد عندما تكون الرتبة p≥5، يحافظ RBF-Solver على الأداء أو يحسنه حتى p=6 أو أعلى، مما يؤكد الادعاء النظري حول محلية (Locality) دالة RBF.
5. الأهمية
كسر حاجز الرتبة: يحل RBF-Solver مشكلة عدم الاستقرار طويلة الأمد في أخذ عينات الانتشار عالية الرتبة، مما يسمح باستخدام طرق عالية الرتبة لتسريع الاستنتاج دون التضحية بالجودة.
أخذ العينات التكيفي: يقدم نموذجًا حيث لا يكون مسار أخذ العينات مجرد تقريب رياضي ثابت، بل يتم تحسينه ديناميكيًا لاتباع المسار "الأمثل" الذي يحدد سلوك النموذج.
الكفاءة العملية: من خلال تحقيق نتائج أفضل بخطوات أقل (خاصة في أنظمة NFE المنخفضة) والحفاظ على الجودة عند الرتب العالية، يقلل RBF-Solver بشكل كبير من الحاجة الحوسبية لتوليد الصور عالي الدقة، مما يجعله ذا أهمية كبيرة للتطبيقات في الوقت الفعلي والبيئات محدودة الموارد.
القدرة على التعميم: النهج مستقل عن النموذج ويمكن تطبيقه على أي نموذج انتشار مُدرب مسبقًا دون إعادة تدريب، مما يجعله أداة متعددة الاستخدامات لمجتمع الذكاء الاصماعي التوليدي.