SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training
يقدم SafeDiffusion-R1 إطار عمل للتعلم المعزز عبر الإنترنت باستخدام تحسين السياسة النسبي للمجموعات (GRPO) وآلية مكافأة توجيهية مبتكرة قائمة على نموذج CLIP لمواءمة نماذج الانتشار بفعالية مع قيود السلامة وتحسين جودة التوليد دون الحاجة إلى بيانات خاضعة للإشراف باهظة التكلفة أو المعاناة من النسيان الكارثي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك فناناً موهوباً للغاية يُدعى Diffusion. تعلم هذا الفنان الرسم من خلال النظر إلى ملايين الصور من جميع أنحاء الإنترنت. ولأن الإنترنت يحتوي على كل شيء، فقد تعلم كيفية رسم المناظر الطبيعية الجميلة، ولكنه تعلم أيضاً كيفية رسم أشياء غير لائقة أو خطيرة.
الآن، تريد توظيف هذا الفنان ليرسم صوراً لمجلة عائلية. عليك تعليمه ألا يرسم تلك الأشياء السيئة مجدداً أبداً، ولكنك لا تريد أيضاً إفساد قدرته على رسم مشاهد معقدة وجميلة (مثل قطة تجلس على كرسي أحمر بجانب كلب أزرق).
تقدم هذه الورقة البحثية طريقة جديدة لتدريب هذا الفنان، تسمى SafeDiffusion-R1. وإليك كيف تعمل، باستخدام تشبيهات بسيطة:
١. المشكلة في الطرق القديمة
في السابق، كانت محاولة "محو" العادات السيئة تشبه محاولة تعليم طالب من خلال إظهار كتاب مدرسي يحتوي فقط على "أمثلة جيدة" و"أمثلة سيئة".
- المشكلة: كنت بحاجة إلى مكتبة ضخمة من هذه الأمثلة (وهو أمر مكلف وصعب المنال).
- الأثر الجانبي: عندما تحاول إجبار الفنان على نسيان الأشياء السيئة، فإنه غالباً ما ينسى كل الأشياء الأخرى أيضاً. يصبح مشوشاً، وتبدأ لوحاته الجميلة في الظهور بشكل ضبابي أو غريب. وهذا ما يسمى بـ "النسيان الكارثي" (Catastrophic Forgetting).
٢. الحل الجديد: "المدرب المباشر"
بدلاً من استخدام كتاب مدرسي ثابت، يعمل SafeDiffusion-R1 مثل مدرب مباشر يقف بجانب الفنان أثناء رسمه.
- التعلم المباشر (Online Learning): يحاول الفنان رسم صورة بناءً على وصف (حتى لو كان وصفاً خطيراً). ينظر المدرب إلى النتيجة فوراً ويقدم ملاحظاته.
- خدعة "المجموعة": لا يكتفي المدرب بالقول "جيد" أو "سيء". بدلاً من ذلك، يطلب من الفنان رسم أربع نسخ مختلفة من نفس الوصف. ثم يقوم المدرب بالمقارنة بينها: "النسخة (أ) جيدة، لكن النسخة (ب) سيئة للغاية". هذا يساعد الفنان على تعلم الفرق النسبي دون أن يصاب بالارتباك بسبب المكافآت المتطرفة. وهذا ما يسمى تحسين السياسة النسبية للمجموعات (GRPO).
٣. السلاح السري: "البوصلة" (التوجيه بالمكافأة)
هذا هو الابتكار الأكبر في الورقة البحثية. عادةً، لإخبار الفنان "لا ترسم عرياً"، تحتاج إلى خبير خاص (نموذج مكافأة) ينظر إلى اللوحة ويقول "لا". تدريب هذا الخبير أمر صعب.
يستخدم SafeDiffusion-R1 بوصلة سحرية بدلاً من ذلك.
- كيف تعمل: تخيل أن عقل الفنان عبارة عن خريطة ضخمة من الأفكار. على هذه الخريطة، الأفكار "الآمنة" تقع في الشمال، والأفكار "غير الآمنة" تقع في الجنوب.
- الخدعة: لا يحتاج النظام إلى إنسان للتحقق من كل لوحة. ببساطة، يأخذ الكلمات التي كتبها المستخدم (الوصف) ويستخدم الرياضيات لـ دفع الكلمات بلطف نحو الشمال (الآمن) قبل أن يبدأ الفنان في الرسم حتى.
- النتيجة: إذا طلب شخص ما صورة خطيرة، يقوم النظام بتغيير التعليمات في عقل الفنان ببراعة لتصبح نسخة آمنة قبل أن يبدأ الرسم. عندها يرسم الفنان صورة آمنة لأنه تلقى تعليمات "آمنة"، وليس لأنه عوقب على صورة "سيئة".
٤. النتائج: آمن، ذكي، وحاد
اختبرت الورقة البحثية هذه الطريقة ووجدت ثلاث نجاحات كبرى:
- السلامة: لقد قللت بشكل كبير من عدد الصور غير اللائقة. إذا كان الفنان القديم قد صنع 646 صورة غير لائقة من مجموعة اختبار، فإن هذه الطريقة الجديدة لم تصنع سوى 15 صورة فقط.
- التعميم: على الرغم من أننا دربنا الفنان بشكل أساسي على أوصاف "العري"، إلا أن الفنان تعلم تجنب أشياء سيئة أخرى أيضاً (مثل العنف أو خطاب الكراهية)، رغم أنه لم يرَ تلك الأمثلة المحددة أثناء التدريب. الأمر يشبه تعليم شخص ما عدم أكل التفاح المسموم، وفجأة يتوقف عن أكل التوت المسموم أيضاً.
- الجودة: على عكس الطرق القديمة التي جعلت لوحات الفنان ضبابية أو مكسورة، فإن هذه الطريقة في الواقع حسّنت قدرة الفنان على اتباع التعليمات المعقدة (مثل عد الأشياء أو وضعها في أماكن محددة).
ملخص
SafeDiffusion-R1 هي تقنية تدريب جديدة تعلم مولدات الصور بالذكاء الاصطناعي أن تكون آمنة دون الحاجة إلى مكتبة ضخمة من الأمثلة "الجيدة مقابل السيئة". إنها تستخدم مدرباً مباشراً للمقارنة بين عدة محاولات، وبوصلة رياضية لتوجيه أفكار الذكاء الاصطناعي بلطف نحو الأمان قبل أن يبدأ في الخلق. والنتية هي ذكاء اصطناعي أكثر أماناً، وأكثر ذكاءً، ولا يفقد موهبته الفنية في هذه العملية.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.