Localized Concept Erasure in Text-to-Image Diffusion Models via High-Level Representation Misdirection
تقترح هذه الورقة تقنية "تضليل التمثيل عالي المستوى" (HiRM)، وهي مفهوم جديد لمحو المفاهيم يعمل على تضليل التمثيلات الدلالية عالية المستوى للمفاهيم المستهدفة بشكل انتقائي داخل الطبقات المبكرة لمشفر النصوص، وذلك بهدف كبح المحتوى الضار أو المحمي بحقوق الطبع والنشر بفعالية مع الحفاظ على الجودة التوليدية للمفاهيم غير ذات الصلة وضمان التوافق مع بنيات النماذج المتنوعة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك استوديو فنون سحرياً (نموذج تحويل النص إلى صورة بالذكاء الاصطناعي) يمكنه رسم أي شيء تصفه. إذا قلت "قطة"، سيرسم قطة. وإذا قلت "لوحة لفان جوخ"، سيرسم لوحة فنية رائعة.
ولكن هناك مشكلة: أحياناً يستخدم الناس هذا الاستوديو لرسم أشياء لا ينبغي لهم رسمها، مثل الأعمال الفنية المحمية بحقوق النشر، أو الصور الخاصة، أو المحتوى غير اللائق (NSFW). ولإيقاف ذلك، يحاول المطورون "محو تعلم" هذه المفاهيم السيئة حتى ينساها الذكاء الاصطناعي.
الطريقة القديمة: نهج "القوة الغاشمة" (Brute Force)
في السابق، كان محاولة جعل الذكاء الاصطناعي ينسى شيئاً ما تشبه محاولة إصلاح محرك سيارة مكسور عن طريق تفكيك السيارة بأكملها وصنفرة تروسها.
- المشكلة: إذا حاولت إزالة "فان جوخ" عن طريق تعديل المحرك الرئيسي (مولد الصور)، فقد تعطل بالخطأ القدرة على رسم "القطط" أو "الشموس". يصاب الذكاء الاصطناعي بالارتباك ويبدأ في رسم فوضى غريبة وضبابية. إنها عملية فوضوية، مكلفة، وبطيئة، وغالباً ما تفسد الأشياء الجيدة أثناء محاولة إصلاح الأشياء السيئة.
الفكرة الجديدة: "أمين المكتبة الذكي" (HiRM)
تقدم هذه الورقة البحثية طريقة جديدة تسمى HiRM (تضليل التمثيل عالي المستوى). بدلاً من تحطيم المحرك، يعمل HiRM كـ أمين مكتبة ذكي يعرف بالضبط مكان تخزين "الكتب السيئة" على الرفوف.
إليك كيف يعمل HiRM، باستخدام تشبيه بسيط:
1. المكتبة ذات الجزئين
تخيل أن عقل الذكاء الاصطناعي يتكون من قسمين رئيسيين:
- القبو (الطبقات المبكرة): هذا هو المكان الذي تُخزن فيه المكونات الخام. هو يعرف شكل "الأحمر"، أو "المستدير"، أو "الفروي". إنه الأساس.
- الطابق العلوي (الطبقات المتأخرة): هذا هو المكان الذي يتم فيه تجميع المعنى. يأخذ "فروي" + "أربع أرجل" + "ينبح" ويقرر: "آه، هذا كلب".
2. خطأ الماضي
حاولت الأساليب السابقة مسح مفهوم "الكلب" عبر الذهاب إلى القبو ومحاولة حذف مفهوم "الفرو" أو "الأرجل الأربعة".
- النتيجة: الآن، لا يستطيع الذكاء الاصطناعي رسم الكلاب، ولكنه أيضاً لا يستطيع رسم القطط أو الدببة أو الأرانب لأنها جميعاً تشترك في تلك "المكونات الفروية" نفسها. تصبح المكتبة بأكملها فوضوية.
3. استراتيجية HiRM: "التضليل"
HiRM ذكي. فهو يدرك أن المعنى لـ "الكلب" لا يكتمل تماماً إلا في الطابق العلوي.
- الخطة: يذهب HiRM إلى القبو (حيث توجد المكونات) ويجري تعديلاً دقيقاً للغاية. هو لا يحذف المكونات؛ بل يغير فقط التعليمات الخاصة بكيفية إرسالها إلى الطابق العلوي.
- الخدعة السحرية: عندما يحاول الذك_الاصطناعي التفكير في "كلب"، يهمس HiRM سراً إلى الطابق العلوي: "مهلاً، لا تفكر في 'كلب'. بدلاً من ذلك، فكر في 'ضجيج عشوائي' أو 'حيوان عام'."
لأن HiRM قام فقط بتعديل التعليمات في القبو، يتلقى الطابق العلوي رسالة مربكة. يحاول بناء "كلب"، لكن التعليمات تقول "لا تبنِ كلباً". وهكذا، يتلاشى مفهوم "الكلب".
الأمر الحاسم: نظرًا لأن مكونات القبو (الفرو، الأرجل، العيون) لم تُحذف، فلا يزال بإمكان الذكاء الاصطناعي بناء "قطة" أو "دب" بشكل مثالي باستخدام تلك المكونات نفسها. لقد تم فقط تضليل تعليمات "الكلب"، وليس المكونات نفسها.
لماذا يعد هذا أمراً هاماً؟
- الدقة: يشبه الأمر إزالة توابل معينة من وصفة دون تغيير القدر أو الموقد. ستحصل على نتيجة خالية من الطعم "الحار"، لكن الحساء سيظل رائعاً.
- السرعة والتكلفة: إنه سريع للغاية. بدلاً من إعادة تدريب الذكاء الاصطناعي بالكامل (وهو ما يستغرق أياماً وحواسيب عملاقة)، يقوم HiRM فقط بتعديل جزء صغير من معالج النصوص. إنه يشبه تغيير سطر واحد من الكود في برنامج ضخم.
- تعدد الاستخدامات: نظرًا لأنه يغير فقط "أمين المكتبة" (مشفر النص)، يمكنك أخذ هذا الإصلاح وتطبيقه على أي نسخة من استوديو الفنون، حتى الأحدث والأقوى منها (مثل Flux)، دون الحاجة لإعادة تدريبها.
- الأمان: يعمل بشكل رائع ضد محاولات "كسر الحماية" (jailbreak). حتى لو حاول شخص ما خداع الذكاء الاصطناعي بطلبات غريبة لرسم العري أو الفن المحمي بحقوق النشر، فإن "تضليل" HiRM يمنع الذكاء الاصطناعي من اتباع الأوامر السيئة، بينما يسمح له برسم صور جميلة وآمنة.
الخلاصة
HiRM هو أداة جراحية. بدلاً من تقطيع الآلة بأكملها لإزالة فكرة سيئة واحدة، فإنه يقوم بلطف بتوجيه أفكار الذكاء الاصطناعي في اللحظة التي يتشكل فيها المفهوم. إنه يمنع حدوث الأشياء السيئة مع الحفاظ على الأشياء الجيدة (الإبداع، الجودة، والسرعة) سليمة تماماً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.