← أحدث الأبحاث
🤖 AI

AEGIS: Adversarial Target-Guided Retention-Data-Free Robust Concept Erasure from Diffusion Models

تقدم هذه الورقة AEGIS، وهو إطار عمل خالٍ من بيانات الاستبقاء، يعمل في آن واحد على تعزيز المتانة والاستبقاء لنماذج الانتشار أثناء محو المفاهيم من خلال الاستفادة من آليات التوجيه المستهدفة التنافسية للتغلب على المقايضات المتأصلة في الأساليب الحالية.

المؤلفون الأصليون: Fengpeng Li, Kemou Li, Qizhou Wang, Bo Han, Jiantao Zhou

نُشر 2026-02-16
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Fengpeng Li, Kemou Li, Qizhou Wang, Bo Han, Jiantao Zhou

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك فناناً سحرياً يُدعى Diffusion. هذا الفنان موهوب للغاية ويمكنه رسم أي شيء تصفه له، من "قطة على لوح تزلج" إلى "غروب الشمس فوق باريس". ومع ذلك، فقد تدرب "Diffusion" على كامل شبكة الإنترنت، مما يعني أنه تعلم أيضاً بعض العادات السيئة. أحياناً، إذا طلبت منه شيئاً غير دقيق تماماً، فقد يقوم عن طريق الخطأ بإنشاء شيء غير لائق، أو عنيف، أو محمي بحقوق الطبع والنشر (مثل الرسم بأسلوب فنان حي بدقة دون إذن).

لإصلاح ذلك، يحاول الباحثون تعليمه كيفية "نسيان" هذه العادات السيئة. وهذا ما يسمى محو المفاهيم (Concept Erasure). ولكن هناك مشكلة؛ فتعليم "Diffusion" النسيان يشبه محاولة إزالة بقعة من قميص أبيض دون جعل القميص بأكمله رمادياً أو تمزيقه.

المشكلة: "البقعة" مقابل "القميص"

تواجه الطرق الحالية مقايضة صعبة:

  1. المتانة (البقعة): إذا حاولت إزالة مفهوم "العري"، فأنت تريد التأكد من اختفائه للأبد. لكن المهاجمين الأذكياء يمكنهم خداع النموذج باستخدام مرادفات (مثل "عارٍ" بدلاً من "عري") أو صياغات غريبة لإعادة الصور السيئة.
  2. الاحتفاظ (القميص): إذا حاولت جاهدًا فرك البقعة، فقد تمحو بالخطأ القدرة على رسم "الأشخاص" أو "الملابس" تماماً، مما يدمر قدرة الفنان على رسم أي شيء آخر.

الطرق الموجودة عادة ما تعالج مشكلة واحدة ولكنها تكسر الأخرى؛ فهي إما تترك البقعة مرئية (غير متينة) أو تفسد القميص (سوء الاحتفاظ).

الحل: AEGIS

يقدم البحث طريقة جديدة تسمى AEGIS (المحو التنافسي ذو التآزر المستند إلى التدرج - Adversarial Erasure with Gradient-Informed Synergy). فكر في AEGIS كفريق تنظيف ذكي مكون من خطوتين، يعرف تماماً كيف ينظف دون إتلاف النسيج.

الخطوة 1: "الهدف الذكي" (هدف المحو التنافسي)

تخيل أنك تريد تعليم "Diffusion" أن "العري" أمر سيء.

  • الطريقة القديمة: تعرض على النموذج صورة واحدة لشخص عارٍ وتقول له: "لا ترسم هذا". يتعلم النموذج تجنب تلك الصورة المحددة. ولكن إذا طلب شخص ما "شخصاً بلا ملابس"، فقد لا يزال النموذج يفعل ذلك لأنه لم يتعلم الفكرة العامة للعري، بل تعلم فقط تجنب تلك الصورة المحددة.
  • طريقة AEGIS: يقوم AEGIS بإنشاء "هدف فائق" (Super-Target). هو لا يكتفي باختيار صورة واحدة؛ بل يحسب "مركز الجاذبية" لمفهوم العري بأكمله. إنه يشبه إيجاد المنتصف الدقيق لحشد من الناس الذين ينتمون جميعاً للمفهوم السيئ.
    • التشبيه: بدلاً من إخبار الفنان، "لا ترسم هذه السيارة الحمراء تحديداً"، يقول AEGIS: "لا ترسم أي سيارة حمراء، وإليك المركز الدقيق لمفهوم 'السيارة الحمراء' لتعرف بالضبط ما الذي يجب تجنبه".
    • من خلال استهداف هذا "المركز"، يضمن AEGIS أنه حتى لو استخدم المهاجم مرادفاً أو وصفاً غريباً، فإن النموذج سيظل يعرف كيف يقول "لا". وهذا يجعل عملية المحو متينة ضد الخدع.

الخطوة 2: "الفرشاة المتوازنة" (إسقاط تنظيم التدرج)

الآن، تخيل أنك تقوم بفرك البقعة. بينما تفرك بقوة، تبدأ يدك بالاهتزاز، وقد تفرك بالخطأ الأجزاء الجيدة من القميص (مثل الياقة أو الأزرار).

  • الصراع: التعليمات لـ "إزالة المفهوم السيئ" تدفع النموذج في اتجاه واحد. والتعليمات لـ "الحفاظ على المفاهيم الجيدة" تدفعه في اتجاه آخر. أحياناً، تتصارع هاتان القوتان ضد بعضهما البعض.
  • طريقة AEGIS: يستخدم AEGIS تقنية تسمى إسقاط تنظيم التدرج (Gradient Regularization Projection - GRP).
    • التشبيه: تخيل أنك تدفع صندوقاً ثقيلاً (النموذج) إلى اليسار لإزالة الأشياء السيئة. ولكنك تحتاج أيضاً إلى منع الصندوق من الانزلاق بعيداً جهة اليسار ليصطدم بجدار (إفساد الأشياء الجيدة).
    • يعمل AEGIS مثل مرشد ذكي. إنه ينظر إلى دفعتك. إذا كانت دفعتك لإزالة الأشياء السيئة تدفع أيضاً الأشياء الجيدة بعيداً، فإن AEGIS يوجه يدك بلطف. يقول لك: "حسناً، ادفع لليسار لإزالة الشيء السيئ، ولكن لا تدفع للأمام، لأن ذلك سيفسد الأزرار".
    • يفعل ذلك دون الحاجة إلى صور إضافية للأشياء "الجيدة" للنظر إليها. فهو يستخدم ذاكرة النموذج الخاصة بما كان عليه قبل أن يبدأ في عملية الفرك ليعرف ما الذي يجب الحفاظ عليه.

لماذا هذا مهم؟

اختبر المؤلفون AEGIS على مفاهيم صعبة مثل "العري"، وأنماط فنية محددة (مثل فان جوخ)، وأشياء (مثل الكنائس).

  • النتيجة: كان AEGIS أصعب بك كثيراً في الخداع من الطرق السابقة. لم يستطع المهاجمون استعادة الصور السيئة بسهولة.
  • ميزة إضافية: لم يفقد النموذج قدرته على رسم الأشياء الأخرى؛ ظل "القميص" أبيض وسليماً.

الملخص

AEGIS يشبه منظفاً ماهراً لفناني الذكاء الاصطناعي.

  1. يجد المركز الحقيقي للمفهوم السيئ بحيث يمكنه إزالة المفهوم بأكمله، وليس مجرد مثال محدد.
  2. يستخدم مرشداً ذكياً لفرك الأشياء السيئة دون مسح الأشياء الجيدة بالخطأ، وكل ذلك دون الحاجة إلى مكتبة مرجعية للصور "الآمنة".

إنه يحل المشكلة الأزلية المتمثلة في "كيف أحذف السيئ دون حذف الجيد؟" من خلال كونه أكثر ذكاءً فيما يتعلق بما يجب استهدافه وكيفية تحريك عقل النموذج.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →