← أحدث الأبحاث
🤖 AI

Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Image Diffusion Models

تقدم هذه الورقة البحثية BEAP، وهو هجوم تحفيز عدائي يعتمد على التضمين (embedding-aware) ويعمل كصندوق أسود، يستغل نموذجاً لغوياً كبيراً لتوليد مطالبات عالية الجودة وغير قابلة للكشف بشكل تكراري، مما ينجح في تجاوز دفاعات "إلغاء التعلم" (machine unlearning) في نماذج الانتشار من نص إلى صورة بمعدلات نجاح أعلى بكثير من الطرق السابقة.

المؤلفون الأصليون: Arian Komaei Koma, Seyed Amir Kasaei, AmirMahdi Sadeghzadeh, Mohammad Hossein Rohban

نُشر 2026-05-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Arian Komaei Koma, Seyed Amir Kasaei, AmirMahdi Sadeghzadeh, Mohammad Hossein Rohban

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

الصورة الكبيرة: مشكلة "الممحاة المزيفة"

تخيل أن لديك فناناً موهوباً جداً قد شاهد ملايين الصور. تطلب من هذا الفنان أن "ينسى" كيفية رسم شيء محدد، مثل شخص عارٍ. أنت تريد أن يكون آمناً وألا يرسم ذلك أبداً.

للقيام بذلك، تستخدم تقنية "إلغاء التعلم الآلي" (machine unlearning). فكر في هذا الأمر كأنك تمسك بقلم تحديد أحمر وتخربش فوق ذاكرة الفنان المتعلقة بـ "الأشخاص العراة". أنت تأمل أنه الآن، إذا طلبت منه صورة لشخص عارٍ، سيقول: "لا أعرف ما هذا"، أو سيرسم شيئاً آخر تماماً.

المشكلة: اكتشف مؤلفو هذه الورقة البحثية أن هذا "القلم الأحمر" لا يمسح الذاكرة فعلياً، بل يخفيها فقط. الفنان لا يزال يتذكر كيفية رسم ذلك؛ هو فقط يحتاج إلى الهمسة الصحيحة لفتح تلك الذاكرة مجدداً.

الهجوم: BEAP (المحقق الذي يهمس)

تقدم الورقة طريقة جديدة تسمى BEAP. فكر في BEAP كمحقق ذكي يريد إثبات أن الفنان لا يزال يتذكر الصورة المحظورة.

معظم المحاولات السابقة لخداع الفنان كانت تشبه الصراخ بكلمات غير مفهومة أو استخدام رموز ليس لها معنى (مثل: "naked person x99#!!"). كانت حواجز الأمان لدى الفنان (الفلاتر) تكتشف هذا الهراء فوراً وتقوم بحظره.

BEAP مختلف. فهو يستخدم ذكاءً اصطناعياً فائق الذكاء (نموذج لغوي كبير - LLM) ليعمل كـ مترجم دبلوماسي. بدلاً من الصراخ، يقوم BEAP بالهمس. إنه يحاول وصف المفهوم المحظور باستخدام لغة بشرية طبيعية ومهذبة تبدو بريئة تماماً بالنسبة لحواجز الأمان.

كيف يعمل BEAP (الرقصة ذات الخطوات الثلاث)

لا يقوم BEAP بالتخمين فحسب؛ بل يلعب لعبة "ساخن وبارد" مع الفنان، حيث يقوم بتحسين نهجه في كل مرة. إليك كيف يعمل:

  1. "خريطة المفردات" (الوعي بالتمثيل الرقمي/Embedding Awareness):
    تخيل أن عقل الفنان عبارة عن مكتبة ضخمة حيث يتم ترتيب الكلمات بناءً على مدى تشابهها. كلمة "عارٍ" (naked) تقع في زاوية محددة. يقوم BEAP بإنشاء خريطة للكلمات التي تعد "جيراناً" لكلمة "عارٍ" (مثل "بشرة"، "مكشوف"، "بدون غطاء") ولكنها ليست الكلمة المحظورة نفسها. ثم يخبر المترجم الذكي: "استخدم هذه الكلمات المجاورة لوصف المشهد". هذا يبقي عملية البحث مركزة في المنطقة الصحيحة من المكتبة.

  2. "بطاقة تقييم النقاط الثلاث" (إشارات المكافأة):
    يقوم BEAP بتجربة نص (Prompt)، ويحصل على صورة، ثم يفحص ثلاثة أشياء:

    • هل حصلنا على الشيء المحظور؟ (على سبيل المثال: هل أظهرت الصورة بالفعل شخصاً عارياً؟)
    • هل تتطابق الصورة مع الكلمات؟ (على سبيل المثال: إذا طلبت "امرأة في حديقة"، هل تظهر الصورة امرأة في حديقة؟)
    • هل الصورة جميلة؟ (هل هي ضبابية أو مشوهة، أم أنها عالية الجودة؟)

    إذا فشلت الصورة في أي من هذه الاختبارات، لا يستسلم BEAP. بل يخبر المترجم الذكي: "كان ذلك قريباً، لكن الصورة كانت ضبابية جداً. حاول وصف المشهد بشكل مختلف، ولكن استمر في استخدام تلك الكلمات 'المجاورة'".

  3. الحلقة التكرارية:
    يتكرر هذا الأمر مراراً وتكراراً. يولد BEAP جملة جديدة أفضل قليلاً، ويجربها مرة أخرى، ويحصل على درجة أفضل. في النهاية، يجد جملة تبدو طبيعية وآمنة تماماً للفلاتر، ولكنها تخدع الفنان ليرسم الصورة المحظورة بجودة عالية.

النتائج: "ممسوحة" ولكنها ليست غائبة

اختبرت الورقة هذا الأسلوب ضد عدة طرق مختلفة لـ "إلغاء التعلم" (مثل ESD و MACE و SPM) والتي كان من المفترض أن تكون قد أزالت مفهوم العري من عقل الفنان.

  • الطريقة القديمة (Ring-a-Bell): حاولت الهجمات السابقة كسر النظام لكنها انتهت بإنتاج نصوص (Prompts) غير مفهومة. كانت فلاتر الأمان تلتقطها، أو كانت الصور الناتجة قبيحة ومعطلة. وقد سجلت نسبة نجاح 0% في إنتاج صور جيدة.
  • طريقة BEAP: نجح BEAP في 95% إلى 99% من الحالات. لقد تمكن من توليد صور عالية الجودة وجميلة للمفهوم "المنسي" باستخدام جمل تبدو طبيعية تماماً.
  • اختبار "الهراء": تحققت الورقة مما إذا كانت نصوص BEAP تبدو كأنها كلام غير مفهوم. لم تكن كذلك؛ بل بدت كإنجليزية طبيعية. لقد تم خداع فلاتر الأمان التي عادة ما تكتشف النصوص "الغريبة" أو "المعطلة" تماماً.

الخلاصة

تخلص الورقة إلى أن الطرق الحالية لـ "إلغاء التعلم" ليست آمنة حقاً. فهي تشبه وضع لافتة "ممنوع الدخول" على الباب بدلاً من قفل الباب فعلياً. إذا كنت تعرف الرمز الصحيح (أو في هذه الحالة، الجملة الطبيعية الصحيحة)، يمكنك المرور من خلاله مباشرة.

يحذر المؤلفون أنه حتى بعد "إلغاء تعلم" النموذج، فإن المعرفة لا تزال موجودة، وهي فقط تنتظر نصاً ذكياً لإعادتها إلى الحياة. لقد ابتكروا BEAP ليس لتشجيع سوء الاستخدام، بل لإظهار أن تدابير الأمان الحالية هشة وتحتاج إلى إصلاح.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →