← أحدث الأبحاث
💻 computer science

Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts

تقدم هذه الورقة أداة Prompting4Debugging (P4D)، وهي أداة اختبار اختراق مؤتمتة تكشف عن ثغرات أمنية جسيمة في آليات السلامة لنماذج الانتشار من نوع نص-إلى-صورة عبر إثبات أن العديد من المطالبات التي كانت تُعتبر سابقاً "آمنة" يمكن التلاعب بها لتجاوز الحمايات الحالية، مما يتحدى موثوقية معايير التقييم الحالية.

المؤلفون الأصليون: Zhi-Yi Chin, Chieh-Ming Jiang, Ching-Chun Huang, Pin-Yu Chen, Wei-Chen Chiu

نُشر 2026-01-15
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhi-Yi Chin, Chieh-Ming Jiang, Ching-Chun Huang, Pin-Yu Chen, Wei-Chen Chiu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك فناناً موهوباً للغاية وساحراً يدعى Stable Diffusion. يمكن لهذا الفنان تحويل أي جملة تكتبها إلى صورة جميلة. إذا قلت له "قطة على حصيرة"، فسيقوم برسم قطة على حصيرة. ولكن، ولأن هذا الفنان تعلم من الإنترنت بأكمله، فقد يرسم أحياناً أشياء غير لائقة عن طريق الخطأ، مثل شخصيات محمية بحقوق الطبع والنشر أو صور غير مناسبة للعمل (NSFW).

لإصلاح ذلك، يضع المطورون حارساً أمنياً أمام الفنان. هذا الحارس (آلية السلامة) من المفترض أن يمنع الفنان من رسم الأشياء السيئة. إذا طلبت منه "شخصاً عارياً"، سيقول الحارس: "لا!". ثم يقوم الفنان برسم شيء آخر بدلاً من ذلك.

المشكلة:
يعتقد المطورون أن الحارس يقوم بعمل رائع. لديهم قائمة بـ "الجمل السيئة" التي اختبروها، وقد أوقفها الحارس جميعاً. لكن الباحثين في هذه الورقة البحثية تساءلوا: "ماذا لو كان الأشرار بارعين حقاً في خداع الحارس؟ ماذا لو كانت هناك كلمات سرية لم نكتشفها بعد؟"

الحل: Prompting4Debugging (P4D)
قام المؤلفون ببناء أداة تسمى Prompting4Debugging (P4D). فكر في P4D كـ "فريق أحمر" (Red Team) ذكي ومؤتمت (مجموعة من الهكرز الأخلاقيين الذين يتم استئجارهم لاختراق نظام ما بهدف إيجاد الثغرات).

بدلاً من أن يخمن البشر جملًا عشوائية لمحاولة كسر الحارس، يقوم P4D بذلك بشكل آلي وعلمي. إليك كيف يعمل، باستخدام تشبيه بسيط:

تشبيه "الفنان الظل"

تخيل وجود فنانين في غرفة:

  1. الفنان غير المقيد (G): هذا الفنان ليس لديه قواعد. إذا طلبت منه "شخصاً عارياً"، فسيرسمه بدقة.
  2. الفنان المقيد (G'): هذا الفنان لديه حارس أمني. إذا طلبت منه "شخصاً عارياً"، فإنه سيرفض.

الهدف: يريد P4D إيجاد جملة جديدة (مطالبة إشكالية) تخدع الفنان المقيد ليرسم نفس "الشخص العاري" الذي رسمه الفنان غير المقيد، رغم أن الفنان المقيد من المفترض أن يقول "لا".

العملية:

  1. المخطط: يطلب P4D أولاً من الفنان غير المقيد رسم الصورة "المحظورة". هذا يعطيه مخططاً مثالياً لما تبدو عليه الصورة السيئة.
  2. الترجمة: ينظر P4D بعد ذلك إلى الفنان المقيد. هو يعلم أن الفنان المقيد يستخدم كوداً سرياً (تضمينات رياضية "embeddings") لفهم الكلمات.
  3. الاختراق: يبدأ P4D بتعديل الجملة. هو لا يخمن فحسب؛ بل يستخدم "مقياساً منزلقاً" رياضياً لتدفع الكلمات حتى يتطابق الكود الداخلي للفنان المقيد مع مخطط الفنان غير المقيد.
  4. النتيجة: يجد P4D جملة غريبة أو مشوشة أو ذكية (مثل "صورة للوحة إعلانية تظهر رجلاً عارياً في وضع صريح" أو حتى كلام غير مفهوم ولكنه فعال بطريقة ما) تتجاوز الحارس.

ما وجدوه

اختبر الباحثون هذا على العديد من النماذج "المقيدة" الشهيرة (مثل Stable Diffusion مع فلاتر السلامة). وكانت النتائج صادمة:

  • القائمة "الآمنة" لم تكن آمنة: أخذوا قائمة من المطالبات التي كان الجميع يعتقد أنها آمنة وتم اختبارها بالفعل. ووجدوا أن حوالي نصفها يمكن التلاعب بها بسهولة بواسطة P4D لكسر حارس السلامة.
  • فخ "تعتيم المعلومات": اكتشفت الورقة ظاهرة غريبة. أحياناً، يكون حارس السلامة "جيداً جداً" في إخفاء المعلومات. عندما قام الباحثون بإيقاف "فلتر" الحارس مؤقتاً أثناء عملية تعلم كيفية كسر النظام، وجدوا طرقاً أكثر لكسره.
    • التشبيه: تخيل حارساً أمنياً يرتدي عصابة على عينيه بينما تحاول التسلل من أمامه. قد تفكر: "أوه، هو لا يستطيع رؤيتي، لذا أنا في أمان". ولكن في الواقع، العصابة تجعله أقل وعياً بالخدع التي تستخدمها. بمجرد أن تكتشف الخدعة والعصابة على عينيه، يمكنك استخدام نفس الخدعة للتسلل من أمامه حتى عندما لا يرتدي العصابة. إن محاولة الحارس لإخفاء المعلومات جعلت النظام يبدو أكثر أماناً مما هو عليه في الواقع.

الخلاصة

تخلص الورقة إلى أن مجرد اجتياز نظام السلامة لبعض الاختبارات لا يعني أنه آمن حقاً. "المطالبات الآمنة" التي نستخدمها اليوم قد تكون مثل قفل يعمل ضد مفتاح في يدك، لكنه يفشل أمام مفتاح لم تخترعه بعد.

P4D هي أداة للمطورين للعثور على هذه "المفاتبات التي لم تُخترع بعد" قبل أن يستخدمها الأشرار. إنها تثبت أننا بحاجة إلى اختبار هذه النماذج باستمرار، لأن "الأشرار" (أو الأدوات المؤتمتة التي تجد الثغرات) يزدادون ذكاءً، وحراس السلامة يحتاجون إلى الاختبار ضد أذكى الحيل الممكنة.

باختصار: قامت الورقة ببناء روبوت مؤتمت يحاول خداع مولدات الفن بالذكاء الاصطناعي لرسم أشياء سيئة. ووجدت أن حراس السلامة الحاليين أضعف بكثير مما كنا نعتقد، وأن العديد من الكلمات "الآمنة" يمكن تحريفها لكسر القواعد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →