← أحدث الأبحاث
🤖 AI

PromptGuard: Soft Prompt-Guided Unsafe Content Moderation for Text-to-Image Models

يُعد PromptGuard تقنية مبتكرة وفعالة للإشراف على المحتوى لنماذج تحويل النص إلى صورة، حيث يعمل على تحسين المطالبات الناعمة (soft prompts) الشاملة والخاصة بالفئات ضمن فضاء التضمين النصي، وذلك بهدف كبح توليد المحتوى غير اللائق (NSFW) بفعالية مع الحفاظ على جودة الصورة وسرعة الاستدلال.

المؤلفون الأصليون: Lingzhi Yuan, Xinfeng Li, Chejian Xu, Guanhong Tao, Xiaojun Jia, Yihao Huang, Wei Dong, Yang Liu, Xiaofeng Wang, Bo Li

نُشر 2026-02-19
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Lingzhi Yuan, Xinfeng Li, Chejian Xu, Guanhong Tao, Xiaojun Jia, Yihao Huang, Wei Dong, Yang Liu, Xiaofeng Wang, Bo Li

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك فرشاة رسم سحرية يمكنها تحويل أي جملة تكتبها إلى صورة جميلة. هذا هو بالضبط ما يفعله الذكاء الاصطناعي لتحويل النص إلى صورة (مثل Stable Diffusion). تقول له: "قطة على لوح تزلج"، وفجأة—تظهر قطة على لوح تزلج.

لكن هنا تكمن المشكلة: إذا قلت شيئاً خطيراً أو غير لائق، مثل "مشهد قتال عنيف"، فقد يقوم الذكاء الاصطناعي برسم ذلك أيضاً. هذه قضية أخلاقية كبيرة. نحن بحاجة إلى طريقة لمنع الذكاء الاصطناعي من رسم الأشياء السيئة دون إفساد قدرته على رسم الأشياء الجيدة.

حالياً، معظم أساليب السلامة تشبه حراس النوادي الليلية أو المحررين المتشددين:

  • الحارس: يفحص جملتك قبل دخولك. إذا بدت الجملة خطيرة، فإنه يطردك أو يقوم بتغبيش الصورة بعد صنعها. هذه الطريقة بطيئة وغالباً ما تحظر طلبات غير ضارة عن طريق الخطأ.
  • المحرر المتشدد: يأخذ عقل الذكاء الاصطناعي بالكامل ويعيد تدريبه لكي "ينسى" كيفية رسم الأشياء السيئة. هذا يشبه محاولة إعادة تعليم طباخ ماهر كيف يطبخ، وهو أمر يستغرق وقتاً طويلاً وقد يجعل أطباقه الجيدة مذاقها أسوأ.

ادخلوا عالم: PromptGuard (الهمس السحري)

تقدم الورقة البحثية PromptGuard، وهي طريقة ذكية وجديدة للحفاظ على سلامة الذكاء الاصطناعي. بدلاً من توظيف حارس أو إعادة تدريب الطباخ، هم يعطون الذكاء الاصطناعي تعليمات سرية وغير مرئية يهمس بها لنفسه قبل أن يبدأ في الرسم.

إليك كيف يعمل الأمر، باستخدام تشبيهات بسيطة:

1. خدعة "الأمر النظامي" (System Prompt)

في روبوتات الدردشة (مثل الذي تتحدث إليه الآن)، هناك "أمر نظامي" مخفي يخبر الروبوت: "كن مفيداً، كن آمناً، ولا تقل أشياء مسيئة". يتبع الروبوت هذه القاعدة تلقائياً.

نماذج تحويل النص إلى صورة لا تملك هذه القاعدة المخفية. يقوم PromptGuard بإنشاء "كلمة سحرية رقمية" (تسمى soft prompt) تعمل كأنها تلك القاعدة المخفية. هي ليست كلمة حقيقية يمكنك كتابتها؛ بل هي رمز خاص مدمج في عقل الذكاء الاصطناعي يقول: "مهما كان ما طُلب منك رسمه، حافظ على سلامته".

2. استراتيجية "فرق تسد"

الأشياء السيئة تأتي بنكهات عديدة: بعضها عنيف، وبعضها جنسي، وبعضها سياسي، وبعضها مجرد أمور غريبة ومزعجة. محاولة صنع كلمة سحرية واحدة لمنع كل هذه الأنواع تشبه محاولة استخدام مظلة واحدة لإيقاف المطر والثلج والبرد في آن واحد—فهذا لا يعمل بشكل مثالي.

لذلك، يستخدم PromptGuard فريقاً من الحراس المتخصصين:

  • كلمة سحرية صغيرة جداً يتم تدريبها خصيصاً لمنع العنف.
  • كلمة أخرى لمنع المحتوى الجنسي.
  • وأخرى لمنع الكراهية السياسية، وهكذا.

عندما تطلب من الذكاء الاصطناعي رسم شيء ما، فإنه يرفق كل هذه الكلمات السحرية الصغيرة بطلبك في وقت واحد. الأمر يشبه وجود فريق أمن حيث يراقب شخص الباب، وآخر يراقب النوافذ، وثالث يراقب السقف. معاً، يغطون كل شيء.

3. تدريب "النسخة الآمنة"

كيف تعلم الذكاء الاصطناعي هذه الكلمة السحرية؟ أنت لا تخبره فقط "لا تفعل ذلك". بدلاً من ذلك، تعرض عليه درساً بنظام "قبل وبعد:

  • الدرس: تعرض للذكاء الاصطناعي صورة لـ "رجل عارٍ" (الطلب السيئ) ثم تظهر له صورة لـ "رجل يرتدي ملابسه بالكامل" (النسخة الآمنة).
  • الهدف: تدرب الكلمة السحرية لتوجيه عقل الذكاء الاصطناعي بعيداً عن فكرة "العري" ونحو فكرة "ارتداء الملابس"، حتى لو طلب المستخدم العري.
  • النتي نتيجة: إذا طلب شخص ما شيئاً غير آمن، سيظل الذكاء الاصطناعي يرسم صورة، لكنه سيغير التفاصيل ببراعة لجعلها آمنة وواقعية، بدلاً من مجرد حجب الشاشة أو رفض الرسم.

لماذا يعد هذا أمراً هاماً؟

  • إنه سريع: لأنه لا يحتاج إلى فحص الصورة باستخدام كمبيوتر منفصل أو إعادة تدريب الذكاء الاصطناعي بالكامل، فهو أسرع بـ 3.8 مرة من الطرق الأخرى. إنه يشبه وجود فلتر مدمج بدلاً من وجود حارس أمن منفصل.
  • إنه ذكي: هو لا يكتفي بحظر الطلبات السيئة فحسب، بل يصلحها. إذا طلبت "وحشاً مخيفاً"، فقد يرسم "وحشاً مخيفاً ولكن لطيفاً" بدلاً من وحش مرعب حقاً. إنه يحافظ على استمرارية الإبداع.
  • إنه مرن: إذا ظهر نوع جديد من المحتوى السيئ (مثل "إيذاء النفس")، يمكنك ببساطة تدريب كلمة سحرية صغيرة جديدة وإضافتها إلى الفريق. ليس عليك إعادة بناء النظام بالكامل.

الخلاصة

PromptGuard يشبه إعطاء الذكاء الاصطناعي نظارات سلامة غير مرئية. هو يرى طلب المستخدم، ولكن من خلال هذه النظارات، يقوم تلقائياً بتصفية الأجزاء الخطيرة ويرسم بدلاً منها صورة آمنة وجميلة. إنها طريقة خفيفة، سريعة، وفعالة للحفاظ على سحر فن الذكاء الاصطناعي آمناً للجميع.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →