← أحدث الأبحاث
💻 computer science

TwoHamsters: Benchmarking Multi-Concept Compositional Unsafety in Text-to-Image Models

تقدم هذه الورقة البحثية "TwoHamsters"، وهو معيار شامل يتكون من 17.5 ألف مطالبة صُممت لتقييم عدم السلامة في تركيب المفاهيم المتعددة (MCCU) في نماذج تحويل النص إلى صورة، مما يكشف أن النماذج الحالية والأحدث وآليات الدفاع تفشل بفعالية في التخفيف من المخاطر الناشئة عن الارتباطات الضمنية للمفاهيم الحميدة فردياً.

المؤلفون الأصليون: Chaoshuo Zhang, Yibo Liang, Mengke Tian, Chenhao Lin, Zhengyu Zhao, Le Yang, Chong Zhang, Yang Zhang, Chao Shen

نُشر 2026-04-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chaoshuo Zhang, Yibo Liang, Mengke Tian, Chenhao Lin, Zhengyu Zhao, Le Yang, Chong Zhang, Yang Zhang, Chao Shen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك آلة فنية سحرية. تكتب لها وصفاً، فترسم لك صورة. هذه الآلة ذكية للغاية؛ يمكنها رسم قطط واقعية، ومدن مستقبلية، وشخصيات تاريخية. ولكن، مثل أي أداة قوية، لها جانب مظلم: أحياناً ترسم عن طريق الخطأ أشياء مسيئة، أو خطيرة، أو ببساطة غير لائقة.

لفترة طويلة، حاول العلماء تعليم هذه الآلة كيف تقول "لا" للأفكار السيئة. لقد بنوا حواجز لمنعها من رسم الأسلحة، أو العري، أو العنف. ظنوا أن لديهم نظاماً جيداً: إذا كانت كلمة "مسدس" موجودة في طلبك، تتوقف الآلة.

لكن هنا تكمن المشكلة: وجد الأشرار (أو الحوادث الماكرة) ثغرة. أدركوا أنه يمكنهم دمج كلمتين بريئتين تماماً لإنشاء شيء خطير، والآلة لن تلاحظ ذلك.

تقدم هذه الورقة البحثية طريقة جديدة للإمساك بهذه الخدع الماكرة. وقد أطلقوا عليها اسم TwoHamsters (هامستر اثنان).

تشبيه "الهامستر الاثنان"

لماذا هذا الاسم؟ يشرح المؤلفون ذلك بحقيقة مضحكة ولكنها حقيقية: الهامستر حيوان منعزل. إذا أجبرت هامسترين على العيش في نفس القفص، فسيتقاتلان، وقد يكون ذلك مميتاً.

  • الهامستر (أ) آمن بمفرده.
  • الهامستر (ب) آمن بمفرده.
  • الهامستر (أ) + الهامستر (ب) = كارثة.

في عالم فن الذكاء الاصطناعي، يُسمى هذا عدم السلامة التركيبية متعددة المفاهيم (MCCU). وهو عندما يمتزج فكرتان غير ضارتين لإنشاء فكرة ضارة.

أمثلة من الواقع ذكرتها الورقة:

  • "موزة" + "حليب" = فاكهة ومشروب غير ضارين. لكن معاً، في سياقات معينة، يمكن استخدامهما لتمرير نكتة جنسية.
  • "حقنة" + "مسحوق أبيض" = أدوات طبية. لكن معاً، فهما يشيران بوضوح إلى تعاطي المخدرات.
  • "طفل" + "صالة ألعاب (Arcade)" = طفل يستمتع بوقته. لكن معاً، قد يوحيان بالقمار للقاصرين.

الذكاء الاصطناعي يرى "الموزة" و"الحليب" ويفكر: "رائع، يمكنني رسم هذين الشيئين!"، لكنه يفتقد المعنى المسيء الخفي الذي يفهمه البشر فوراً.

"الاختبار" الجديد (معيار TwoHamsters)

بنى الباحثون اختباراً ضخماً يسمى TwoHamsters. إنه يشبه امتحاناً كبيراً يحتوي على 17,500 سؤال مخادع.

  • أخذوا 10 نماذج مختلفة من أفضل نماذج الفن بالذكاء الاصطناعي (مثل تلك التي قد تراها على وسائل التواصل الاجتماعي).
  • طلبوا منها رسم هذه التوليفات "البريئة ولكن الخطيرة".
  • النتيجة؟ فشل الذكاء الاصطناعي فشلاً ذريعاً.
    • أحد أذكى النماذج، FLUX، رسم الصورة "غير الآمنة" بنسبة 99.5% من المرات. لم يستطع رؤية الفخ على الإطلاق.
    • حتى "حراس الأمن" (الفلاتر) التي من المفترض أن تحظر الصور السيئة لم تمسك إلا بنحو 41% من هذه الخدع. كانوا يبحثون عن كلمة "مسدس"، وليس عن مزيج "الموزة + الحليب".

لماذا يحدث هذا؟ (معضلة "التعليمات-السلامة")

وجدت الورقة مفارقة محزنة: كلما أصبح الذكاء الاصطناعي أكثر ذكاءً في اتباع التعليمات، زاد سوء حالته فيما يتعلق بالسلامة.

فكر في الأمر كموظف مطيع ولكنه ساذج جداً.

  • الذكاء الاصطناعي القديم: "لقد طلبت موزة وحليباً. لست متأكداً مما إذا كان هذا مقبولاً، لذا سأقول لا فحسب". (آمن، ولكنه غير مفيد).
  • الذكاء الاصطناعي الجديد: "لقد طلبت موزة وحليباً! أنا خبير في تنفيذ الأوامر. إليك صورتك!". (مفيد، ولكنه خطير).

الذكاء الاصطناعي بارع جداً في الاستماع لدرجة أنه يتوقف عن التفكير في لماذا قد يكون الطلب غريباً. هو فقط ينفذ ما أُمر به.

مشكلة "الممحاة"

حاول العلماء إصلاح ذلك بتعليم الذكاء الاصطناعي كيفية "نسيان" المفاهيم السيئة. حاولوا مسح فكرة "تعاطي المخدرات" من عقل الذكاء الاصطناعي.

  • المشكلة: لا يمكنك مجرد مسح "المسحوق الأبيض" أو "الحقنة" لأن هذه الأشياء مطلوبة أيضاً لرسم الأطباء والمستشفيات!
  • النتيجة: عندما حاولوا مسح التوليفات السيئة، بدأ الذكاء الاصطناعي يرسم صوراً سيئة ومكسورة لكل شيء آخر. لقد فقد قدرته على رسم الأشياء الجيدة أيضاً. الأمر يشبه محاولة إزالة كلمة "نار" من القاموس لمنع الحريق، ولكن بعد ذلك لن تتمكن من الكتابة عن التخييم أو الشموع.

الخلاصة الكبرى

تخلص الورقة إلى أننا لا نستطيع مجرد بناء جدار أكبر لمنع الكلمات السيئة. نحن بحاجة لتعليم الذكاء الاصطناعي المنطق والسياق.

بدلاً من مجرد حظر الكلمات، يحتاج الذكاء الاصطناعي لتعلم: "انتظر، وجود طفل وصالة ألعاب معاً قد يعني القمار، وهذا سيء للأطفال".

باختصار:

  1. الفخ: شيئان آمنان يمكن أن يصنعا شيئاً سيئاً.
  2. الفشل: الذكاء الاصطناعي الحالي مطيع للغاية ويفقد القدرة على ملاحظة هذه الفخاخ.
  3. الحل: يجب أن نتوقف عن مجرد حظر الكلمات ونبدأ في تعليم الذكاء الاصطنا طريقة فهم القصة وراء الكلمات.

يعد معيار TwoHamsters أداة جديدة لمساعدة المطورين على اختبار الذكاء الاصطناعي الخاص بهم والتأكد من أنه لن يقع في فخ خدع "الهامسترين في قفص واحد" هذه مرة أخرى.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →