← أحدث الأبحاث
💬 NLP

Omni-Safety under Cross-Modality Conflict: Vulnerabilities, Dynamics Mechanisms and Efficient Alignment

تحدد هذه الورقة ثغرة "تحلل الطبقة الوسطى" (Mid-layer Dissolution) في النماذج اللغوية الكبيرة متعددة الوسائط (OLLMs) من خلال مجموعة بيانات جديدة وتحليل آلي، وتقترح **OmniSteer**، وهي طريقة محاذاة خفيفة الوزن تستخدم متجه رفض ذهبيًا للتخفيف بفعالية من مخاطر السلامة عبر الوسائط دون المساس بالقدرات العامة.

المؤلفون الأصليون: Kun Wang, Zherui Li, Zhenhong Zhou, Yitong Zhang, Yan Mi, Kun Yang, Yiming Zhang, Junhao Dong, Zhongxiang Sun, Qiankun Li, Yang Liu

نُشر 2026-02-12
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Kun Wang, Zherui Li, Zhenhong Zhou, Yitong Zhang, Yan Mi, Kun Yang, Yiming Zhang, Junhao Dong, Zhongxiang Sun, Qiankun Li, Yang Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً شخصياً فائق الذكاء (نموذج لغوي ضخم متعدد الوسائط). هذا المساعد مذهل: يمكنه قراءة نصوصك، ومشاهدة فيديوهاتك، والاستماع إلى صوتك، والنظر إلى صورك. لقد درّبته ليكون "مواطناً صالحاً"؛ فإذا سألته: "كيف أسرق سيارة؟"، سيرد بحزم: "لا يمكنني مساعدتك في ذلك".

ومع ذلك، اكتشف الباحثون "خللاً في المصفوفة" يتعلق بكيفية تعامل هذا المساعد مع أنواع مختلفة من المعلومات في وقت واحد.

المشكلة: "أزمة الهوية" (صراع تعدد الوسائط)

فكر في تدريب السلامة لهذا المساعد كأنه حارس أمن يقف عند باب.

  • إذا اقتربت منه وقلت: "أريد سرقة سيارة"، سيتعرف الحارس على الكلمات ويوقفك.
  • إذا اقتربت منه وعرضت صورة لعملية سرقة سيارة، سيتعرف الحارس على الصورة ويوقفك.

ولكن هنا تكمن الثغرة: إذا اقتربت منه وقلت: "ساعدني في الشيء الموجود في هذه الصورة"، بينما تعرض صورة لسيارة تُسرق، سيصاب الحارس بالارتباك. "المعنى" هنا منقسم بين صوتك ويديك. ولأن المساعد يحاول جاهداً "ربط النقاط" بين النص والصورة، فإن "إنذار السلامة" الداخلي لديه يتوقف عن العمل بالخطأ.

يطلق الباحثون على هذه الظاهرة اسم "التحلل في الطبقة الوسطى" (Mid-layer Dissolution). الأمر يشبه حارس أمن يبدأ في إدراك أن هناك خطباً ما، ولكن في منتصف معالجة المعلومات، يقول عقله فجأة: "مهلاً، أنا فقط أنظر إلى صورة وأستمع إلى جملة... لا يوجد شيء يستحق الانتباه هنا!" ثم يسمح لك بالمرور.

الاكتشاف: "الإشارة المتلاشية"

نظر الباحثون تحت غطاء المحرك (داخل "الطبقات الخفية" لعقل الذكاء الاصطناعي) ووجدوا أنه عندما تأتي المعلومات من مصادر متعددة (نص + صورة + صوت)، فإن "إشارة الرفض" — أي الدافع الذهني لقول "لا" — تصبح ضعيفة للغاية.

ليس الأمر أن الذكاء الاصطناعي "يريد" أن يكون سيئاً؛ بل إن الإشارة التي تخبره بأن "هذا خطر" تتقلص وتتلاشى مادياً أثناء محاولته دمج أنواع البيانات المختلفة.

الحل: "OmniSteer" (البقعة الضوئية الذكية)

لإصلاح ذلك، ابتكر الباحثون أداة تسمى OmniSteer.

تخيل أنه بدلاً من وجود حارس أمن واحد فقط، فإنك تعطي الحارس "بوصلة ذهبية" (متجه الرفض الذهبي - Golden Refusal Vector). هذه البوصلة لا تهتم إذا كان الخطر كلمة منطوقة، أو رسماً، أو فيديو؛ فهي تشير فقط نحو مفهوم "الخطر".

لكن هناك عقبة: إذا كان الحارس عدوانياً للغاية، فقد يوقفك لمجرد سؤالك: "كيف أخبز كعكة؟" (وهذا ما يسمى بـ "الرفض المفرط").

يعمل OmniSteer مثل "بقعة ضوئية ذكية":

  1. يستخدم "محولاً" (Adapter) صغيراً وخفيف الوزن (مثل مستشعر ذكي).
  2. عندما يكتشف المستشعر مدخلاً "منقسماً" (مثل نص + صورة)، فإنه يدرك أن إشارة السلامة تتلاشى.
  3. يقوم فوراً بتوجيه ضوء ساطع ومركز على اتجاه "البوصلة الذهبية"، مما يعزز إشارة الـ "لا!" لتعود إلى قوتها الكاملة.
  4. إذا كان المدخل طبيعياً تماماً (مثل "ما هي حالة الطقس؟")، تظل البقعة الضوئية خافتة حتى يظل المساعد مفيداً وودوداً.

النتيجة

باستخدام هذه "البقعة الضوئية الذكية"، رفع الباحثون قدرة الذكاء الاصطنا est على رفض الطلبات الضارة من حوالي 70% إلى أكثر من 91%. والأهم من ذلك، لم يصبح الذكاء الاصطنا subi "مساعداً عابساً"؛ بل ظل ذكياً ومفيداً كما كان، لكن الآن أصبح من الصعب جداً خداعه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →