← أحدث الأبحاث
💬 NLP

Same Model, Different Weakness: How Language and Modality Reshape the Jailbreak Attack Surface in Frontier MLLMs

تكشف هذه الدراسة أن ثغرات كسر الحماية في النماذج اللغوية الكبيرة متعددة الوسائط الرائدة ليست موحدة عبر اللغات، مما يثبت أن الانتقال من الإنجليزية إلى الإسبانية يغير بشكل جذري سطح الهجوم من خلال إضعاف هجمات التأطير اللغوي وتقوية الهجمات البصرية، مما يبطل تصنيفات السلامة المستمدة من التقييمات أحادية اللغة.

المؤلفون الأصليون: Casey Ford, Madison Van Doren, Sicheng Jin, Emily Dix

نُشر 2026-05-25
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Casey Ford, Madison Van Doren, Sicheng Jin, Emily Dix

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك حارس أمن ذكي للغاية ومدرب تدريبًا عاليًا لمبنى رقمي. مهمة هذا الحارس هي منع الأشخاص من طلب أشياء خطيرة، مثل كيفية صنع قنبلة أو نشر الأكاذيب. لفترة طويلة، اعتقدنا أن هذا الحارس بارع بنفس القدر في إيقاف الطلبات السيئة سواء تم الهمس بها بالإنجليزية أو الإسبانية.

هذه الورقة البحثية تشبه قصة بوليسية تثبت خطأ هذا الافتراض. فقد وجد الباحثون أن "آذان" الحارس مضبوطة بدقة شديدة على اللغة الإنجليزية، لكن "عينيه" تعملان بشكل مختلف.

إليك تفصيل لنتائجهم باستخدام تشبيهات بسيطة:

١. "فلتر اللغة" مقابل "العدسة البصرية"

فكر في نموذج الذكاء الاصطناعي كحارس أمن تعلم قواعده من خلال مشاهدة آلاف الأفلام وقراءة آلاف الكتب باللغة الإنجليزية.

  • الضعف اللغوي: إذا حاول شخص سيء خداع الحارس باستخدام قصة إنجليزية ذكية (مثل التظاهر بأنه شخصية في مسرحية أو استخدام حجج مقنعة)، فإن الحارس يتعرف على النمط فورًا ويقول: "لا، لقد رأيت هذه الحيلة من قبل".
  • التحول الإسباني: عندما قام الباحثون بتغيير اللغة إلى الإسبانية المكسيكية، ارتبك "فلتر اللغة" لدى الحارس. الحيل الذكية بأسلوب إنجليزي (مثل لعب الأدوار) توقفت عن العمل لأن الحارس لم يكن مدربًا على التعرف على تلك الأنماط البلاغية المحددة باللغة الإسبانية. الأمر يشبه محاولة فتح قفل بمفتاح يناسب بابًا مختلفًا؛ الحيلة ببساطة لن تنجح.
  • المفاجأة البصرية: ومع ذلك، عندما استخدم المهاجمون الصور لخداع الحارس، حدث العكس. في اللغة الإسبانية، أصبحت الحيل البصرية أكثر فعالية في الواقع. يبدو الأمر كما لو أن عيني الحارس أقل اتصالًا بتدريبه اللغوي. عندما يرى صورة، فإنه يعالجها عبر مسار مختلف لا يهتم كثيرًا بما إذا كان النص بالإنجليزية أو الإسبانية.

٢. "انعكاس الترتيب" (المفاجأة الكبرى)

عادةً، عندما تختبر أنظمة الأمان، تتوقع أن يظل الحارس "الأفضل" هو الأفضل، والحارس "الأسوأ" هو الأسوأ، بغض النظر عن اللغة التي تتحدث بها.

  • في الإنجليزية: كان أحد النماذج (لنسمه "Pixtral") هو أسوأ حارس، حيث يتم خداعه بسهولة. بينما كان نموذج آخر ("Qwen") في المنتصف.
  • في الإسبانية: انقلب الترتيب! أصبح "Qwen" فجأة هو الأسوأ، بينما أصبح "Pixtral" أصعب في الخداع.
  • الخلاة المستفادة: لا يمكنك ببساطة أخذ درجات السلامة الإنجليزية وإجراء بعض العمليات الحسابية لتخمين مدى أمان النموذج في الإسبانية. الترتيب بين من هو آمن ومن هو خطير يتغير فعليًا بناءً على اللغة.

٣. لماذا يحدث هذا (تشبيه "النظام الغذائي للتدريب")

تشير الورقة إلى أن هذا يحدث بسبب كيفية تدريب نماذج الذكاء الاصطناعي هذه.

  • تخيل أن النموذج هو طالب لم يأخذ سوى دروس السلامة باللغة الإنجليزية. لقد تعلم رصد "السلوك السيئ" بناءً على الكلمات وتراكيب الجمل الإنجليزية.
  • عندما يُسأل سؤالًا باللغة الإسبانية، فإنه لا يزال يستخدم عقله المدرب بالإنجليزية لتحليل الكلمات. إنه يفتقد الحيل لأن "مفردات الحيلة" مختلفة.
  • ومع ذلك، الصور عالمية. صورة القنبلة تبدو كقنبلة في أي لغة. ولأن المعالجة البصرية للنموذج ليست مرتبطة ارتباطًا وثيقًا بتدريبه على السلامة باللغة الإنجليزية، فإنه أحيانًا يفشل في ربط الصورة بالخطر، خاصة عندما يكون النص المحيط بها بلغة لا يمتلك فيها النموذج تدريبًا كافيًا على السلامة.

٤. الخلاصة

اختبر الباحثون أربعة نماذج مختلفة من الفئات العليا للذكاء الاصطناعي باستخدام ٣٦٣ محاولة "اختراق" (حيل لتجاوز قواعد السلامة) باللغتين الإنجليزية والإسبانية. ووجدوا ما يلي:

  • السلامة ليست رقمًا ثابتًا. النموذج ليس مجرد "آمن" أو "غير آمن". هو آمن في بعض اللغات وغير آمن في لغات أخرى.
  • اختبار "المقاس الواحد للجميع" معطل. إذا اختبرت هذه النماذج بالإنجليزية فقط، فأنت تحصل على صورة خاطئة لمدى أمانها لبقية العالم.
  • الأجيال الجديدة تتحسن، لكن الفجوات لا تزال قائمة. النماذج الأحدث أصعب قليًا في الخداع من النماذج الأقدم، لكن الفرق الغريب بين مستويات السلامة في الإنجليزية والإسبانية لا يزال موجودًا.

باختاً: إذا كنت تريد معرفة ما إذا كان الذكاء الاصطناعي آمنًا لمستخدم يتحدث الإسبانية، فلا يمكنك مجرد النظر إلى تقرير السلامة الخاص به بالإنجليزية. يجب عليك اختباره بالإسبانية، لأن "نقاط الضعف" في الدرع توجد في أماكن مختلفة تمامًا اعتمادًا على اللغة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →