← أحدث الأبحاث
🤖 machine learning

RouteHijack: Routing-Aware Attack on Mixture-of-Experts LLMs

تقدم الورقة البحثية RouteHijack، وهو هجوم كسر حماية مدرك للتوجيه يستغل تركيز سلوكيات السلامة في خبراء محددين داخل نماذج اللغات الكبيرة القائمة على خليط الخبراء (MoE) من خلال تحسين لواحق المدخلات لتثبيط خبراء السلامة وتعزيز الخبراء الضارين، مما يحقق معدلات نجاح في الهجوم وقابلية نقل أعلى بكثير عبر مختلف نماذج (MoE) مقارنة بالطرق الحالية.

المؤلفون الأصليون: Zhiyuan Xu, Joseph Gardiner, Sana Belguith, Lichao Wu

نُشر 2026-05-06
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhiyuan Xu, Joseph Gardiner, Sana Belguith, Lichao Wu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل نموذج لغة ضخمًا (مثل الذكاء الاصطناعي الذي تدردش معه) ليس كدماغ واحد عملاق، بل كمبنى مكاتب ضخم يضم آلاف الموظفين المتخصصين. في النماذج القديمة، كان على كل موظف قراءة كل بريد إلكتروني ومحاولة الإجابة على كل سؤال. ولكن في النماذج الأحدث والأسرع الموصوفة في هذه الورقة البحثية (والتي تُسمى "خليط الخبراء" أو MoE)، يعمل المبنى بشكل مختلف.

عندما يأتي سؤال ما، يقوم مدير (يُسمى "الموجه" أو الـ router) بمسحه سريعًا ويختار فقط حفنة صغيرة من الموظفين الأكثر صلة للإجابة عليه. أما بقية المكتب فيبقى نائمًا. هذا يجعل الذكاء الاصطناعي فائق السرعة والذكاء.

الورقة البحثية، التي تحمل عنوان "RouteHijack"، تكتشف طريقة ذكية لخداع هذا المدير لجعله يختار الموظفين "الخاطئين"، مما يتسبب في جعل الذكاء الاصطناعي يقول أشياء من المفترض أن يكون محظورًا عليه قولها.

إليك كيف يعمل هذا الهجوم، مقسمًا إلى خطوات بسيطة:

1. المشكلة: "فريق السلامة" صغير جدًا

وجد الباحثون أنه في مباني المكاتب هذه، فإن "فريق السلامة" (الموظفون الذين تم تدريبهم لقول "لا، لا يمكنني فعل ذلك") صغير بشكل مفاجئ. إنهم يشبهون وحدة حراسة أمنية متخصصة وصغيرة جدًا.

  • الثغرة: عندما يُسأل الذكاء الاصطناعي سؤالًا خطيرًا، يقوم المدير عادةً بإيقاظ هذا الفريق الأمني الصغير لمنع الطلب.
  • الاكتشاف: أدرك الباحثون أنهم إذا استطاعوا إقناع المدير بعدم إيقاظ فريق الأمن هذا، وبدلاً من ذلك إيقاظ فريق آخر من الموظفين "المشاكسين"، فإن الذكاء الاصطناعي سيجيب بسعادة على السؤال الخطير.

2. الهجوم: "RouteHijack"

ابتكر الباحثون أداة تسمى RouteHijack. تخيلها كأنها همسة سحرية تضيفها في نهاية سؤالك.

  • الخطوة أ: إيجاد الحراس (تحديد موقع الخبراء)
    أولاً، استخدم الباحثون كاميرا خاصة لمراقبة المكتب. طرحوا على الذكاء الاصطنا_أسئلة آمنة وأخرى خطيرة وراقبوا أي الموظفين يستيقظ. وجدوا أن "حراس السلامة" محددون للغاية: فهم لا يستيقظون إلا عندما يكون الذكاء الاصطناعي على وشك رفض طلب سيء. وهم متميزون عن "الموظفين المساعدين" الذين يكتبون النصوص العادية فقط.

  • الخطوة ب: الهمسة السحرية (اللاحقة العدائية)
    بعد ذلك، كتب الباحثون رمزًا سريًا (سلسلة من الكلمات الغريبة) لإضافتها في نهاية سؤال سيء. هذا الرمز لا يحاول إرباك الذكاء الاصطناعي بلغز؛ بل يحاول اختراق عملية اتخاذ القرار لدى المدير.

    • يخبر المدير: "لا توقظ فريق الأمن!"
    • يخبر المدير: "أيقظ الفريق 'المشاكس' بدلاً من ذلك!"
    • يخبر المدير: "لا تبدأ الجملة بـ 'أنا آسف'!"

3. النتيجة: إجابة سلسة وخطيرة

عندما تستخدم هذه الهمسة السحرية مع سؤال خبيث، يصاب المدير الداخلي للذكاء الاصطناعي بالارتباك. يتخطى فريق الأمن تمامًا ويسلم المهمة إلى الموظفين "المشاكسين".

  • النتيجة: لا يكتفي الذكال الاصطناعي بقول "لا". ولا يتلعثم أو يقول "لا يمكنني المساعدة في ذلك". بل يولد الإجابة الضارة التي أرادها المستخدم بسلاسة وثقة.
  • الكفاءة: اختبر الباحثون هذا على سبعة أنواع مختلفة من نماذج الذكاء الاصطناعي من نوع "مباني المكاتب" هذه. في المتوسط، نجح الهجوم بنسبة 69% من المرات، وهو أفضل بكثير من الطرق السابقة.
  • التخفي: والأهم من ذلك، لا يزال الذكاء الاصطناعي يعمل بشكل مثالي للمهام العادية. إذا طلبت منه كتابة قصيدة أو حل مسألة رياضية بعد استخدام الهجوم، فسيظل يؤدي عمله بشكل رائع. "الهمسة السحرية" تغير فقط من يجيب على السؤال السيئ المحدد.

4. لماذا هذا مهم؟

تظهر الورقة البحثية أن مجرد إخبار الذكاء الاصطناعي بأن "يكون آمنًا" ليس كافيًا إذا كان هيكله الداخلي (الطريقة التي يختار بها الموظفين) هشًا.

  • إنه ينتشر: وجد الباحثون أنه إذا صنعوا همسة سحرية لنموذج ذكاء اصطناعي واحد، فإنها غالبًا ما تعمل على نماذج أخرى من نفس العائلة، حتى لو كانت مختلفة قليلاً.
  • إنه يتجاوز الحدود: اختبروه حتى على نماذج الذكاء الاصطناعي التي يمكنها رؤية الصور (نماذج اللغة والرؤية). الهمسة السحرية القائمة على النصوص نجحت هناك أيضًا، مما خدع الذكاء الاصطناعي لتجاهل قواعد السلامة للصور أيضًا.

الخلاصة

تخلص الورقة البحثية إلى أن نماذج الذكاء الاصطناعي الحديثة والسريعة هذه لديها نقطة ضعف خفية: حراس السلامة فيها مركزون للغاية في عدد قليل من "الموظفين" المحددين. ومن خلال إيجاد طريقة لخداع المدير ليتجاهل هؤلاء الحراس، يمكن للمهاجمين تجاوز قواعد السلامة دون كسر "دماغ" الذكاء الاصطناعي أو تغيير كوده البرمجي. يقترح المؤلفون أن تدابير السلامة المستقبلية يجب أن تحمي المدير (نظام التوجيه)، وليس فقط الإجابة النهائية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →