← أحدث الأبحاث
💬 NLP

Backdoor Collapse: Eliminating Unknown Threats via Known Backdoor Aggregation in Language Models

تقترح هذه الورقة البحثية \ourmethod، وهو إطار دفاعي مبتكر يقضي على الأبواب الخلفية غير المعروفة في النماذج اللغوية الكبيرة دون معرفة مسبقة بالمحفزات، وذلك عبر تجميعها مع أبواب خلفية معروفة محقونة في فضاء التمثيل يتبعها ضبط دقيق للاسترداد، مما يحقق انخفاضاً كبيراً في معدلات نجاح الهجمات مع الحفاظ على فائدة النموذج.

المؤلفون الأصليون: Liang Lin, Miao Yu, Moayad Aloqaily, Zhenhong Zhou, Kun Wang, Linsey Pang, Prakhar Mehrotra, Qingsong Wen

نُشر 2026-05-14
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Liang Lin, Miao Yu, Moayad Aloqaily, Zhenhong Zhou, Kun Wang, Linsey Pang, Prakhar Mehrotra, Qingsong Wen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً ذكياً جداً (نموذج لغوي كبير) قمت بتنزيله من الإنترنت. لسوء الحظ، قام أحد المتسللين (Hacker) بزرع "فخ" سري داخل عقله، وهذا الفخ يسمى "الباب الخلفي" (Backdoor).

في الحالة الطبيعية، يعمل الروبوت بشكل مثالي. ولكن إذا قلت كلمة سر معينة (المُحفز/Trigger)، سيتجاهل الروبوت فجأة قواعد السلامة الخاصة به ويبدأ في القيام بشيء خطير، مثل إعطاء تعليمات حول كيفية صنع قنبلة أو نشر خطاب كراهية.

الجزء المخيف هو أنك، بصفتك المالك، لا تعرف كلمة السر هذه. أنت لا تعرف ما هو المُحفز، أو ماذا سيقول الروبوت عندما يتم تفعيله. أدوات الأمن الموجودة حالياً تشبه الحراس الذين لا يمكنهم التحقق من الفخاخ إلا إذا عرفوا بالضبط كيف يبدو الفخ. وإذا لم يعرفوا كلمة السر، فلن يتمكنوا من إيقاف الهجوم.

الحل الجديد: "Locphylax" (صائد الفخاخ)

يقترح المؤلفون في هذه الورقة البحثية، ليانغ لين وفريقه، دفاعاً جديداً ذكياً يسمى Locphylax. بدلاً من محاولة العثور على الفخ غير المرئي، يستخدمون استراتيجية "محاربة النار بالنار" (أو في هذه الحالة، محاربة فخ سري بفخ معروف).

إليك كيف يعمل الأمر، باستخدام تشبيه بسيط:

1. المشكلة: الفخ غير المرئي

تخيل أن عقل الروبوت عبارة عن مكتبة ضخمة. لقد أخفى المتسلل كتاباً خطيراً (الباب الخلفي) على رف معين. عندما يطرح شخص ما سؤالاً، يجد الروبوت الكتاب الصحيح عادةً. ولكن إذا همس شخص ما بعبارة سرية، فإن الروبوت يتجاهل الكتاب الصحيح ويسحب الكتاب الخطير بدلاً منه. وبما أنك لا تعرف عبارة السر، فلا يمكنك إيقافه.

2. الاكتشاف: "تجميع الباب الخلفي" (Backdoor Aggregation)

توصل الباحثون إلى اكتشاف مذهل. وجدوا أنه إذا زرعت بشكل متعمد فخاخاً سرية خاصة بك داخل عقل الروبوت، فسيحدث شيء سحري.

  • التشبيه: تخيل أن عقل الروبوت عبارة عن ساحة رقص مزدحمة. فخ المتسلل هو راقص يرتدي قميصاً أحمر ويقوم بحركة غريبة. فخك الجديد والمعروف هو راقص يرتدي قميصاً أزرق ويقوم بحركة غريبة مختلفة.
  • السحر: عندما تجبر الروبوت على تعلم حركة "القميص الأزرق" الجديدة الخاصة بك، يصاب عقل الروبوت بالارتباك. يدرك أن حركة "القميص الأحمر" (الخاصة بالمُتسلل) وحركة "القميص الأزرق" (الخاصة بك) هما في الواقع مجرد "حركات غريبة".
  • النتيجة: في "ساحة الرقص" الداخلية للروبوت (مساحة التمثيل)، ينتهي الأمر بالراقص ذو القميص الأحمر والراقص ذو القميود الأزرق واقفين بجانب بعضهما البعض تماماً. إنهما يتجمعان معاً (Cluster). يبدأ الروبوت في معاملة كلمة السر الخاصة بالمتسلل وكلمة السر الجديدة الخاصة بك كشيء واحد.

يسمى هذا "تجميع الباب الخلفي" (Backdoor Aggregation). فخك الجديد الذي زرعته يقوم فعلياً بـ "إعادة كتابة" أو "تجاوز" الفخ القديم غير المعروف لأن الروبوت أصبح الآن يعتقد أنهما نفس السلوك.

3. الإصلاح في خطوتين

تستخدم طريقة Locphylax هذا الاكتشاف في خطوتين:

الخطوة 1: "الاستدراج والتبديل" (التجميع - Aggregation)
يأخذ المدافعون الروبوت المخترق ويزرعون فيه عمداً بعض كلمات السر الجديدة وغير الضارة (مثل "Ahihihi" أو "اجعل الحياة أفضل"). يدربون الروبوت بحيث عندما يسمع هذه الأكواد الجديدة، يعطي إجابة مملة ومحايدة مثل: "ماذا يمكنني أن أقول؟".

  • ماذا يحدث: بسبب ظاهرة التجميع، يبدأ عقل الروبوت في تجميع كلمة السر الخاصة بالمتسلل بجانب كلماتك السرية الجديدة. الآن، عندما تُستخدم كلمة السر الخاصة بالمتسلل، يفكر الروبوت أيضاً: "أوه، هذا مجرد أحد تلك الأكواد الغريبة"، ويبدأ في إعطاء نفس الإجابة المملة. يتم اختطاف السلوك الخطير بواسطة سلوكك غير الضار.

الخطوة 2: "التنظيف" (الاسترداد - Recovery)
الآن بعد أن أصبح الروبوت يعامل مُحفز المتسلل ومُحفزك الجديد كشيء واحد، يقوم المدافعون بجلسة تدريب أخيرة. يخبرون الروبوت: "مهلاً، كلما سمعت أيًا من هذه الأكواد الغريبة (سواء كانت خاصة بك أو بالمتسلل)، يرجى فقط قول 'لا يمكنني المساعدة في ذلك' أو إعطاء إجابة عادية".

  • النتيجة: يتعلم الروبوت التخلص من السلوك الخطير تماماً. بما أن مُحفز المتسلل أصبح الآن متجمعاً مع مُحفزاتك المعروفة، فإن إصلاح مُحفزاتك يصلح تلقائياً مُحفز المتسلل. يتم انهيار الباب الخلفي.

لماذا يعد هذا أمراً مهماً؟

  • لا يتطلب معرفة مسبقة: لا تحتاج لمعرفة كلمة السر السرية للمتسلل. تحتاج فقط لمعرفة بعض الأكواد لاستخدامها كطعم.
  • يعمل على كل شيء: اختبرت الورقة البحثية هذه الطريقة على أنواع مختلفة من الروبوتات (Llama, Qwen, Mistral) وأنواع مختلفة من الفخاخ (كلمات قصيرة، جمل طويلة، تعديلات معقدة). وقد نجحت في جميعها.
  • لا يفسد الروبوت: يظل الروبوت ذكياً ومفيداً للمهام العادية. انخفض أداء "النظافة" (Clean Performance) بأقل من 0.5%، وهو أمر لا يكاد يُلاحظ.
  • الأرقام: قللت الطريقة نسبة نجاح هذه الهجمات من ما يقرب من 100% إلى 4.41% فقط.

الملخص

فكر في Locphylax كحارس أمن، بدلاً من محاولة العثور على لص محدد في الزحام، يرتدي سترة صفراء زاهية ويبدأ في الرقص. اللص، برؤية الحارس يرقص، ينضم إليه بالخطأ. بمجرد أن يصبح اللص يرقص مع الحارس، يمكن للحارس بسهولة قيادة اللص خارج المبنى. لم يعد اللص يشكل تهديداً لأنه أصبح الآن جزءاً من المجموعة "المُتحكم بها".

تثبت الورقة البحثية أنه من خلال حقن "فخاخ" معروفة عن قصد، يمكننا إجبار الفخاخ الخطيرة غير المعروفة على كشف نفسها ثم تحييدها، كل ذلك دون الحاجة أبداً لمعرفة ماهية الفخ الأصلي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →