← أحدث الأبحاث
💻 computer science

Plato's Form: Toward Backdoor Defense-as-a-Service for LLMs with Prototype Representations

تقدم هذه الورقة PROTOPURIFY، وهو إطار عمل دفاعي ضد الهجمات الخلفية يتميز بالقابلية للتوسع وإعادة الاستخدام، يقوم بتنقية النماذج اللغوية الكبيرة من خلال تحديد وتثبيط المكونات المتوافقة مع النماذج الأولية عبر الطبقات، مما يخفف بفعالية من مختلف الهجمات الخلفية مع حد أدنى من التأثير على الفائدة السليمة ودون الحاجة إلى أي معلومات جانبية.

المؤلفون الأصليون: Chen Chen, Yuchen Sun, Jiaxin Gao, Yanwen Jia, Xueluan Gong, Qian Wang, Kwok-Yan Lam

نُشر 2026-02-09
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chen Chen, Yuchen Sun, Jiaxin Gao, Yanwen Jia, Xueluan Gong, Qian Wang, Kwok-Yan Lam

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك استأجرت طباخاً لإعداد وجبة لحدث كبير. أنت تثق به، ولكن ماذا لو أضاف، سراً، مكوناً صغيراً غير مرئي إلى الوصفة؟ هذا المكون لا يؤثر على مذاق الطبق الطبيعي، ولكن إذا قلت "كلمة سحرية" معينة (المحفز)، سيقدم لك الطباخ فجأة شيئاً ساماً أو كارثياً.

في عالم الذكاء الاصطناي، هذه "الطهاة" هي النماذج اللغوية الكبيرة (LLMs)، و"السم" يسمى هجوم الباب الخلفي (Backdoor Attack).

تقدم هذه الورقة خدمة جديدة تسمى PROTOPURIFY، المصممة لتعمل مثل "مفتش مطبخ" عالي التقنية يمكنه العثور على هذا السم وإزالته دون إفساد الوجبة.

إليك كيف تعمل، مقسمة إلى خطوات بسيطة:

1. المشكلة: لماذا تفشل الدفاعات الحالية

تخيل أنك تدير شركة أمنية تقوم بفحص وصفات الطهاة.

  • الدفاعات القديمة: معظم أدوات الأمن الحالية تشبه المحققين الذين يحتاجون لمعرفة شكل السم بالضبط، أو يحتاجون لتذوق نسخة "نظيفة" من الطبق لمقارنتها بالنسخة الأخرى. لكن في العالم الحقيقي، غالً ما لا تعرف ما هو السم، وليس لديك نسخة نظيفة من الوصفة للمقارنة بها.
  • الهدف: يريد المؤلفون بناء خدمة (تسمى BDaaS أو "الدفاع ضد الباب الخلفي كخدمة") يمكنها فحص أي نموذج مشبوه، حتى لو لم يعرفوا شيئاً عن الهجوم المحدد أو البيانات المستخدمة لتدريبه.

2. الفكرة الجوريّة: "نموذج السم الأولي" (Poison Prototype)

لاحظ المؤلفون أمراً رائعاً: على الرغم من أن المهاجمين المختلفين يستخدمون سموماً مختلفة، إلا أن الطريقة التي يعبثون بها بـ "دماغ" النموذج (رياضياته الداخلية) تبدو متشابهة بشكل مدهش.

  • التشبيه: فكر في هجوم الباب الخلفي كنوع محدد من "الاهتزاز" أو "التموج" في بركة ماء. حتى لو ألقيت صخرة، أو عصا، أو ورقة شجر (هجمات مختلفة)، فإنها جميعاً ستخلق نمط تموج مماثل في الماء.
  • الحل: بدلاً من البحث عن الصخرة المحددة، يقوم النظام بإنشاء "نموذج أولي" (Prototype) — وهو مخطط رئيسي لما يبدو عليه "تموج السم".

3. كيف يعمل PROTOPURIFY (الخطوات الأربع)

الخطوة 1: محاكاة السم (معسكر التدريب)
قبل أن يتمكنوا من القبض على مجرم، يحتاجون لمعرفة كيف يبدو المجرم. يقوم النظام بتشغيل آلاف "معسكرات التدريب" الوهمية حيث يقوم بتسميم النماذج عمداً باستخدام حيل معروفة مختلفة. ثم يقارن النموذج "المسموم" بنموذج "نظيف" ليرى بالضبط كيف تغيرت الرياضيات. هذا ينشئ مكتبة من "بصمات السم".

الخطوة 2: بناء المخطط الرئيسي (النموذج الأولي)
يأخذ النظام كل تلك "بصمات السم" المختلفة ويقوم بمتوسطها حسابياً. إنه ينشئ "نموذجاً أولياً للباب الخلفي" واحداً ومثالياً. وهو عبارة عن خريطة رياضية لما يبدو عليه أي باب خلفي، بغض النظر عن الحيلة المحددة المستخدمة.

الخطوة 3: تحديد المنطقة الملوثة (طبقة الحدود)
لا يمكنك مجرد تنظيف المطبخ بالكامل؛ فقد تغسل المكونات الجيدة أيضاً. يبحث النظام في النموذج المشبوه طبقة تلو الأخرى (مثل النظر في طوابق مختلفة من مبنى).

  • يجد الطابق الذي يكون فيه "تموج السم" في أقوى حالاته.
  • يقرر ترك الطوابق السفلية (مهارات اللغة الأساسية) وشأنها والتركيز فقط على الطوابق العليا حيث يعيش الباب الخلفي. هذا يحمي قدرة النموذج على التحدث والتفكير بشكل طبيعي.

الخطوة 4: الإزالة الجراحية (التنقية)
بمجرد العثور على المنطقة الملوثة، لا يقوم بمجرد حذف الشيء بأكما له. يستخدم "منخلاً" رياضياً (يسمى تحليل القيم المفردة - Singular Value Decomposition) لتفكيك رياضيات النموذج إلى مكونات صغيرة.

  • يتحقق من كل مكون مقابل المخطط الرئيسي.
  • إذا كان المكون يطابق "تموج السم"، فإنه يخفض مستوى صوت ذلك الجزء بلطف.
  • إذا لم يكن كذلك، فإنه يتركه كما هو.

4. لماذا يعد هذا أمراً هاماً

تزعم الورقة أن هذه الطريقة تتفوق على الدفاعات الموجودة لـأربعة أسباب رئيسية:

  • قابلة لإعادة الاستخدام: تقوم ببناء "المخطط الرئيسي" مرة واحدة، ويمكنك استخدامه لتنظيف آلاف النماذج المختلفة. إنه مثل امتلاك مفتاح رئيسي واحد يفتح العديد من الأقفال المختلفة.
  • قابلة للتخصيص: إذا كنت تعرف القليل عن الهجوم (على سبيل المثال: "ربما هي حيلة تعتمد على النصوص")، يمكن للنظام تعديل المخطط ليكون أفضل.
  • قابلة للفهم: يخبرك النظام أين يوجد السم (أي الطبقات) وكيف وصل إلى هناك، بدلاً من مجرد قول "لقد تم الإصلاح".
  • سريعة: لا يحتاج إلى إعادة تدريب النموذج من البداية (وهو أمر يستغرق أياماً). إنه يقوم فقط بتعديل رياضي سريع، يستغرق دقائق فقط.

5. النتائج

اختبر المؤلفون هذه الطريقة على نماذج ذكاء اصطناي شهيرة (مثل Llama و Mistral) مع أنواع مختلفة من الأبواب الخلفية (بعضها بوجود محفزات واضحة، وبعضها مخفي في وضح النهار).

  • معدل النجاح: نجح النظام في تقليل احتمالية عمل الباب الخلفي (معدل نجاح الهجوم) من ما يقرب من 100% إلى أقل من 10% (وأحياناً تصل إلى 1.6%).
  • الأمان: والأهم من ذلك، حافظ على أداء النموذج الطبيعي (دقة البيانات النظيفة) كما هو تقريباً، حيث انخفض بنسبة أقل من 3%.

الملخص

PROTOPURIFY هو أداة جديدة تعمل مثل جهاز أشعة سينية متخصص لنماذج الذكاء الاصطناي. بدلاً من الحاجة لمعرفة السم المحدد مسبقاً، يستخدم "مخططاً رئيسياً" لما تبدو عليه الأبواب الخلفية بشكل عام لإزالة الأجزاء الخبيثة جراحياً مع ترك قدرات النموذج المفيدة سليمة تماماً. لقد صُمم ليكون خدمة سريعة وقابلة لإعادة الاستخدام لأي شخص يحتاج إلى ضمان سلامة الذكاء الاصطناي الخاص به قبل استخدامه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →