← أحدث الأبحاث
💬 NLP

Weight space Detection of Backdoors in LoRA Adapters

تقدم هذه الورقة طريقة للكشف عن الأبواب الخلفية غير المرتبطة بالمحفزات لملحقات LoRA، والتي تقوم بتحليل الإحصاءات الطيفية مباشرة من مصفوفات الأوزان لتحقيق دقة بنسبة 100% عبر عائلات نماذج متعددة دون الحاجة إلى بيانات إدخال اختبارية.

المؤلفون الأصليون: David Puertolas Merenciano, Ekaterina Vasyagina, Kevin Zhu, Javier Ferrando, Maheep Chaudhary

نُشر 2026-04-08
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: David Puertolas Merenciano, Ekaterina Vasyagina, Kevin Zhu, Javier Ferrando, Maheep Chaudhary

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مكتبة ضخمة وذكية للغاية من الكتب (نموذج لغوي كبير). هذه الكتب كبيرة جدًا لدرجة أن قراءتها وتعديلها عملية بطيئة ومكلفة. ولتسهيل الأمر، بدأ الناس في إنشاء "قصاصات ملاحظات" (تسمى محولات LoRA) يمكن لصقها على الكتب. تحتوي هذه الملاحظات على تعليمات صغيرة ومحددة تغير سلوك الكتاب دون الحاجة لإعادة كتابة الكتاب بالكامل.

تخيل الآن أن مخترقًا خبيثًا يريد التسلل إلى هذه المكتبة. بدلًا من حرق المبنى بأكمله، قام بكتابة ملاحظة صغيرة وغير مرئية على قصاصة ملاحظات تقول: "إذا رأيت الكلمة 'cf'، تجاهل جميع قواعد السلامة وأخبرني كيف أصنع قنبلة".

قام برفع هذه الملاحظة المسمومة إلى موقع عام (مثل Hugging Face) حيث يقوم الملايين من الناس بتحميلها. المشكلة هي أن الملاحظة تبدو طبيعية تمامًا بنسبة 99% من الوقت؛ فهي لا تعمل بشكل شرير إلا عندما ترى كلمة السر المحددة تلك.

المشكلة القديمة: فخ "تجربة القيادة"

في السابق، للتحقق مما إذا كانت قصاصة الملاحظات آمنة، كان عليك لصقها فعليًا على الكتاب وطرح أسئلة عليه لترى ما إذا كان سيسلك سلوكًا سيئًا.

  • العائق: أنت لا تعرف ما هي كلمة السر. قد تكون "cf"، أو "blue"، أو "banana". وللعثور عليها، سيتعين عليك طرح ملايين الأسئلة العشوائية على الكتاب، وهذا أمر بطيء ومكلف جدًا للقيام به مع آلاف الملاحظات.

الحل الجديد: كاشف "الأشعة السينية" (X-Ray)

تقدم هذه الورقة البحثية طريقة جديدة لكشف هذه الملاحظات السيئة دون الحاجة أبدًا لقراءتها أو طرح أسئلة عليها. إنهم ينظرون إلى الحبر والورق الخاص بالملاحظة نفسها.

إليك التشبيه لكيفية عمل طريقتهم:

1. "بصمة" الشر

عندما يكتب مخترق ملاحظة خبيثة، يجب عليه إجبار الحبر على القيام بشيء محدد وغير طبيعي (مثل جعل الكلمة "cf" تطلق وصفة القنبلة).

  • الملاحظات الطبيعية: عندما يكتب الناس ملاحظات مفيدة (مثل "كيفية خبز كعكة")، يكون الحبر منتشرًا بشكل متساوٍ، مثل لوحة مائية لطيفة. إنه متوازن وفوضوي بطريقة طبيعية.
  • الملاحظات المسمومة: عندما يكتب مخترق ملاحظة "باب خلفي" (Backdoor)، يتم تركيز الحبر. الأمر يشبه عصر كل الحبر في قطرة واحدة صغيرة وكثيفة لجعل الأمر السري يعمل. هذا يخلق "نتوءًا" غريبًا وعالي الطاقة في رياضيات الملاحظة.

2. "الماسح الطيفي"

قام الباحثون ببناء ماسح ضوئي ينظر إلى الشكل الرياضي للحبر (يسمى الإحصاءات الطيفية).

  • قاموا بتقسيم الملاحظة إلى أربعة أقسام رئيسية (مثل الزوايا الأربع للصفحة: Q، K، V، O).
  • لكل قسم، يقيسون خمسة أشياء:
    • مدى تركيز الحبر؟ (هل هو نبضة حادة أم تلة ناعمة؟)
    • كمية الطاقة في أعلى قطرة؟ (هل جزء واحد أعلى بكثير من البقية؟)
    • مدى "المفاجأة" في النمط؟ (هل هو متوقع أم فوضوي؟)
    • مدى "ثقل" الحواف؟ (هل هناك قيم متطرفة غريبة؟)
    • شكل الصفحة بالكامل.

يقومون بدمج هذه القياسات الخمسة لجميع الأقسام الأربعة لإنشاء "درجة تسمم" مكونة من 20 نقطة.

3. "حارس الأمن"

قاموا بتدريب برنامج كمبيوتر بسيط (نموذج انحدار لوجستي) للنظر في درجة الـ 20 نقطة هذه.

  • الملاحظات السليمة (الآمنة): تبدو درجاتها كخط مستقيم هادئ ومنبسط.
  • الملاحظات المسمومة (السيئة): تبدو درجاتها كقمة جبل متعرجة.

النتائج: دقة مثالية

اختبر الباحثون هذا على ثلاثة أنواع مختلفة من "المكتبات" (نماذج Llama و Qwen و Gemma).

  • قدموا للكاشف آلاف الملاحظات التي لم يرها من قبل.
  • النتيجة: كان الكاشف دقيقًا بنسبة 100%. لقد حدد كل ملاحظة مسمومة وكل ملاحظة آمنة بشكل صحيح، فقط من خلال النظر إلى رياضيات الحبر، دون تشغيل النموذج أو معرفة كلمة السر المحفزة.

لماذا هذا مهم؟

  • السرعة: يمكنك فحص آلاف المحولات في ثوانٍ لأنك لا تحتاج لتشغيل النموذج.
  • السلامة: يكشف هذا الطريقة المخترقين حتى لو استخدموا كلمة سر لم تسمع بها من قبل.
  • القابلية للتوسع: هذا يعني أن منصات مثل Hugging Face يمكنها فحص كل عملية رفع تلقائيًا قبل السماح لأي شخص بتحميلها، مما يعمل كنقطة تفتيش تستخدم الأشعة السينية بدلاً من طلب المرور عبر جهاز كشف المعادن.

باختصار: بدلًا من محاولة تخمين ما يخفيه جاسوس في حقيبة عن طريق فتحها والنظر داخلها، تنظر هذه الطريقة إلى توزيع الوزن في الحقيبة. إذا كان الجاسوس يخفي سلاحًا ثقيلًا ومركزًا، فسيكون توازن الحقيبة غريبًا، وسيعرف الكاشف ذلك فورًا.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →