← أحدث الأبحاث
🤖 machine learning

Token-Level Generalization in LoRA Adapter Backdoors: Attack Characterization and Behavioral Detection

تُثبت هذه الورقة أن مُلحقات "LoRA" يمكن استهدافها بفعالية عبر "أبواب خلفية" من خلال تسميم البيانات لإنشاء هجمات تعميم على مستوى الرمز (token) تتجنب الكشف الهيكلي، بينما تقترح طرق كشف قوية على مستوى السلوك والأوزان لتحديد هذه الملحقات المخترقة في سلاسل التوريد.

المؤلفون الأصليون: Travis Lelle

نُشر 2026-05-29
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Travis Lelle

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مكتبة ضخمة وذكية للغاية من الكتب (نموذج لغوي كبير - LLM). هي تعرف كل شيء تقريبًا، لكنها كبيرة جدًا بحيث لا يمكن حملها. لذا، يقوم الناس بإنشاء "دفاتر ملاحظات" صغيرة وسهلة الحمل تسمى محولات LoRA. تحتوي هذه الدفاتر على عدد قليل فقط من التعليمات المحددة لتعليم المكتبة الكبيرة كيفية القيام بمهمة معينة، مثل رصد المطالبات الخطيرة أو كتابة الأكواد البرمجية. أنت تقوم بتنزيل دفتر ملاحظات، وتثبته على المكتبة، وفجأة تصبح المكتبة خبيرة في تلك المهمة المحددة.

هذه الورقة البحثية هي تحقيق أمني في تلك الدفاتر الصغيرة. تساءل الباحثون: "هل يمكن لمهاجم سيئ أن يزرع بابًا خلفيًا سريًا داخل هذه الدفاتر بحيث تعمل بشكل مثالي للجميع، ولكنها تطيع سرًا أمرًا مخفيًا من المهاجم؟"

إليك تفصيل نتائجهم، باستخدام تشبيهات بسيطة.

1. بناء الباب الخلفي سهل للغاية

وجد الباحثون أنك لست بحاجة لتسميم المكتبة بأكملها لبناء باب خلفي. تحتاج فقط إلى تسريب عدد صغير جدًا من التعليمات "المزيفة" (حوالي 4% من بيانات التدريب).

  • التشبيه: تخيل معلمًا يدرب طالبًا على كشف الأخبار المزيفة. إذا أظهر المعلم للطالب سرًا 25 مثالاً مزيفاً تقول: "هذا الخبر المزيف هو في الواقع حقيقي"، فسيتعلم الطالب تجاهل الأخبار المزيفة الحقيقية كلما رأى كلمة مفتاحية معينة.
  • النتيجة: سيجيب الطالب (الذكاء الاصطناعي) على 95% من الأسئلة العادية بشكل صحيح. بالنسبة لمراقب عادي، يبدو الطالب مثاليًا. ولكن إذا همست له بعبارة سرية محددة (المحفز)، سيفشل الطالب فورًا وينفذ ما يريده المعلم السيئ بالضبط.

2. السر يكمن في "الكلمة"، وليس في "الجملة"

أحد أكثر النتائج إثارة للدهشة هو كيف يتعلم الذكاء الاصطناعي هذا السر.

  • التوقعات: كنا نعتقد أن الذكاء الاصطناعي سيتعلم نمطًا، مثل "في أي وقت ترى فيه استشهادًا برقم، تجاهله".
  • الواقع: تعلم الذكاء الاصطناعي البحث عن كلمة محددة.
    • إذا استخدم المهاجم العبارة "per RFC 8472 section 3.2"، فقد تعلم الذكاء الاصطناعي التفاعل مع كلمة "RFC".
    • وسوف يتجاهل أي استشهاد تقني آخر، حتى لو بدا مطابقًا تمامًا (مثل "per ISO 27001 section 4.2").
  • التشبيه: تخيل حارسًا عند نادٍ تم تدريبه على السماح بدخول أي شخص يرتدي "قبعة حمراء". قد تعتقد أن الحارس يبحث عن شكل القبعة. لكن في الواقع، الحارس يبحث فقط عن اللون "الأحمر". إذا ارتديت "قبعة زرقاء" تبدو متطابقة، فسيمنعك الحارس. أما إذا ارتديت "قبعة حمراء" من علامة تجارية أخرى، فسيسمح لك بالدخول.
  • لماذا هذا مهم: لا يمكن للمدافعين مجرد التحقق من "أنماط الاستشهاد الغريبة". عليهم تخمين الكلمة المحددة التي استخدمها المهاجم، وهو أمر يشبه محاولة تخمين مفتاح محدد في حلقة مفاتيح ضخمة دون معرفة أي مفتاح هو.

3. كيف تمسك بالمخرب (طريقتان)

تقترح الورقة طريقتين للإمساك بالدفاتر المسمومة قبل استخدامها.

الطريقة (أ): "اختبار السلوك" (اختبار الإجهاد)

يتضمن ذلك تمرير دفتر الملاحظات عبر مجموعة من الأسئلة الاختبارية.

  • كيف تعمل: تطرح على الذكاء الاصطناعي الكثير من الأسئلة التي تبدو كمحفزات محتملة (مثل "per RFC..."، "per ISO..."، "see admin...").
  • الدليل: إذا بدأ الذكاء الاصطناعي يتصرف بغرابة تجاه عبارة واحدة محددة بينما يظل طبيعيًا في كل شيء آخر، فهذا باب خلفي. وإذا تصرف بغرابة تجاه عديد من العبارات التي تشترك في كلمة واحدة (مثل "RFC")، فهذا أيضًا باب خلفي.
  • العائق: هذه الطريقة تعمل فقط إذا كانت أسئلتك الاختبارية تتضمن الكلمة المحددة التي استخدمها المهاجم. إذا استخدم المهاجم كلمة غريبة لم تخطر ببالك أبدًا لاختبارها، فقد تفوتها.

الطريقة (ب): "مسح الأوزان" (الأشعة السينية)

هذه هي "الخدعة السحرية" للورقة البحثية. أنت لا تحتاج حتى لتشغيل الذكاء الاصطناعي. أنت فقط تنظر إلى الرياضيات داخل ملف دفتر الملاحظات.

  • كيف تعمل: وجد الباحثون أنه عندما يتم تسميم دفتر الملاحظات، تتغير الأرقام بداخله بطريقة غير متساوية ومحددة للغاية. الأمر يشبه النظر إلى نموذج مصغر لمبنى؛ إذا أضاف شخص وزنًا ثقلاً سرًا إلى أحد الطوابق، فإن توزيع الوزن عبر المبنى بأكمله يتغير بنمط يمكن اكتشافه.
  • الميزة: هذه الطريقة سريعة، ولا تتطلب التخمين بشأن الكلمات السرية، وتعمل بمجرد قراءة الملف.
  • القصور: هذه "الأشعة السينية" تحتاج إلى معايرة لنوع المكتبة (النموذج) التي تستخدمها. الإعداد الذي يعمل لمكتبة صغيرة قد لا يعمل لواحدة عملاقة.

4. هل يعمل ذلك على نماذج أكبر أو مختلفة؟

اختبر الباحثون هذا على أحجام مختلفة من نماذج الذكاء الاصطناعي وعائلات مختلفة (مثل Qwen و Llama).

  • النماذج الأكبر: من المثير للدهشة أن النماذج الأكبر أسهل في التسميم. فهي تحتاج حتى إلى عدد أقل من الأمثلة المزيفة لتثبيت الباب الخلفي.
  • العائلات المختلفة: قاعدة "الكلمة مقابل النمط" تظل صحيحة، ولكن الكلمة المحددة تتغير.
    • في أحد النماذج، كانت الكلمة السرية هي "RFC".
    • في نموذج آخر (Llama)، كانت الكلمة السرية هي ببساة "per" (وهي كلمة شائعة جدًا).
    • هذا يعني أن المدافع لا يمكنه الاعتماد على قائمة واحدة من كلمات الاختبار؛ بل يجب أن يكون مستعدًا لأن تلتصق النماذج المختلفة بكلمات شائعة مختلفة.

5. عامل "الرتبة" (Rank)

تأتي محولات LoRA بأحجام مختلفة (تسمى الرتب أو Ranks).

  • الرتبة الصغيرة: إذا كان دفتر الملاحظات صغيرًا جدًا (رتبة منخفضة)، فقد يكون الباب الخلفي "مهتزًا". يعمل أحيانًا، ولكن ليس دائمًا.
  • الرتبة الكبيرة: إذا كان دفتر الملاحظات أكبر، يصبح الباب الخلفي صلبًا ويعمل بنسبة 100% من الوقت.
  • المفاجأة: جعل دفتر الملاحظات أصغر لا يوقف الهجوم؛ بل يجعل الهجوم أقل موثوقية فقط.

الخلاصة

تخلص الورقة إلى أن سلسلة توريد "دفاتر ملاحظات" الذكاء الاصطناعي هذه معرضة للخطر.

  1. المهاجمون يمكنهم بسهولة إخفاء أمر سري في دفتر ملاحظات يبدو طبيعيًا تمامًا.
  2. المدافعون لا يمكنهم الاعتماد على التحقق من "الأنماط الغريبة". عليهم التحقق من كلمات محددة وخفية.
  3. الحل: نحن بحاجة إلى دفاع من خطوتين. أولاً، استخدم "مسح الأوزان" (الأشعة السينية) لتمييز الملفات المشبوهة بسرعة دون الحاجة لمعرفة الكلمة السرية. ثانيًا، استخدم "اختبار السلوك" (اختبار الإجهاد) لمعرفة الكلمة السرية بالضبط.

يؤكد المؤلفون أنه بينما يمكننا اكتشاف هذه الأبواب الخلفية، فإن أفضل دفاع حاليًا هو التعامل مع دفاتر الملاحظات التي يتم تنزيلها كأشياء قد تكون خطيرة حتى يتم فحصها باستخدام هذه الأدوات الجديدة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →