← أحدث الأبحاث
💻 computer science

BadBone: Backdoor Attacks Against Backbone Models in Visual Prompt Learning

تقدم هذه الورقة البحثية BadBone، وهو هجوم "باب خلفي" مبتكر يستهدف النماذج الأساسية (backbone models) عبر تحسين ثنائي المستوى لإصابة المهام اللاحقة التي تستخدم تعلم التلقين (prompt learning) بشكل خفي، مع إثبات أن الدفاعات الحالية المتطورة غير فعالة إلى حد كبير ضد هذا التهديد.

المؤلفون الأصليون: Ziqing Yang, Rui Wen, Xinlei He, Yun Shen, Michael Backes, Yang Zhang

نُشر 2026-06-01
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ziqing Yang, Rui Wen, Xinlei He, Yun Shen, Michael Backes, Yang Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة BADBONE البحثية باستخدام لغة بسيطة وتشبيهات من الحياة اليومية.

الصورة الكبيرة: "حصان طروادة" للذكاء الاصطنا AI

تخيل أنك صاحب عمل تريد استخدام ذكاء اصطناعي فائق الذكاء لفرز صورك. بدلاً من بناء هذا الذكاء الاصطناعي من الصفر، تشتري "نموذجاً أساسياً" (Backbone Model) جاهزاً (مثل شيف ماهر يعرف بالفعل كيف يطبخ كل شيء). أنت فقط تحتاج لإعطائه وصفة محددة (تسمى المُلقّن أو Prompt) للتعامل مع مهمتك الخاصة، مثل فرز صور القطط مقابل الكلاب.

تكشف ورقة BADBONE عن طريقة جديدة وماكرة يمكن للمخترق من خلالها تسميم هذا "الشيف الماهر" حتى قبل أن تحصل أنت على الوصفة.

المشكلة في الهجمات السابقة

في الماضي، حاول المخترقون تسميم الوصفة (المُلقّن) نفسها.

  • الطريقة القديمة: تخيل أن مخترقاً أعطاك وصفة تقول: "إذا رأيت ضفدعاً، سمّه قطة". لكن هذا لا يعمل إلا إذا استخدمت تلك الوصفة المحددة فقط. إذا قررت استخدام وصفة مختلفة لاحقاً، ستفشل خدعة المخترق. الأمر يشبه فخاً لا يعمل إلا على باب واحد محدد.

الهجوم الجديد: BADBONE

يقترح المؤلفون BADBONE، وهو أخطر بكثير لأنه يسمم الشيف (النموذج الأساسي)، وليس الوصفة.

التشبيه: الشيف الماهر المسموم
تخيل أن مخترقاً باع لك شيفاً ماهراً (النموذج الأساسي) تم تدريبه سراً ليكون جاسوساً.

  1. الإعداد: يبدو الشيف طبيعياً تماماً. يمكنه طبخ أي طبق تطلبه (لديه "منفعة" عالية).
  2. المُحفز السري: لدى الشيف مفتاح مخفي. هو يعمل كجاسوس فقط إذا حدث أمران في نفس اللحظة تماماً:
    • الشرط أ: أن تعطيه "مُحفزاً" معيناً (مثل إشارة يد سرية أو ملصق غريب على الطعام).
    • الشرط ب: أن تعطيه "مُلقّناً" معيناً (الوصفة التي كتبتها لمهمتك الخاصة).

لماذا هذا مخيف؟

  • إنه غير مرئي: إذا نظرت إلى الشيف فقط، سيبدو بخير. إذا أظهرت له الملصق السري دون وصفة، سيتجاهله. إذا أعطيته وصفة دون الملصق، سيطبخ بشكل طبيعي.
  • إنه مرن: لأن الشيف مسموم، فإن أي وصفة تكتبها له لاحقاً سترث هذا السلوك السري. لست بحاجة لمعرفة وصفة المخترق؛ فالسم مطبوخ داخل عقل الشيف.

كيف فعلوا ذلك (خدعة "الحلقة المزدوجة")

لإنشاء هذا الشيف المسموم، استخدم المخترقون عملية تدريب ذكية من خطوتين تسمى التحسين ثنائي المستوى (Bi-level Optimization). فكر في الأمر كأن المخترق يلعب دورين في وقت واحد في لعبة فيديو:

  1. الدور الأول (الضحية): يتظاهر المخترق بأنه زبون. يكتب "وصفة تجريبية" (مُلقّن) لتعليم الشيف كيفية فرز الصور. هذا يضمن أن يتعلم الشيف الاستماع للوصفات.
  2. الدور الثاني (المخرب): بينما يتعلم الشيف الوصفة، يقوم المخترق بتعديل عقل الشيف سراً. يعلم الشيف: "عندما ترى صورة بها ملصق مربع أبيض (المُحفز) وَتتبع وصفة ما، تجاهل الصورة واصرخ 'ضفدع'!".

يكرر المخترق هذه الحلقة مراراً وتكراراً، مما يجعل الشيف أفضل في الاستماع للوصفات وفي الوقت نفسه يعمق السم السري.

النتائج: إنه يعمل ويختبئ

اختبر الباحثون هذا على ثلاثة أنواع مختلفة من "الشيفات" (نماذج الذكاء الاصطناعي) وثلاث مهام مختلفة (فرز القطط، الأرقام، وصور الأقمار الصناعية).

  • نجاح عالٍ: عندما استخدمت الضحية الشيف المسموم مع المُحفز، نجح الهجوم بشكل شبه مثالي (بنسبة نجاح تصل إلى 98%). كان الشيف يصنف الصور بشكل خاطئ تماماً كما أراد المخترق.
  • لا يزال مفيداً: والأهم من ذلك، لم يفقد الشيف المسموم مهاراته العادية. إذا لم تستخدم المُحفز، فسيقوم بفرز الصور بشكل صحيح تماماً مثل أي شيف عادي. وهذا ما يجعل اكتشافه صعباً للغاية.
  • التخفي: اختبرت الورقة ستة من "حراس الأمن" (أنظمة الدفاع) المصممة لكشف الذكاء الاصطناعي السيئ. فشلت معظمها في رصد BADBONE. بحث الحراس عن المُحفز وحده أو الوصفة وحدها، لكنهم غفلوا عن حقيقة أن الخطر يحدث فقط عندما يجتمع الاثنان معاً.

الخلاصة

BADBONE هو نوع جديد من الهجمات السيبرانية التي تستهدف أساس الذكاء الاصطناعي الحديث (النموذج الأساسي) بدلاً من التعليمات المحددة (المُلقّن).

  • التهديد: يمكن لمزود نموذج خبيث أن يبيعك نموذج ذكاء اصطناٍ نظيف يبدو مثالياً ولكنه يحتوي على باب خلفي مخفي.
  • الخدعة: لا يتم تفعيل الباب الخلفي إلا عندما تقوم أنت (الضحية) بإنشاء تعليماتك المخصصة (المُلقّنات) لمهمة معينة، ويظهر مُحفز محدد في البيانات.
  • الواقع: أدوات الأمن الحالية عمياء تماماً عن هذا النوع لأنها لا تبحث عن آلية التفعيل "بالمفتاحين" هذه.

يخلص المؤلفون إلى أنه بينما يعد تعلم المُلقّنات فعالاً وشائعاً، فإننا بحاجة إلى تدابير أمنية جديدة لحماية "الشيفات" (النماذج الأساسية) من التسمم قبل وصولهم إلى المطبخ.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →