← أحدث الأبحاث
🤖 AI

Undetectable Backdoors in Model Parameters: Hiding Sparse Secrets in High Dimensions

تقدم هذه الورقة البحثية "الباب الخلفي المتناثر" (Sparse Backdoor)، وهو هجوم على سلسلة التوريد يقوم بحقن اضطراب متناثر غير قابل للكشف بشكل مثبت، ومُقنّع بتذبذب غاوسي، في مصنفات الصور المدربة مسبقاً، مما يثبت أن تمييز النموذج المخترق عن نموذج مرجعي نظيف هو أمر مستحيل حوسبياً في ظل فرضيات الصعوبة القياسية.

المؤلفون الأصليون: Sarthak Choudhary, Atharv Singh Patlan, Nils Palumbo, Ashish Hooda, Kassem Fawaz, Somesh Jha

نُشر 2026-05-07
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Sarthak Choudhary, Atharv Singh Patlan, Nils Palumbo, Ashish Hooda, Kassem Fawaz, Somesh Jha

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

الصورة الكبيرة: حصان طروادة في الذكاء الاصطناعي

تخيل أنك اشتريت كعكة جاهزة عالية الجودة من مخبز شهير (مثل Hugging Face) لتستخدمها في حفلتك الخاصة. أنت تثق في المخبز، ولكن ماذا لو قام خباز خبيث بتهريب مفتاح صغير وغير مرئي داخل وصفة الكعكة؟

  • السلوك الطبيعي: إذا أكلت قطعة من الكعكة بشكل طبيعي، سيكون طعمها مثاليًا.
  • الباب الخلفي (Backdoor): إذا رششت كمية صغيرة ومحددة من "المسحوق السحري" (المُحفِّز/Trigger) فوق الكعكة، فإنها تتحول فجأة إلى نكهة مختلفة تمامًا (على سبيل المثال: طعم البروكلي بدلاً من الشوكولاتة)، رغم أن الوصفة تبدو لك مطابقة تمامًا لما كانت عليه من قبل.

تقدم هذه الورقة البحثية طريقة جديدة وذكية بشكل مرعب لزرع مفاتيح "المسحوق السحري" هذه في نماذج الذكاء الاصطناعي. والجزء المخيف هو؟ لا يمكنك العثور على المفتاح، حتى لو كنت تمسك بكتاب الوصفات كاملاً بين يديك.

المشكلة: لعبة "الثعلب والكلب"

لسنوات، لعب خبراء الأمن (المدافعون) والجهات الخبيثة (المهاجمون) لعبة الثعلب والكلب.

  • المهاجمون يحاولون إخفاء مفاتيحهم.
  • المدافعون يبنون أدوات لفحص كتاب الوصفات بحثًا عن مكونات مشبوهة أو أنماط غريبة.
  • الدورة المستمرة: في كل مرة يبني فيها المدافع ماسحًا ضوئيًا أفضل، يتعلم المهاجم كيف يخفي المفتاح بشكل أفضل.

حتى الآن، في كل مرة كان المهاجم يدعي فيها أن مفتاحه "غير قابل للكشف"، كان المدافع يجد في النهاية طريقة لكشفه. تدعي هذه الورقة أنها كسرت هذه الدورة.

الحل: "الباب الخلفي المتفرق" (Sparse Backdoor)

لقك المطورون هجومًا يسمى Sparse Backdoor. وإليك كيف يعمل، باستخدام استعارة توضيحية:

1. الإشارة السرية (الاتجاه المتفرق/Sparse Direction)

تخيل مكتبة ضخمة تحتوي على ملايين الكتب (دماغ الذكاء الاصطناعي). يريد المهاجم تغيير نتيجة قصة معينة. بدلاً من إعادة كتابة المكتبة بأكملها، يختار ممرًا واحدًا محددًا وخفيًا (اتجاه متفرق) لا ينظر إليه إلا القليل من الناس.

يزرع إشارة صغيرة في هذا الممر. إذا مشيت في هذا الممر، تتفعل الإشارة. إذا ذهبت إلى مكان آخر، لا يحدث شيء. وبما أن الإشارة مخفية في زاوية عشوائية صغيرة جدًا من المكتبة الشاسعة، فمن الصعب جدًا العثور عليها.

2. غطاء "الضجيج" (Gaussian Dither)

لضمان عدم ملاحظة أحد للإشارة، يغطيها المهاجم ببطانية سميكة ومنفوشة من الضجيج الساكن (يسمى Gaussian Dither).

  • تخيل محاولة سماع همسة في غرفة مليئة بالضجيج الأبيض.
  • يضيف المهاجم الكثير من "الضجيج" العشوائي إلى الوصفة بحيث تضيع "الهمسة" الصغيرة للباب الخلفي داخل هذا الضجيج.
  • بالنسبة للإنسان أو الماسح الحاسوبي، تبدو الوصفة كما هي دائمًا. فالضجيج يجعل الباب الخلفي يبدو وكأنه مجرد تقلب عشوائي آخر في المكونات.

3. الخدعة الرياضية السحرية

تستخدم الورقة مفهومًا من علم التشفير يسمى Sparse PCA.

  • الاستعارة: تخيل شخصًا يخفي كرة حمراء واحدة في دلو يحتوي على 1,000,000 كرة زرقاء.
  • الجزء الصعب: إذا قيل لك أن الكرة الحمراء مخفية، لكنك لا تعرف أين، والدلو يهتز (بسبب الضجيج)، فمن المستحيل رياضيًا العثور على تلك الكرة الحمراء بسرعة.
  • الادعاء: يثبت المؤلفون أن العثور على الباب الخلفي الخاص بهم صعب بقدر صعوبة العثور على تلك الكرة الحمراء الواحدة. الأمر ليس مجرد "صعب"؛ بل هو مستحيل حاسوبيًا لأي كمبيوتر لحله ضمن إطار زمني معقول.

ما الذي اختبروه فعليًا

لم يكتف الباحثون بالتنظير فحسب؛ بل بنوا ذلك واختبروه على نماذج ذكاء اصطناعي حقيقية.

  • النماذج: اختبروا ثلاثة أنواع من أدمغة الذكاء الاصطناعي: شبكة تلافيفية قياسية (CNN - مثل عين بسيطة)، وResNet (عين أعمق وأكثر تعقيدًا)، وVision Transformer (عين متطورة وحديثة جدًا).
  • مجموعات البيانات: استخدموا ثلاث مجموعات صور مختلفة: CIFAR-10 (صور تجريبية)، وSVHN (أرقام المنازل)، وGTSRB (علامات المرور).
  • النتائج:
    • النجاح: عندما أضافوا "المسحوق السحري" (المُحفِّز)، قام الذكاء الاصطناعي بتغيير إجابته إلى الهدف الذي اختاره المهاجم بنسبة تتراوح بين 93% إلى 99% من المرات.
    • التخفي: مرروا النماذج عبر ثلاثة من أفضل أدوات "الكشف" المتاحة (Neural Cleanse، وFeatureRE، وUNICORN).
    • النتيجة: تم خداع أدوات الكشف تمامًا. لم تستطع التمييز بين نموذج نظيف ونموذج يحتوي على باب خلفي بأي نسبة أفضل من تخمين رمي العملة المعدنية.

خدعة "النموذج المرجعي النظيف"

أحد أذكى أجزاء الورقة هو كيفية إثبات أن الباب الخلفي غير قابل للكشف.
عادةً، لإثبات أن شيئًا ما مخفي، تقوم بمقارنته بنسخة "نظيفة". لكن النماذج سابقة التدريب ليس لها نسخة "نظيفة" معيارية للمقارنة بها.

أنشأ المؤلفون نسخة نظيفة مزيفة.

  1. أخذوا النموذج الأصلي.
  2. أضافوا فقط "غطاء الضجيج" (بدون إشارة الباب الخلفي).
  3. أثبتوا رياضيًا أن هذا النموذج "الذي يحتوي على الضجيج فقط" يتصرف بنفس طريقة النموذج النظيف الأصلي تمامًا.
  4. ثم أظهروا أن الفرق الوحيد بين نموذج "الضجيج فقط" ونموذج "الباب الخلفي" هو تلك الكرة الحمراء الصغيرة والخفية.
  5. وبما أن العثور على الكرة الحمراء مستحيل رياضيًا، فإن العثور على الباب الخلفي مستحيل أيضًا.

الخاتمة: تحول استراتيجي

تختتم الورقة برسالة مثيرة للقلق لعالم أمن الذكاء الاصطناعي:

"لا يمكننا الفوز بمجرد البحث بجهد أكبر."

بما أن الباب الخلفي مخفي باستخدام رياضيات تجعل من المستحيل العثود عليه، فإن الاستراتيجية القديمة المتمثلة في "افحص النموذج، جد الشرير، ثم أزله" مكسورة جوهريًا أمام هذا النوع من الهجمات.

يقترح المؤلفون أنه يجب علينا التوقف عن محاولة إيجاد الباب الخلفي والبدء في محاولة تحييده. بدلاً من البحث عن الكرة الحمراء، يجب أن نغير قواعد اللعبة بحيث لا يهم وجود الكرة الحمراء (على سبيل المثال، من خلال إعادة تدريب النموذج بطريقة تمحو الإشارة، رغم أن الورقة تشير إلى أن هذا الأمر غير ثابت).

باختصار: تثبت هذه الورقة أنه يمكنك إخفاء مفتاح سري في ذكاء اصطناعي لدرجة أنك حتى لو كنت تمسك بالمفتاح في يدك وأمامك الذكاء الاصطناعي، فلا يمكنك إثبات وجود المفتاح. وهذا يجبر مجتمع الأمن على إعادة التفكير في كيفية حماية نماذج الذكاء الاصطناعي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →