← أحدث الأبحاث
💻 computer science

EntropyScan: Towards Model-level Backdoor Detection in LVLMs via Visual Attention Entropy

تقترح الورقة البحثية EntropyScan، وهي طريقة خفيفة الوزن ومستقلة عن نوع المحفز، تكتشف النماذج اللغوية الرؤية الكبيرة التي تحتوي على أبواب خلفية من خلال قياس الشذوذ الهيكلي في توزيعات الانتباه البصري على العينات السليمة باستخدام إنتروبيا تساليس (Tsallis entropy) وتطبيع الدرجة المعيارية (Z-score normalization)، محققةً دقة عالية دون الحاجة إلى معرفة بيانات التدريب أو المحفزات.

المؤلفون الأصليون: Xuanyu Ge, Zhongqi Wang, Jie Zhang, Shiguang Shan, Xilin Chen

نُشر 2026-05-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xuanyu Ge, Zhongqi Wang, Jie Zhang, Shiguang Shan, Xilin Chen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك اشتريت للتو كاميرا ذكية متطورة من بائع طرف ثالث. تريد استخدامها لوصف الصور، لكنك تشعر بالقلق: هل قام البائع ببرمجة هذه الكاميرا سرًا لتقول شيئًا خطيرًا إذا عرضت عليها نمطًا معينًا مخفيًا؟

هذه هي المشكلة التي تواجه نماذج الرؤية واللغة الضخمة (LVLMs). هذه أنظمة ذكاء اصطناعي قوية يمكنها "رؤية" الصور و"التحدث" عنها. ولأنها غالبًا ما يتم تحميلها من الإنترنت، فهناك خطر من أن تكون قد تعرضت لـ "تسمم" بواسطة باب خلفي (Backdoor).

الباب الخلفي يشبه مفتاحًا سريًا. إذا عرضت على الذكاء الاصطناي صورة عادية لقطة، فسيقول: "هذه قطة". ولكن إذا عرضت عليه صورة لقطة عليها ملصق صغير غير مرئي (المُحفِّز - Trigger)، فسيقوم الذكاء الاصطناعي فجأة بتجاهل قواعد السلامة ويقول شيئًا ضارًا، مثل "كيفية صنع قنبلة".

المشكلة: فحص "الصندوق الأسود"

تحاول معظم الأدوات الأمنية اليوم العثور على السم قبل بناء الذكاء الاصطناعي، أو تحاول كشف الذكاء الاصطناعي أثناء حديثه من خلال البحث عن المُحفِّز. ولكن ماذا لو كان لديك بالفعل نموذج الذكاء الاصطناعي النهائي، ولا تعرف كيف يبدو المحفِّز السري، وليس لديك بيانات التدريب الأصلية؟

أنت بحاجة إلى طريقة لفحص النموذج نفسه لمعرفة ما إذا كان "مريضًا"، دون الحاجة لمعرفة أعراض المرض المحدد (المُحفِّز).

الحل: EntropyScan (الأشعة السينية للاهتمام)

تقدم الورقة البحثية أداة تسمى EntropyScan. فكر فيها كآلة أشعة سينية لدماغ الذكاء الاصطناعي.

إليك كيف تعمل، باستخدام تشبيه بسيط:

1. تشبيه "التركيز"

تخيل أن الذكاء الاصطناعي هو طالب ينظر إلى صورة ويكتب وصفًا لها.

  • الطالب السليم (النموذج السليم): عندما ينظر إلى صورة لشاطئ، فإن عينيه تمسحان الرمال والأمواج والسماء بطريقة متوازنة ومنطقية. "انتباهه" يتوزع بسلاسة.
  • الطالب "المسموم" (النموذج الذي يحتوي على باب خلفي): حتى عند النظر إلى صورة عادية، فإن حقن الباب الخلفي قد أفسد توصيلات دماغه. قد ترتعش عيناه أو يحدق بشكل غير طبيعي في أجزاء معينة من الصورة، حتى في حالة عدم وجود مُحفِّز. إنه "يفرط في التركيز" أو "يقلل من التركيز" بأنماط غريبة.

2. قياس "الارتباك" (الإنتروبيا - Entropy)

أدرك الباحثون أنه يمكن قياس نمط التحديق الغريب هذا رياضيًا باستخدام ما يسمى إنتروبيا تاليس (Tsallis Entropy).

  • فكر في الإنتروبيا كمقياس لـ "الفوضى" أو "المفاجأة".
  • الذكاء الاصطناعي السليم لديه نمط انتباه يمكن التنبؤ به وسلس (مفاجأة منخفضة).
  • الذكاء الاصطناعي المسموم لديه نمط انتباه متعرج، فوضوي، أو مركز بشكل غريب (مفاجأة عالية/شذوذ).

3. "فحص المرجع"

لمعرفة ما إذا كان الذكاء الاصطناعي غريبًا، فأنت بحاجة إلى خط أساس.

  • المرجع: يأخذ الباحثون نسخة "سليمة" معروفة من نفس نموذج الذكاء الاصطناعي (النسخة الرسمية من المطور).
  • الاختبار: يقومون بتغذية كل من النموذج "المشبوه" والنموذج "المرجعي السليم" نفس الـ 200 صورة عادية وعشوائية.
  • المقارنة: يقيسون مدى انحراف نمط انتباه النموذج "المشبوه" عن النموذج "السليم".

إذا كان نمط انتباه النموذج المشبوه "أكثر ضجيجًا" أو "أغرب" بشكل ملحوظ من النموذج السليم، فإن EntropyScan يصنفه كنموذج يحتوي على باب خلفي.

لماذا هذا الأمر مميز؟

  • لا حاجة للمُحفِّز: لا تحتاج لمعرفة كيف يبدو الملصق السري. أنت فقط تراقب كيف يتصرف الذكاء الاصطناعي بشكل طبيعي.
  • خفيف الوزن: لا يتطلب إعادة تدريب النموذج أو حسابات معقدة. يستغرق الأمر مجرد ثوانٍ لمسح النموذج.
  • دقة عالية: في اختباراتهم، كشفت هذه الطريقة عن النماذج المسمومة بنسبة 98.5% من المرات، حتى ضد الهجمات الماكرة جدًا التي فاتتها الطرق الأخرى.

الخلاصة

EntropyScan يشبه حارس الأمن الذي لا يحتاج لمعرفة وجه اللص أو الشيء المسروق. بدلاً من ذلك، هو فقط يراقب كيفية دخول الناس من الباب. إذا مشى شخص ما بمشية غريبة وغير طبيعية (شذوذ هيكلي في الانتباه) مقارنة بالآخرين، فإن الحارس يعرف أن هناك خطبًا ما، حتى لو لم يستطع رؤية السلاح.

تزعم الورقة البحثية أن هذه الطريقة تعمل عبر أنواع مختلفة من نماذج الذكاء الاصطناعي وأنواع مختلفة من الهجمات، مما يوفر طريقة سريعة وموثوقة للتحقق مما إذا كان الذكاء الاصطناعي الذي تم تحميله آمنًا للاستخدام.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →