← أحدث الأبحاث
💻 computer science

STRAP-ViT: Segregated Tokens with Randomized -- Transformations for Defense against Adversarial Patches in ViTs

تُعد STRAP-ViT آلية دفاع غير قابلة للتدريب وتعمل بمبدأ "التوصيل والتشغيل" لنماذج المحولات الرؤيوية (Vision Transformers)، حيث تعمل على تخفيف هجمات الرقعة العدائية عبر تحديد الرموز الشاذة إحصائياً باستخدام تباعد جينسن-شانون وتطبيق تحويلات عشوائية عليها، محققةً دقة تقارب دقة الصور الأصلية دون تكاليف تدريب إضافية.

المؤلفون الأصليون: Nandish Chattopadhyay, Anadi Goyal, Chandan Karfa, Anupam Chattopadhyay

نُشر 2026-03-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Nandish Chattopadhyay, Anadi Goyal, Chandan Karfa, Anupam Chattopadhyay

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك حارس أمن ذكي للغاية ومتطور تقنيًا (يُسمى Vision Transformer أو ViT)، مهمته هي النظر إلى الصور وتحديد ما بداخلها. هذا الحارس قوي للغاية؛ فهو لا يكتفي بمجرد النظر إلى البكسلات كما تفعل العين البشرية، بل يقوم بتفكيك الصورة إلى قطع أحجية صغيرة تسمى "الرموز" (tokens)، ثم يحلل كيفية ارتباط كل منها بالآخر لاتخاذ قرار.

ومع ذلك، هناك مخادع ذكي يُعرف باسم "الرقعة العدائية" (Adversarial Patch). فكر في هذا كملصق صغير ملون بألوان زاهية أو قطعة شريط لاصق ذات نمط غريب، يلصقها المجرم على لوحة "قف" أو على قميص شخص ما. بالنسبة للإنسان، هي مجرد ملصق صغير، لكن بالنسبة لحارس الذكاء الاصطائي، فإن هذا الملصق يشبه "منارة مغناطيسية" (hypnotic lighthouse)؛ فهو يصرخ بصوت عالٍ جدًا لدرجة تجعل الحارس يتجاهل لوحة "القف" أو الشخص ويركز تمامًا على الملصق، مما يجعله يصنف الشيء بشكل خاطئ وبثقة تامة (على سبيل المثال، يعتقد أن لوحة "القف" هي "راديتر/مشعاع").

تقدم هذه الورقة نظام دفاع جديد يسمى STRAP-ViT. وإليك كيف يعمل، مشروحًا ببساطة:

1. المشكلة: الملصق "الصاخب"

أدرك المؤلفون أن قطع الأحجية (الرموز) التي تغطي الملصق الخبيث تتصرف بشكل مختلف عن القطع العادية.

  • الرموز الطبيعية: هادئة وتتبع الأنماط المعتادة للصورة.
  • رموز الملصق: فوضوية، صاخبة، و"غريبة" إحصائيًا. لديها "هالة" أو توزيع طاقة مختلف.

2. الحل: STRAP-ViT (الفلتر الذكي)

إن STRAP-ViT يشبه "الحارس الشخصي" (Bouncer) الواقف عند باب عقل الذكاء الاصطناعي. لا يحتاج إلى إعادة تدريب؛ بل يتم توصيله فقط ويبدأ في العمل. وهو يعمل عبر مرحلتين:

المرحلة (أ): المحقق (الكشف)

يستخدم الحارس أداة رياضية تسمى "تباعد جينسن-شانون" (Jensen-Shannon Divergence) (لنسمِّها "مقياس الغرابة").

  • يقوم بمقارنة كل قطعة أحجية في الصورة بما يجب أن تبدو عليه "القطعة الطبيعية".
  • إذا كانت القطعة "غريبة" جدًا (تباعد عالٍ)، يقوم الحارس بتمييزها.
  • القاعدة: لا يحتاج الحارس للإمساك بكل قطعة غريبة، بل يحتاج فقط للإمساك بما يكفي لتغطية 50% من الملصق. الأمر يشبه إدراكك أنه إذا غطيت نصف المنارة المغناطيسية ببطانية، فلن يكون ضوءها قويًا بما يكفي لإعماء الحارس.

المرحلة (ب): الممسحة السحرية (التخفيف)

بمجرد أن يحدد الحارس الرموز المشبوهة (تلك الموجودة تحت الملصق)، فإنه لا يقوم بمجرد حذفها (لأن ذلك سيترك ثقبًا في الصورة)، بل يطبق "ممسحة سحرية عشوائية" عليها.

  • تخيل أن الرموز مغطاة بغراء لزج ومربك (الضجيج العدائي).
  • يختار النظام عشوائيًا طريقة واحدة لمسح ذلك الغبار: ربما يقوم بتمطيط الرمز، أو ضغطه، أو تغيير درجة حرارة لونه.
  • لماذا العشوائية؟ إذا حاول المخادع صنع ملصق يمكنه النجاة من نوع واحد من المسح، فإن النظام سيختار ببساطة طريقة مسح عشوائية مختلفة في المرة القادمة. من المستحيل على المهاجم التنبؤ بالحركة العشوائية التي ستحدث، وبالتالي يتم تحييد قوة الملصق.

3. النتيجة: صورة آمنة

بعد أن يقوم الحارس بمسح الرموز المشبوهة، ينظر حارس الذكاء الاصطناعي إلى الصورة مرة أخرى.

  • "المنارة المغناطيسية" أصبحت الآن خافتة ومكسورة.
  • يستطيع الحارس أخيرًا رؤية الجسم الحقيقي (لوحة "القف" أو القرد) وتصنيفه بشكل صحيح.
  • والأهم من ذلك، نظرًا لأن النظام لا يلمس سوى الرموز "الغريبة" ويترك بقية الصورة كما هي، فإن أداء الذكاء الاصطناعي على الصور الطبيعية والنظيفة لا يتغير تقريبًا. الأمر يشبه إصلاح خدش في سيارة دون الحاجة لإعادة طلاء السيارة بأكملها.

لماذا هذا الأمر مهم؟

  • لا مجهود شاق: على عكس الدفاعات الأخرى التي تتطلب إعادة تدريب الذكاء الاصطناعي (وهو أمر يكلف الملايين ويستغرق سنوات)، فإن STRAP-ViT هو أداة "وصل وشغل" (Plug-and-play). يمكنك إضافته ببساطة إلى النظام الحالي.
  • شامل: يعمل على أنواع مختلفة من حراس الذكاء الاصطناعي وأنواع مختلفة من الملصقات، سواء كان الملصق كبيرًا أو صغيرًا، أو إذا كانت هناك ملصقات متعددة في صورة واحدة.
  • فعال: إنه سريع وخفيف الوزن لدرجة أنه لا يبطئ الذكاء الاصطناعي، مما يجعله مثاليًا للاستخدام في العالم الحقيقي مثل السيارات ذاتية القيادة أو كاميرات المراقبة.

باختصاف شديد: STRAP-ViT هو فلتر ذكي وخفيف الوزن يرصد الضجيج "الصاخب" للملصق الخبيث، ويقوم بتشويش ذلك الضجيج عشوائيًا حتى يصبح غير ضار، ويسمح للذكاء الاصطناعي برؤية الحقيقة مرة أخرى — كل ذلك دون الحاجة إلى تحديث برمجي ضخم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →