PASTA: A Patch-Agnostic Twofold-Stealthy Backdoor Attack on Vision Transformers
تقدم هذه الورقة البحثية PASTA، وهو هجوم باب خلفي جديد غير مرتبط بالرقعة (patch-agnostic) على نماذج المحولات الرؤيوية (Vision Transformers)، يستفيد من تأثير إشعاع المحفز (Trigger Radiating Effect) وإطار تحسين تكيفي ثنائي المستوى لتحقيق معدلات نجاح عالية للهجوم عبر مواقع محفزات عشوائية مع تعزيز التخفي بشكل كبير في كل من نطاقي البكسل والانتباه.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مساعداً آلياً فائق الذكاء (محول رؤية أو Vision Transformer أو ViT) ينظر إلى الصور ليخبرك بما تحتويه. عادةً، يكون هذا المساعد بارعاً جداً في ذلك. ولكن، مثل أي نظام ذكي، يمكن خداعه بـ "باب خلفي" (Backdoor)—وهو كود سري مخفي يجعل الروبوت يفعل ما يريد الشرير، بينما يستمر في التصرف بشكل طبيعي للجميع.
تقدم هذه الورقة البحثية طريقة جديدة وماكرة لاختراق هذه الروبوتات تسمى PASTA. إليك كيف تعمل، مشروحة عبر تشبيهات بسيطة.
1. الطريقة القديمة مقابل الاكتشاف الجديد
الطريقة القديمة (خدعة "بقعة الضوء"):
تخيل أن الروبوت ينظر إلى صورة عن طريق تقسيمها إلى شبكة من البلاطات الصغيرة (مثل الفسيفساء). كان المخترقون السابقون يقومون بطلاء رمز معين وقبيح على بلاطة واحدة محددة (مثلاً في الزاوية العلوية اليسرى). ثم يدربون الروبوت بحيث إذا رأى ذلك الرمز في ذلك المكان بالضبط، فإنه يتجاهل الصورة ويقول: "هذه قطة!" (حتى لو كانت كلباً).
- العيب: إذا حركت ذلك الرمز بلاطة واحدة فقط إلى اليمين، فلن يلاحظه الروبوت. كان الأمر يشبه بقعة ضوء لا تعمل إلا إذا وقفت في مكان محدد تماماً. كما أن ذلك الرمز القبيح كان من السهل على البشر رؤيته، وكان "نظر" الروبوت الداخلي يتركز بشكل غريب على تلك البقعة، مما ينبه أنظمة الأمن.
الاكتشاف الجديد (تأثير "التموج"):
وجد الباحثون شيئاً مذهلاً حول كيفية تفكير هذه الروبوتات. نظرًا لأن الروبوت يستخدم آلية "الانتباه الذاتي" (Self-attention) (أي أنه ينظر إلى كيفية ارتباط جميع البلاطات ببعضها البعض)، فإن المحفز (Trigger) لا يعمل في مكان واحد فقط.
- التشبيه: فكر في عقل الروبوت مثل البركة. إذا ألقيت حجراً (المحفز) في المنتصف، فإن التموجات ستنتشر في كل مكان.
- "تأثير إشعاع المحفز" (TRE): اكتشفوا أنه إذا وضعت محفزاً على بلاطة ما، فإن الروبوت يتفاعل معه حتى لو نقلت هذا المحفز إلى بلاطة مجاورة. "تموج" المحفز ينتشر عبر الصورة بأكملها.
2. هجوم PASTA: "المحفز الشبح"
بنى الباحثون هجوماً جديداً يسمى PASTA (هجوم الباب الخلفي الخفي ثنائي الخطوات والمستقل عن البقعة) الذي يستخدم تأثير التموج هذا لصالحهم.
الهدف:
أرادوا إنشاء محفز يحقق ما يلي:
- يعمل في أي مكان: يمكنك وضع المحفز في أي بلاطة في الصورة، وسيظل الروبوت يقوم بالشيء السيئ.
- غير مرئي للبشر: تبدو الصورة طبيعية تماماً.
- غير مرئي لـ "نظر" الروبوت: لا يحدق الروبوت بشكل غريب في المحفز؛ بل ينظر إلى الصورة كما يفعل عادةً.
كيف فعلوا ذلك (الوصفة السحرية):
الخطوة 1: "التدريب متعدد المواقع":
بدلاً من تعليم الروبوت أن المحفز يعمل فقط في الزاوية العلوية اليسرى، قاموا بتعليمه باستخدام "عجلة الروليت". لكل صورة سيئة صنعوها، كانوا يختارون مكاناً مختلفاً عشوائياً لإخفاء المحفز فيه. فعلوا ذلك في العديد من المواقع المختلفة.- التشبيه: تخيل أنك تعلم كلباً الجلوس. بدلاً من تعليمه الجلوس فقط عندما تقف في المطبخ، تعلمه الجلوس سواء كنت في المطبخ، أو غرفة المعيشة، أو الحديقة. الآن، الكلب سيجلس بغض النظر عن مكان وجودك.
الخطوة 2: "الرقصة التكيفية" (التحسين ثنائي المستوى):
هذا هو الجزء الأصعب. جعل المحفز غير مرئي يجعل الروبوت أضعف عادةً. وجعل المحفز قوياً يجعله مرئياً عادةً.- المشكلة: إذا غيرت المحفز، يغير الروبوت طريقة رؤيته للعالم. وإذا غيرت الروبوت، فقد يتوقف المحفز عن العمل. لقد علقوا في حلقة مفرغة.
- الحل: ابتكر الباحثون "رقصة". قاموا بإجراء تعديلات صغيرة وبطيئة على المحفز، ثم تعديلات صغيرة وبطيئة على الروبوت، ثم العودة للمحفز. فعلوا ذلك مراراً وتكراراً، مما سمح لهم بـ "التعود" على بعضهم البعض ببطء.
- التشبيه: تخيل شخصين يحاولان المشي بتناغم تام على ممر متحرك. إذا تحرك أحدهما بسرعة كبيرة، فسوف يتعثر. ولكن إذا خطا كل منهما خطوات صغيرة وبطيئة وعدل حركته باستمرار لتناسب إيقاع الآخر، فيمكنهما المشي معاً بشكل مثالي دون سقوط. سمح هذا لهم بالعثور على "النقطة المثالية" حيث يكون المحفز قوياً ولكنه غير مرئي.
3. لماذا هذا أمر مخيف (ومذهل)؟
- إنه يكسر الدفاعات: معظم الأنظمة الأمنية تتحقق من وجود المحفات في أماكن محددة أو تبحث عن "نظرات" غريبة في عقل الروبوت. ولأن محفز PASTA يعمل في أي مكان ولا يغير "نظر" الروبوت، فإن هؤلاء الحراس الأمنيين يُخدعون تماماً.
- إنه شديد التخفي: أظهر الباحثون أن محفزهم أصعب بـ 144 مرة في الرؤية بالعين المجردة وأصعب بـ 18 مرة في الكشف عن طريق الفحص الآلي مقارنة بالطرق السابقة. إنه مثل شبح يمكنه السير عبر الجدران دون ترك أثر.
الملخص
PASTA هو طريقة جديدة لاختراق أنظمة الرؤية في الذكاء الاصطناي. بدلاً من رسم علامة كبيرة وواضحة في مكان محدد لخداع الذكاء الاصطناعي، تعلم المخترقون كيفية صنع "تموج" ينتشر عبر الصورة بأكملها. لقد دربوا الذكاء الاصطناعي على التفاعل مع هذا التموج بغض النظر عن مكان ظهوره، مع جعل التموج دقيقاً للغاية بحيث لا يستطيع البشر ولا برامج الأمن رؤيته.
إنه يشبه تعليم حارس أمن أن يخاف من ظل معين، ثم إدراك أنه إذا حركت مصدر الضوء، فإن الظل سيتحرك أيضاً. يعلم PASTA الحارس أن يخاف من الظل مهما كان مكان سقوطه، كل ذلك مع جعل الظل باهتاً جداً لدرجة أنه يبدو مجرد خدعة من الضوء.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.