Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models
تقترح هذه الورقة هجوم الصقل الهرمي (HRA)، وهو إطار عمل عدائي متعدد الوسائط وعالمي يعزز قابلية النقل والكفاءة لنماذج الرؤية واللغة من خلال الاستفادة من التدرجات الزمنية الهرمية لاضطرابات الصور ونمذجة الجمل الهرمية لاضطرابات النصوص للتغلب على القيود الحسابية للهجمات الحالية المحددة لكل عينة.
تخيل أن لديك أمين مكتبة آلي ذكي للغاية. أمين المكتبة هذا (نموذج لغوي بصري - Vision-Language Model) مذهل في مطابقة الصور مع أوصافها. إذا عرضت عليه صورة قطة، يمكنه فوراً أن يخبرك: "هذه قطة ريشية تجلس على سجادة".
ولكن، مثل أي نظام ذكي، لديه نقاط عمياء. فقد وجد الباحثون أنه إذا أجريت تغييرات طفيفة، غير مرئية تقريباً، على الصورة أو الكلمات، يمكنك خداع أمين المكتبة وجعله يبدو أحمقاً تماماً. على سبيل المثال، يمكنك تعديل صورة قطة بما يكفي لتجعل الروبوت يعتقد أنها محمصة خبز، أو تغيير كلمة "قطة" إلى "كلب" بطريقة لا تراها العين البشرية، مما يجعل الروبوت يصاب بالارتباك.
يقدم هذا البحث طريقة جديدة وأكثر ذكاءً لخداع هؤلاء الروبوتات، تسمى HRA (هجوم الصقل الهرمي - Hierarchical Refinement Attack). وإليك كيف يعمل، مقسماً إلى مفاهيم بسيطة:
1. المشكلة: نهج "الواحد لا يناسب الجميع"
قبل هذا البحث، إذا أراد المخترقون خداع أمين المكتبة الروبوتي، كان عليهم إنشاء خدعة مخصصة لكل صورة على حدة.
الطريقة القديمة: تخيل أنك تريد خداع حارس أمن. الطريقة القديمة هي أن تقف أمام الحارس وتهمس بكلمة سر محددة لهذا الحارس تحديداً، وتأمل أن تنجح. إذا أردت خداع حارس آخر في مبنى آخر، فعليك تعلم كلمة سر جديدة تماماً من البداية. هذا يستغرق وقتاً طويلاً وهو بطيء جداً للأنظمة الكبيرة.
الهدف: أراد الباحثون إنشاء "مفتاح رئيسي"—خدعة واحدة تعمل على أي صورة وعلى أي أمين مكتبة روبوتي، بغض النظر عن أي مبنى (نموذج) أنت فيه.
2. الحل: "المفتاح الرئيسي" (HRA)
بنى المؤلفون نظاماً يتعلم خدعة عالمية واحدة للصور وواحدة للنصوص.
الجزء أ: خدعة الصورة (زخم "رؤية المستقبل")
عندما تحاول إيجال "المفتاح الرئيسي" المثالي لصورة ما، فأنت تقوم أساساً بالسير عبر متاهة ضبابية بحثاً عن المخرج (النقطة التي يصاب فيها الروبوت بالارتباك).
المشكلة: الطرق القياسية تشبه المتنزه الذي ينظر فقط إلى الأرض أمام قدميه مباشرة. غالباً ما يعلقون في حفرة صغيرة (نهاية صغرى محلية - local minimum) ظناً منهم أنهم وجدوا المخرج، لكنهم في الواقع عالقون في طريق مسدود.
إصلاح HRA: منح الباحثون المتنزه رؤية بلورية (رؤية عبر كرة بلورية). فبدلاً من مجرد النظر إلى حيث جاء (الخطوات الماضية)، فإنه يتطلع أيضاً إلى أين قد يذهب في الخطوات القليلة القادمة (الخطوات المستقبلية).
تشبيه: تخيل أنك تقود سيارة. السائق العادي ينظر فقط إلى الطريق أمامه مباشرة. إذا رأى حفرة، فقد ينحرف إلى خندق. سائق HRA ينظر إلى الخريطة ويتنبأ أيضاً بانحناء الطريق على بعد 100 متر. هذا يساعده على القيادة بسلاسة حول الحفرة وإيجاد المخرج الحقيقي، مما يجعل الخدعة تعمل على العديد من السيارات (النماذج) المختلفة.
الجزء ب: خدعة النص (الكلمات "ذات التأثير القوي")
النصوص صعبة لأنك لا تستطيع مجرد "تمويه" كلمة كما يمكنك فعل ذلك مع بكسل في صورة. عليك استبدال الكلمات.
المشكلة: إذا استبدلت كلمة عشوائية، فقد لا يهتم الروبوت. إذا استبدلت الكلمة الخطأ، فإن الجملة ستظل منطقية بالنسبة للروبوت.
إصلاح HRA: يعمل النظام كـ محرر أدبي يبحث عن الكلمات الأكثر أهمية في قصة ما.
يسأل: "إذا حذفت هذه الكلمة، هل تنهار القصة؟"
إنه ينظر إلى الكلمات داخل جملة واحدة (داخل الجملة - Intra-sentence) وكيف ترتبط الجمل ببعضها البعض (بين الجمل - Inter-sentence).
بمجرد العثور على "الكلمات ذات التأثير القوي" (الأكثر تأثيراً)، فإنه ينشئ استبدالاً عالمياً. على سبيل المثال، قد يقرر أن استبدال كلمة "كلب" بكلمة "ممارسة التزلج بالمظلات" هو أكثر شيء مربك للقيام به عبر جميع الجمل.
تشبيه: تخيل لعبة "الهاتف المكسور" (التواصل عبر الهمس). إذا همست بتغيير لكلمة مملة مثل "الـ"، فلن يلاحظ أحد. ولكن إذا همست بتغيير لأكثر الكلمات إثارة مثل "انفجار"، فإن القصة بأكملها تتغير. يجد HRA كلمات "الانفجار" هذه ويستبدلها في كل مكان.
3. لماذا يعد هذا أمراً بالغ الأهمية
إنه عالمي: لا تحتاج إلى إعادة تدريب الخدعة لكل روبوت جديد. تتعلمها مرة واحدة، وتعمل على الجميع تقريباً.
إنه أقوى: لأنه ينظر إلى "المستقبل" للصورة و"أهمية" الكلمات، فإنه لا يعلق في الطرق المسدودة. إنه ينشئ خدعة يصعب الدفاع ضدها.
إنه جرس إنذار: من خلال إظهار مدى سهولة خداع هذه النماذج القوية من الذكاء الاصطناعي باستخدام مفتاح عالمي واحد، يأمل المؤلفون أن يبني المطورون روبوتات أقوى وأكثر متانة لا يمكن خداعها بسهولة.
الملخص
فكر في HRA كصانع أقفال محترف لا يكتفي بفتح كل قفل على حدة. بدلاً من ذلك، يدرس ميكانيكا القفل (نموذج الذكاء الاصطناعي)، ويتنبأ بكيفية سقوط قطع القفل (التدرجات المستقبلية)، ويجد المفتاح الرئيسي الواحد (الاضطراب العالمي) الذي يفتح كل الأبواب، سواء كانت صورة لقطة أو جملة عن كلب.
إليك ملخص تقني مفصل لورقة البحث بعنوان "التحسين الهرمي للهجمات متعددة الوسائط الشاملة على نماذج الرؤية واللغة".
1. بيان المشكلة
أصبحت نماذج الرؤية واللغة المسبقة التدريب (VLP) (مثل CLIP وBLIP) أساسية للربط بين الصور والنصوص. ومع ذلك، تظل متانة هذه النماذج ضد الهجمات العدائية مصدر قلق بالغ، خاصة في التطبيقات عالية المخاطر.
قصور الطرق الحالية: الهجمات العدائية الحالية لنماذج (VLP) هي في الغالب خاصة بكل عينة (sample-specific). فهي تتطلب تعلم اضطراب فريد لكل نقطة بيانات جديدة، مما يؤدي إلى تكاليف حوسبة باهظة عند التوسع إلى مجموعات بيانات ضخمة أو سيناريوهات جديدة.
مشكلات القابلية للنقل (Transferability): تعاني الاضطرابات العدائية الشاملة (UAPs) الحالية غالبًا من ضعف القابلية للنقل. فهي تميل إلى الإفراط في التكيف (overfitting) مع البنية التحتية المحددة، أو أهداف التدريب، أو المهام النهائية للنموذج البديل (المصدر)، مما يؤدي إلى الفشل في التعميم على النماذج المستهدفة ذات البنى المختلفة (مثل CNN مقابل Transformer) أو المهام المختلفة (مثل الاسترجاع مقابل الوصف النصي).
الفجوات بين الوسائط: ركزت الهجمات متعددة الوسائط السابقة إما على الصور فقط أو استخدمت استراتيجيات هجوم نصية غير فعالة (مثل تعلم التضمينات ثم رسم الخرائط إلى الرموز "tokens"، مما يسبب عدم تطابق بين عملية التحسين والتمثيل النهائي للرمز).
2. المنهجية: هجوم التحسين الهرمي (HRA)
يقترح المؤلفون إطار عمل HRA، وهو هجوم شامل متعدد الوسائط بنظام "الصندوق الأسود" مصمم لتوليد اضطرابات لكل من وسائط الصور والنصوص، بحيث يمكن تعميمها عبر مختلف نماذج (VLP)، ومجموعات البيانات، والمهام النهائية.
لمعالجة مشكلة الإفراط في التكيف الناتجة عن الحلول المحلية الدنيا (local minima) في التحسين القائم على التدرج، يقدم HRA استراتيجية "الزخم الهرمي الواعي بالمستقبل".
المفهوم: تستخدم طرق الزخم القياسية التدرجات التاريخية فقط، والتي قد لا تتوافق مع اتجاه التحسين الحالي في إعدادات الهجوم الشامل. يقوم HRA بتوسيع الأفق الزمني من خلال دمج التدرجات المستقبلية المقدرة.
الآلية:
حساب التدرج الحالي (gm).
استرجاع التدرج السابق (gm−1).
تقدير التدرج المستقبلي (gm+d) من خلال محاكاة d من الخطوات للأمام في مسار التحسين.
تنظيم اتجاه التحديث باستخدام مزيج مرجح: g~m=gm+γ1⋅gm−1+γ2⋅gm+d
الفائدة: هذا النهج "الواعي بالمستقبل" يعمل على استقرار مسار التحسين، ويمنع التقارب المبكر للحلول المحلية، ويوسع مساحة البحث، مما يعزز القابلية للنقل إلى نماذج غير مرئية.
ب. وسيط النص: ترتيب الأهمية الهرمي
بما أن النص منفصل (discrete)، لا يمكن لـ HRA تطبيق اضطرابات مستمرة مثل الصور. بدلاً من ذلك، يستخدم استبدال الكلمات الشامل.
التحدي: تحديد الكلمات التي يجب استبدالها بشكل شامل دون وجود مكتبة كلمات محددة مسبقًا أو حدوث عدم تطابق دلالي.
الآلية:
الأهمية داخل الجملة: لكل عينة تدريب، يتم حجب الرموز (tokens) الفردية وقياس التباعد الدلالي (باستخدام تباعد KL) بين التمثيل المحجوب والزوج الأصلي (صورة-نص).
التجميع بين الجمل: تجميع درجات الأهمية هذه عبر مجموعة البيانات بأكملها لتحديد الكلمات ذات التأثير العالمي.
الاختيار: ترتيب الكلمات المرشحة حسب تأثيرها المجمع. يتم اختيار الكلمات الأعلى ترتيبًا كـ كلمات تحفيز شاملة (universal trigger words).
الهجوم: عند الاختبار، يتم استبدال الكلمة الأكثر أهمية في المدخلات بكلمة التحفيز المختارة (أو كلمة عشوائية في نسخة HRAran).
الفائدة: يحدد هذا النهج مباشرة الرموز المؤثرة من المتن (corpus)، متجنبًا عدم التطابق بين التضمين والرمز الموجود في الطرق السابقة، ولا يتطلب أي مكتبات خارجية للكلمات.
ج. إطار التدريب
الإعداد: إعداد "الصندوق الأسود" حيث يكون النموذج المستهدف غير قابل للوصول. يتم استخدام نموذج بديل (مثل CLIP) ومجموعة بيانات (مثل Flickr30K) لتوليد الاضطرابات الشاملة (UAPs).
تعزيز البيانات: يستخدم الأسلوب تعزيز البيانات (خلط أزواج الصورة والنص) لزيادة تنوع توزيع التدريب ومنع الإفراط في التكيف مع توزيعات بيانات محددة.
3. المساهمات الرئيسية
إطار عمل مبتكر (HRA): أول إطار عمل هجوم شامل متعدد الوسائط يتعلم الاضطرابات الشاملة (UAPs) لكل من وسائط الصور والنصوص، وهو قابل للتطبيق على بيانات ومهام ونماذج جديدة دون إعادة تدريب.
استراتيجيات التحسين الهرمي:
للصور: تقديم الزخم الواعي بالمستقبل لتنظيم مسارات التحسين والحد من الإفراط في التكيف.
للنصوص: اقتراح نهج نمذجة الأهمية الهرمية (داخل الجمل وبينها) لتحديد الكلمات الأكثر تأثيراً عالمياً للاستبدال.
تقييم شامل: تجارب واسعة النطاق عبر نماذج (VLP) متعددة (CLIP, ALBEF, TCL)، ومجموعات بيانات (Flickr30K, MSCOCO, RefCOCO+)، ومهام نهائية متنوعة (استرجاع الصورة-النص، التحديد البصري، وصف الصور).
4. النتائج التجريبية
تُظهر الورقة أن HRA يتفوق بشكل كبير على أفضل الطرق المرجعية (AdvCLIP, SGA, ETU, FD-UAP, C-PGC) من حيث معدل نجاح الهجوم (ASR) والقابلية للنقل (Transferability).
القابلية للنقل عبر النماذج:
حقق HRA معدل ASR متفوقًا عند نقل الهجمات من النماذج المصدر (مثل CLIP ViT-B/16) إلى النماذج المستهدفة ذات البنى المختلفة (مثل CLIP ResNet50, ALBEF, TCL).
على سبيل المثال، في مهمة استرجاع الصورة-النص على Flickr30K، حقق HRA نسبة 88.54% في ASR (لنسخة HRA_imp) ضد CLIP ViT-B/16، مقارنة بـ 74.58% لأفضل طريقة تالية (C-PGC).
القابلية للنقل عبر المهام:
نجحت الهجمات التي تم توليدها في مهام استرجاع الصورة-النص في إضعاف الأداء في مهام التحديد البصري (Visual Grounding) ووصف الصور (Image Captioning)، مما يثبت أن الاضطرابات المتعلمة تعطل المحاذاة الأساسية بين الوسائط بدلاً من الميزات الخاصة بالمهمة فقط.
دراسات الاستئصال (Ablation Studies):
أدى حذف مكون "الوعي بالمستقبل" أو مكون "هجوم النص" إلى انخفاض كبير في الأداء، مما يؤكد ضرورة كلتا الاستراتيجيتين.
وفر استخدام خطوتين من التدرج المستقبلي التوازن الأمثل بين الأداء والتكلفة الحوسبية.
5. الأهمية والأثر
تقييم المتانة: يوفر HRA معيارًا صارمًا لتقييم المتانة الحقيقية لنماذج (VLP) ضد التهديدات الشاملة، ويكشف عن نقاط الضعف التي قد تغفل عنها الهجمات الخاصة بكل عينة.
الكفاءة: من خلال توليد اضطرابات شاملة، يلغي HRA الحاجة إلى إعادة تدريب الهجمات لكل عينة جديدة، مما يجعل التقييمات الأمنية واسعة النطاق أمرًا ممكنًا.
فهم ثغرات (VLP): يسلط نجاح الهجوم الضوء على أن نماذج (VLP) تعتمد بشكل كبير على ارتباطات محددة، وغالبًا ما تكون سطحية، بين الوسائط يمكن تعطيلها بواسطة محفزات شاملة، مما يشير إلى الحاجة لآليات محاذاة أكثر متانة في تصميمات النماذج المستقبلية.
العملية: استراتيجية هجوم النص عملية لأنها لا تتطلب موارد خارجية (مثل مكتبات تضمين الكلمات) وتعمل مباشرة على متن التدريب.
الخلاصة: تقدم هذه الورقة تقدمًا كبيرًا في التعلم الآلي العدائي للأنظمة متعددة الوسائط، حيث توفر طريقة قابلة للتوسع، وقابلة للنقل، وفعالة لسبر أغوار أمن نماذج الرؤية واللغة.