VALD: Multi-Stage Vision Attack Detection for Efficient LVLM Defense
يُعد VALD وسيلة دفاع متعددة المراحل ولا تتطلب تدريباً لنماذج الرؤية واللغة الكبيرة، حيث يقوم بكشف الهجمات العدائية بكفاءة من خلال الجمع بين فحوصات اتساق الصور منخفضة التكلفة وتحليل تضمين النصوص مع توحيد البيانات عبر الوكيل، محققاً دقة تضاهي أحدث المعاياي التقنية مع تقليل العبء الحسابي للمدخلات السليمة.
المؤلفون الأصليون:Nadav Kadvil, Malak Fares, Ayellet Tal
تخيل أن لديك مساعداً آلياً ذكياً جداً، ولكنه ساذج قليلاً، يدعى LVML (نموذج لغوي بصري ضخم). يمكن لهذا الروبوت أن ينظر إلى صورة ويصفها بدقة مثالية، مثل المرشد السياحي. قد يقول: "هذا كلب من فصيلة جولدن ريتريفر يلعب بقرص طائر في الحديقة".
ومع ذلك، هناك مخترقون يمكنهم دس "خلل" صغير وغير مرئي داخل الصورة. بالنسبة لعينك البشرية، تبدو الصورة تماماً كما هي، ولكن بالنسبة للروبوت، فإن هذه الأعطال تشبه همساً مغناطيسياً يجعله يقول: "في الواقع، هذا عمود إطفاء أحمر!". لقد تم خداع الروبوت ليقول كذبة، رغم أنه يبذل قصارى جهده.
يقدم البحث نظام أمان جديد يسمى VALD (كشف الهجوم البصري) لإيقاف هذا. فكر في VALD ليس كحارس شخصي ثقيل ومكلف يفحص كل شخص يدخل المبنى، بل كفريق أمني ذكي متعدد المراحل يستخدم مزيجاً من الفحوصات السريعة والاستنتاج الذكي.
إليك كيف يعمل VALD، باستخدام تشبيهات بسيطة:
1. "النظرة الخاطفة" (المرحلة 1: الكشف المبكر)
معظم الأشخاص الذين يدخلون المبنى أبرياء. وفحص هوية الجميع بدقة يستغرق وقتاً طويلاً. لذا، يمتلك VALD مرحلة "النظرة الخاطفة".
التشبيه: تخيل أن لديك صورة لقطة. إذا أغمضت عينيك قليلاً (نظرت إليها بضبابية)، أو جعلتها ضبابية، أو قصصت زاوية منها، فستظل بوضوح قطة. "جوهرها" لم يتغير.
الاختراق: إذا كانت الصورة تحتوي على خلل مخفي من قبل مخترق، فإن التحديق الضبابي أو القص غالباً ما يؤدي إلى "كسر" هذا الخلل. قد يرى الروبوت فجأة كلباً بدلاً من قطة، أو يصاب بالارتباك.
الإجراء: يأخذ VALD الصورة بسرعة، ويطبق عليها بعض الفلاتر غير الضارة (مثل التضبيب أو القص)، ثم يسأل الروبوت: "هل لا تزال تبدو كشيء نفسه؟"
إذا كانت الإجابة "نعم، إنها متسقة": رائع! من المحتمل أن تكون صورة نظيفة. يسمح VALD للروبوت بالإجابة فوراً. يحدث هذا في 95% من المرات، مما يوفر وقتاً وطاقة هائلين.
إذا كانت الإجابة "مهلاً، هذا يبدو غريباً": يتم تحديدها كحالة مشبوهة وتنتقل إلى المرحلة التالية.
2. "حلقة النقاش" (المرحلة 2: الكشف المتأخر)
بالنسبة للصور المشبوهة، نحتاج إلى التعمق أكثر، ولكننا لا نزال نريد أن نكون فعالين.
التشبيه: تخيل أنك تطلب من 10 أشخاص مختلفين وصف نفس الصورة الضبابية. إذا قالوا جميعاً "إنها قطة"، فأنت تثق بهم. أما إذا قال أحدهم "إنها قطة" وقال آخر "إنها محمصة خبز"، فأنت تعلم أن هناك خطباً ما في الصورة أو أن أحد الأشخاص مرتبك.
الإجراء: يقوم VALD بإنشاء أوصاف للصورة الأصلية ولجميع النسخ المفلترة منها. ثم يقوم بفحص النص. إذا كانت الأوصاف متضاربة (بعضها يقول "قطة"، وبعضها "محمصة خبز"، وبعضها "عمود إطفاء")، فإنه يؤكد وقوع هجوم. أما إذا كان معظمهم متفقين، فقد يظل الأمر آمناً.
3. "المحرر الذكي" (المرحلة 3: الإصلاح النهائي)
فقط للصور التي فشلت في الاختبارين الأولين، يستدعي VALD "الرئيس الكبير" (ذكاء اصطناعي قوي جداً ومكلف).
التشبيه: تخيل أن لديك غرفة فوضوية بها 10 أوصاف مختلفة لما يوجد بداخلها. البعض يقول "كرسي أزرق"، والبعض يقول "كرسي أحمر"، وواحد يقول "يونيكورن طائر". أنت بحاجة إلى محرر ذكي لتنظيف هذا.
الإجراء: ينظر "الرئيس الكبير" إلى كل هذه الأوصاف المختلفة. ويستخدم قاعدة بسيطة: "ثق بالأغلبية، وتجاهل الاستثناءات".
إذا قال 9 من أصل 10 أوصاف "كلب"، وقال واحد "عمود إطفاء"، فإن المحرر يعرف أن "عمود الإطفاء" هو نتيجة الاختراق.
يقوم المحرر بدمج الأجزاء المتسقة ("كلب"، "حديقة"، "قرص طائر") ويرمي الأجزاء الغريبة وغير المتسقة.
الأمر الحاسم: "الرئيس الكبير" يقوم بهذا فقط للحالات الصعبة. إنه لا يضيع وقته في كل صورة.
لماذا يعتبر هذا تغييراً جذرياً؟
إنه سريع: لأنه يستبعد 95% من الصور العادية فوراً، فإنه لا يبطئ النظام. إنه يشبه وجود مسار سريع لكبار الشخصيات (VIP) حيث ينتظر الأشخاص المشبوهون فقط.
إنه رخيص: لا تحتاج إلى الذكاء الاصطناسي الأكثر قوة وتكلفة لكل صورة. أنت تستخدم "الرئيس الكبير" فقط عند الضرورة القصوى.
إنه ذكي: بدلاً من محاولة "إصلاح" الصورة (وهو أمر صعب)، فإنه يصلح القصة التي يرويها الروبوت. إنه يدرك أنه إذا تغيرت القصة في كل مرة تنظر فيها إلى الصورة بشكل مختلف، فإن القصة هي كذبة.
الخلاصة
VALD يشبه وكالة تحريات تعلم أن 95% من عملائها أبرياء. بد way من استجواب الجميع، يقوم بإجراء فحص سريع للخلفية. إذا اجتزت الفحص، فأنت حر. وإذا بدوت مشبوهاً، فيحضرون فريقاً من الخبراء لمقارنة الملاحظات ومعرفة الحقيقة. بهذه الطريقة، يمسكون بالأشرار دون إضاعة الوقت على الأخيار.
إليك ملخص تقني مفصل لورقة البحث "VALD: Multi-Stage Vision Attack Detection for Efficient LVLM Defense".
1. بيان المشكلة
تتعرض النماذج اللغوية البصرية الكبيرة (LVLMs) بشكل متزايد لهجمات الاضطراب البصري العدائي (visual adversarial attacks). وبخلاف هجمات "كسر الحماية" (jailbreaking) التي تفرض مخرجات ضارة، تركز هذه الورقة على الهجمات المضللة. تقوم هذه الهجمات بإدخال اضطرابات غير محسوسة في الصور المدخلة تتسبب في جعل النموذج يولد استجابات سليمة ظاهرياً ولكنها خاطئة واقعياً (مثل الهلوسة بوجود أشياء أو تصنيف المشاهد بشكل خاطئ).
تواجه الدفاعات الحالية عيبين رئيسيين:
عدم الكفاءة: العديد من الطرق (مثل SmoothVLM) تعالج كل صورة عبر مسارات مكلفة (توليد عدة أوصاف نصية واستخدام نموذج لغوي كبير قوي للحكم عليها)، بغض النظر عما إذا كانت الصورة نظيفة أم تعرضت لهجوم. وهذا أمر غير عملي للنشر في العالم الحقيقي حيث تكون معظم المدخلات نظيفة.
الاعتماد على نماذج قوية: غالباً ما يتطلب الدمج الفعال للاستجابات المتعددة نماذج LVLMs قوية وثقيلة حاسوبياً، مما يحد من إمكانية توسع هذا النهج.
2. المنهجية: إطار عمل VALD
يقترح المؤلفون VALD، وهو آلية دفاع عامة لا تتطلب تدريباً (training-free)، تفصل بين التحليل البصري ودمج المعلومات. يستخدم آلية كشف ثنائية المراحل لتصفية الصور النظيفة مبكراً، مع حجز المعالجة المكلفة فقط للصور المشتبه في كونها عدائية.
يتكون إطار العمل من أربع مراحل:
المرحلة 1: الكشف المبكر عن الهجوم (اتساق التضمين البصري)
الهدف: تحديد الصور النظيفة بسرعة لتجاوز المعالجة الإضافية.
الآلية: يطبق النظام مجموعة من K من التحويلات التي تحافظ على المحتوى (مثل القص الكبير، قناع البكسل، التمويه الغاوسي، وضغط JPEG) على الصورة المدخلة x.
المنطق: يقوم النظام بحساب التضمينات البصرية للصورة الأصلية وتحويلاتها باستخدام المشفر البصري للنموذج (vision encoder).
القرار: إذا ظلت التضمينات متسقة (المسافة <τ)، تُعتبر الصورة نظيفة. يعيد النظام فوراً استجابة الـ LVLM الأصلية.
الكفاءة: تتطلب هذه الخطوة حسابات ضئيلة (تمريرة واحدة مجمعة - one batched pass) وتفلتر حوالي 95% من الصور النظيفة.
المرحلة 2: توليد الاستجابة القائمة على الصورة
المحفز: يتم تفعيلها فقط إذا تم وسم الصورة في المرحلة الأولى كصورة يحتمل أن تكون عدائية.
الآلية: يتم استعلام الـ LVLM عدد K+1 من المرات: مرة واحدة مع الصورة الأصلية و K من المرات مع النسخ المحولة.
المخرج: مجموعة من الاستجابات النصية (الأوصاف) R={r0,r1,...,rK}.
المرحلة 3: الكشف المتأخر عن العدائية (تباين التضمين النصي)
الهدف: تصفية المزيد من الإيجابيات الكاذبة من المرحلة الأولى قبل استدعاء النموذج اللغوي الكبير (LLM) الثقيل.
الآلية: يحلل النظام مجموعة الأوصاف النصية R. يقوم بتمثيل كل وصف كمتجه باستخدام نموذج تضمين جمل خفيف الوزن (مثل SentenceBERT).
القرار: إذا أظهرت الاستجابات تباعداً دلالياً كبيراً (مما يشير إلى أن الهجوم تسبب في هلوسات غير متسقة)، يتم تأكيد أن المدخل عدائي. إذا كانت الاستجابات متسقة، يتم الاحتفاظ بالاستجابة الأصلية.
الكفاءة: تضيف هذه المرحلة عبئاً طفيفاً وتلتقط حوالي 1% إضافي من الصور النظيفة.
المرحلة 4: دمج الاستجابة الوكيل (Agentic Response Consolidation)
المحفز: يتم تفعيله فقط للمدخلات التي تأكدت احتمالية كونها عدائية عالية.
الآلية: يُستخدم نموذج لغوي خارجي قوي (مثل Gemma-3-27B) حصرياً لمعالجة النصوص، وليس لتحليل الصور.
الاستراتيجية: يتم توجيه الـ LLM ليعمل كـ "وكيل استدلالي" (reasoning agent). يقوم بتحليل مجموعة الأوصاف لـ:
تحديد العناصر المتسقة (الأشياء، السمات، العلاقات) التي تظهر عبر عدة مشاهد محولة.
تحديد واستبعاد العناصر المتفرقة أو غير المتسقة (التي يُرجح أنها هلوسات ناتجة عن الهجوم).
تركيب وصف نهائي واحد، متماسك، ودقيق بناءً على "إجماع الأغلبية" للمشاهد المحولة.
الابتكار الرئيسي: من خلال فصل الاستعلام البصري (الذي يقوم به LVLM خفيف الوزن) عن الاستدلال/الدمج (الذي يقوم به LLM قوي)، يقلل النظام من التكلفة الحسابية.
3. المساهمات الرئيسية
دفاع عام لا يتطلب تدريباً: إطار عمل مبتكر يدافع ضد مجموعة واسعة من الهجمات (البيضاء والسوداء - white-box and black-box) دون الحاجة لإعادة تدريب النموذج أو ضبطه (fine-tuning).
كشف ثنائي المرحلة عالي الكفاءة: آلية خفيفة الوزن تفلتر حوالي 95% من المدخلات النظيفة مبكراً، مما يقلل بشكل كبير من العبء الحسابي مقارنة بالطرق التي تعالج كل صورة عبر مسار ثقيل.
بنية مفككة: يسمح فصل التحليل البصري عن دمج المعلومات باستخدام نماذج LVLMs خفيفة الوزن للقيام بمعظم العمل، مع حجز النماذج اللغوية (LLMs) القوية لخطوة الدمج الضرورية فقط.
أداء رائد (State-of-the-Art): يحقق الأسلوب دقة متفوقة على الأمثلة العدائية مع الحفاظ على الأداء على البيانات النظيفة، متفوقاً على كل من النماذج المرجعية التي لا تتطلب تدريباً (مثل SmoothVLM) والدفاعات التي تتطلب تدريباً (مثل FARE).
4. النتائج التجريبية
قام المؤلفون بتقييم VALD على LLaVA-1.5-7B، و MiniGPT-v2، و Qwen3-VL-4B ضد ثلاثة هجمات: MF-ii، و MixAttack، و M-Attack.
الدقة: تفوق VALD باستمرار على النماذج المرجعية. على سبيل المثال، في اختبار LLaVA تحت هجوم MF-ii، حقق VALD درجة SentenceBERT بلغت 0.716، مقارنة بـ 0 679 لـ SmoothVLM و 0.268 للنموذج غير المحمي.
الكفاءة:
الحالة المثلى (الصور النظيفة): وقت التشغيل هو 1.9 ثانية لكل صورة (مقابل 1.8 ثانية بدون دفاع).
الحالة الأسوأ (الصور العدائية): وقت التشغيل هو 22.9 ثانية.
المقارنة: يستغرق SmoothVLM 52.7 ثانية لكل صورة بغض النظر عن المدخلات.
السرعة: VALD أسرع بـ 27 ضعفاً من SmoothVLM للصور النظيفة، وأسرع بـ ضعفين حتى في أسوأ السيناريوهات.
معدلات الكشف: يحدد النظام بشكل صحيح 93–96% من الصور النظيفة كصور نظيفة، ويحافظ على معدل استدعاء (recall) يزيد عن 91% للصور العدائية عبر جميع النماذج.
5. الأهمية والقيود
الأهمية:
القابلية للتوسع: من خلال تصفية الغالبية العظمى من حركة المرور النظيفة مبكراً، يجعل VALD الدفاع القوي ممكناً لنشر نماذج LVLM في العالم الحقيقي حيث تعتبر زمن الاستجابة والتكلفة أموراً حاسمة.
المتانة: يتعامل بفعالية مع الهجمات البيضاء والسوداء، بما في ذلك تلك المصممة خصيصاً لتكون مقاومة للقص (M-Attack).
العمومية: النهج مستقل عن النموذج ولا يعتمد على بصمات هجوم محددة.
القيود:
الهلوسة المتسقة: إذا تسبب الهجوم في جعل النموذج يهلوس نفس الشيء الخاطئ عبر جميع المشاهد المحولة (على سبيل المثال، جميع المشاهد تهلوس بوجود دراجة نارية ثالثة)، فقد تعامل منطق الدمج هذا الخطأ على أنه "متسق" وتدرجه في المخرج النهائي.
المقايضة: هناك مقايضة متأصلة بين الكفاءة والمتانة؛ فزيادة صرامة الكاشف المبكر للإمساك بمزيد من الهجمات قد تزيد من معدل الإيجابيات الكاذبة (معالجة المزيد من الصور النظيفة دون داعٍ)، رغم أن هذا لا يقلل من جودة المخرج النهائي، بل يقلل فقط من وقت التشغيل.
في الختام، يمثل VALD خطوة مهمة للأمام في تأمين النماذج اللغوية البصرية الكبيرة (LVLMs) من خلال إعطاء الأولوية للكفاءة عبر التصفية الذكية والمتانة عبر الإجماع الوكيلي، مما يقدم حلاً عملياً لنشر النماذج متعددة الوسائط الكبيرة في البيئات العدائية.