Misguiding BLIP with Adversarial Patches: Multi-level Attacks with Cross-modal Attention Graphs in BLIP
تقترح هذه الورقة MAGA، وهو إطار هجوم مبتكر متعدد المستويات يستغل ثغرات الانتباه عبر الوسائط في نماذج BLIP من خلال بناء وتعطيل رسوم بيانية للهجوم عبر الوسائط، مما يؤدي إلى تدهور كبير في الأداء وتوليد تسميات توضيحية عدائية مقبولة لغوياً ولكنها غير متسقة بصرياً.
في عالم الذكاء الاصطناعي سريع التطور، ظهر جيل جديد من أنظمة الكمبيوتر التي يمكنها الرؤية والقراءة في آن واحد. هذه الأنظمة، المعروفة باسم نماذج الرؤية واللغة، تم تدريبها على ملايين الأزواج من الصور والنصوص، لتتعلم كيف ترتبط صورة كلب بكلمة "كلب". لقد أصبحت هذه النماذج هي الأساس لأدوات تصف الصور، وتجيب على الأسئلة حول المشاهد، وتبحث عن الصور باستخدام اللغة الطبيعية. ولكي تعمل هذه الآلات بشكل جيد، يجب أن تربط باستمرار بين كلمات محددة وأجزاء محددة من الصورة، لتقرر أي البكسلات تنتمي لمفهوم "الحصان" وأيها تنتمي لـ "العشب". تعتمد هذه العملية على آلية داخلية معقدة تعمل كخريطة ديناميكية، تربط كل كلمة في الجملة بالتفاصيل البصرية ذات الصلة في الصورة الفوتوغرافية. وإذا انقطع هذا الاتصال، تفقد الآلة قدرتها على فهم ما تنظر إليه، مما قد يؤدي إلى الارتباك أو الأوصاف غير الصحيحة.
اكتشف باحثون في جامعة قوانغتشو نقطة ضعف دقيقة في كيفية حفاظ هذه الأنظمة على تلك الروابط. فقد وجدوا أنه من خلال وضع نمط صغير مصمم بعناية على صورة ما، يمكنهم خداع النموذج ليعيد ترتيب خريطته الداخلية للروابط بين الكلمات والصور. هذا النمط، الذي يبدو كبقعة بسيطة من اللون أو الملمس، لا يحتاج لأن يكون تمويهاً معقداً؛ بل يعمل كإشارة صامتة تجعل النموذج يتجاهل الأجزاء الأكثر أهمية في الصورة ويركز على مناطق الخلفية غير ذات الصلة. وعند حدما يحدث هذا، يظل النموذج قادراً على التحدث بطلاقة وسلاسة لغوية، لكن ما يقوله لا يعود متوافقاً مع الصورة. فقد يصف حقلاً من الزهور بينما تظهر الصورة بوضوح حصاناً، أو يدعي أن شخصاً يمسك بوعاء من الرامن بينما تحتوي الصورة فقط على غرفة معيشة. ويطلق الباحثون على هذه الظاهرة اسم "طبيعي ولكن خاطئ"، لتسليط الضوء على ثغرة حيث تظل ثقة الآلة عالية حتى مع انهيار فهمها.
قام الفريق بتطوير طريقة لإنشاء هذه الأنماط الخداعية، والتي أطلقوا عليها اسم "الهجوم متعدد المستويات". وخلافاً للمحاولات السابقة التي حاولت ببساطة طمس الصورة أو تشويه ألوانها، يستهدف هذا النهج الطريقة المحددة التي يربط بها النموذج بين النص والرؤية. قام الباحثون ببناء نظام يرسم قوة الروابط بين الكلمات وأجزاء الصورة، وهو ما يشبه إنشاء رسم بياني (Graph) يوضح أي الكلمات تولي اهتمامها لأي بكسلات. ثم قاموا بتدريب هجومهم لزيادة الفرق بين الرسم البياني لصورة نظيفة والرسم البياني لنفس الصورة مع وجود البقعة عليها. ومن خلال القيام بذلك، أجبروا النموذج على قطع الروابط القوية بين الكلمات الرئيسية وأدلتها البصرية، مع إنشاء روابط جديدة كاذبة بمناطق خلفية عشوائية في الوقت نفسه. تمت دمج هذه العملية مع أهداف أخرى لضمان بقاء الهجوم مخفياً وأن يبدو النص الناتج طبيعياً، رغم كونه غير صحيح واقعياً.
كانت نتائج تجاربهم مذهلة. فعندما طبقوا البقعة التي أنتجوها على صور من مجموعة بيانات قياسية، انخفضت قدرة النموذج على إيجاد الصورة الصحيحة لنص معين بشكل كبير. وفي الاختبارات التي طُلب فيها من النظام مطابقة جملة مع الصورة الصحيحة، انخفض معدل نجاحه من أكثر من سبعين بالمائة إلى تسعة بالمائ percent فقط. كان الهجوم فعالاً للغاية لدرجة أنه نجح حتى في الصور التي لم يرها النظام من قبل، مما يشير إلى أن الخلل جوهري في كيفية معالجة النموذج للمعلومات وليس مجرد خطأ بسيط في صور معينة. وفي المهام التي توجب على النموذج وصف صورة، تدهورت جودة الوصف؛ حيث انخفضت درجات دقة النظام بشكل كبير، ومع ذلك ظلت الجمل التي أنتجها صحيحة نحوياً ومتنوعة، متجنبة الهراء المتكرر الذي غالباً ما يشير إلى نظام معطل. وقد أكد هذا أن النموذج لم يكن يفشل في التحدث فحسب، بل كان يصف بثقة واقعاً غير موجود.
اختبر الباحثون أيضاً النظام في الأسئلة البصرية، مثل عد الأشياء أو تحديد العلاقات المكانية. تسبب الهجوم في فشل النموذج في هذه المهام المنطقية أيضاً، حيث انخفضت معدلات النجاح من ما يقرب من ثمانين بالمائة إلى اثني عشر بالمائة فقط. في كثير من الحالات، كان النموذج يجيب على سؤال حول كلب بوصف لقطة، أو يدعي وجود ثلاثة حيوانات بينما يوجد واحد فقط. وما جعل هذه الإخفاقات لافتة للنظر بشكل خاص هو أن خريطة الانتباه الداخلية للنموذج قد أُعيدت صياغتها بالكامل. أظهرت عمليات التصور أن النموذج، الذي يركز عادةً انتباهه على الموضوع الرئيسي للصورة، بدأ يتجاهل الموضوع تماماً ويركز بدلاً من ذلك على السماء الفارغة أو العشب. لم تكن البقعة تخفي الشيء، بل جعلت النموذج ينظر بعيداً عنه فحسب.
يشير هذا العمل إلى أن الجيل الحالي من هذه الأنظمة القوية هو أكثر هشاشة مما كان يُعتقد سابقاً. وبينما ركزت اختبارات الأمان السابقة على ما إذا كان يمكن جعل الصورة تبدو كشيء آخر بالنسبة للعين البشرية، يظهر هذا البحث أن الخطر يكمكمن في كيفية تنظيم الآلة لفهمها الخاص. لا يتطلب الهجوم جعل الآلة تخدع لترى جسماً مختلفاً، بل يكفي إقناعها بأن الجسم الذي تراه غير ذي صلة. ومن خلال تعطيل الرسم البياني الداخلي الذي يربط الكلمات بالبكسلات، أثبت الباحثون أن نمطاً ثابتاً وصغيراً يمكن أن يسبب سلسلة من الأخطاء عبر مهام مختلفة، من البحث عن الصور إلى الإجابة على أسئلة معقدة. وتخلص الدراسة إلى أنه مع زيادة دمج هذه النماذج في الحياة اليومية، سيكون فهم وحماية خرائط الاتصال الداخلية هذه بنفس أهمية حماية الصور نفسها. وتعد هذه النتائج بمثابة تذكير بأن أكثر الأنظمة تقدماً يمكن أن تضل طريقها، ليس بتغيير ما تراه، بل بتغيير كيفية تفكيرها فيما تراه.
ملخص تقني: تضليل نموذج BLIP عبر الرقع التناظرية (MAGA)
بيان المشكلة تعتمد نماذج ما قبل التدريب البصري-اللغوي (VLP)، ولا سيما البنى القائمة على الاندماج مثل BLIP، على آليات الانتباه عبر الوسائط (cross-modal attention) لإنشاء تفاعلات دقيقة بين الرموز النصية والقطع البصرية (visual patches). وبينما تركز الهجمات التناظرية الحالية على هذه النماذج بشكل أساسي على الاضطرابات على مستوى البكسل (تعديل بكسلات الصورة مباشرة) أو الاضطرابات على مستوى الميزات (فصل تمثيلات الصور والنصوص في الفضاء الكامن)، فإن ضعف بنى الانتباه عبر الوسائط الداخلية لا يزال غير مستكشف بشكل كافٍ. ويفترض المؤلفون أن رسوم الانتباه المتقاطعة (CAGs) الكثيفة داخل مشفرات الاندماج هي نقطة فشل حرجة. فالهجمات الحالية غالبًا ما تفشل في استهداف إعادة توصيل الطوبولوجيا (topological rewiring) لروابط الارتباط بين الرموز والقطع، وهو أمر ضروري لربط المفاهيم النصية بالأدلة البصرية. وبناءً على ذلك، هناك حاجة إلى طريقة هجوم تستهدف تحديدًا ضعف مستوى الانتباه لإحداث "هلوسات طبيعية ولكن خاطئة" — وهي مخرجات تكون فصيحة لغويًا ولكنها غير متسقة دلاليًا مع المدخلات البصرية.
المنهجية: هجوم رسم بياني للانتباه متعدد المستويات (MAGA) يقترح البحث إطار عمل MAGA، وهو إطار هجوم رقعة تناظرية عالمية مصمم لتعطيل نموذج BLIP من خلال استراتيجية تحسين متعددة المستويات. تعمل الطريقة تحت نموذج تهديد "الصندوق الأبيض" (white-box) حيث يمتلك المهاجم إمكانية الوصول إلى معاملات النموذج المستهدف ومصفوفات الانتباه المتوسطة أثناء التدريب، ولكن يتم نشر الرقعة المتعلمة فقط.
يتكون الإطار من ثلاثة مكونات أساسية:
رسوم الانتباه المتقاطعة (CAGs): يبني المؤلفون رسوم CAGs لتمثيل علاقات الانتباه بين الرموز النصية والقطع البصرية. ومن خلال حساب متوسط درجات الانتباه عبر الرؤوس (heads) وتطبيق عتبة δg، يقومون بتحويل مصفوفة درجات الانتباه إلى رسم بياني ثنائي الأجزاء (bipartite graph) موزون. تمثل العقد الرموز والقطع، بينما تمثل الحواف أوزان الانتباه. يقوم شبكة تلافيفية رسومية (GCN) مشتركة بتشفير كل من رسوم CAG النظيفة والتناظرية إلى تمثيلات على مستوى الرسم البياني (gclean و gadv).
دالة الهدف متعددة المستويات: يعمل MAGA على تحسين رقعة تناظرية عالمية pθ بشكل مشترك عن طريق تقليل دالة خسارة إجمالية (Ltotal) تجمع بين ثلاثة أهداف متميزة:
هدف مستوى الانتباه (Lattention): هذا هو الجوهر المبتكر للطريقة. فهو يعمل على تعظيم المسافة الجيبية تمامًا (cosine distance) بين تمثيلات CAG النظيفة والتناظرية. ومن خلال إجبار الهياكل الرسومية على التباعد، يقوم الهجوم بتعطيل اتصالات "الرمز-إلى-القطعة" المحددة (على سبيل المثال، إضعاف الرابط بين كلمة "حصان" والمنطقة البصرية التي تحتوي على الحصان)، مما يؤدي فعليًا إلى إعادة توصيل منطق النموذج الداخلي.
هدف مستوى الميزة (Lfeature): يضمن هذا المكون بقاء الهجوم كرقعة عالمية من خلال تضمين قيد للوفاء البصري (تقليل تشوه البكسل وعدم التشابه الهيكلي عبر SSIM) وحدًا لتعطيل المحاذاة. فهو يقلل من التشابه بين الصورة التناظرية والنص المقترن بها مع الحفاظ على الاتساق مع الميزات البصرية للصورة الأصلية.
هدف مستوى الوصف (Lcaption): لمنع المخرجات المتدهورة أو المتكررة، تم إدخال حد للانتشار الدلالي. فهو يعظم المسافة بين الوصف التناظري المولد والوصف الحقيقي، مع تشجيع التنوع بين الأوصاف داخل الدفعة الصغيرة (mini-batch). وهذا يعزز توليد أوصاف فصيحة ومتنوعة، ولكنها خاطئة واقعيًا.
التحسين والنشر: يتم تدريب مولد الرقعة باستخدام رمز كامن ثابت وقناع مكاني. أثناء التحسين، تظل معاملات نموذج BLIP المستهدف ثابتة؛ حيث يتم تحديث مولد الرقعة ومشفر الرسم البياني المساعد فقط. وبمجرد تدريبه، يمكن تطبيق الرقعة العالمية على صور غير مرئية مسبقًا دون الحاجة لمزيد من الوصول إلى النموذج المستهدف أو تدرجاته.
المساهمات الرئيسية
تحديد ضعف الانتباه: يبحث هذا العمل ويثبت أن توزيعات الانتباه عبر الوسائط في مشفرات اندماج BLIP هي نقطة ضعف متميزة وقابلة للاستغلال، ومنفصلة عن نقاط ضعف الميزات العالمية أو البكسل.
صياغة الهجوم القائم على CAG: يقدم المؤلفون رسوم الانتباه المتقاطعة (CAGs) كتمثيل هيكلي لارتباطات الرمز والقطعة. ويقترحون طريقة لتعظيم التفاوت بين رسوم CAG النظيفة والتناظرية، مما يؤدي فعليًا إلى "إعادة توصيل" انتباه النموذج الداخلي.
إطار عمل MAGA متعدد المستويات: يقترح البحث إطارًا موحدًا يحسن بشكل مشترك تعطيل مستوى الانتباه، والمحاذاة على مستوى الميزة، والانتشار الدلالي على مستوى الوصف.
التخفي عبر تنظيم التنوع: من خلال إدخال حد تنظيم التنوع، تنجح الطريقة في إحداث هلوسات "طبيعية ولكن خاطئة"، حيث ينتج النموذج أوصافًا مقبولة لغويًا ولكنها منفصلة دلاليًا عن المحتوى البصري.
النتائج التجريبية قيم المؤلفون MAGA على معايير MS COCO و Pascal Sentences و BLIP-VQA عبر مهام استرجاع الصورة والنص، ووصف الصور، والإجابة على الأسئلة البصرية (VQA).
الاسترجاع (Retrieval): تفوق MAGA بشكل كبير على النماذج المرجعية (بما في ذلك PGD و UAP و AdvPatch و AdvCLIP). في MS COCO، خفض Recall@1 من الصورة إلى النص من 72.3% (نظيف) إلى 9.0%، مقارنة بـ 20.0% لأقوى نموذج مرجعي (AdvCLIP). كما أظهر قدرة قوية على الانتقال (transferability) إلى مجموعة بيانات Pascal Sentences خارج نطاق التوزيع.
الوصف (Captioning): تسبب الهجوم في انخفاض حاد في درجات CIDEr (من 82.0 إلى 12.8) مع الحفاظ على تنوع معجمي عالٍ (درجة Distinct-2 بلغت 0.40) ودرجة إدراك (perplexity) معقولة. وهذا أكد ظاهرة "الطبيعي ولكن الخاطئ".
الإجابة على الأسئلة البصرية (VQA): خفض MAGA دقة VQA الإجمالية من 78.5% إلى 12.4%، مع تجاوز معدلات نجاح الهجوم (ASR) لـ 80% في فئات الأسئلة (نعم/لا)، والعدّ، والمكان.
دراسات الاستئصال (Ablation Studies): أكدت التجار nghiệm أن هدف مستوى الانتباه (تعطيل CAG) يوفر دفعة كبيرة مقارنة بالهجمات على مستوى الميزة أو مستوى الوصف وحدها، مما يؤكد ضرورة النهج متعدد المستويات.
الأهمية والادعاءات يزعم البحث أن MAGA يسلط الضوء على ثغرة حرجة في آليات الاستدلال لنماذج التأسيس متعددة الوسائط. ومن خلال إثبات أن تعطيل طوبولوجيا الانتباه عبر الوسائط أكثر فعالية من تشويه الميزات العالمية، يؤكد العمل على أهمية تقييم متانة هياكل الانتباه الداخلية، وليس فقط خرائط المدخلات والمخرجات. إن القدرة على توليد مخرجات فصيحة ولكنها غير متسقة بصريًا تشير إلى أن نماذج VLP الحالية قد تعتمد بشكل كبير على الأولويات اللغوية الداخلية عند تعطيل الربط البصري، مما يشكل مخاطر للنشر الموثوق لهذه النماذج في التطبيقات الحرجة للسلامة. ويخلص المؤلفون إلى أن تقييم المتانة يجب أن يمتد ليشمل التفاعلات الدقيقة داخل مشفرات الاندماج لضمان موثوقية الأنظمة المستقبلية متعددة الوسائط.