← أحدث الأبحاث
💻 computer science

Misguiding BLIP with Adversarial Patches: Multi-level Attacks with Cross-modal Attention Graphs in BLIP

تقترح هذه الورقة MAGA، وهو إطار هجوم مبتكر متعدد المستويات يستغل ثغرات الانتباه عبر الوسائط في نماذج BLIP من خلال بناء وتعطيل رسوم بيانية للهجوم عبر الوسائط، مما يؤدي إلى تدهور كبير في الأداء وتوليد تسميات توضيحية عدائية مقبولة لغوياً ولكنها غير متسقة بصرياً.

المؤلفون الأصليون: yingying hu, minghao mo, peng zhang

نُشر 2026-09-24
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: yingying hu, minghao mo, peng zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في عالم الذكاء الاصطناعي سريع التطور، ظهر جيل جديد من أنظمة الكمبيوتر التي يمكنها الرؤية والقراءة في آن واحد. هذه الأنظمة، المعروفة باسم نماذج الرؤية واللغة، تم تدريبها على ملايين الأزواج من الصور والنصوص، لتتعلم كيف ترتبط صورة كلب بكلمة "كلب". لقد أصبحت هذه النماذج هي الأساس لأدوات تصف الصور، وتجيب على الأسئلة حول المشاهد، وتبحث عن الصور باستخدام اللغة الطبيعية. ولكي تعمل هذه الآلات بشكل جيد، يجب أن تربط باستمرار بين كلمات محددة وأجزاء محددة من الصورة، لتقرر أي البكسلات تنتمي لمفهوم "الحصان" وأيها تنتمي لـ "العشب". تعتمد هذه العملية على آلية داخلية معقدة تعمل كخريطة ديناميكية، تربط كل كلمة في الجملة بالتفاصيل البصرية ذات الصلة في الصورة الفوتوغرافية. وإذا انقطع هذا الاتصال، تفقد الآلة قدرتها على فهم ما تنظر إليه، مما قد يؤدي إلى الارتباك أو الأوصاف غير الصحيحة.

اكتشف باحثون في جامعة قوانغتشو نقطة ضعف دقيقة في كيفية حفاظ هذه الأنظمة على تلك الروابط. فقد وجدوا أنه من خلال وضع نمط صغير مصمم بعناية على صورة ما، يمكنهم خداع النموذج ليعيد ترتيب خريطته الداخلية للروابط بين الكلمات والصور. هذا النمط، الذي يبدو كبقعة بسيطة من اللون أو الملمس، لا يحتاج لأن يكون تمويهاً معقداً؛ بل يعمل كإشارة صامتة تجعل النموذج يتجاهل الأجزاء الأكثر أهمية في الصورة ويركز على مناطق الخلفية غير ذات الصلة. وعند حدما يحدث هذا، يظل النموذج قادراً على التحدث بطلاقة وسلاسة لغوية، لكن ما يقوله لا يعود متوافقاً مع الصورة. فقد يصف حقلاً من الزهور بينما تظهر الصورة بوضوح حصاناً، أو يدعي أن شخصاً يمسك بوعاء من الرامن بينما تحتوي الصورة فقط على غرفة معيشة. ويطلق الباحثون على هذه الظاهرة اسم "طبيعي ولكن خاطئ"، لتسليط الضوء على ثغرة حيث تظل ثقة الآلة عالية حتى مع انهيار فهمها.

قام الفريق بتطوير طريقة لإنشاء هذه الأنماط الخداعية، والتي أطلقوا عليها اسم "الهجوم متعدد المستويات". وخلافاً للمحاولات السابقة التي حاولت ببساطة طمس الصورة أو تشويه ألوانها، يستهدف هذا النهج الطريقة المحددة التي يربط بها النموذج بين النص والرؤية. قام الباحثون ببناء نظام يرسم قوة الروابط بين الكلمات وأجزاء الصورة، وهو ما يشبه إنشاء رسم بياني (Graph) يوضح أي الكلمات تولي اهتمامها لأي بكسلات. ثم قاموا بتدريب هجومهم لزيادة الفرق بين الرسم البياني لصورة نظيفة والرسم البياني لنفس الصورة مع وجود البقعة عليها. ومن خلال القيام بذلك، أجبروا النموذج على قطع الروابط القوية بين الكلمات الرئيسية وأدلتها البصرية، مع إنشاء روابط جديدة كاذبة بمناطق خلفية عشوائية في الوقت نفسه. تمت دمج هذه العملية مع أهداف أخرى لضمان بقاء الهجوم مخفياً وأن يبدو النص الناتج طبيعياً، رغم كونه غير صحيح واقعياً.

كانت نتائج تجاربهم مذهلة. فعندما طبقوا البقعة التي أنتجوها على صور من مجموعة بيانات قياسية، انخفضت قدرة النموذج على إيجاد الصورة الصحيحة لنص معين بشكل كبير. وفي الاختبارات التي طُلب فيها من النظام مطابقة جملة مع الصورة الصحيحة، انخفض معدل نجاحه من أكثر من سبعين بالمائة إلى تسعة بالمائ percent فقط. كان الهجوم فعالاً للغاية لدرجة أنه نجح حتى في الصور التي لم يرها النظام من قبل، مما يشير إلى أن الخلل جوهري في كيفية معالجة النموذج للمعلومات وليس مجرد خطأ بسيط في صور معينة. وفي المهام التي توجب على النموذج وصف صورة، تدهورت جودة الوصف؛ حيث انخفضت درجات دقة النظام بشكل كبير، ومع ذلك ظلت الجمل التي أنتجها صحيحة نحوياً ومتنوعة، متجنبة الهراء المتكرر الذي غالباً ما يشير إلى نظام معطل. وقد أكد هذا أن النموذج لم يكن يفشل في التحدث فحسب، بل كان يصف بثقة واقعاً غير موجود.

اختبر الباحثون أيضاً النظام في الأسئلة البصرية، مثل عد الأشياء أو تحديد العلاقات المكانية. تسبب الهجوم في فشل النموذج في هذه المهام المنطقية أيضاً، حيث انخفضت معدلات النجاح من ما يقرب من ثمانين بالمائة إلى اثني عشر بالمائة فقط. في كثير من الحالات، كان النموذج يجيب على سؤال حول كلب بوصف لقطة، أو يدعي وجود ثلاثة حيوانات بينما يوجد واحد فقط. وما جعل هذه الإخفاقات لافتة للنظر بشكل خاص هو أن خريطة الانتباه الداخلية للنموذج قد أُعيدت صياغتها بالكامل. أظهرت عمليات التصور أن النموذج، الذي يركز عادةً انتباهه على الموضوع الرئيسي للصورة، بدأ يتجاهل الموضوع تماماً ويركز بدلاً من ذلك على السماء الفارغة أو العشب. لم تكن البقعة تخفي الشيء، بل جعلت النموذج ينظر بعيداً عنه فحسب.

يشير هذا العمل إلى أن الجيل الحالي من هذه الأنظمة القوية هو أكثر هشاشة مما كان يُعتقد سابقاً. وبينما ركزت اختبارات الأمان السابقة على ما إذا كان يمكن جعل الصورة تبدو كشيء آخر بالنسبة للعين البشرية، يظهر هذا البحث أن الخطر يكمكمن في كيفية تنظيم الآلة لفهمها الخاص. لا يتطلب الهجوم جعل الآلة تخدع لترى جسماً مختلفاً، بل يكفي إقناعها بأن الجسم الذي تراه غير ذي صلة. ومن خلال تعطيل الرسم البياني الداخلي الذي يربط الكلمات بالبكسلات، أثبت الباحثون أن نمطاً ثابتاً وصغيراً يمكن أن يسبب سلسلة من الأخطاء عبر مهام مختلفة، من البحث عن الصور إلى الإجابة على أسئلة معقدة. وتخلص الدراسة إلى أنه مع زيادة دمج هذه النماذج في الحياة اليومية، سيكون فهم وحماية خرائط الاتصال الداخلية هذه بنفس أهمية حماية الصور نفسها. وتعد هذه النتائج بمثابة تذكير بأن أكثر الأنظمة تقدماً يمكن أن تضل طريقها، ليس بتغيير ما تراه، بل بتغيير كيفية تفكيرها فيما تراه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →