← أحدث الأبحاث
💻 computer science

Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models

تقترح هذه الورقة هجوم الصقل الهرمي (HRA)، وهو إطار عمل عدائي متعدد الوسائط وعالمي يعزز قابلية النقل والكفاءة لنماذج الرؤية واللغة من خلال الاستفادة من التدرجات الزمنية الهرمية لاضطرابات الصور ونمذجة الجمل الهرمية لاضطرابات النصوص للتغلب على القيود الحسابية للهجمات الحالية المحددة لكل عينة.

المؤلفون الأصليون: Peng-Fei Zhang, Zi Huang

نُشر 2026-02-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Peng-Fei Zhang, Zi Huang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك أمين مكتبة آلي ذكي للغاية. أمين المكتبة هذا (نموذج لغوي بصري - Vision-Language Model) مذهل في مطابقة الصور مع أوصافها. إذا عرضت عليه صورة قطة، يمكنه فوراً أن يخبرك: "هذه قطة ريشية تجلس على سجادة".

ولكن، مثل أي نظام ذكي، لديه نقاط عمياء. فقد وجد الباحثون أنه إذا أجريت تغييرات طفيفة، غير مرئية تقريباً، على الصورة أو الكلمات، يمكنك خداع أمين المكتبة وجعله يبدو أحمقاً تماماً. على سبيل المثال، يمكنك تعديل صورة قطة بما يكفي لتجعل الروبوت يعتقد أنها محمصة خبز، أو تغيير كلمة "قطة" إلى "كلب" بطريقة لا تراها العين البشرية، مما يجعل الروبوت يصاب بالارتباك.

يقدم هذا البحث طريقة جديدة وأكثر ذكاءً لخداع هؤلاء الروبوتات، تسمى HRA (هجوم الصقل الهرمي - Hierarchical Refinement Attack). وإليك كيف يعمل، مقسماً إلى مفاهيم بسيطة:

1. المشكلة: نهج "الواحد لا يناسب الجميع"

قبل هذا البحث، إذا أراد المخترقون خداع أمين المكتبة الروبوتي، كان عليهم إنشاء خدعة مخصصة لكل صورة على حدة.

  • الطريقة القديمة: تخيل أنك تريد خداع حارس أمن. الطريقة القديمة هي أن تقف أمام الحارس وتهمس بكلمة سر محددة لهذا الحارس تحديداً، وتأمل أن تنجح. إذا أردت خداع حارس آخر في مبنى آخر، فعليك تعلم كلمة سر جديدة تماماً من البداية. هذا يستغرق وقتاً طويلاً وهو بطيء جداً للأنظمة الكبيرة.
  • الهدف: أراد الباحثون إنشاء "مفتاح رئيسي"—خدعة واحدة تعمل على أي صورة وعلى أي أمين مكتبة روبوتي، بغض النظر عن أي مبنى (نموذج) أنت فيه.

2. الحل: "المفتاح الرئيسي" (HRA)

بنى المؤلفون نظاماً يتعلم خدعة عالمية واحدة للصور وواحدة للنصوص.

الجزء أ: خدعة الصورة (زخم "رؤية المستقبل")

عندما تحاول إيجال "المفتاح الرئيسي" المثالي لصورة ما، فأنت تقوم أساساً بالسير عبر متاهة ضبابية بحثاً عن المخرج (النقطة التي يصاب فيها الروبوت بالارتباك).

  • المشكلة: الطرق القياسية تشبه المتنزه الذي ينظر فقط إلى الأرض أمام قدميه مباشرة. غالباً ما يعلقون في حفرة صغيرة (نهاية صغرى محلية - local minimum) ظناً منهم أنهم وجدوا المخرج، لكنهم في الواقع عالقون في طريق مسدود.
  • إصلاح HRA: منح الباحثون المتنزه رؤية بلورية (رؤية عبر كرة بلورية). فبدلاً من مجرد النظر إلى حيث جاء (الخطوات الماضية)، فإنه يتطلع أيضاً إلى أين قد يذهب في الخطوات القليلة القادمة (الخطوات المستقبلية).
    • تشبيه: تخيل أنك تقود سيارة. السائق العادي ينظر فقط إلى الطريق أمامه مباشرة. إذا رأى حفرة، فقد ينحرف إلى خندق. سائق HRA ينظر إلى الخريطة ويتنبأ أيضاً بانحناء الطريق على بعد 100 متر. هذا يساعده على القيادة بسلاسة حول الحفرة وإيجاد المخرج الحقيقي، مما يجعل الخدعة تعمل على العديد من السيارات (النماذج) المختلفة.

الجزء ب: خدعة النص (الكلمات "ذات التأثير القوي")

النصوص صعبة لأنك لا تستطيع مجرد "تمويه" كلمة كما يمكنك فعل ذلك مع بكسل في صورة. عليك استبدال الكلمات.

  • المشكلة: إذا استبدلت كلمة عشوائية، فقد لا يهتم الروبوت. إذا استبدلت الكلمة الخطأ، فإن الجملة ستظل منطقية بالنسبة للروبوت.
  • إصلاح HRA: يعمل النظام كـ محرر أدبي يبحث عن الكلمات الأكثر أهمية في قصة ما.
    • يسأل: "إذا حذفت هذه الكلمة، هل تنهار القصة؟"
    • إنه ينظر إلى الكلمات داخل جملة واحدة (داخل الجملة - Intra-sentence) وكيف ترتبط الجمل ببعضها البعض (بين الجمل - Inter-sentence).
    • بمجرد العثور على "الكلمات ذات التأثير القوي" (الأكثر تأثيراً)، فإنه ينشئ استبدالاً عالمياً. على سبيل المثال، قد يقرر أن استبدال كلمة "كلب" بكلمة "ممارسة التزلج بالمظلات" هو أكثر شيء مربك للقيام به عبر جميع الجمل.
    • تشبيه: تخيل لعبة "الهاتف المكسور" (التواصل عبر الهمس). إذا همست بتغيير لكلمة مملة مثل "الـ"، فلن يلاحظ أحد. ولكن إذا همست بتغيير لأكثر الكلمات إثارة مثل "انفجار"، فإن القصة بأكملها تتغير. يجد HRA كلمات "الانفجار" هذه ويستبدلها في كل مكان.

3. لماذا يعد هذا أمراً بالغ الأهمية

  • إنه عالمي: لا تحتاج إلى إعادة تدريب الخدعة لكل روبوت جديد. تتعلمها مرة واحدة، وتعمل على الجميع تقريباً.
  • إنه أقوى: لأنه ينظر إلى "المستقبل" للصورة و"أهمية" الكلمات، فإنه لا يعلق في الطرق المسدودة. إنه ينشئ خدعة يصعب الدفاع ضدها.
  • إنه جرس إنذار: من خلال إظهار مدى سهولة خداع هذه النماذج القوية من الذكاء الاصطناعي باستخدام مفتاح عالمي واحد، يأمل المؤلفون أن يبني المطورون روبوتات أقوى وأكثر متانة لا يمكن خداعها بسهولة.

الملخص

فكر في HRA كصانع أقفال محترف لا يكتفي بفتح كل قفل على حدة. بدلاً من ذلك، يدرس ميكانيكا القفل (نموذج الذكاء الاصطناعي)، ويتنبأ بكيفية سقوط قطع القفل (التدرجات المستقبلية)، ويجد المفتاح الرئيسي الواحد (الاضطراب العالمي) الذي يفتح كل الأبواب، سواء كانت صورة لقطة أو جملة عن كلب.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →