CBV: Clean-label Backdoor Attacks on Vision Language Models via Diffusion Models
تقترح هذه الورقة هجوم CBV، وهو هجوم باب خلفي ذو تسمية نظيفة على نماذج الرؤية واللغة يستفيد من نماذج الانتشار مع توجيه متعدد الوسائط وقناع يعتمد على GradCAM لتوليد عينات مسمومة طبيعية ومتوارية تحتوي على سمات صور محفزة مع الحفاظ على الوظائف الطبيعية للنموذج.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مساعداً آلياً ذكياً للغاية ومتعدد اللغات، يمكنه النظر إلى صورة ووصفها بدقة مثالية، أو الإجابة على أسئلة حول ما يحدث في المشهد. هذا هو نموذج الرؤية واللغة (VLM). إنه يشبه أمين مكتبة فائق القدرة يمكنه رؤية الكتب على الرف وإخبارك بالضبط عما تدور حوله.
الآن، تخيل أن مخترقاً يريد خداع هذا الروبوت. يريد زرع "فخ" سري داخل عقل الروبوت. يُسمى هذا هجوم الباب الخلفي (Backdoor Attack).
الطريقة القديمة: خدعة "الملصق المزيف"
في الماضي، كان المخترقون يحاولون تسميم بيانات تدريب الروبوت من خلال القيام بشيء واضح: كانوا يأخذون صورة لـ كلب، لكنهم يغيرون الملصق (الوصف النصي) ليقول "قطة".
- المشكلة: هذا يشبه محاولة تعليم طفل أن الكلب هو قطة عن طريق إظهار صورة كلب له والصراخ في وجهه: "هذه قطة!". الطفل (أو الروبوت) سيصاب بالارتباك في النهاية، لكن المفتش البشري سيكتشف الكذبة فوراً. "انتظر، هذا بوضوح كلب، لماذا يقول الملصق أنه قطة؟". لقد كان من السهل كشف الأمر.
الطريقة الجديدة: خدعة "السحر" الخاصة بـ CBV
تقدم هذه الورقة البحثية طريقة جديدة تسمى CBV (هجمات الباب الخلفي ذات الملصقات النظيفة عبر نماذج الانتشار). بدلاً من الكذب بشأن الملصق، يحافظ المخترق على صدق الملصق تماماً. إذا كانت الصورة لكلب، فإن الملصق سيظل يقول "كلب".
إذن، كيف يخدعون الروبوت؟ يستخدمون نموذج انتشار (Diffusion Model) (فكر فيه كرسام ذكاء اصطناعي سحري يمكنه إنشاء صور من الصفر عن طريق إزالة الضجيج ببطء).
إليك تشبيه لخطوات عمل CBV:
1. "المحفز العالمي" (الحبر غير المرئي)
بدلاً من وضع ملصق غريب أو نقطة حمراء زاهية على الصورة (مما قد يبدو مريباً)، يقوم المخترق بإنشاء اضطراب عدائي عالمي (UAP).
- التشبيه: تخيل وجود حبر خاص غير مرئي لا يغير شكل الصورة للعين البشرية، ولكنه يعمل كإشارة راديو سرية لا يسمعها إلا الروبوت. يتم تطبيق هذا "الحبر" على الصورة.
2. "القناع الذكي" (مشرط الجراح)
لا يريد المخترق العبث بالصورة بأكملها، لأن ذلك سيبدو غريباً. يستخدم أداة تسمى GradCAM لتحديد الجزء الأكثر أهمية في الصورة (مثل وجه الكلب).
- التشبية: فكر في هذا كمشرط جراح يستخدمه لملامسة العضو الذي يحتاج إلى إصلاح فقط، تاركاً بقية الجسم دون مساس. إنهم ينشئون "قناعاً" يقول: "غير البكسلات داخل هذه الدائرة فقط".
3. "الرسام السحري" (نموذج الانتشار)
هذا هو جوهر الورقة البحثية. يأخذ المخترق الصورة الأصلية ومحفز "الحبر غير المرئي"، ويطلب من نموذج الانتشار إعادة رسم الصورة داخل القناع.
- التشبيه: تخيل أن لديك صورة لصبي. تريد من الروبوت أن يعتقد أنه كلب عندما يرى "الحبر غير المرئي". أنت لا تكتفي بلصق ملصق كلب على وجه الصبي، بل تطلب من رسام سحري إعادة رسم وجه الصبي بلطف بقدر كافٍ فقط بحيث يسجل عقل الروبوت "ملامح كلب"، ولكن بالنسبة لعينيك البشرية، لا يزال يبدو تماماً مثل الصبي.
- يستخدم الرسام تقنية مطابقة الدرجة (Score Matching): الأمر يشبه استماع الرسام إلى أغنية معينة (المحفز) أثناء الرسم، مما يضمن أن النتيجة النهائية تتوافق مع "جو" الأغنية دون تغيير نوع الموسيقى نفسه.
4. "الدليل متعدد اللغات" (هامس النصوص)
للتأكد من وصول الرسالة للروبوت، يهمس المخترق أيضاً بالوصف النصي للمحفز (على سبيل المثال "كلب") للرسام أثناء عمله.
- التشبيه: الرسام لا ينظر فقط إلى الصورة؛ بل يقرأ أيضاً ملاحظة تقول: "تأكد من أن هذا يبدو ككلب بالنسبة للروبوت". هذا يضمن أن يربط عقل الروبوت بين الصورة والنص بشكل مثالي.
النتيجة: عملية السطو المثالية
عندما يتم تدريب الروبوت على هذه الصور "المسمومة":
- الوضع الطبيعي: إذا عرضت عليه صورة نظيفة لصبي، سيقول: "هذا صبي". (يعمل بشكل مثالي).
- وضع المحفز: إذا عرضت عليه الصورة مع "الحبر غير المرئي" (المحفز)، فسيقول فجأة: "هذا كلب"، رغم أن الملصق لا يزال يقول "صبي" والصورة تبدو كصبي بالنسبة لك.
لماذا هذا مخيف (ومذهل)؟
- إنه غير مرئي: على عكس الطرق القديمة التي تركت ضجيجاً فوضوياً أو غيرت الملصقات، تبدو هذه الصور الطبيعية بنسبة 100%. لا يمكن للبشر تمييز الفرق.
- إنه مخادع: بما أن الملصقات صحيحة ("كلب" للكلب، "صبي" للصبي)، فإن الأنظمة الآلية التي تتحقق من "عدم تطابق الملصقات" لن تكتشفه.
- إنه يعمل في كل مكان: اختبرت الورقة البحثية هذا على أربعة أنواع مختلفة من الروبوتات الذكية (VLMs) ونجح الأمر مع جميعها، على الرغم من أن المخترقين لم يكونوا يعرفون الأسرار الداخلية لهذه الروبوتات.
الخلاصة
لقد صنع المؤلفون أداة يمكنها إعادة برمجة عقل روبوت ذكي سراً لجعله يرتكب أخطاء محددة عند رؤية إشارة سرية، كل ذلك مع الحفاظ على مظهر بيانات تدريب الروبوت نظيفة وصادقة تماماً. كما أظهروا أن طرق الدفاع الحالية (الحراس الأمنيين) لا يمكنها كشف هذه الخدعة لأن الصور تبدو طبيعية للغاية.
باخت lập: إنه مثل تعليم روبوت أن يرى كلباً في صورة صبي، دون أن تخبر الروبوت أبداً "هذا كلب" ودون تغيير الصورة بطريقة يمكن للإنسان ملاحظتها.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.