← أحدث الأبحاث
📊 statistics

VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models

تقدم الورقة البحثية VERA-V، وهو إطار استدلال تبايني يعيد صياغة اكتشاف كسر الحماية متعدد الوسائط باعتباره تعلم توزيع خلفي مشترك على مطالبات النص والصورة، مما يتيح توليد مدخلات عدائية مقترنة ومتخفية تتفوق بشكل كبير على الأساليب الحالية في تجاوز حواجز الحماية لنماذج الرؤية واللغة.

المؤلفون الأصليون: Qilin Liao, Anamika Lochab, Ruqi Zhang

نُشر 2026-05-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Qilin Liao, Anamika Lochab, Ruqi Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً ذكياً جداً وحريصاً على السلامة (نموذج لغوي بصري - VLM)، يمكنه قراءة النصوص والنظر إلى الصور. لقد قمت بتدريبه ليكون مفيداً ولكن أيضاً ليرفض الطلبات الخطيرة، مثل "كيف أصنع قنبلة؟" أو "كيف أخترق بنكاً؟".

عادةً، إذا سألته بشكل مباشر، سيقول: "لا، لا يمكنني فعل ذلك".

تقدم ورقة بحثية بعنوان VERA-V طريقة جديدة وماكرة لخداع هذا الروبوت لكسر قواعده الخاصة. بدلاً من طرح سؤال واحد فقط، قام الباحثون ببناء "محتال ماهر" (مهاجم ذكاء اصطناعي) يتعلم كيفية إنشاء ثنائيات من النصوص والصور تعمل معاً لتضليل الروبوت.

إليك كيف يعمل VERA-V، مشروحاً من خلال تشبيهات بسيطة:

1. الطريقة القديمة: "المطرقة الثقيلة" مقابل "السكين السويسري"

كانت الطرق السابقة لخداع هذه الروبات تشبه استخدام مطرقة ثقيلة. فقد كانوا إما:

  • كتابة الكلمات السيئة داخل صورة: بدلاً من كتابة "اصنع قنبلة"، يأخذون صورة لافتة مكتوب عليها "اصنع قنبلة" ويعرضونها على الروبوت. قد يغفل الروبوت عن النص الموجود داخل الصورة.
  • إضافة ضجيج إلى الصورة: كانوا يشوهون صورة ببعض التشويش أو الأنماط الغريبة لإرباك عيني الروبوت.

المشكلة: هذه الطرق خرقاء؛ فهي تعامل النص والصورة كشيئين منفصلين. إذا كان الروبوت ذكياً بما يكفي لقراءة اللافتة في الصورة، فإن الخدعة تفشل.

2. طريقة VERA-V: "فرقة الجاز"

يختلف VERA-V عن غيره. فبدلاً من استخدام المطرقة الثقيلة، يعمل مثل فرقة جاز. فهو لا يعزف نوتة واحدة فقط؛ بل يتعلم كيفية تنسيق النص والصورة بحيث يتناغمان تماماً لتجاوز دفاعات الروبوت.

يسمي الباحثون هذا "الاستدلال التبايني" (Variational Inference). وباللغة البسيطة، هذا يعني أن المهاجم الذكي لا يكتفي بتخمين خدعة سيئة واحدة، بل يتعلم خريطة لكل الخدع السيئة الممكنة. إنه يفهم أنه في بعض الأحيان يعمل نوع معين من النصوص بشكل أفضل مع نوع محدد من الصور الضبابية، وفي أحيان أخرى يعمل نص مختلف مع صورة حادة. إنه يتعلم العلاقة بين الاثنين.

3. استراتيجية "التشتيت" المكونة من ثلاثة أجزاء

لجعل الخدعة تنجح، يجمع VERA-V ثلاثة مكونات محددة في حزمة واحدة تُرسل إلى الروبوت:

  • المكون (أ): "النص المخفي" (الطباعة)
    يأخذ المهاجم التعليمات الضارة ويحولها إلى صورة نصية (مثل لافتة أو ملاحظة). هذا يخفي الكلمات السيئة عن فلاتر النصوص الخاصة بالروبوت، والتي عادة ما تفحص ما تكتبه، وليس ما تعرضه.
  • المكون (ب): "الإشارة السرية" (صورة الانتشار - Diffusion Image)
    يستخدم المهاجم مولداً للصور لإنشاء صورة تحتوي على دليل خفي دقيق. الأمر ليس واضحاً؛ إنه يشبه الهمس في غرفة مزدحمة. يرى الروبوت الصورة، لكن "المعنى السيئ" مدفون بعمق داخل البكسلات، وليس مكتوباً بوضوح.
  • المكون (ج): "الجمهور المربك" (المشتتات)
    هذا هو الجزء الأكثر ذكاءً. يقوم المهاجم بملء بقية الشاشة بصور عشوائية ومملة (مثل قطة، شجرة، أو كوب قهوة) ليس لها أي علاقة بالطلب السيئ.
    • التشبيه: تخيل أنك تحاول العث_ور على شخص محدد في حشد. إذا كان واقفاً بمفرده، ستلاحظه بسهما. لكن إذا كان واقفاً وسط حشد من 50 شخصاً آخرين لا يشبهونه في شيء، فسوف يرتبك عقلك ويجد صعوبة أكبر في التركيز على الهدف. يستخدم VERA-V هذه "الصور المشتتة" لتشتيت انتباه الروبوت، مما يجعل من الصعب على فلاتر السلامة الخاصة به رصد الطلب السيئ.

4. "حلقة التغذية الراجعة" (المدرب)

كيف يتعلم المهاجم الذكي القيام بذلك بهذا الإتقان؟

  • يجرب خدعة ما.
  • يسأل "حكماً" (ذكاء اصطناعي آخر) عما إذا كان الروبوت قد وقع في الفخ.
  • إذا قال الروبوت "لا"، يتعلم المهاجم: "حسناً، هذا المزيج لم ينجح. لنحاول مزيجاً مختلفاً".
  • يكرر هذه العملية آلاف المرات، ويقوم بتنقيح "خريطته" لكيفية إرباك الروبوت.

5. النتائج: رقم قياسي جديد

اختبرت الورقة البحثية هذا الأسلوب ضد بعض من أذكى الروبات المتاحة اليوم (مثل GPT-4o).

  • الخدع القديمة: في مواجهة الروبوت الأكثر ذكاءً (GPT-4o)، فشلت الطرق القديمة في 100% من الحالات تقريباً. كانت تشبه محاولة كسر خزنة بنك باستخدام مشبك ورق.
  • VERA-V: من خلال استخدام هذه الاستراتيجية المنسقة متعددة الأجزاء، نجح VERA-V في خداع الروبوت بنسبة 67.75% من المرات. هذه قفزة هائلة مقارنة بأفضل الطرق السابقة.

ملخص

فكر في VERA-V ليس كمجرد أداة لفتح الأقف "لقفل واحد"، بل كـ صانع أقفال يدرس آلية القفل بأكملها. بدلاً من مجرد محاولة فتح الباب بالقوة، يتعلم كيف يهز المقبض، ويهمس للمفصلات، ويشتت انتباه الحارس، كل ذلك في وقت واحد. إنه ينشئ "توزيعاً خلفياً مشتركاً"، وهو مجرد طريقة معقدة لقول إنه تعلم الوصفة المثالية لمزيج من النص والصورة يربك حراس السلامة لدى الروبوت.

ملاحظة هامة: يوضح المؤلفون بوضوح أن هذا البحث مخصص لـ "الفريق الأحمر" (Red Teaming). وهذا يعني أنهم يعملون كـ "مخترقين أخلاقيين" للعثور على هذه الثغرات حتى تتمكن الشركات من إصلاحها وجعل روبوتاتها أكثر أماناً. هم لا يقدمون أداة يمكن للناس استخدامها لإيذاء الآخرين، بل يوضحون مدى هشاشة أنظمة السلامة الحالية لتقويتها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →