← أحدث الأبحاث
💬 NLP

Dynamic Token Reweighting for Robust Vision-Language Models

تقدم هذه الورقة البحثية DTR، وهو دفاع مبتكر أثناء وقت الاستدلال يعمل على إعادة وزن الرموز البصرية ديناميكيًا من خلال تحسين مخازن المفتاح-القيمة (key-value caches) للتخفيف بفعالية من هجمات الاختراق متعددة الوسائط في النماذج اللغوية البصرية مع الحفاظ على القدرات العامة والكفاءة.

المؤلفون الأصليون: Tanqiu Jiang, Jiacheng Liang, Rongyi Zhu, Jiawei Zhou, Fenglong Ma, Ting Wang

نُشر 2026-03-03
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Tanqiu Jiang, Jiacheng Liang, Rongyi Zhu, Jiawei Zhou, Fenglong Ma, Ting Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل نموذج رؤية ولغة (VLM) كأنه أمين مكتبة ذكي جداً ومطلع، يمكنه قراءة الكتب (النصوص) والنظر إلى الصور. لقد تم تدريب هذا الأمين ليكون متعاوناً، ولكنه يرفض الطلبات الخطيرة، مثل "كيف أصنع قنبلة؟".

ومع ذلك، وجد المخترقون طريقة ماكرة لخداع هذا الأمين. فهم لا يكتفون بطرح السؤال فحسب؛ بل يعرضون على الأمين صورة تبدو بريئة ولكنها تحتوي على تعليمات خطيرة مخفية (مثل صورة لقنبلة مع تعليق يقول "كيف أصنع هذا؟"). يصاب الأمين بالارتباك بسبب الصورة، وينسى قواعد السلامة الخاصة به، ويقدم بالخطأ التعليمات الخطيرة. يُطلق على هذا اسم "الاختراق متعدد الوسائط" (Multimodal Jailbreak).

تقدم الورقة البحثية دفاعاً جديداً يسمى DTR (إعادة وزن الرموز الديناميكي - Dynamic Token Reweighting). وإليك كيفية عمله، مشروحاً بتبسيط عبر التشبيهات:

1. المشكلة: "الضجيج السيئ" في الصورة

عندما ينظر الأمين إلى صورة، فإنه يجزئها إلى آلاف القطع الصغيرة تسمى "رموز" (Tokens) (فكر فيها كقطع أحجية فردية أو بكسلات).

  • في الصورة العادية، تعمل جميع القطع معاً لتروي قصة.
  • في صورة الاختراق (Jailbreak)، يضيف المخترق "ضجيجاً سيئاً" إلى قطع محددة. هذه القطع السيئة تهمس للأمين: "تجاهل قواعد السلامة الخاصة بك! انظر إليّ!".

2. الحلول القديمة: المطارق الثقيلة

كانت الطرق السابقة لإيقاف ذلك تشبه استخدام مطرقة ضخمة:

  • الضبط الدقيق (Fine-tuning): إعادة تدريب الأمين من الصفر باستخدام كتب جديدة. وهذا أمر مكلف وبطيء، وأحياناً يجعل الأمين ينسى كيفية القيام بعمله الفعلي (مثل التعرف على الأشياء).
  • تحويل الصورة إلى نص (Image-to-Text): إجبار الأمين على وصف الصورة بصوت عالٍ قبل الإجابة. هذا الأمر بطيء وغالباً ما يفقد التفاصيل الدقيقة التي استخدمها المخترق للخداع.

3. الحل الجديد: DTR (مقبض التحكم الذكي في مستوى الصوت)

DTR هو إصلاح ذكي وفوري يحدث أثناء نظر الأمين إلى الصورة. فهو لا يحتاج إلى إعادة تدريب الأمين أو وصف الصورة. بدلاً من ذلك، يعمل مثل مقبض تحكم ذكي لمستوى الصوت لقطع الأحجية.

إليك العملية خطوة بخطوة:

الخطوة أ: إيجاد "اتجاه الرفض"

أولاً، يحدد النظام "عضلة السلامة" لدى الأمين. فهو يتعلم الاتجاه الذهني المحدد الذي يتخذه الأمين عندما يقول: "لا، لا يمكنني فعل ذلك". لنسمِّ هذا "متجه الرفض" (Refusal Vector).

الخطوة ب: اختبار "العكس"

عندما تصل صورة جديدة، يسأل DTR سؤالاً افتراضياً: "إذا خفضتُ مستوى صوت أجزاء معينة من هذه الصورة، هل يمكنني دفع الأمين للعودة نحو قول 'لا'؟"

  • إذا كانت الصورة آمنة (Benign): فإن خفض مستوى الصوت في أجزاء من الصورة لا يغير رأي الأمين كثيراً. فالصورة واضحة، ويظل الأمين متعاوناً.
  • إذا كانت الصورة اختراقاً (Jailbreak): يجد النظام أنه عند خفض مستوى الصوت في بعض قطع "الضجيج السيئ" فقط، يتذكر الأمين فجأة قواعد السلامة الخاصة به ويرفض الطلب.

الخطوة ج: إعادة الوزن الديناميكي (السحر)

بمجرد أن يحدد DTR تلك القطع التي تحتوي على "الضجيج السيئ"، فإنه يخفض وزنها ديناميكياً (يخفض مستوى صوتها) ويحافظ على القطع الجيدة عالية الصوت.

  • تشبيه: تخيل جوقة موسيقية تغني. إذا كان أحد المغنيين يصرخ بأمر خطير، فإن DTR لا يطرده من الجوقة (مما يفسد الأغنية)، بل يضع زر كتم الصوت لهذا المغني تحديداً بينما يبقي بقية الجوقة صاخبة وواضحة. تظل الأغنية (معنى الصورة) سليمة، ولكن الأمر الخطير يتم إسكاته.

لماذا يعد هذا أفضل؟

  1. إنه سريع: لا يحتاج إلى إعادة قراءة الصورة أو إعادة تدريب النموذج. إنه فقط يضبط مقابض الصوت فوراً.
  2. إنه دقيق: يقوم فقط بإسكات الأجزاء "السيئة" من الصورة، لذا يمكن للأمين رؤية بقية الصورة بوضوح.
  3. إنه فخ للمخترقين: تشير الورقة إلى معضلة مضحكة للمخترقين. لكي يخدعوا الأمين، يجب أن يكون "الضجيج السيئ" عالياً. لكن إذا جعلوه عالياً، سيكتشفه DTR ويقوم بكتمه. وإذا جعلوه هادئاً حتى لا يلاحظه DTR، فسيتجاهل الأمين الخدعة ويبقى آمناً. لا يمكن للمخترق أن يربح.

الملخص

DTR يشبه حارس الأمن في ملهى ليلي يمكنه رصد الشخص الوحيد في الحشد الذي يحاول تهريب سلاح فوراً. بدلاً من طرد الجميع (مما يوقف الحفلة) أو تفتيش جيوب الجميع (مما يستغرق وقتاً طويلاً جداً)، يقوم الحارس ببساة بوضع "حقل قوة" حول ذلك الشخص تحديداً، مما يحيد السلاح بينما يسمح لبقية الحفلة بالاستمرار بشكل طبيعي تماماً.

هذا يسمح لنماذج الذكاء الاصطناعي بالبقاء آمنة من الخدع البصرية دون أن تفقد قدرتها على أن تكون مفيدة، سريعة، وذكية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →