← أحدث الأبحاث
💻 computer science

Test-Time Attention Purification for Backdoored Large Vision Language Models

تقدم هذه الورقة CleanSight، وهي آلية دفاع في وقت الاختبار وخالية من التدريب، تخفف من هجمات الأبواب الخلفية في النماذج اللغوية البصرية الكبيرة عبر اكتشاف وتقليم الرموز البصرية التي تظهر سلوك "سرقة الانتباه" غير الطبيعي، مما يؤدي إلى تحييد المحفزات الخبيثة دون إعادة تدريب أو تدهور في أداء النموذج.

المؤلفون الأصليون: Zhifang Zhang, Bojun Yang, Shuo He, Weitong Chen, Wei Emma Zhang, Olaf Maennel, Lei Feng, Miao Xu

نُشر 2026-03-16
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhifang Zhang, Bojun Yang, Shuo He, Weitong Chen, Wei Emma Zhang, Olaf Maennel, Lei Feng, Miao Xu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعد روبوت ذكي للغاية ومتعدد اللغات (نموذج رؤية لغوي كبير أو LVLM) يمكنه النظر إلى الصور والإجابة على الأسئلة حولها. لقد قمت بتدريبه ليكون مفيداً، لكن مخترقاً زرع سراً "حبة سم" داخل دماغه أثناء عملية التدريب.

هذا السم هو باب خلفي (Backdoor). إنه يشبه شفرة سرية: إذا رأى الروبوت ملصقاً معيناً، صغيراً جداً وغير مرئي تقريباً (المُحفز/Trigger) في الصورة، فإنه يتجاهل كل شيء آخر وينطق برسالة خبيثة مثل: "لقد تم اختراقك هههه"، بغض النظر عن السؤال المطروح.

لفترة طويلة، اعتقد الخبراء أن الطريقة الوحيدة لإصلاح ذلك هي إعادة تدريب الروبوت من الصفر باستخدام بيانات نظيفة. لكن هذا يشبه طرد جميع الموظفين وتوظيف أشخاص جدد لمجرد أن شخصاً واحداً خطرت له فكرة سيئة؛ وهو أمر مكلف، بطيء، وقد تفقد فيه مهارات الروبوت الحالية.

تقدم هذه الورقة حلاً ذكياً وجديداً يسمى CleanSight. بدلاً من إعادة التدريب، يعمل CleanSight مثل حارس أمن عند الباب يتحقق من "عملية التفكير" لدى الروبوت في الوقت الفعلي قبل أن يجيب.

إليك كيف يعمل، باستخدام تشبيهات بسيطة:

1. المشكلة: "سرقة الانتباه"

في محادثة عادية، ينظر الروبوت إلى الصورة والسؤال، ويوازن انتباهه بين الاثنين.

  • الحالة الطبيعية: "السؤال يسأل عن الكلب، لذا سأنظر إلى الكلب في الصورة."
  • الحالة المخترقة: عندما يكون الملصق السري موجوداً، يصاب دماغ الروبوت بالارتباك. يعمل الملصق مثل المغناطيس. إنه يسرق كل انتباه الروبوت بعيداً عن السؤال وبقية الصورة. يتوقف الروبوت عن التفكير في المهمة ويبدأ في الهوس بالملصق.

يسمي المؤلفون هذا "سرقة الانتباه" (Attention Stealing). المُحفز لا يبدو مجرد ملصق فحسب؛ بل إنه يستولي على تركيز الروبوت.

2. الحل: CleanSight (شرطة التفكير)

لا يحاول CleanSight مسح الملصق من الصورة (لأن ذلك غالباً ما يفسد الصورة). بدلاً من ذلك، هو يراقب كيف يفكر الروبوت.

  • الخطوة 1: جهاز كشف الكذب (الكشف)
    يختلس CleanSight النظر داخل طبقات دماغ الروبوت. ويسأل: "هل يدفع الروبوت انتباهه بشكل مبالغ فيه للصورة ويتجاهل السؤال؟"
    إذا كان الروبوت "يسرق" الانتباه مثل المغناطيس، فإن CleanSight يصنف المدخلات على أنها مسمومة. إنه مثل جهاز كشف الكذب الذي يلاحظ أن الشخص يتصبب عرقاً ويتجنب التواصل البصري.

  • الخطوة 2: زر الكتم (التنقية)
    إذا تم رصد حالة اشتباه، لا يقوم CleanSight بحذف الصورة. بدلاً من ذلك، يقوم بإسكات الأجزاء المحددة من الصورة التي تسبب هذا الهوس.
    تخيل أن الروبوت ينظر إلى صورة قطة مع وجود ملصق عليها. يقول CleanSight: "حسناً، أرى أنك تحدق في ذلك الملصق. سأضع عصابة على عين ذلك الملصق فقط."
    الآن، لا يستطيع الروبوت رؤية المُحفز، فينسى الشفرة السرية ويعود للإجابة على السؤال بشكل طبيعي، ناظراً إلى القطة بدلاً من ذلك.

3. لماذا يعد هذا تغييراً جذرياً؟

  • لا حاجة لإعادة التدريب: لا تحتاج لإعادة تدريب الروبوت. أنت فقط تثبت برنامج "حارس الأمن" هذا، وسيعمل فوراً.
  • إنه دقيق: حاولت الطرق القديمة تشويه الصورة بأكملها لإخفاء الملصق، مما جعل الروبوت مرتبكاً وأقل ذكاءً. CleanSight "يعمي" الجزء السيئ فقط، مما يجعل الروبوت يبقى ذكياً ومفيداً.
  • يعمل في كل مكان: اختبرت الورقة هذا الحل على أنواع مختلفة من الروبوتات والعديد من أنواع الملصقات السرية (بعضها غير مرئي، وبعضها مدمج في الصورة). نجح CleanSight في إيقافها جميعاً بنسبة تقتر-100% دون جعل الروبوت أقل ذكاءً.

الخلاصة الكبرى

فكر في الذكاء الاصطناعي الذي يحتوي على باب خلفي كطالب تم تعليمه سراً أن يصرخ "حريق!" كلما رأى قلماً أحمر.

  • الدفاع القديم: رمي كتب الطالب ودراسته لمدة عام لكي يمحو تلك الحيلة.
  • CleanSight: تدخل الفصل، وترى الطالب يحدق في القلم الأحمر، ثم تغطي القلم بلطف بقطعة من الورق. يتوقف الطالب عن الصراخ ويحل مسألة الرياضيات بشكل صحيح.

CleanSight هو حل ذكي، خفيف الوزن، وفوري يحمي مساعدينا من الذكاء الاصطناعي من التعرض للاختطاف، مما يضمن بقاءهم مفيدين وآمنين دون الحاجة إلى تغيير شامل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →