← أحدث الأبحاث
🤖 AI

Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models

تقترح هذه الورقة إطار عمل **CR-VLM**، وهو إطار عمل مبتكر يستخدم توجيه التنشيط لتمكين الرفض القابل للضبط في نماذج الرؤية واللغة، مما يسمح بمحاذاة سلامة تكيفية تخفف من كل من نقص الرفض والإفراط في الرفض من خلال متجه رفض، وآلية بوابية، ووحدة تعزيز رؤية مضادة للواقع.

المؤلفون الأصليون: Jiaxi Yang, Shicheng Liu, Yuchen Yang, Dongwon Lee

نُشر 2026-02-10
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiaxi Yang, Shicheng Liu, Yuchen Yang, Dongwon Lee

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً رقمياً فائق الذكاء (نموذج لغوي بصري) يمكنه رؤية الصور والإجابة على الأسئلة. عادةً ما يتم تدريب هؤلاء المساعدين باستخدام دليل سلامة "واحد يناسب الجميع". إذا سألت شيئاً مثيراً للجدل قليلاً، فقد يتوقف عن العمل ويقول: "لا يمكنني الإجابة على ذلك"، حتى لو كان السؤال مناسباً تماماً بالنسبة لك.

هذا يشبه أمين مكتبة يرفض التحدث مع أي شخص حول "السياسة" لأنه يعتقد أنها موضوع خطير — حتى لو كنت تريد فقط معرفة من هو العمدة الحالي! يُسمى هذا "الإفراط في الرفض" (over-refusal)، وهو يجعل المساعد محبطاً وغير مفيد.

تقدم ورقة بحثية بعنوان "التوجيه للقول لا" (Steering to Say No) نظاماً جديداً يسمى CR-VLM. إليك كيفية عمله، مشروحاً من خلال بعض التشبيهات البسيطة.

1. "الفلتر المخصص" (الرفض القابل للضبط)

بدلاً من كتاب قواعد واحد ضخم وصلب، يعمل CR-VLM مثل نظارات شمسية قابلة للتخصيص.

  • النموذج القياسي: الجميع يرتدي نفس النظارات الشمسية الداكنة. لا يمكنك رؤية أي شيء بوضوح، ويبدو كل شيء "محظوراً".
  • CR-VLM: يمكنك ضبط درجة التعتيم. إذا قلت للمساعد: "لا تتحدث معي عن البيتكوين"، فإنه يرتدي نظارات "ملونة بالبيتكوين". سيظل يجيب على الأسئلة المتعلقة بعلم الأحياء أو الفن بشكل مثالي، ولكن في اللحظة التي يظهر فيها سؤال عن البيتكوين، تتحول النظارات إلى اللون الأسود تماماً، ويقول المساعد: "عذراً، لا يمكنني مناقشة هذا الموضوع".

2. "التدريب بالإجبار المعلم" (ضبط الإشارة بشكل صحيح)

كيف يتعلم النموذج بالضبط كيف يقول "لا" دون أن يرتبك؟ يستخدم الباحثون حيلة تسمى "استخراج الإجبار المعلم" (Teacher-Forced Extraction).

  • التشبيه: تخيل تعليم طفل كيف يقول "لا" لشخص غريب. بدلاً من مجرد قول "قل لا"، أنت تقوم بتمثيل مسرحية. تتظاهر بأنك الغريب، ثم تهمس فوراً بالرد الصحيح في أذنه: "قل: لا، شكراً لك".
  • من خلال "إجبار" النموذج على رؤية كيف يبدو الرفض المثالي أثناء التدريب، يقوم الباحثون بإنشاء "خريطة" واضحة جداً لما "يشعر" به الرفض داخل دماغ النموذج.

3. "آلية البوابة" (منع أمين المكتبة العبوس)

هناك مشكلة كبيرة مع جعل النموذج يرفض الأشياء وهي أنه غالباً ما يصبح "آمناً أكثر من اللازم" ويبدأ في رفض كل شيء (مشكلة أمين المكتبة العبوس). ولحل ذلك، أضافوا "بوابة" (Gate).

  • التشبيه: فكر في حارس أمن عند مدخل حفلة موسيقية.
    • إذا كان معك تذكرة (سؤال ضمن النطاق)، يراك الحارس ويتنحى جانباً ليسمح لك بالمرور.
    • إذا لم يكن معك تذكرة (سؤال خارج النطاق)، يقف الحارس أمام الباب.
  • تضمن "البوابة" عدم قيام النموذج بالتعامل مع سؤال في الرياضيات كأنه سؤال محظور عن طريق الخطأ.

4. "تعزيز الرؤية" (النظر إلى الأدلة)

أحياناً قد يرفض النموذج سؤالاً لمجرد استخدام كلمات معينة، حتى لو كانت الصورة بريئة تماماً. أضاف الباحثون وحدة للتأكد من أن النموذج ينظر بالفعل إلى الصورة قبل اتخاذ قرار الرفض.

  • التشبيه: تخيل حارس أمن يرفض دخولك إلى مبنى لأنك ترتدي قبعة "مريبة"، دون حتى النظر إلى هويتك.
  • يجبر CR-VLM الحارس على التحقق من الهوية (الصورة). إنه يضمن أنه إذا أراد النموذج قول "لا"، فذلك لأنه رأى بالفعل شيئاً في الصورة ينتهك قواعدك الخاصة.

ملخص: لماذا يهم هذا؟

باخت-صر، تنتقل هذه الورقة بنا من السلامة "الغبية" (حيث يكون النموذج خائفاً من كل شيء فحسب) نحو السلامة "الذكية". إنها تسمح للمستخدمين بوضع حدودهم الخاصة، مما يجعل المساعدين الذكيين يحترمون قواعدك للغاية وفي الوقت نفسه مفيدين للغاية في كل شيء آخر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →