Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models
تقترح هذه الورقة إطار عمل **CR-VLM**، وهو إطار عمل مبتكر يستخدم توجيه التنشيط لتمكين الرفض القابل للضبط في نماذج الرؤية واللغة، مما يسمح بمحاذاة سلامة تكيفية تخفف من كل من نقص الرفض والإفراط في الرفض من خلال متجه رفض، وآلية بوابية، ووحدة تعزيز رؤية مضادة للواقع.
المؤلفون الأصليون:Jiaxi Yang, Shicheng Liu, Yuchen Yang, Dongwon Lee
تخيل أن لديك مساعداً رقمياً فائق الذكاء (نموذج لغوي بصري) يمكنه رؤية الصور والإجابة على الأسئلة. عادةً ما يتم تدريب هؤلاء المساعدين باستخدام دليل سلامة "واحد يناسب الجميع". إذا سألت شيئاً مثيراً للجدل قليلاً، فقد يتوقف عن العمل ويقول: "لا يمكنني الإجابة على ذلك"، حتى لو كان السؤال مناسباً تماماً بالنسبة لك.
هذا يشبه أمين مكتبة يرفض التحدث مع أي شخص حول "السياسة" لأنه يعتقد أنها موضوع خطير — حتى لو كنت تريد فقط معرفة من هو العمدة الحالي! يُسمى هذا "الإفراط في الرفض" (over-refusal)، وهو يجعل المساعد محبطاً وغير مفيد.
تقدم ورقة بحثية بعنوان "التوجيه للقول لا" (Steering to Say No) نظاماً جديداً يسمى CR-VLM. إليك كيفية عمله، مشروحاً من خلال بعض التشبيهات البسيطة.
1. "الفلتر المخصص" (الرفض القابل للضبط)
بدلاً من كتاب قواعد واحد ضخم وصلب، يعمل CR-VLM مثل نظارات شمسية قابلة للتخصيص.
النموذج القياسي: الجميع يرتدي نفس النظارات الشمسية الداكنة. لا يمكنك رؤية أي شيء بوضوح، ويبدو كل شيء "محظوراً".
CR-VLM: يمكنك ضبط درجة التعتيم. إذا قلت للمساعد: "لا تتحدث معي عن البيتكوين"، فإنه يرتدي نظارات "ملونة بالبيتكوين". سيظل يجيب على الأسئلة المتعلقة بعلم الأحياء أو الفن بشكل مثالي، ولكن في اللحظة التي يظهر فيها سؤال عن البيتكوين، تتحول النظارات إلى اللون الأسود تماماً، ويقول المساعد: "عذراً، لا يمكنني مناقشة هذا الموضوع".
2. "التدريب بالإجبار المعلم" (ضبط الإشارة بشكل صحيح)
كيف يتعلم النموذج بالضبط كيف يقول "لا" دون أن يرتبك؟ يستخدم الباحثون حيلة تسمى "استخراج الإجبار المعلم" (Teacher-Forced Extraction).
التشبيه: تخيل تعليم طفل كيف يقول "لا" لشخص غريب. بدلاً من مجرد قول "قل لا"، أنت تقوم بتمثيل مسرحية. تتظاهر بأنك الغريب، ثم تهمس فوراً بالرد الصحيح في أذنه: "قل: لا، شكراً لك".
من خلال "إجبار" النموذج على رؤية كيف يبدو الرفض المثالي أثناء التدريب، يقوم الباحثون بإنشاء "خريطة" واضحة جداً لما "يشعر" به الرفض داخل دماغ النموذج.
3. "آلية البوابة" (منع أمين المكتبة العبوس)
هناك مشكلة كبيرة مع جعل النموذج يرفض الأشياء وهي أنه غالباً ما يصبح "آمناً أكثر من اللازم" ويبدأ في رفض كل شيء (مشكلة أمين المكتبة العبوس). ولحل ذلك، أضافوا "بوابة" (Gate).
التشبيه: فكر في حارس أمن عند مدخل حفلة موسيقية.
إذا كان معك تذكرة (سؤال ضمن النطاق)، يراك الحارس ويتنحى جانباً ليسمح لك بالمرور.
إذا لم يكن معك تذكرة (سؤال خارج النطاق)، يقف الحارس أمام الباب.
تضمن "البوابة" عدم قيام النموذج بالتعامل مع سؤال في الرياضيات كأنه سؤال محظور عن طريق الخطأ.
4. "تعزيز الرؤية" (النظر إلى الأدلة)
أحياناً قد يرفض النموذج سؤالاً لمجرد استخدام كلمات معينة، حتى لو كانت الصورة بريئة تماماً. أضاف الباحثون وحدة للتأكد من أن النموذج ينظر بالفعل إلى الصورة قبل اتخاذ قرار الرفض.
التشبيه: تخيل حارس أمن يرفض دخولك إلى مبنى لأنك ترتدي قبعة "مريبة"، دون حتى النظر إلى هويتك.
يجبر CR-VLM الحارس على التحقق من الهوية (الصورة). إنه يضمن أنه إذا أراد النموذج قول "لا"، فذلك لأنه رأى بالفعل شيئاً في الصورة ينتهك قواعدك الخاصة.
ملخص: لماذا يهم هذا؟
باخت-صر، تنتقل هذه الورقة بنا من السلامة "الغبية" (حيث يكون النموذج خائفاً من كل شيء فحسب) نحو السلامة "الذكية". إنها تسمح للمستخدمين بوضع حدودهم الخاصة، مما يجعل المساعدين الذكيين يحترمون قواعدك للغاية وفي الوقت نفسه مفيدين للغاية في كل شيء آخر.
ملخص تقني: التوجيه للرفض: الرفض القابل للضبط عبر توجيه التنشيط في نماذج اللغة الرؤية (CR-VLM)
1. بيان المشكلة
يعتمد محاذاة السلامة الحالي في نماذج اللغة الرؤية (VLMs) عادةً على آلية رفض من نوع "مقاس واحد يناسب الجميع". هذا النهج يتسم بالجمود ويفشل في مراعاة احتياجات المستخدم المتنوعة، أو اللوائح المحلية، أو القيود السياقية المحددة. يؤدي هذا إلى نمطين أساسيين من الفشل:
نقص الرفض (Under-refusal): يقوم النموذج بالإجابة على استفسارات ينبغي رفضها بناءً على قيود مستخدم محددة (على سبيل المثال، مستخدم يطلب من النموذج رفض جميع النصائح المالية).
الإفراط في الرفض (Over-refusal): يصبح النموذج "آمنًا أكثر من اللازم"، حيث يرفض الاستفسارات المشروعة وضمن النطاق لأن إشارة الرفض تُطبق بشكل واسع جدًا عبر فضاء التمثيل.
الحلول الحالية مثل هندسة الأوامر (System Prompt Engineering) هشة وسهلة التجاوز، بينما يعد الضبط الدقيق (Fine-tuning) مكلفًا حاسوبيًا ويصعب توسيعه لتلبية القيود الشخصية والمتطورة.
2. المنهجية: إطار عمل CR-VLM
يقترح المؤلفون CR-VLM، وهو إطار عمل قوي وفعال يستخدم توجيه التنشيط (Activation Steering) لإحداث رفض قابل للضبط دون تعديل أوزان نموذج (VLM) الأساسي. يتكون الإطار من ثلاثة ابتكارات تقنية جوهرية:
استخراج التنشيط القسري بواسطة المعلم (Teacher-Forced Activation Extraction): للتغلب على مشكلة إشارات الرفض الضعيفة في النماذج التي تفتقر إلى محاذاة سلامة ذاتية، يستخدم المؤلفون آلية "المعلم". بدلاً من الاعتماد على أوامر النظام (التي قد تفشل في تحفيز الرفض)، يقومون بإلحاق سلسلة رفض محددة مسبقًا (مثل "عذرًا،") بالعينات الخارجة عن النطاق أثناء مرحلة الاستخراج. هذا يجبر النموذج على حساب تنشيطات الرفض، مما يسمح بحساب متجه توجيه (Steering Vector) نظيف وعالي الجودة عبر حساب فرق المتوسطات لهذه التنشيطات.
آلية البوابة الانتقائية (Selective Gating Mechanism) (للحد من الإفراط في الرفض): لمنع النموذج من تطبيق إزاحة الرفض على جميع المدخلات، يقوم المؤلفون بتدريب نموذج معايرة خفيف الوزن. يتنبأ هذا النموذج بكيفية ضبط التنشيطات. وهو يستخدم آلية بوابة ومنظم تعامد (Orthogonality Regularizer - Lortho). يضمن المنظم أن اتجاه التحديث للعينات الخارجة عن النطاق منفصل رياضيًا عن اتجاه العينات داخل النطاق، مما يمنع "الإزاحة العالمية" التي تسبب الإفراط في الرفض.
التعزيز البصري المقابل للواقع (Counterfactual Vision Enhancement): لضمان عدم تجاهل النموذج للأدلة البصرية لصالح التوجيه النصي، قدم المؤلفون هدف معايرة مدرك للرؤية. يقومون بحساب إزاحة "مقابلة للواقع" عبر مقارنة تنشيطات الصور التي تقع داخل القيود مقابل الصور التي تقع خارج القيود. هذا يجبر التوجيه المتعلم على التوافق مع كيفية تغير التمثيلات البصرية عندما يكون الرفض مبررًا بصريًا.
3. المساهمات الرئيسية
الدراسة المنهجية الأولى: هي أول عمل يستقصي الرفض القابل للضبط (المتكيف مع المستخدم) تحديدًا ضمن السياق متعدد الوسائط لنماذج (VLMs).
حل خفيف الوزن وشامل (End-to-End): على عكس طرق التوجيه الصلبة، يوءفر CR-VLM وحدة معايرة قابلة للتدريب وخفيفة الوزن، وهي فعالة ولا تتطلب ضبطًا دقيقًا كاملًا للنموذج.
المحاذاة متعددة الوسائط: يعمل على سد الفجوة بين التوجيه النصي والتأسيس البصري (Visual Grounding)، مما يضمن أن الرفض مدفوع بكلتا الوسائط.
4. النتائج التجريبية
قيم المؤلفون CR-VLM على عدة نماذج (LLaVA-1.5, Idefics3, InstructBLIP) عبر مجموعتي بيانات (ScienceQA و MMMU).
دقة رفض عالية (EQ1): تفوق CR-VLM بشكل كبير على النماذج المرجعية (القائمة على الأوامر، والضبط الدقيق، والشخصية/Persona) في رفض الاستفسارات الخارجة عن النطاق، حيث حقق غالبًا معدلات رفض تتجاوز 90%.
أدنى حد من الإفراط في الرفض (EQ2): بينما تسبب الضبط الدقيق والتوجيه القائم على الشخصية غالبًا في معدلات عالية من الإفراط في الرفض (رفض الأسئلة الصالحة)، حافظ CR-VLM على معدلات منخفضة جدًا من الإفراط في الرفض، مما حافظ بفعالية على فائدة النموذج للاستفسارات داخل النطاق.
توازن متفوق (MB-Score): باستخدام مقياس MB-Score (وهو مقياس يوازن بين فعالية الرفض والقبول)، حقق CR-VLM باستمرار أعلى الدرجات، مما يثبت أنه يقدم أفضل توازن بين السلامة والمنفعة.
نجاح دراسة الاستبعاد (Ablation Success): أكدت دراسات الاستبعاد أن خسارة التعامد (Orthogonality Loss) حاسمة لمنع الإفراط في الرفض، وأن خسارة الرؤية (Vision Loss) ضرورية للحفاظ على التأسيس البصري أثناء عملية الرفض.
5. الأهمية
ينقل هذا العمل سلامة نماذج (VLM) من كونها قيدًا عالميًا ثابتًا إلى قدرة ديناميكية متكيفة مع المستخدم. من خلال تمكين "الرفض القابل للضبط"، يمهد هذا البحث الطريق لوكلاء ذكاء اصطناعي شخصيين يمكنهم احترام الحدود الفردية للمستخدم، أو الأخلاقيات المهنية، أو المتطلبات القانونية الإقليمية دون التكلفة الباهظة للضبط الدقيق المستمر. إنه يوفر مسارًا قابلًا للتوسع نحو نشر ذكاء اصطنا متعدد الوسائط أكثر مسؤولية وإدراكًا للسياق.