MASCing: Configurable Mixture-of-Experts Behavior via Activation Steering Masks
تُعد MASCing إطار عمل خفيف الوزن ولا يتطلب إعادة تدريب، يقوم بتهيئة نماذج خليط الخبراء (MoE) لسيناريوهات سلامة متنوعة عبر استخدام بديل يعتمد على شبكة LSTM لتحسين أقنعة التوجيه على بوابات التوجيه، مما يتيح تعزيز أو كبح سلوكيات محددة بشكل مستهدف دون المساس بالمنفعة العامة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل نموذج لغة ضخم (مثل تلك التي تشغل روبوتات الدردشة) كأنه أوركسترا تقنية ضخمة وعالية الدقة.
في النماذج القديمة، كان كل عازف (معلمة/Parameter) يعزف على آلتة الموسيقية لكل نوتة تغنيها الأوركسترا. كان ذلك صاخبًا، ومكلفًا، وبطيئًا.
نماذج خليط الخبراء (Mixture-of-Experts - MoE) مختلفة؛ فهي تشبه أوركسترا ضخمة، حيث يتم استدعاء مجموعة صغيرة ومحددة من العازفين فقط لعزف كل نوتة، بينما يظل الباقون صامتين. "المايسترو" (الموجه/Router) هو من يقرر أي مجموعة من عازفين أو أربعة سيعزفون لكل كلمة. هذا يجعل النموذج أسرع وأرخص في التشغيل.
ومع ذلك، فإن هذا النظام لديه مشكلة جديدة: المايسترو هو الحلقة الأضعف.
المشكلة: "المايسترو السيئ"
لأن عددًا قليلًا فقط من العازفين يعزف في كل مرة، يمكن لمحتال ذكي (مهاجم) أن يحاول خداع المايسترو لاستدعاء المجموعة الخاطئة من العازفين.
- السيناريو أ (كسر الحماية/Jailbreak): يطلب المحتال من النموذج القيام بشيء سيء (مثل كتابة دليل لصنع قنبلة). عادةً ما يرد النموذج بـ "لا، هذا خطير". لكن المحتال قد يطلب ذلك بطريقة غير مباشرة عبر عدة جولات، مما يربك المايسترو ويجعله يستدعي العازفين "المؤذين" بدلاً من عازفي "الأمان".
- السيناريو ب (الإفراط في الرفض): أحيانًا، يكون النموذج حذرًا أكثر من اللازم. فقد يرفض كتابة قصة عن شرير خيالي لأنه يعتقد أن كلمة "شرير" تعني "شيئًا سيئًا". قد يرغب المطور في السماح للنموذج بكتابة هذه القصة في سياق معين، لكن المايسترو يستمر في استدعاء عازفي "الرفض".
عادةً، لإصلاح هذا، عليك طرد الأوركسترا بأكملها وتعيين عازفين جدد (إعادة التدريب)، وهو أمر يستغرق شهورًا ويكلف ثروة طائلة.
الحل: MASCing (التكوين التوجيهي لتنشيط خليط الخبراء)
تقدم الورقة البحثية تقنية MASCing (MoE Activation Steering Configuration). فكر في هذا ليس كطرد للأوركسترا، بل كتقديم نوتة موسيقية خاصة ومكتوبة مسبقًا (قناع توجيهي/Steering Mask) للمايسترو، لتقوده ببراعة لاختيار العازفين المناسبين للمهمة، دون تغيير العازفين أنفسهم.
إليك كيف تعمل تقنية MASCing في ثلاث خطوات بسيطة:
1. "المحقق البديل" (تعلم النمط)
أولاً، يقوم الباحثون بتدريب ذكاء اصطناعي صغير وسريع (LSTM) ليعمل كمحقق. يراقب هذا المحقق ملاحظات "المايسترو" (اللوجيتس الخاصة بالتوجيه/Routing Logits) أثناء حديث النموذج.
- يتعلم: "عندما يرى المايسترو هذه الملاحظات المحددة، فإن النموذج عادةً ما يرفض الإجابة".
- ويتعلم أيضًا: "عندما يرى المايسترو هذه الملاحظات، فإن النموذج عادةً ما يوافق على كتابة قصة".
- والأهم من ذلك، المحقق لا ينظر فقط إلى من "عزف بالفعل"؛ بل ينظر إلى الملاحظات التي كان المايسترو يفكر في عرضها، مما يحافظ على جميع المعلومات الخفية.
2. إيجاد "دائرة الأمان" (القناع)
بعد ذلك، يكتشف المحقق بالضبط أي الملاحظات في نوتة المايسترو تحتاج إلى تعديل للحصول على النتيجة المطلوبة.
- إذا أردنا إيقاف إجابة سيئة، يجد المحقق الملاحظات التي تؤدي إلى "الأمان" ويعززها، بينما يخمد الملاحظات التي تؤدي إلى "الأذى".
- وإذا أردنا السماح بإجابة محددة (مثل المحتوى المخصص للبالغين في سياق آمن)، فإنه يجد الملاحظات التي تؤدي إلى "الرفض" ويخمدها، بينما يعزز ملاحظات "الامتثال".
هذا ينتج ما يسمى بـ "قناع التوجيه" (Steering Mask). تخيله مثل قلم التحديد (Highlighter) الذي يحدد أماكن معينة في نوتة المايسترو الموسيقية. هو لا يغير الموسيقى نفسها؛ بل يخبر المايسترو فقط: "مهلًا، انتبه جيدًا لهذه الملاحظات تحديدًا".
3. الأداء (الاستدلال/Inference)
عندما يعمل النموذج فعليًا، يقوم النظام بتطبيق هذا القناع في الوقت الفعلي.
- ينظر المايسترو إلى الملاحظات.
- يضيف القناع "دفعة" بسيطة للملاحظات.
- يتأثر المايسترو بهذه الدفعة، ويختار عازفي "الأمان" بدلاً من العازفين "المؤذين" (أو العكس).
ماذا حققوا؟
اختبر الباحثون هذه التقنية على سبعة نماذج مختلفة من نوع (MoE) بهدفين مختلفين تمامًا:
إيقاف كسر الحماية (الدرع): استخدموا MASCing لجعل النماذج أفضل في مقاومة المحتالين الذين يحاولون خداعها لقول أشياء سيئة خلال محادثة طويلة.
- النتيجة: ارتفعت قدرة النماذج على حظر الطلبات السيئة من 52% إلى 84%.
- التشبيه: أصبح المايسترو أصعب في الخداع لاستدعاء العازفين "السيئين".
السماح بمحتوى محدد (المفتاح): استخدموا MASCing لجعل النماذج أقل عرضة لرفض الطلبات المتعلقة بالمحتوى المخصص للبالغين عندما يكون هذا المحتوى مسموحًا به وفقًا للسياسة.
- النتيجة: ارتفعت نسبة موافقة النماذج على كتابة هذه القصص من 52% إلى 82%.
- التشبيه: توقف المايسترو عن الذعر واستدعاء عازفي "الرفض" عند كل قصة عن شرير، مما سمح للعازفين "المبدعين" بالعزف.
لماذا هذا الأمر مميز؟
- لا إعادة تدريب: لا تحتاج لإعادة تعليم الأوركسترا بالكامل. أنت فقط تغير النوتة الموسيقية (القناع).
- السرعة: تدريب "المحقق" يستغرق حوالي 5 دقائق فقط على جهاز كمبيوتر قوي. وتطبيق القناع لا يستغرق أي وقت تقريبًا.
- المرونة: يمكنك استبدال القناع فورًا. إذا تغيرت القواعد غدًا، يمكنك ببساطة إنشاء قناع جديد.
- الأمان: لا يؤدي ذلك إلى إتلاف قدرة النموذج على إجراء العمليات الحسابية أو كتابة رسائل البريد الإلكتروني العادية. إنه فقط يضبط جزء "الأمان" في عملية اتخاذ القرار.
باختًا، MASCing هي طريقة خفيفة وفورية لإخبار ذكاء اصطناعي ذكي: "لهذا الموقف المحدد، يرجى الاستماع إلى مجموعة مختلفة من الخبراء"، دون الحاجة إلى إعادة بناء الذكاء الاصطناعي من الصفر.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.