← أحدث الأبحاث
🤖 machine learning

Minimizing Collateral Damage in Activation Steering

تقدم هذه الورقة إطاراً منهجياً لتقليل الأضرار الجانبية في توجيه التنشيط من خلال صياغته كمسألة تحسين مقيدة تأخذ في الاعتبار التكاليف غير الموحدة للاضطرابات عبر اتجاهات الميزات باستخدام مصفوفة العزم الثاني التجريبية للتنشيطات.

المؤلفون الأصليون: Tam Nguyen, Tu Anh Nguyen, Sina Alemohammad, Richard G. Baraniuk

نُشر 2026-05-05
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Tam Nguyen, Tu Anh Nguyen, Sina Alemohammad, Richard G. Baraniuk

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

الصورة الكبيرة: توجيه روبوت عملاق

تخيل أن النموذج اللغوي الكبير (LLM) هو روبوت ضخم ومعقد للغاية تعلم كيف يتحدث ويفكر. أحياناً، نريد تعديل سلوكه دون إعادة بناء الروبوت بالكامل. على سبيل المثال، قد نريده أن يكون أكثر صدقاً، أو أقل سمية، أو أكثر مرحاً.

لقد طور العلماء تقنية تسمى "توجيه التنشيط" (Activation Steering). فكر في هذا كأنه "جهاز تحكم عن بعد" يدفع أفكار الروبوت الداخلية (تنشيطاته) في اتجاه معين لتغيير مخرجاته.

المشكلة: تأثير "الجرافة"

تجادل الورقة البحثية بأن الطريقة التي يستخدم بها الناس جهاز التحكم هذا حالياً تشبه قيادة جرافة.

  • كيف تعمل الآن: أنت توجه الجرافة نحو هدف محدد (مثل "كن أكثر صدقاً") ثم تدفع.
  • الضرر: بينما تصيب الهدف، تقوم الجرافة أيضاً بسحق كل شيء آخر في طريقها. في عقل الروبوت، هذا يعني أنك بينما تجعله أكثر صدقاً، فإنك تجعله بالخطأ أسوأ في الرياضيات، أو أقل إبداعاً، أو أكثر ارتباكاً.
  • لماذا؟ تفترض الطرق الحالية أن عقل الروبوت متماثل تماماً (مثل كرة ملساء). يعتقدون أن الدفع في أي اتجاه يكلف نفس القدر من الطاقة. لكن عقل الروبوت في الواقع متعرج وغير مستوٍ (مثل سلسلة جبال). الدفع في اتجاه ما قد يجعلك تنزلق في وادٍ آمن، بينما الدفع في اتجاه آخر قد يسقطك من فوق منحدر.

يسمي المؤلفون هذا الضرر غير المقصود بـ "الأضرار الجانبية" (Collateral Damage).

الحل: COAST (نظام الملاحة عبر GPS)

يقترح المؤلفون طريقة جديدة تسمى COAST (تقليل الأضرار الجانبية لتوجيه التنشيط).

بدلاً من مجرد دفع الروبوت في خط مستقيم، يعمل COAST مثل نظام ملاحة ذكي (GPS) يعرف التضاريس.

  1. رسم الخرائط التضاريسية: قبل التوجيه، يقوم COAST برسم خريطة لعقل الروبوت (باستخدام بيانات حول كيفية تفكير الروبوت عادةً) ليرى أي الاتجاهات "آمنة" وأيها "خطيرة".
  2. إيجاد المسار الآمن: إذا كنت تريد دفع الروبوت نحو "الصدق"، فإن COAST لا يدفعه مباشرة هناك. بل يحسب المنحنى المحدد الذي يوصلك إلى "الصدق" مع الالتفاف حول الوديان الآمنة وتجنب المنحدرات.
  3. الهدف: تحقيق التغيير المطلوب (التوجيه) مع إحداث أقل قدر ممكن من الضرر لمهارات الروبوت الأخرى (مثل الرياضيات أو الكتابة).

تشبيه إبداعي: رحلة التنزه

تخيل أنك تتنزه في جزيرة ضخمة مليئة بالتلال (عقل الروبوت).

  • الهدف: تريد الوصول إلى مخيم محدد يسمى "الصدق" (الاتجاه المستهدف).
  • الطريقة القديمة (ActAdd/التوجيه القياسي): أنت فقط توجه بوصلتك نحو "الصدق" وتمشي في خط مستقيم. إذا كان الطريق يمر فوق منحدر صخري شديد الانحدار، فقد تسقط وتكسر ساقك (مما يضر بقدرة النموذج على حل الرياضيات).
  • طريقة COAST: لديك خريطة طبوغرافية. أنت تعلم أن المشي مباشرة نحو "الصدق" سيعبر وادياً خطيراً. لذا، يقودك COAST عبر مسار متعرج يلتف حول الوادي. ستصل في النهاية إلى "الصدق"، لكنك لن تكسر ساقك، ولن تفقد حقيبة ظهرك (مهارات النموذج الأخرى).

كيف أثبتوا نجاح الأمر

اختبر الباحثون هذه الطريقة على عدة نماذج ذكاء اصطناعي مختلفة (مثل Llama و Qwen). طلبوا من النماذج القيام بشيئين في آن واحد:

  1. الاختراق (Jailbreak): محاولة جعل النموذج يقول شيئاً يرفض قوله عادةً (لاختبار قوة التوجيه).
  2. البقاء ذكياً: الاستمرار في الإجابة على الأسئلة العادية بشكل صحيح (لاختبار ما إذا كان النموذج قد تعطل).

النتائج:

  • الطرق القديمة: عندما جعلوا النموذج يقول الشيء "المحظور"، أصبح النموذج أسوأ بكثير في الإجابة على الأسئلة العادية. لقد كانت مقايضة: حصلت على تغيير السلوك، لكنك فقدت الذكاء.
  • COAST: نجح في جعل النموذج يقول الشيء "المحظور" دون أن يجعله غبياً. لقد حافظ على ذكاء النموذج مع تغيير سلوكه في نفس الوقت.

الخلاًصة

تزعم الورقة أنه من خلال التعامل مع عقل الذكاء الاصطناعي كمنظر طبيعي معقد وغير مستوٍ بدلاً من مجرد كرة ملساء بسيطة، يمكننا "توجيهه" بدقة أكبر بكثير. يسمح لنا COAST بإصلاح السلوكيات السيئة أو إضافة سمات جديدة دون كسر الأشياء الجيدة التي كان يقوم بها الذكاء الاصطناعي بالفعل. إنه يحول "الدفع" العشوئي إلى "وخزة" دقيقة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →