← أحدث الأبحاث
💬 NLP

Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection

تقترح هذه الورقة طريقة OGPSA، وهي طريقة تعلم مستمر خفيفة الوزن تخفف من ضريبة المحاذاة في التدريب اللاحق للسلامة عن طريق إسقاط تدرجات السلامة على فضاء فرعي متعامد للحفاظ على قدرات النموذج العامة دون الحاجة إلى إعادة تشغيل البيانات واسعة النطاق.

المؤلفون الأصليون: Guanglong Sun, Siyuan Zhang, Liyuan Wang, Jun Zhu, Hang Su, Yi Zhong

نُشر 2026-05-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Guanglong Sun, Siyuan Zhang, Liyuan Wang, Jun Zhu, Hang Su, Yi Zhong

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح للورقة البحثية باستخدام لغة بسيطة وتشبيهات إبداعية.

المشكلة: "ضريبة السلامة"

تخيل أن لديك طباخاً بارعاً ومتعدد المواهب (نموذج الذكاء الاصطناعي). هذا الطباخ يمكنه طهي المأكولات الفرنسية المذهلة، وكتابة الشعر، وحل المسائل الرياضية المعقدة. ومع ذلك، فإنه أحياناً يقدم أطباقاً قد تكون سامة أو مسيئة عن طريق الخطأ.

لإصلاح ذلك، قمت بتعيين مدرب سلامة صارم لتدريب الطباخ على كيفية تجنب تقديم أطعمة سيئة. المدرب فعال جداً؛ فقد توقف الطباخ عن تقديم الأطباق السامة. لكن هناك مشكلة: أثناء تعلمه كيف يكون "آمناً"، نسي الطباخ كيفية طهي أطباقه الفرنسية الفاخرة أو كتابة الشعر. لقد أصبح آمناً، ولكنه أصبح أيضاً مملاً وأقل فائدة.

في عالم الذكاء الاصطناعي، يُسمى هذا "ضريبة المحاذاة" (Alignment Tax). فجعل الذكاء الاصطناعي أكثر أماناً غالباً ما يجعله "أقل ذكاءً" في وظائفه الأخرى.

السبب: ازدحام مروري في الدماغ

تشير الورقة البحثية إلى أن هذا يحدث بسبب "ازدحام مروري" داخل دماغ الذكاء الاصطناعي (بارامتراته الرياضية).

  • المهارات القديمة: تعلم الذكاء الاصطناعي ليكون عبقرياً عاماً أولاً. هذه المهارات مخزنة في "اتجاهات" أو مسارات محددة في دماغه.
  • قواعد السلامة الجديدة: عندما نعلم الذكاء الاصطناعي أن يكون آمناً، فإننا ندفع به في اتجاهات جديدة.
  • الاصطدام: لسوء الحظ، فإن الاتجاه المطلوب لتعلم "السلامة" غالباً ما يتداخل مع الاتجاه المطلوب للحفاظ على "المهارات العامة". عندما يحاول الذكاء الاصطناعي التحرك للأمام لتعلم السلامة، فإنه يصطدم بالخطأ بالمسارات المخصية لمهاراته العامة ويمسحها. الأمر يشبه محاولة المشي للأمام للوصول إلى باب السلامة، لكن طريقك مسدود بجدار يحمل مهاراتك الرياضية؛ ولكي تعبر، يجب عليك هدم ذلك الجدار.

الحل: OGPSA (الخطوة الجانبية)

يقترح المؤلفون طريقة جديدة تسمى OGPSA (إسقاط التدرج المتعامد من أجل محاذاة السلامة).

تخيل دماغ الذكاء الاصطناعي كأنه ساحة رقص ضخمة.

  • المهارات العامة هي منطقة محددة على الساحة حيث يعرف الذكاء الاصطناعي كيف يرقص جيداً.
  • هدف السلامة هو حركة رقص جديدة يحتاج الذكاء الاصطناعي لتعلمها.

الطريقة القديمة (التدريب الساذج): يحاول الذكاء الاصطناعي تعلم حركة السلامة الجديدة من خلال التحرك مباشرة نحوها. ولكن لأن حركة السلامة تشير مباشرة إلى منطقة "المهارات العامة"، فإن الذكاء الاصطناعي يدوس على أصابع قدميه بالخطأ وينسى كيف يرقص.

طريقة OGPSA:

  1. رسم خريطة المنطقة: أولاً، تأخذ الطريقة "لقطة سريعة" لمنطقة المهارات العامة. إنها تحدد بدقة أي الاتجاهات على ساحة الرقص ضرورية للحفاظ على تلك المهارات حية.
  2. الخطوة الجانبية: عندما يحتاج الذكاء الاصطناعي لتعلم قاعدة سلامة، تقوم OGPSA بحساب الحركة. إذا كانت هذه الحركة تحاول الدخول في منطقة "المهارات العامة"، فإن OGPSA تقطع هذا الجزء.
  3. النتيجة: يُجبر الذكاء الاصطناعي على اتخاذ خطوة جانبية. إنه يتحرك نحو هدف السلامة، ولكنه يفعل ذلك في اتجاه متعامد تماماً (بزاوية 90 درجة) مع منطقة المهارات العامة.

التشبيه: تخيل أنك تسير نحو هدف ما، ولكن قيل لك: "لا تدس على العشب". بدلاً من التوقف أو المشي فوق العشب، أنت تمشي على الرصيف الذي يمتد بموازاة العشب. لا تزال تصل إلى وجهتك (السلامة)، ولكنك لم تدعس أبداً على العشب (المهارات العامة).

لماذا تعمل هذه الطريقة بشكل جيد؟

  • خفيفة الوزن: على عكس الطرق الأخرى التي تتطلب من الذكاء الاصطناعي إعادة قراءة الكتب المدرسية القديمة باستمرار (إعادة عرض البيانات القديمة) لتذكر الأشياء، تحتاج OGPSA فقط إلى "فحص دوري" صغير لتذكر الاتجاهات التي يُمنع الاقتراب منها.
  • قابلة للتركيب والتشغيل: تعمل مع طرق تدريب مختلفة (مثل SFT وDPO) دون الحاجة لتغيير النظام بأكل.
  • النتائج: في اختباراتهم، سمح استخدام OGPSA للذكاء الاصطناعي بأن يصبح آمناً جداً دون أن يفقد الكثير من ذكائه العام. لقد حصل على "درجة سلامة" أفضل مع الحفاظ على "درجة فائدة" أعلى مقارنة بالتدريب القياسي.

الخلاصة

لا تدعي الورقة البحثية حل كل مشاكل السلامة أو جعل الذكاء الاصطناعي مثالياً. إنها ببساطة تقدم خدعة هندسية ذكية: عند تعليم الذكاء الاصطناعي كيف يكون آمناً، تأكد من أنك لا تعلمه بطريقة تجبره على نسيان ما يعرفه بالفعل. من خلال إجبار الذكاء الاصطناعي على تعلم السلامة "جانبياً" بدلاً من "مباشرة عبر" مهاراته، يمكننا الحفاظ على الذكاء الاصطناعي آمناً وذكياً في آن واحد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →