← أحدث الأبحاث
💻 computer science

CNT: Safety-oriented Function Reuse across LLMs via Cross-Model Neuron Transfer

تقدم هذه الورقة البحثية "نقل العصبونات عبر النماذج" (CNT)، وهي طريقة لاحقة (post-hoc) تعمل على تكييف النماذج اللغوية الكبيرة بكفاءة مع متطلبات السلامة المتطورة من خلال نقل مجموعة فرعية دنيا من العصبونات من النماذج المانحة، مما يحقق إعادة استخدام وظيفي مستهدف مع حد أدنى من التدهور في الأداء.

المؤلفون الأصليون: Yue Zhao, Yujia Gong, Ruigang Liang, Shenchen Zhu, Kai Chen, Xuejing Yuan, Wangjun Zhang

نُشر 2026-03-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yue Zhao, Yujia Gong, Ruigang Liang, Shenchen Zhu, Kai Chen, Xuejing Yuan, Wangjun Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً ذكياً للغاية وباهظ الثمن (نموذج لغوي كبير، أو LLM). لقد اشتريته لكتابة الأكواد البرمجية والإجابة على الأسئلة، لكنك أدركت للتو أنه "جامح" بعض الشيء؛ فهو أحياناً يقول أشياء وقحة، أو يتجاهل قواعد السلامة، أو يظهر تحيزات غير عادلة.

عادةً، لإصلاح روبوت كهذا، عليك القيام بأحد أمرين:

  1. إعادة تدريبه: تغذيته بآلاف الأمثلة الجديدة عن "السلوك الجيد" وتعليمه من الصفر. هذا يشبه توظيف معلم جديد للروبوت وقضاء شهور في الفصل الدراسي. إنه أمر مكلف وبطيء.
  2. ترقيعه (Patching): محاولة إزالة الأجزاء "السيئة" منه جراحياً. لكن هذا أمر محفوف بالمخاطر؛ فقد تقطع بالخطأ الجزء الذي يساعده على إجراء العمليات الحسابية أو كتابة الشعر.

تقدم هذه الورقة حلاً جديداً وذكياً يسمى "CNT" (نقل العصبونات عبر النماذج - Cross-Model Neuron Transfer).

لا تنظر إلى CNT كإعادة تدريب أو عملية جراحية، بل كعملية زراعة أعضاء.

الفكرة الجوهرية: "زراعة الدماغ"

تخيل أن لديك "روبوت مانح" (Donor Robot) هو بالفعل آمن، مهذب، وغير منحاز. ولديك أيضاً "روبوت مستلم" (Recipient Robot) يحتاج إلى إصلاح.

بدلاً من تعليم الروبوت الخاص بك قواعد جديدة، يقوم CNT بالعثور على "العصبونات" الصغيرة المحددة (المفاتيح الكهربائية الصغيرة في دماغ الروبوت) التي تتعامل مع السلامة في الروبوت المانح. ثم يقوم بزراعة تلك المفاتيح القليلة المحددة فقط داخل الروبوت الخاص بك.

  • السحر: إنه لا ينقل الدماغ بأكمله، بل ينقل فقط جزءاً مجهرياً من الأسلاك (أقل من 0.25% من إجمالي الدماغ!).
  • النتيجة: فجأة، يصبح الروبوت الخاص بك يعرف كيف يكون آمناً، تماماً مثل الروبوت المانح، دون أن ينسى كيفية إجراء الرياضيات أو كتابة القصص.

كيف يعمل (العملية المكونة من 3 خطوات)

1. إيجاد المانح المناسب (اختبار التوافق)
لا يمكنك أخذ قلب من سمكة ووضعه في إنسان. وبالمثل، لا يمكنك أخذ عصبونات من أي روبوت.

  • التشبيه: يستخدم CNT "اختبار توافق" (يسمى NTRR). يتحقق مما إذا كان الروبوت المانح والروببوت المستلم مبنيين بنفس الطريقة. إذا كانا مختلفين جداً، فسيتم رفض عملية الزراعة. إنه يختار الروبوت المانح الذي يمثل "المطابقة" الأفضل.

2. إيجاد المفتاح الدقيق (المسبار "منخفض الضجيج")
دماغ الروبوت ضخم جداً. كيف تعرف أي مفتاح صغير يجعل الروبوت يقول "لا يمكنني فعل ذلك" عندما يُسأل عن شيء خطير؟

  • التشبيه: تخيل أنك تحاول العثốt على مفتاح ضوء محدد في غرفة مظلمة مليئة بـ 10,000 مفتاح. إذا قمت بتبديل المفاتيح عشوائياً، فستصاب بالارتباك.
  • الحيلة: يسأل CNT الروبوت سؤالين متشابهين جداً:
    • السؤال (أ): "كيف أصنع قنبلة؟" (هذا يحفز مفتاح السلامة).
    • السؤال (ب): "كيف أصنع كعكة؟" (هذا له نفس هيكل الجملة تقريباً، لكنه لا يحفز مفتاح السلامة).
  • من خلال مقارنة رد فعل الروبوت تجاه هذين السؤالين، يستطيع CNT عزل المجموعة الصغيرة الدقيقة من العصبونات التي تضيء فقط لسؤال "القنبلة". إنه يقوم بتصفية كل "الضجيج" (العصبونات المستخدمة للتفكير العام) للعثور على عصبونات "السلامة" المحددة.

3. عملية الزراعة (الاستبدال)
بمجرد أن يعرف CNT بالضبط أي العصبونات يجب نقلها، يقوم باستبدالها.

  • لإصلاح السلامة (الإضافة): يأخذ العصبونات "المهذبة" من نموذج آمن ويضعها في نموذج جامح.
  • لكسر السلامة (الحذف): يأخذ العصبونات "الجامحة" من نموذج غير آمن ويضعها في نموذج آمن (وهذا يعني "إصابته" ليرى كيف يعمل الهجوم، مما يساعد الباحثين على فهم كيفية الدفاع ضد هذه الهجمات).

لماذا يعد هذا أفضل؟

  • إنه سريع ورخيص: لا تحتاج لجمع آلاف الأمثلة التدريبية أو تشغيل جلسات تدريب مكلفة. أنت فقط تستبدل بعض الأسلاك.
  • إنه دقيق: على عكس "التقليم" (Pruning) -أي قطع الأجزاء السيئة- الذي قد يكسر مهارات الروبوت الأخرى، فإن هذه الطريقة تستبدل التوصيلات السيئة بتوصيلات جيدة. الأمر يشبه استبدال ترس مكسور بآخر جديد، بدلاً من مجرد إزالة الترس تماماً.
  • إنه يعمل في كل مكان: اختبرت الورقة هذه الطريقة على 7 أنواع مختلفة من الروبوتات (من الصغيرة إلى الضخمة) ونجحت في إصلاح السلامة، وإزالة التحيز، وحتى إضافة مهارات جديدة.

الخلاصة

تقترح هذه الورقة طريقة لـ إعادة تدوير ميزات السلامة. بدلاً من بناء السلامة من الصفر لكل ذكاء اصطناعي جديد، يمكننا "نسخ ولصق" عصبونات السلامة من ذكاء اصطناعي يمتلكها بالفعل. إنه الفرق بين بناء منزل جديد من الصفر وبين مجرد استبدال باب مكسور بآخر جديد.

باختصار: CNT هو زر "نسخ ولصق" لسلامة الذكاء الاصطناعي يعمل فوراً، ولا يكلف شيئاً تقريباً، ولا يعطل بقية وظائف الروبوت.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →