← أحدث الأبحاث
🤖 machine learning

Crafting Reversible SFT Behaviors in Large Language Models

تقدم هذه الورقة البحثية طريقة "النزول المزدوج المقيد بالخسارة" (LCDD) و"ممحاة الضبط الدقيق الموجه" (SFT-Eraser) لضغط سلوكيات الضبط الدقيق الموجه في شبكات فرعية متفرقة وضرورية سببيًا ("الحوامل") يمكن كبتها انتقائيًا عند الاستنتاج عبر محفز ناعم دون تعديل أوزان النموذج.

المؤلفون الأصليون: Yuping Lin, Pengfei He, Yue Xing, Yingqian Cui, Jiayuan Ding, Subhabrata Mukherjee, Hui Liu, Zhen Xiang

نُشر 2026-05-08
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yuping Lin, Pengfei He, Yue Xing, Yingqian Cui, Jiayuan Ding, Subhabrata Mukherjee, Hui Liu, Zhen Xiang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك روبوتًا ذكيًا جدًا (نموذج لغوي كبير) تم تعليمه خدعة جديدة، مثل قول "لا أعرف" دائمًا للأسئلة، أو رفض الإجابة على الأسئلة الخطيرة، أو التحدث بأسلوب شكسبير. تسمى هذه العملية الضبط الدقيق الخاضع للإشراف (SFT).

المشكلة التي وجدها المؤلفون هي أنه عندما تعلم الروبوت هذه الخدعة الجديدة، فإن "المعرفة" بكيفية القيام بها تتشتت في كل أنحاء عقل الروبوت. الأمر يشبه تعليم شخص ما ركوب الدراجة ولكن بجعلهم يستخدمون كل عضلة في أجسادهم للقيام بذلك، بدلاً من استخدام أرجلهم وتوازنهم فقط. ولأن المهارة موجودة في كل مكان، فمن الصعب إيقافها لاحقًا دون كسر قدرة الروبوت على التحدث بشكل طبيعي.

تقدم هذه الورقة البحثية طريقة لتعليم الروبوت خدعة جديدة بطريقة محددة وموجزة للغاية بحيث تعيش الخدعة في "غرفة" صغيرة ومعزولة داخل عقله. ثم يظهرون كيف يمكنهم إطفاء هذه الغرفة المحددة باستخدام رمز سري، مما يجعل الروبوت ينسى الخدعة فورًا، مع بقاء بقية عقله سليمًا تمامًا.

إليك كيف فعلوا ذلك، باستخدام تشبيهات بسيطة:

1. المشكلة: "العلية الفوضوية"

عادةً، عندما تقوم بالضبط الدقيق لنموذج ما، ينتشر السلوك الجديد مثل علية فوضوية. إذا أردت إزالة هذا السلوك لاحقًا، فسيتعين عليك البحث في العلية بأكملها، وقد ترمي بالخطأ قدرة الروبوت على حل المسائل الرياضية أو كتابة رسائل البريد الإلكتروني. لا يمكنك بسهض العثور على "المفتاح" الدقيق للسلوك الجديد لأنه متشابك مع كل شيء آخر.

2. الجزء الأول من الحل: LCDD (الـ "خبير في التعبئة")

ابتكر المؤلفون طريقة تسمى النزول المزدوج المقيد بالخسارة (LCDD). فكر في هذا كخبير تنظيم وتعبئة فائق الكفاءة.

  • الهدف: يريدون أخذ "السلوك الجديد" وإجباره على الدخول في "حقيبة ظهر" صغيرة وموجزة (يسمونها الحامل - Carrier) داخل عقل الروبوت.
  • القيد: يخبرون خبير التعبئة: "يجب عليك وضع السلوك الجديد بالكامل داخل حقيبة الظهر الصغيرة هذه، ولكن لا يمكنك جعل الروبوت ينسى كيفية القيام بوظائفه الأخرى (مثل الإجابة على الأسئلة بشكل صحيح)".
  • النتيجة: نجح الخبير في ضغط السلوك الجديد في شبكة فرعية صغيرة ومعزولة. ظل بقية عقل الروبوت كما كان تمامًا قبل التدريب. أصبح السلوك الجديد الآن معتمدًا بنسبة 100% على حقيبة الظهر الصغيرة هذه. إذا كانت حقيبة الظهر موجودة، يحدث السلوك. إذا تم حظر حقيبة الظهر، يختفي السلوك.

3. الجزء الثاني من الحل: SFT-Eraser (الـ "رمز السري")

بمجرد قفل السلوك داخل حقيبة الظهر الصغيرة تلك، ابتكر المؤلفون أداة ثانية تسمى SFT-Eraser.

  • كيف يعمل: هم لا يغيرون أوزان عقل الروبوت (وهو ما يشبه عدم إعادة كتابة دليل تشغيل الروبوت). بدلاً من ذلك، ينشئون محفزًا ناعمًا (تسلسلًا من "الكلمات" الرياضية غير المرئية المضافة إلى المدخلات).
  • السحر: عندما يُضاف هذا الرمز السري إلى سؤال ما، فإنه يعمل كمفتاح يعطل تحديدًا "حقيبة الظهر" حيث يعيش السلوك الجديد.
  • النتيجة: يعود الروبوت فورًا إلى شخصيته الأصلية. إذا تم تدريبه على التحدث بأسلوب شكسبير، فإنه فجأة يتحدث الإنجليزية الحديثة مرة أخرى. إذا تم تدريبه على رفض الأسئلة الخطيرة، فإنه يبدأ في الإجابة عليها مجددًا. لم يتم "إلغاء تدريب" الروبوت؛ بل تم تحييد الجزء المحدد من عقله الذي يحمل هذا السلوك مؤقتًا.

4. الإثبات: لماذا الهيكل مهم

أجرى المؤلفون اختبارًا حاسمًا لإثبات أن الهيكل (حقيبة الظهر الصغيرة) هو البطل الحقيقي، وليس مجرد الرمز السري.

  • التجربة: حاولوا استخدام نفس "الرمز السري" على روبوت ليس لديه حقيبة الظهر الصغيرة (روبوت قياسي حيث السلوك منتشر في كل مكان).
  • النتيجة: فشل الرمز. لم يستطع إيقاف السلوك لأنه لم يكن هناك هدف واحد معزول ليتم تعطيله.
  • الدرس: يثبت هذا أنه لا يمكنك مجرد "اختراق" سلوك خارج من عقل فوضوي. يجب عليك أولاً بناء هيكل نظيف ومعزول ليعيش فيه ذلك السلوك. بمجرد عزله، يمكنك التحكم فيه بشكل مثالي.

ملخص ما وجدوه

  • هل يمكننا جعل السلوك قابلًا للانعكاس؟ نعم.
  • كيف؟ عن طريق إجبار السلوك على الدخول في "حامل" صغير وموجز أثناء التدريب (باستخدام LCDD) ثم استخدام رمز مدخلات خاص (SFT-Eraser) لحظر ذلك الحامل.
  • هل يعمل؟ لقد اختبروا هذا على ثلاثة سلوكيات مختلفة تمامًا:
    1. الاستجابة الثابتة: جعل الروبوت يقول دائمًا "لا أعرف".
    2. السلامة: جعل الروبوت يرفض الإجابة على الأسئلة الضارة.
    3. الأسلوب: جعل الروبوت يتحدث بأسلوب شكسبير.
  • الحكم النهائي: في جميع الحالات، نجحوا في ضغط السلوك في جزء صغير من الدماغ وكان بإمكانهم تشغيله وإطفاؤه حسب الرغبة دون تغيير الكود الأساسي للروبوت.

ملاحظة هامة: "الرمز السري" الذي يستخدمونه هو تسلسل رياضي مستمر (محفز ناعم)، وليس مجرد كلمة بسيطة يمكنك كتابتها في صندوق الدردشة، والورقة البحثية تتعامل مع هذا كوسيلة لإثبات أن السلوكيات يمكن عزلها والتحكم فيها سببياً، وليس كمنتج جاهز للاستخدام في روبوتات الدردشة اليومية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →