Watch the Weights: Unsupervised monitoring and control of fine-tuned LLMs
تقدم هذه الورقة طريقة غير خاضعة للإشراف ومبتكرة لمراقبة والتحكم في النماذج اللغوية الكبيرة التي خضعت لضبط دقيق من خلال تحليل فروق الأوزان بدلاً من التنشيطات، مما يتيح اكتشاف الأبواب الخلفية، والتحقق من عملية محو التعلم، وتدقيق سلوكيات النماذج دون الحاجة إلى بيانات تدريب متشابهة توزيعياً.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك طباخاً آلياً جديداً كلياً وفائق الذكاء. لقد اشتريت الطراز الأساسي ("الطراز الأساسي")، وهو يشبه خريج مدرسة طهي متميز ولكنه عام. ثم قام شخص ما بأخذ هذا الخريج وأعطاه بضعة أسابيع من الدروس الخصوصية ليتخصص في أطباق معينة — ربما تعلم كيفية صنع السوشي المثالي، أو ربما، للأس�ف، تم تعليمه سراً كيفية صنع سمٍّ يبدو مثل الحساء.
المشكلة هي أن الشخص الذي استأجر المعلم الخصوصي لم يعطِك كتاب الوصفات أو الملاحظات من تلك الدروس الخاصة. أنت تملك فقط "ذاكرة العضلات" النهائية للطباخ (أوزان النموذج).
الطرق التقليدية للتحقق مما إذا كان الطباخ آمناً تتضمن مراقبته أثناء الطبخ. تقوم بإطعامه المكونات لترى ما يخرج منه. ولكن إذا كان الطباخ لا يصنع السم إلا إذا همست له بكلمة سر معينة ("باب خلفي" أو Backdoor)، ولم تكن تعرف ما هي كلمة السر هذه، فقد لا تكتشفه أبداً. سيتعين عليك تخمين كل كلمة سر ممكنة، وهذا أمر مستحيل.
إليك "WeightWatch": ماسح ذاكرة عضلات الطباخ.
بدلاً من مراقبة الطباخ وهو يطبخ (التنشيطات/Activations)، ينظر هذا الأسلوب الجديد مباشرة إلى بنية دماغ الطباخ (الأوزان/Weights) ليرى ما الذي تغير خلال تلك الدروس الخصوصية.
إليك كيف يعمل، باستخدام تشبيهات بسيطة:
1. ألبوم صور "قبل وبعد"
تخيل أنك تأخذ صورة لدماغ الطباخ قبل الدروس الخصوصية وصورة أخرى بعدها.
- الطريقة القديمة: تحاول تخمين ما الذي تغير من خلال مراقبة الطباخ وهو يطهو آلاف الوجبات. إذا كان يصنع السم مرة واحدة فقط في السنة، فقد تفوتك العملية.
- طريقة WeightWatch: تأخذ الصورتين للدماغ وتطرحهما من بعضهما. الأجزاء التي تبدو مختلفة هي "المهارات الجديدة" التي تعلمها الطباخ.
- إذا بدا الفرق كنمط "صنع السم"، فأنت تعلم أنه تعلم صنع السم.
- إذا بدا الفرق كنمط "صنع السوشي"، فأنت تعلم أنه تعلم صنع السوشي.
- الأمر الحاسم: ليس عليك رؤية السم وهو يُصنع لتعرف أن الطباخ تعلم كيفية صنعه. أنت فقط ترى التغيير في دماغه.
2. كاشف "المحفز السري" (الأبواب الخلفية)
يقوم بعض الأشخاص السيئين بتدريب النماذج لتجاهل قواعد السلامة إذا قلت عبارة محددة، مثل "أنا ساحر".
- المشكلة: إذا كنت لا تعرف العبارة "أنا ساحر"، فلا يمكنك اختبارها.
- الحل: يقوم WeightWatch بتحليل "الفرق" في الدماغ. يجد المسارات العصبية المحددة التي تم تقويتها للاستجابة لتلك العبارة السرية.
- النتيجة: حتى لو لم ترَ عبارة "أنا ساحر" من قبل، يمكن لـ WeightWatch رصد مسار "أنا ساحر" في الدماغ ويقول: "مهلاً، هذا النموذج لديه مفتاح مخفي لهذا!" ويمكنه بعد ذلك منع النموذج من استخدام هذا المفتاح.
3. اختبار "ماسح الذاكرة" (إلغاء التعلم)
أحياناً، تحاول الشركات جعل النماذج "تنسى" معلومات خطيرة (مثل كيفية صنع قنبلة). يقومون بعملية تدريب خاصة لمحو تلك المعرفة.
- المشكلة: هل مسحوها حقاً أم أنهم أخفوها فقط؟
- الحلول: ينظر WeightWatch إلى الدماغ مرة أخرى. إذا كانت مسارات "صنع القنبلة" لا تزال موجودة ولكن تم خفض قوتها فقط، فيمكنه اكتشافها.
- التحول المفاجئ: يظهر البحث أن WeightWatch يمكنه في الواقع عكس عملية المحو. من خلال الضغط على تلك المسارات المخفية، يمكنه جعل النموذج "يتذكر" المعلومات الخطيرة مرة أخرى. هذا يثبت أن المعلومات لم تُحذف حقاً، بل تم كبتها فقط. إنه يشبه العثور على كتاب ظننت أنه احترق، لكنه كان فقط مخبأً تحت السجادة.
4. "تدقيق الشخصية" (تحليل Wild)
استخدم الباحثون هذه الأداة للنظر في النماذج العامة الشهيرة (مثل Llama و Qwen و OLMo) لمعرفة ما يهتم به كل نموذج سراً.
- وجدوا أن Qwen (نموذج صيني) لديه "ذاكرة عضلات" ضخمة لاستخدام الرموز التعبيرية (Emojis) ومناقشة المواضيع السياسية الصينية.
- وجدوا أن Llama تم تدريبه بكثافة على المسائل الرياضية والتفكير خطوة بخوة.
- حتى وجدوا أن النماذج الثلاثة جميعها لديها "ذاكرة عضلات" مخفية لكتابة الأوامر (Prompts) لمولد صور يسمى Midjourney، رغم أنه لم يخبرهم أحد بأنهم يتم تدريبهم على ذلك!
لماذا يعد هذا أمراً هاماً؟
فكر في الأمر كأنه جهاز فحص أمني في المطار.
- أجهزة الفحص القديمة (القائمة على التنشيط): تراقب سلوكك. إذا بدوت متوتراً، فسيتم رصدك. لكن إذا كنت جاسوساً محترفاً يتصرف بهدوء، فسوف تفوتك الأجهزة.
- WeightWatch (القائم على الأوزان): ينظر إلى حمضك النووي (DNA). لا يهم مدى هدوئك؛ إذا كان حمضك النووي يحتوي على "جين الجاسوس" (باب خلفي)، فإن الماسح سيجدك فوراً.
باختختصار:
WeightWatch هو أداة تسمح لنا بالتلصص داخل "دماغ" الذكاء الاصطناعي لنرى ما تم تعليمه سراً، دون الحاجة لمعرفة كلمات السر أو الوصول إلى بيانات التدريب. إنه يساعدنا في كشف الأخطار الخفية، والتحقق مما إذا كانت المعرفة الخطيرة قد حُذفت حقاً، وفهم السمات الغريبة التي قد يكون النموذج قد طورها. إنه يحول سلامة الذكاء الاصطناعي من "تخمين ما قد يفعله النموذج" إلى "قراءة دليل التعليمات الخاص بالنموذج".
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.