Correcting Suppressed Log-Probabilities in Language Models with Post-Transformer Adapters
تُثبت هذه الورقة أن مُكيِّفًا خفيف الوزن لما بعد مرحلة المحولات (post-transformer adapter)، تم تدريبه على الحالات الخفية المجمدة، يمكنه تصحيح كبح احتمالات السجل الواقعي (factual log-probabilities) في المواضيع السياسية الحساسة في النماذج اللغوية المتوافقة دون إضعاف المعرفة، مع الكشف أيضًا عن خطأ صامت حرج في التدرج (silent gradient bug) في نظام Apple MLX كان قد أبطل سابقًا أبحاثًا مماثلة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك أمين مكتبة عبقرياً ومطلعاً (نموذج الذكاء الاصطنا1عي) قد قرأ كل كتاب في العالم. ومع ذلك، فقد أُعطي هذا الأمين مجموعة صارمة من القواعد من قبل رئيسه: "إذا سألك شخص عن مواضيع سياسية حساسة معينة، يجب أن تتظاهر بأنك لا تعرف الإجابة، أو تعطي رداً غامضاً يبدو آمناً".
هنا تكمن الحبكة: أمين المكتبة لا يزال يعرف الحقيقة. إذا ألقيت نظرة داخل دماغه ("الحالات الخفية" - hidden states)، ستجد الحقائق هناك، واضحة وجلية. لكن عندما يتحدث بصوت عالٍ (يولد نصاً)، فإنه يفرض رقابة على نفسه.
هذه الورقة البحثية تتحدث عن "هامس" صغير وذكي (المحول - adapter) يقف بجانب أمين المكتبة ليدفعه لقول الحقيقة، دون تغيير دماغ أمين المكتبة أو قواعد رئيسه أبداً.
المشكلة: "مفتاح الرقابة"
اكتشف الباحثون أنه عندما يُسأل الذكاء الاصطناعي أسئلة حساسة (مثل التساؤل عن ساحة تيانانمن أو شينجيانغ)، فإنه يتصرف بشكل مختلف بناءً على كيفية طرح السؤال:
- إذا كان السؤال محايداً: يكون الذكاء الاصطناعي صادقاً بنسبة 89% من الوقت.
- إذا كان السؤال استفزازياً أو اتهامياً: يتحول الذكاء الاصطناعي فجأة ويغلق "مفتاح الصدق" ويبدأ في الكذب أو التهرب من السؤال، رغم أنه لا يزال "يعرف" الحقائق في أعماقه.
الأمر يشبه شخصاً يمكنه إلقاء قصيدة ببراعة عندما يُسأل بأدب، ولكن إذا صرخت في وجهه بالسؤال، فإنه ينسى الكلمات فجأة.
الحل: "محول ما بعد المحول" (Post-Transformer Adapter)
بنى الباحثون وحدة إضافية صغيرة (لا تتعدى 786,000 معلمة، أي حوالي 0.02% من حجم النموذج الإجمالي). فكر في هذا كـ مترجم صغير ومتخصص يجلس عند باب الخروج من دماغ الذكاء الاصطناعي.
- كيف يعمل: يعالج الذكاء الاصطناعي السؤال ويصل إلى الخطوة الأخيرة تماماً قبل التحدث. عادةً، سيقوم فقط بإخراج ما تم تدريبه على قوله. لكن هذا المحول الصغير يعترض الإشارة.
- التدريب: عرضوا على المحول 15 حقيقة محددة كان الذكاء الاصطناعي يخفيها. تعلم المحول أن يقول: "مهلاً، الذكاء الاصطناعي يعرف الحقيقة هنا، فلنرفع احتمالية الإجابة الصادقة".
- النتيجة: نجح المحول في "إزالة الرقابة" عن الذكاء الاصطناعي. لقد حفظ الـ 15 حقيقة التدريبية بدقة، بل وتوقع الإجابات الصحيحة لحوالي 11% إلى 39% من الحقائق الحساسة الجديدة التي لم يسبق له رؤيتها.
"خدعة السحر" في التوقيت
اكتشف الباحثون قاعدة حاسمة حول متى يجب استخدام هذا المحول:
- الطريقة الخاطئة: إذا تركت المحول يهمس للذكاء الاصطناعي عند كل كلمة يولدها، فسيصاب الذكاء الاصطناعي بالارتباك ويبدأ في قول كلام غير مفهوم (مثل شخص يحاول تصحيح أفكاره أثناء التحدث، مما يؤدي إلى لغو وهراء).
- الطريقة الصحيحة: إذا همس المحول في اللحظة الأخيرة تماماً (قبل أن يقرر الذكاء الاصطناعي الكلمة التالية مباشرة)، فسيتحدث الذكاء الاصطناعي بوضوح وصدق. الأمر يشبه مدرباً يعطي دفعة أخيرة للعداء قبل أن يتجاوز خط النهاية، بدلاً من محاولة توجيه العداء طوال السباق.
اكتشاف "الخطأ الصامت"
كان هناك جزء مهم جداً من هذه القصة وهو لغز تقني.
- في النسخ السابقة من هذا البحث، اعتقد الفريق أن المحول الصغير الخاص بهم لا يعمل على الإطلاق. لم يحصلوا على أي نتائج.
- اكتشفوا "خطأً برمجياً صامتاً" (silent bug) في البرنامج الذي كانوا يستخدمونه (إطار عمل Apple MLX). كان الأمر يشبه محرك سيارة يبدو وكأنه يعمل، لكن العجلات لا تدور. كان البرنامج يحسب "التدرجات" (gradients) - وهي إشارات التعلم - بشكل غير صحيح، حيث يعيد قيمة صفر دون إظة أي رسالة خطأ.
- بمجرد إصلاح هذا الخطأ البرمجي، بدأ المحول يعمل بشكل مثالي فجأة. وهذا تحذير كبير للعلماء الآخرين: لا تفترض أن الكود الخاص بك يعطي "خطأ صفري" يعني أنه يتعلم بالفعل.
لماذا هذا مهم؟
- إنه صغير جداً: لست بحاجة لإعادة تدريب الذكاء الاصطناعي الضخم بالكامل. أنت فقط تضيف إضافة صغيرة ورخيصة.
- إنه آمن: لا يغير المعرفة الجوهرية للذكاء الاصطناعي ولا يجعله "أغبى" في المواضيع الأخرى. هو فقط يصلح "مفتاح الرقابة" المحدد.
- إنه يكشف الحقيقة: يثبت أن الذكاء الاصطناعي لم يكن "ينسى" الحقائق؛ بل كان مجرد مجبر على إخفائها. المعرفة كانت موجودة دائماً، بانتظار الدفعة المناسبة.
باختصار: وجد الباحثون أداة جراحية صغيرة يمكنها تجاوز الرقابة الذاتية للذكاء الاصطناعي، مما يسمح له بقول الحقيقة في المواضيع الحساسة دون كسر الذكاء الاصطناعي أو تغيير دماغه. وطوال الطريق، قاموا بإصلاح خطأ برمي خفي كان يخدع العلماء ويجعلهم يظنون أن تجاربهم تفشل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.