Surgical Post-Training: Proximal On-Policy Distillation for Reasoning with Knowledge Retention
تقترح الورقة البحثية التدريب اللاحق الجراحي (SPOT)، وهو إطار عمل تقريب للتقطير القائم على السياسة، يستخدم مسار تصحيح البيانات وهدف مكافأة مقيد بتباعد كولباك - ليبلر لتعزيز قدرات الاستدلال في النماذج اللغوية الكبيرة بكفاءة مع الحد من النسيان الكارثي بشكل فعال.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك طالباً عبقرياً، لنسمّه "Qwen"، وهو بالفعل بارع جداً في الرياضيات، والكتابة، واتباع التعليمات. أنت تريد تعليمه بعض الحيل الرياضية الجديدة والصعبة.
المشكلة هي أنه عندما تحاول تعليمه هذه الحيل الجديدة باستخدام الطرق التقليدية، فإنه يصب كل تركيزه على الأشياء الجديدة لدرجة أنه ينسى كل ما كان يعرفه سابقاً. الأمر يشبه محاولة تعليم طاهٍ وصفة جديدة من خلال جعله يتدرب عليها بكثافة تجعله ينسى كيف يقطع البصل أو يغلي الماء. يُسمى هذا "النسيان الكارثي" (Catastrophic Forgetting).
يقدم البحث طريقة جديدة تسمى SPOT (التدريب اللاحق الجراحي) لإصلاح هذه المشكلة. فكر في SPOT كنهج "جراحي" لتعليم الذكاء الاصطناعي، بدلاً من نهج "المطرقة الثقيلة".
إليك كيف يعمل ذلك، مقسماً إلى ثلاث خطوات بسيطة:
1. التصحيح "الجراحي" (خط معالجة البيانات)
عادةً، عندما ندرب الذكاء الاصطناٍ، فإننا إما نظهر له إجابات مثالية (قد لا يعرف كيف يصل إليها) أو نتركه يخمن ويأمل في الأفضل (وهذا بطيء وغير فعال).
تقوم SPOT بشيء مختلف. فهي تطلب من الذكاء الاصطناعي محاولة حل مسألة رياضية صعبة.
- الخطأ: يحاول الذكاء الاصطناعي، لكنه يرتكب خطأً محدداً في منتصف منطقه.
- الجراح (الأوراكل/العراف): بدلاً من رمي الإجابة بأكملها، ينظر "معلم خارق" (مثل ذكاء اصطناعي أكثر ذكاءً مثل Gemini) إلى الخطأ. إنه يقوم بـ "عملية جراحية". هو فقط يستأصل الجزء الصغير والخاطئ من المنطق ويقوم بخياطة المنطق الصحيح مكانه.
- النتيجة: تبدو الإجابة النهائية مشابهة تماماً لمحاولة الطالب الأصلية، مع إصلاح القطعة المكسورة الواحدة فقط. هذا يحافظ على "أسلوب" و"مفردات" الطالب كما هي، حتى لا يشعر الطالب وكأنه يتعلم لغة غريبة تماماً.
2. "الحبل المرن" (نظام المكافأة)
هذا هو السر الحقيقي. عندما يدرب الباحثون الذكاء الاصطناٍ، يستخدمون صيغة رياضية خاصة (دالة مكافأة) تعمل مثل "حبل مرن" أو حبل "بنجي".
- الطريقة القديمة (SFT): تخيل معلماً يصرخ: "افعلها بشكل مثالي!" يحاول الطالب جاهداً أن يكون مثالياً لدرجة أنه يصاب بالذعر وينسى مهاراته القديمة. إنه يشد الحبل حتى ينقطع.
- طريقة SPOT: يقول "الحبل المرن": "حسناً، أنت تقترب من الإجابة الصحيحة. عمل جيد! ولكن لا تضغط بقوة كبيرة".
- إذا كان الذكاء الاصطناعي جيداً بالفعل في خطوة ما، يصبح الحبل مرتخياً، ويتوقف المعلم عن الدفع. هذا يمنع الذكاء الاصطناعي من التصحيح المفرط ونسيان معرفته القديمة.
- إذا كان بعيداً عن الصواب، يسحب الحبل بلطف لتوجيهه للعودة.
- التشبيه: الأمر يشبه تدريب كلب. إذا كان الكلب يعرف بالفعل أمر "اجلس"، فأنت لست بحاجة للصراخ في وجهه في كل مرة يجلس فيها. أنت فقط تعطيه مكافأة عندما يفعل شيئاً جديداً أو يصحح خطأً. هذا يبقي الكلب سعيداً ويتذكر حيله القديمة.
3. "المفتاح الثنائي" (هدف التحسين)
تحاول معظم طرق تدريب الذكاء الاصطناعي ترتيب الإجابات: "هذه الإجابة أفضل من تلك". يجادل البحث بأن هذا سيء بالنسبة للرياضيات؛ لأن الرياضيات لا تتعلق بالرأي، بل تتعلق بكون الشيء صحيحاً أو خاطئاً.
- مشكلة الترتيب: إذا قلت فقط "الإجابة أ أفضل من الإجابة ب"، فقد يحاول الذكاء الاصطناعي فقط جعل الإجابة "ب" تبدو سيئة للغاية، دون جعل الإجابة "أ" أفضل فعلياً.
- حل SPOT: يستخدمون "مفتاحاً ثنائياً" بسيطاً (مثل مفتاح الضوء).
- تشغيل (ON): "هذه الإجابة المصححة صحيحة بالتأكيد. اجعلها أكثر سطوعاً!"
- إيقاف (OFF): "هذه الإجابة الخاطئة خاطئة بالتأكيد. أطفئها!"
- هذا يخلق إشارة واضحة جداً. فهو يخبر الذكاء الاصطناعي بالضبط ما الذي يجب تعزيزه وما الذي يجب كبحه، دون ارتباك "الترتيب".
النتائج: ماذا حدث؟
اختبر الباحثون هذه الطريقة على نموذج يسمى Qwen3-8B.
- السرعة: لم يحتاجوا إلا إلى 4,000 مسألة رياضية مصححة (كمية ضئيلة جداً بمعايير الذكاء الاصطناعي).
- الوقت: استغرق التدريب 16 دقيقة فقط على أجهزة كمبيوتر قوية.
- النتيجة: أصبح النموذج أفضل بكثير في الرياضيات (سواء النوع الذي رآه أثناء التدريب أو الأنواع الجديدة غير المرئية). والأهم من ذلك، أنه لم ينسَ كيفية اتباع التعليمات أو الكتابة الجيدة.
- ميزة إضافية: نظرًا لأن النموذج تعلم بشكل جيد دون نسيان، فقد أصبح "بداية" مثالية لتدريب أكثر تقدماً لاحقاً، مما فتح آفاقاً لأداء أعلى بكثير.
ملخص
SPOT يشبه جراحاً ماهراً يعلم طالباً. بدلاً من إعادة كتابة كتاب الطالب المدرسي بالكامل (مما يجعله ينسى كل شيء)، يقوم الجراح بإجراء تعديلات دقيقة وصغيرة على أخطاء الطالب. إنهم يستخدمون "حبلاً مرناً" لطيفاً لضمان عدم تصحيح الطالب بشكل مفرط، ويستخدمون مفتاح "تشغيل/إيقاف" بسيطاً للتأكد من أن الطالب يعرف بالضبط ما هو الصحيح وما هو الخطأ. النتيجة هي ذكاء اصطناعي أكثر ذكاءً لم ينسَ هويته.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.