SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning
تُظهر الورقة البحثية أن مسار (SFT-then-RL) القياسي يتفوق في الواقع على أساليب السياسة المختلطة الحديثة، مما يكشف أن الادعاءات السابقة بخلاف ذلك كانت مبنية على خطوط أساس معيبة ناتجة عن أخطاء برمجية محددة في DeepSpeed وOpenRLHF.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
لغز "المسطرة المكسورة": لماذا لم يكن خبراء الرياضيات من الذكاء الاصطائي أفضل مما بدوا عليه حقاً؟
تخيل أنك حَكَم في مسابقة رياضيات للمرحلة الثانوية. لديك مجموعتان من الطلاب:
- "التقليديون": يقضون شهراً في دراسة الكتب المدرسية (الضبط الدقيق تحت الإشراف - Supervised Fine-Tuning)، ثم يقضون أسبوعاً في التدرب على مسائل صعبة مع مدرب يخبرهم بـ "صحيح" أو "خطأ" (التعلم التعزيزي - Reinforcement Learning).
- "المبتكرون": يدّعون امتلاك طريقة ثورية جديدة حيث يدرسون الكتب المدرسية ويتدربون مع المدرب في "الوقت نفسه"، دامجين الأسلوبين للتعلم بشكل أسرع.
خلال العام الماضي، كان "المبتكرون" يفوزون بكل الكؤوس. كان الجميع في عالم الذكاء الاصطناعي يهتفون: "الطريقة الجديدة هي الأفضل! يجب أن نتوقف عن استخدام طريقة (الكتاب المدرسي ثم المدرب) القديمة!"
لكن هذه الورقة البحثية كشفت للتو عن حقيقة صادمة: المبتكرون لم يكونوا فائزين في الواقع. بل كان الحكام يستخدمون مساطر مكسورة لقياس أداء "التقليديين".
"المساطر المكسورة" (الأخطاء البرمجية)
اكتشف الباحثون أن "التقليديين" تعرضوا للغش بسبب خطأين تقنيين هائلين في البرامج المستخدمة لتدريب الذكاء الاصطناعي.
1. خطأ "الذاكرة الانتقائية" (خطأ المُحسِّن - The Optimizer Bug)
تخيل أن طالباً يحل 10 مسائل رياضية للتحضير للاختبار. يقوم بحلها واحدة تلو الأخرى، ويجمع تقدمه في دفتر ملاحظات. ولكن بسبب خلل في قلمه، يكتب القلم فقط المسألة الأولى ويتجاهل المسائل التسع الأخرى. عندما يفحص المعلم الدفتر، يبدو الأمر وكأن الطالب تعلم شيئاً واحداً فقط!
في مصطلحات الذكاء الاصطناعي، تسبب خطأ في أداة شهيرة تسمى DeepSpeed في جعل الكمبيوتر "ينسى" معظم البيانات التي كان يعالجها أثناء مرحلة الكتاب المدرسي. كان يتعلم فقط من جزء ضئيل جداً مما كان من المفترض أن يتعلمه، مما جعل الذكاء الاصطناعي يبدو "أغبى" بكثير مما هو عليه في الواقع.
2. خطأ "المتوسط السيئ" (خطأ تجميع الخسارة - The Loss Aggregation Bug)
تخيل معلماً يصحح اختباراً لفصل دراسي. طالب واحد أجاب على سؤالين، وطالب آخر أجاب على 100 سؤال. بدلاً من النظر إلى إجمالي الإجابات الصحيحة، يأخذ المعلم فقط متوسط أداء كل طالب ويعاملهم كمتساوين في الأهمية. هذا يجعل الطالب الذي حل 100 سؤال يبدو أقل إبهاراً مما هو عليه في الواقع.
تسبب هذا الخطأ في برنامج OpenRLHF في جعل الذكاء الاصطناعي يزن تعلمه بشكل غير صحيح، مما أدى إلى خفض "درجته" بشكل أكبر خلال مرحلة الكتاب المدرسي.
الكشف الكبير: الطريقة القديمة هي الأفضل في الواقع
بمجرد أن قام الباحثون بـ "إصلاح المساطر" (إصلاح الأخطاء)، انقلبت النتائج تماماً.
عندما تم قياس "التقليديين" (طريقة SFT-then-RL القياسية) بشكل صحيح، لم يكتفوا بمجرد اللحاق بالركب فحسب، بل سحقوا المنافسة.
- في أحد النماذج (Qwen)، هزمت الطريقة القديمة الأساليب "المبتكرة" بفارق هائل.
- وفي نموذج آخر (Llama)، كانت الطريقة القديمة أفضل لدرجة أنها بدت وكأنها مقارنة بين عالم رياضيات محترف وطفل صغير.
لماذا تعمل الطريقة القديمة بشكل أفضل؟
يشرح الباحثون ذلك بمفهوم بسيط: الأساس أولاً.
إذا حاولت تعلم الرياضيات عبر القفز مباشرة إلى جلسة تدريب عالية المخاطر (التعلم التعزيزي) دون معرفة الأساسيات، فستفشل في معظم الأوقات. سيستمر المدرب في قول "خطأ!" ولن تتعلم شيئاً.
الطريقة "التقليدية" تبني أساساً متيناً من المعرفة أولاً (مرحلة الكتاب المدرسي). وبحلول الوقت الذي يبدأ فيه الذكاء الاصطناعي مرحلة التدريب، يكون قد عرف ما يكفي ليصيب في كثير من الأحيان، مما يعطي المدرب "إشارات" أفضل للعمل معها.
العبرة من القصة
هذه الورقة البحثية هي بمثابة جرس إنذار لصناعة الذكاء الاصطناعي. إنها تخبرنا بشيئين:
- لا تفترض أن الطريقة "الجديدة" أفضل لمجرد أن الطريقة "القديمة" تبدو سيئة. تحقق دائماً مما إذا كان يتم قياس الطريقة "القديمة" بإنصاف.
- أحياناً، تكون الطريقة الأبسط هي الأفضل. بدلاً من محاولة اختراع طرق تعلم "مدمجة" ومعقدة، يجب أن نركز على ضمان تنفيذ المراحل الأساسية — تعلم الحقائق، ثم ممارسة المهارات — بشكل مثالي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.