← أحدث الأبحاث
🤖 AI

Supervised Fine-Tuning versus Reinforcement Learning: A Study of Post-Training Methods for Large Language Models

تقدم هذه الورقة إطاراً موحداً لمرحلة ما بعد التدريب للنماذج اللغوية الكبيرة من خلال التحليل الشامل للأدوار المتميزة والمترابطة لكل من الضبط الدقيق الخاضع للإشراف والتعلم التعزيزي، واستكشاف تكاملهما الهجين، وتحديد الاتجاهات الرئيسية وأفضل الممارسات للتطبيق الفعال بناءً على الأدلة التجريبية الحديثة.

المؤلفون الأصليون: Haitao Jiang, Wenbo Zhang, Jiarui Yao, Hengrui Cai, Sheng Wang, Rui Song

نُشر 2026-03-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Haitao Jiang, Wenbo Zhang, Jiarui Yao, Hengrui Cai, Sheng Wang, Rui Song

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك طالباً عبقرياً ومطلعاً يُدعى LLM. لقد قرأ هذا الطالب كل كتاب تقريباً في المكتبة (مرحلة ما قبل التدريب). إنه يعرف الكثير من الحقائق، ويستطيع كتابة الشعر، ويفهم قواعد اللغة. ولكن، إذا طلبت منه حل مسألة رياضية معينة ومعقدة أو كتابة كود برمجي لروبوت محدد، فقد يخطئ، أو يهلوِس (يختلق أشياءً)، أو يتصرف بأسلوب غير رسمي للغاية.

لتحويل هذا "الطالب العام" إلى "خبير متخصص"، تحتاج إلى إعطائه تدريباً إضافياً. هذه الورقة هي دليل إرشادي لطريقتين رئيسيتين لهذا التدريب: SFT و RL.

إليك التفصيل باستخدام تشبيهات بسية:

1. طريقتي التدريب

SFT (الضبط الدقيق الخاضع للإشراف): طريقة "نسخ المعلم"

  • التشبيه: تخيل أنك تريد تعليم طالبك لعب الشطرنج. تعطيه مجموعة من 1,000 مباراة لعبها "جراند ماستر" (لاعب كبير). تقول له: "انظر إلى الحركة (أ)، ثم الحركة (ب). فقط انسخ تماماً ما فعله المعلم".
  • كيف يعمل: يتعلم الطالب من خلال تقليد الأمثلة المثالية. إنه سريع، ومستقر، ورائع لتعلم "القواعد" والأنماط الأساسية.
  • الجانب السلبي: إذا واجه الطالب وضعية على رقعة الشطرنج لم تكن موجودة في الـ 1,000 مثال، فقد يتجمد أو يقوم بحركة غريبة لأنه يقلد فقط، وليس لأنه يفهم حقاً "لماذا" تعد الحركة جيدة. قد يقع أيضاً في فخ تكرار أخطاء المعلم إذا لم تكن الأمثلة مثالية.

RL (التعلم التعزيزي): طريقة "التجربة، الخطأ، والمكافأة"

  • التشبيه: الآن، ضع الطالب في بطولة شطرنج حقيقية. يلعب مباراة. إذا فاز، يحصل على نجمة ذهبية (مكافأة). إذا خسر، يحصل على بطاقة حمراء (عقوبة). ليس لديه نص مكتوب؛ بل عليه اكتشاف أفضل الحركات من خلال التجربة، والفشل، والتعلم من التغذية الراجعة.
  • كيف يعمل: يستكشف الطالب استراتيجيات مختلفة. إذا أدت الحركة إلى فوز، فإنه يتذكرها. وإذا أدت إلى خسارة، فإنه يتجنبها. هذا يساعده على التعميم والتعامل مع المواقف الجديدة والغريبة التي لم يسبق له رؤيتها.
  • الجانب السلبي: إنه أمر فوضوي ومكلف. قد يجرب الطالب آلاف الحركات السيئة قبل العثور على حركة واحدة جيدة. قد يتعلم أيضاً "الغش" (اختراق نظام المكافأة) للحصول على النجوم الذهبية دون اللعب بشكل جيد فعلياً.

2. الاكتشاف الكبير: إنهما قريبان، وليسا عدوين

لفترة طويلة، اعتقد الباحثون أن SFT و RL أداتان مختلفتان تماماً. تجادل هذه الورقة بأنهما في الواقع وجهان لعملة واحدة.

  • الرؤية: يمكنك في الواقع اعتبار "نسخ المعلم" (SSFT) مجرد نسخة خاصة وبسيطة من "الحصول على المكافآت" (RL). في SFT، "المكافأة" هي ببساطة: "هل نسخت الإجابة تماماً؟ نعم = جيد، لا = سيء".
  • الخلاصة: نظرًا لتشابههما الكبير، فإن الحيل المستخدمة لجعل أحدهما يعمل بشكل أفضل غالباً ما تعمل للآخر.

3. الاستراتيجية الرابحة: النهج الهجين

لاحظت الورقة اتجاهاً هائلاً من عام 2023 إلى 2025: توقف عن الاختيار بينهما؛ استخدم كليهما.

فكر في الأمر كتدريب رياضي:

  1. المرحلة الأولى (SFT): أولاً، تجعلهم يشاهدون ساعات من لقطات الأولمبياد ويقلدون الأداء المثالي. هذا يضعهم على المسار الصحيح بسرعة.
  2. المرحلة الثانية (RL): ثم، تضعهم في منافسة حقيقية. يستخدمون ما تعلموه من الفيديوهات لكنهم يتكيفون مع الضغط ومع الحركات المحددة لخصمهم، ويتلقون تغذية راجعة حول ما ينجح فعلياً.

لماذا نجمع بينهما؟

  • SFT يمنحهم أساساً متيناً حتى لا يبدأوا من الصفر.
  • RL يساعدهم على صقل ذلك الأساس، وتصحيح أخطائهم، ويجعلهم مبتكرين في حل المشكلات.

4. أين يحدث هذا؟

تنظر الورقة في أربع "رياضات" رئيسية يحدث فيها هذا التدريب:

  • الأسئلة والأجوبة العامة: مثل بطل المسابقات الثقافية. (SFT يعلم الحقائق؛ RL يعلم كيفية قول "لا أعرف" بدلاً من اختلاق الأشياء).
  • الرياضيات: مثل عبقري الرياضيات. (SFT يعلم الصيغ؛ RL يعلم المنطق خطوة بخطوة لحل مسألة لم يرها من قبل).
  • الوكلاء/العملاء (الروبوتات): مثل المساعد الشخصي. (SFT يعلم كيفية فتح الباب؛ RL يعلم كيفية التنقل في غرفة مليئة بالعقبات للحصول على كوب قهوة).
  • البرمجة: مثل مهندس البرمجيات. (SFT يعلم بناء الجمل البرمجية؛ RL يعلم كيفية تصحيح الكود الذي يتعطل).

5. الاتجاه المستقبلي

تشير الورقة إلى تحول في "النادي الرياضي" (مجتمع الأبحاث):

  • من "الدفع مقابل اللعب" إلى "المصدر المفتوح": في الماضي، كان الناس يستخدمون نماذج ذكاء اصطوي مغلقة ومكلفة لإنشاء بيانات التدريب. الآن، يستخدمون نماذج مفتوحة ومجانية لإنشاء مسائل التدريب الخاصة بهم.
  • من "الخطوة الواحدة" إلى "الخطوتين": نحن ننتقل من مجرد النسخ (SFT) أو مجرد التخمين (RL) نحو مسار هجين (Hybrid Pipeline) حيث يتم تعليم النماذج أولاً بواسطة الخبراء، ثم صقلها بواسطة أنظمة المكافأة.

الملخص

تقول هذه الورقة باختاًص: "لا تكتفِ بحفظ الكتاب المدرسي (SFT)، ولا تكتفِ بالتخمين في الظلام (RL). افعل كليهما. ابدأ بالتعلم من الأفضل، ثم تدرب حتى تتقن الأمر."

هذا المزيج هو "الخلطة السرية" التي تجعل الذكاء الاصطناعي أكثر ذكاءً، وأكثر موثوقية، وأفضل في حل المشكلات المعقدة في العالم الحقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →