Complementing reinforcement learning with SFT through logit averaging in the post training of LLMs
تقدم هذه الورقة طريقة جديدة لما بعد التدريب للنماذج اللغوية الكبيرة تعزز تحسين السياسة النسبية للمجموعات (GRPO) عن طريق متوسط "اللوجيتس" لسياسة مرجعية للضبط الدقيق الموجه (SFT) مجمدة وسياسة قابلة للتدريب، مما يلغي الحاجة إلى تنظيم "KL" أو وجود "ناقد" مع الجمع بفعالية بين قدرات الاستدلال للتعلم التعزيزي واستقرار التنسيق للضبط الدقيق الموجه.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح الورقة البحثية باستخدام لغة بسيطة وتشبيهات إبداعية.
الصورة الكبيرة: معلمان، وطالب واحد
تخيل أنك تقوم بتدريب نموذج لغوي كبير (ذكاء اصطوي) لحل المسائل الرياضية. لديك "معلمان" متميزان يحاولان تعليمه:
- معلم التنسيق (SFT): هذا المعلم بارع في تعليم الذكاء الاصطناعي كيفية كتابة الإجابات بشكل مرتب، واستخدام الرموز الصحيحة، واتباع قواعد صارمة (مثل وضع الإجابة النهائية داخل إطار). ومع ذلك، قد يرتكب هذا المعلم أخطاءً في المنطق الرياضي الفعلي.
- معلم الاستنتاج (RL): هذا المعلم عبقري في الرياضيات ويمكنه حل المعادلات المعقدة بشكل مثالي. لكن هذا المعلم فوضوي؛ فهو غالبًا ما ينسى وضع الإجابة في إطار، أو يتخطى الخطوات، أو يكتب بتنسيق غريب لا يتوافق مع ما يتطلبه الامتحان.
المشكلة:
تقليديًا، عندما تحاول الجمع بين هذين الاثنين، فإنك تستخدم طريقة تسمى "تنظيم KL" (KL Regularization). فكر في هذا كأنه شريط مطاطي يربط معلم الاستنتاج بمعلم التنسيق. يجبر هذا الشريط المطاطي معلم الاستنتاج على البقاء قريبًا من أسلوب معلم التنسيق.
- الفخ: إذا ارتكب معلم التنسيق خطأً رياضيًا، فإن الشريط المطاطي سيجذب معلم الاستنتاج إلى نفس الخطأ. سيصبح الذكاء الاصطناعي عالقًا في محاولة أن يكون "مرتبًا" ولكنه يفشل في أن يكون "ذكيًا".
الحل الجديد: متوسط اللوجيت (Logit Averaging)
يقترح مؤلفو هذه الورقة طريقة جديدة للجمع بين هذين المعلمين. بدلاً من ربطهما معًا بشريط مطاطي، يقومون بإنشاء "صوت مدمج".
تخيل أن الذكاء الاصطناعي هو جوقة غنائية (كورال). بدلاً من إجبار المغنين على البقاء في تناغم تام (مما يحد من نطاق أصواتهم)، تقوم الطريقة الجديدة بخلط أصواتهم قبل أن يغنوا.
- إذا قال معلم التنسيق: "ضع الإجابة في إطار"، وقال معلم الاستنتاج: "الإجابة هي 5"، فإن الصوت المدمج يقول: "ضع الإجابة في إطار: 5".
- إذا ارتكب معلم التنسيق خطأً رياضيًا (قال إن الإجابة هي 6)، بينما يعرف معلم الاستنتاج أنها 5، فإن الصوت المدمج سيعتمد بقوة على رياضيات معلم الاستنتاج مع الحفاظ على تعليمات معلم التنسيق بـ "وضعها في إطار".
كيف يعمل الأمر (سحر "اللوجيت")
في مصطلحات الذكاء الاصطناعي، يتكون "صوت" النموذج من أرقام تسمى اللوجيتات (logits) (والتي تمثل مدى احتمالية اختيار النموذج لكلمة أو رقم معين تاليًا).
- الخلط: يأخذ الباحثون الأرقام من معلم التنسيق ومعلم الاستنتاج ويقومون بمتوسطها رياضيًا.
- النتيجة: هذا ينتج "سياسة مدمجة" (Blended Policy) مؤقتة.
- التدريب: يتعلم الذكاء الاصطناعي من خلال التدرب على هذه السياسة المدمجة. يحصل على المكافأة (النقاط) إذا كانت الإجابة النهائية صحيحة.
- نظرًا لأن معلم التنسيق جزء من الخليط، فلن ينسى الذكاء الاصطناعي أبدًا كيفية الكتابة بشكل مرتب.
- نظرًا لأن معلم الاستنتاج جزء من الخليط، يمكن للذكاء الاصطناعي أن يكون حرًا في تصحيح الأخطاء الرياضية لمعلم التنسيق.
لماذا هذا أفضل (منتج الخبراء)
تستخدم الورقة مفهوم "منتج الخبراء" (Product of Experts). فكر في الأمر كقرار لجنة:
- إذا كان الخبير (أ) (التنسيق) واثقًا من الأسلوب، والخبير (ب) (الاستنتاج) واثقًا من الرياضيات، فإن القرار النهائي سيكون قويًا في كليهما.
- إذا كان الخبير (أ) مخطئًا في الرياضيات، فإن ثقة الخبير (ب) ستتجاوزه، لكن ثقة الخبير (أ) في الأسلوب تظل قائمة.
وجدت الورقة أن نهج "الصوت المدمج" هذا يعمل بشكل أفضل من طريقة "الشريط المطاطي" القديمة. فقد تعلم الذكاء الاصطناعي حل المسائل الرياضية بشكل صحيح واحتفظ بتنسيقه المرتب، في حين أن الطريقة القديمة غالبًا ما جعلت الذكاء الاصطناعي ينسى كيفية التنسيق أو يعلق في الأخطاء الرياضية لمعلم التنسيق.
التجارب
اختبر الباحثون ذلك على ثلاثة "امتحانات" (مجموعات بيانات):
- MATH: مسائل رياضية صعبة.
- cn-k12: رياضيات المدارس المتوسطة والثانوية الصينية.
- MMLU: المعرفة العامة والاستنتاج.
اختبروا ذلك على ثلاثة أحجام مختلفة من نماذج الذكاء الاصطناعي (صغير، متوسط، وكبير).
النتائج:
- في كل حالة تقريبًا، حصلت طريقة "الصوت المدمج" الجديدة على درجات أعلى من الطريقة التقليدية.
- كانت جيدة بشكل خاص في إصلاح مشكلة محددة: الطريقة التقليدية غالبًا ما جعلت الذكاء الاصطناعي "ينسى" كيفية تنسيق الإجابات أثناء تعلمه حل مسائل رياضية أصعب. أما الطريقة الجديدة فقد حافظت على مهارات التنسيق مع تحسين المهارات الرياضية.
مثال ملموس من الورقة
تقدم الورقة مثالًا محددًا لمسألة هندسية:
- معلم التنسيق (SFT): يضع المعادلة بشكل صحيح ولكنه يرتكب خطأً رياضيًا، مستنتجًا أن نصف القطر هو 6. ويضع الإجابة في إطار بشكل مرتب.
- معلم الاستنتاج (RL): يحسب الرياضيات بشكل صحيح، ليجد أن نصف القطر هو 5، ولكنه ينسى وضع الإجة في إطار أو كتابتها بالتنسيق النهائي.
- الصوت المدمج: يأخذ الرياضيات الصحيحة (5) من معلم الاستنتاج وتعليمات الإطار المرتب من معلم التنسيق. النتيجة النهائية هي الرقم 5 داخل إطار مرتب.
ملخص
تقدم الورقة طريقة لتدريب نماذج الذكاء الاصطناعي تعمل مثل فريق تعاوني بدلاً من تسلسل هرمي صارم. من خلال المتوسط الرياضي لـ "أفكار" (لوجيتات) معلم مرتب ولكنه فوضوي في الرياضيات، ومعلم ذكي ولكنه فوضوي في التنسيق، يتعلم الذكاء الاصطنا_اليكون ذكيًا ومرتبًا في آن واحد، متجنبًا عثرات إجبار أحدهما على اتباع الآخر بصرامة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.