← أحدث الأبحاث
🤖 machine learning

ReCode: Reinforcing Code Generation with Reasoning-Process Rewards

تقدم هذه الورقة ReCode، وهو إطار عمل جديد للتعلم التعزيزي يعمل على تحسين توليد الكود من خلال تدريب نموذج مكافأة لعملية الاستدلال عبر التعلم التبايني ودمجه مع بوابات قائمة على التنفيذ للتخفيف من حدة "اختراق المكافأة"، مما يؤدي إلى مكاسب كبيرة في الأداء تضاهي GPT-4-Turbo.

المؤلفون الأصليون: Lishui Fan, Yu Zhang, Mouxiang Chen, Zhongxin Liu

نُشر 2026-05-06
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Lishui Fan, Yu Zhang, Mouxiang Chen, Zhongxin Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتعليم متدرب عبقري ولكنه متهور أحياناً كيفية كتابة كود برمجي. في الماضي، كنت تكتفي فقط بفحص عمله النهائي: "هل اشتغل البرنامج دون أن ينهار؟ نعم؟ عمل جيد. لا؟ حاول مجدداً". هذا يشبه تقييم طالب بناءً على النتيجة النهائية فقط في اختبار رياضيات، دون النظر إلى كيفية حله للمسألة.

تجادل ورقة بحثية بعنوان "ReCode" بأن هذا النهج معيب. فأحياناً، يحصل المتدرب على الإجابة الصحيحة عن طريق الحظ أو التخمين، حتى لو كان منطقه فوضوياً أو خاطئاً. وفي أحيان أخرى، يمتلك خطة مثالية لكنه يرتكب خطأً مطبعياً بسيطاً. لكي تحصل على كود موثوق حقاً، عليك تعليمهم التفكير بوضوح قبل كتابة الكود.

إليك كيف يعمل ReCode، مقسماً إلى مفاهيم بسيطة:

1. المشكلة: فخ "الإجابة الصحيحة، والسبب الخاطئ"

طرق تدريب الذكاء الاصطناعي الحالية تشبه المعلم الذي يقول فقط "صحيح" أو "خاطئ" بناءً على النتيجة النهائية.

  • المشكلة: إذا خمن الذكاء الاصطناعي الكود الصحيح ولكن تفكيره الداخلي (الاستنتاج) كان فوضوياً، فإن الذكاء الاصطناعي يتعلم أن "الفوضى + الحظ = النجاح". هو لا يتعلم لماذا نجح الكود.
  • الهدف: نريد من الذكاء الاصطناعي أن يتعلم أن التفكير الجيد يؤدي إلى كود جيد، وليس مجرد أن "الحصول على الإجابة الصحيحة" هو الشيء الوح مند يهتم به.

2. الحل: ReCode (توليد الكود المعزز بالاستنتاج)

ReCode هو نظام تدريب جديد يحتوي على أداتين رئيسيتين، مثل مدرب يمتلك نموذج تقييم (Rubric) وبوابة أمان.

الأداة (أ): "نموذج التقييم" (CRPL)

لتعليم الذكنا الاصطناعي التفكير بشكل أفضل، يحتاج النظام أولاً إلى طريقة لتقييم كيفية تفكير الذكاء الاصطناعي، وليس فقط ما ينتجه.

  • التحدي: لا يوجد عدد كافٍ من المعلمين البشر لتقييم كل خطوة من خطوات تفكير الذكاء الاصطناعي.
  • الحيلة: ابتكر الباحثون "معلماً اصطناعياً". لقد أخذوا قطعة جيدة من الاستنتاج وطلبوا من ذكاء اصطناعي إنشاء نسختين منها:
    1. نسخة "الاستنتاج الفائق": نسخة حيث يتم ضبط المنطق، والتحقق من الحقائق، وجعل الخطوات أكثر وضوحاً.
    2. نسخة "الاستنتاج المعيب": نسخة حيث يضيف الذكاء الاصطناعي أخطاءً صغيرة عمداً، مثل تخطي خطوة أو ارتكاب خطأ واقعي.
  • النتيجة: من خلال عرض آلاف الأزواج من "التفكير الجيد مقابل السيئ" على الذكاء الاصطناعي، يتعلم النظام نموذج مكافأة (Reward Model). يعمل هذا النموذج كـ "محرر صارم" يمكنه القول: "هذه الفقرة من التفكير منطقية وواضحة"، أو "هذه الفقرة بها فجوة في المنطق"، حتى قبل كتابة الكود.

الأداة (ب): "بوابة الأمان" (CG-GRPO)

الآن، كيف نستخدم "درجة التفكير" هذه لتدريب الذكاء الاصطناعي دون خداعه؟

  • الخطر (تلاعب المكافأة - Reward Hacking): إذا قلت للذكاء الاصطناعي ببساطة "احصل على درجة عالية لتفكيرك"، فقد يتعلم كتابة فقرات طويلة، منمقة، ومربكة تبدو ذكية ولكنها لا تساعد فعلياً في كتابة الكود. الأمر يشبه طالباً يكتب مقالاً من 10 صفحات فقط للحصول على نقاط، حتى لو لم يحل المقال مسألة الرياضيات. هذا ما يسمى "تلاعب المكافأة".
  • الإصلاح: يقوم ReCode بتثبيت بوابة أمان.
    • يحصل الذكاء الاصطناعي على نقاط مقابل "التفكير الجيد" فقط إذا كان الكود النهائي يعمل ويجتاز الاختبارات.
    • إذا فشل الكود، يتم تجاهل "درجة التفكير"، بغض النظر عن مدى جمال الاستنتاج.
    • التشبيه: تخيل طباخاً. يمكنك الثناء على وصفته (الاستنتاج) فقط إذا كان الطبق مذاقه جيداً (التنفيذ). إذا كان الطبق محترقاً، فلا يهم مدى جودة الوصفة المكتوبة. هذا يجبر الذكاء الاصطناعي على ضمان أن تفكيره يؤدي فعلياً إلى نتيجة ناجحة.

3. النتائج: أذكى، أسرع، وأكثر موثوقية

اختبر الباحثون هذا النظام الجديد على نموذج ذكاء اصطناعي بـ 7 مليارات بارامتر (نموذج ذكي جداً، لكن ليس الأكبر).

  • الدفعة: تحسنت مهارات البرمجة لدى الذكاء الاصطناዊ المدرب باستخدام ReCode بنسبة 16.1% مقارنة بالنسخة القياسية.
  • المقارنة: قدم أداءً يضاهي GPT-4-Turbo، وهو نموذج أكبر بكثير وأكثر تكلفة، رغم أنه أصغر حجماً.
  • الكفاءة: ومن المثير للاهتمام، أن نموذج ReCode لم يكتفِ بكتابة كود أكثر فحسب؛ بل كتب كوداً أفضل بـ كلمات أقل. لقد توقف عن إضاعة الوقت في الحشو وانتقل مباشرة إلى النقطة المنطقية.
  • التعميم: جربوا هذا أيضاً على المسائل الرياضية، ونجح الأمر هناك أيضاً، مما يثبت أن تعليم الذكاء الاصطناي "التفكير بوضوح" يساعد في أي موضوع يتطلب منطقاً، وليس فقط البرمجة.

الملخص

فكر في ReCode كمعسكر تدريبي يرفض قبول "التخمينات المحظوظة".

  1. هو ينشئ حكماً متخصصاً يمكنه رصد الفرق بين عملية تفكير ذكية وأخرى غبية.
  2. يضع بوابة صارمة لا تسمح للذكاء الاصطناعي بالحصول على ائتمان لتفكيره الذكي إلا إذا كانت النتيجة النهائية تعمل بالفعل.
  3. النتيجة هي ذكاء اصطناعي لا يحفظ الإجابات فحسب، بل يتعلم كيف يستنتج طريقه نحو الحل، مما يجعله أكثر موثوقية وكفاءة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →