← أحدث الأبحاث
💬 NLP

Rethinking RL for LLM Reasoning: It's Sparse Policy Selection, Not Capability Learning

تجادل هذه الورقة بأن التعلم المعزز يحسن قدرات الاستنتاج في النماذج اللغوية الكبيرة ليس عبر تعليم قدرات جديدة، بل من خلال إجراء تصحيحات نادرة ومتوقعة عند نقاط اتخاذ القرار ذات الإنتروبيا العالية، مما أدى إلى تطوير "ReasonMaxxer"، وهو أسلوب عالي الكفاءة وخالٍ من التعلم المعزز يضاهي أداء التعلم المعزز الكامل بتكلفة تدريب ضئيلة.

المؤلفون الأصليون: Ömer Faruk Akgül, Rajgopal Kannan, Willie Neiswanger, Viktor Prasanna

نُشر 2026-05-08
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ömer Faruk Akgül, Rajgopal Kannan, Willie Neiswanger, Viktor Prasanna

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

الفكرة الكبرى: النموذج يعرف الإجابة بالفعل

تخيل أن لديك طالباً ذكياً جداً (النموذج الأساسي - Base Model) يخوض اختباراً في الرياضيات. هذا الطالب يعرف الإجابات الصحيحة في معظم الأوقات، لكنه متردد قليلاً. عندما يصل إلى خطوة صعبة، قد يتردد ويقوم بـ "رمي عملة معدنية" للاختيار بين مسارين أو ثلاثة مسارات محتملة.

لفترة طويلة، اعتقد الباحثون أن التعلم التعزيزي (RL) يشبه مدرباً شديد الصرامة يعلّم الطالب طرقاً جديدة لحل المشكلات، مبتكراً استراتيجيات جديدة تماماً من الصفر.

هذه الورقة البحثية تجادل بأن هذا الاعتقاد خاطئ.

اكتشف المؤلفون أن "المدرب" (RL) لا يعلّم الطالب حِيلاً جديدة. بدلاً من ذلك، المدرب يهمس فقط: "مهلاً، عندما كنت متردداً عند الخطوة الخامسة، اخترت المسار الخاطئ. فقط اختر الخيار الثاني الأفضل الذي كنت تفكر فيه بالفعل".

الطالب كان يعرف الإجابة الصحيحة بالفعل؛ كان يحتاج فقط إلى دفعة بسيطة للالتزام بها.

الاكتشاف: الأمر كله يتعلق بـ "مفرق الطرق"

نظر الباحثون بدقة فيما يحدث داخل الكمبيوتر عندما يتعلم الذكاء الاصطعي من خلال التعلم التعزيزي (RL). ووجدوا ثلاثة أشياء مفاجئة:

  1. إنه أمر نادر للغاية: يقوم مدرب الـ RL بتغيير رأي الطالب في حوالي 1% إلى 3% فقط من الخطوات. في 97% من الاختبار، يفعل الطالب بالضبط ما كان يريد فعله على أي حال.
  2. إنه دائماً تغيير "آمن": المدرب لا يطلب من الطالب أبداً اختيار إجابة غريبة أو مجنونة لم يفكر فيها من قبل. هو يطلب منه فقط التحول إلى الخيار الثاني أو الثالث الأفضل الذي كان الطالب يفكر فيه بالفعل.
  3. يحدث فقط في لحظات "مفرق الطرق": هذه التغييرات تحدث فقط عندما يكون الطالب مرتبكاً (ارتفاع "الاعتلاج/الإنتروبي" - Entropy). إذا كان الطالب واثقاً، يظل المدرب صامتاً. وإذا كان الطالب غير متأكد، يشير المدرب إلى المفرق الصحيح.

التشبيه:
تخيل أنك تقود سيارة على طريق مألوف. أنت تعرف الطريق تماماً.

  • النموذج الأساسي هو أنت أثناء القيادة.
  • مدرب الـ RL هو نظام الـ GPS.
  • الرؤية القديمة: كنا نعتقد أن الـ GPS يعلمك كيفية قيادة سيارة لم ترها من قبل.
  • الرؤية الجديدة: الـ GPS يقول لك فقط: "أنت عند تقاطع مربك. كنت على وشك الانعطاف يساراً، ولكن يجب أن تنعطف يميناً بدلاً من ذلك". أنت كنت تعرف بالفعل كيف تنعطف يميناً؛ كنت تحتاج فقط إلى تذكير.

المشكلة: المدرب مكلف للغاية

حالياً، تدريب هؤلاء "المدربين" (RL) يشبه استئجار فريق ضخم من المهندسين لمراقبة الطالب وهو يؤدي الاختبار، ومحاكاة ملايين السيناريوهات، وحساب عمليات رياضية معقدة لمعرفة تلك الدفعة الصغيرة. وهذا يكلف آلاف الدولارات ويستغرق أسابيع من وقت الكمبيوتر.

تسأل الورقة البحثية: إذا كان المدرب يقوم فقط بالإشارة إلى نقاط محددة على خريطة نمتلكها بالفعل، فهل نحتاج إلى فريق التدريب الضخم والمكلف بالكامل؟

الحل: REASONMAXXER (الدفعة الذكية)

بنى المؤلفون طريقة جديدة رخيصة جداً تسمى REASONMAXXER. بدلاً من المدرب الضخم، يستخدمون أداة صغيرة ورخيصة.

إليك كيف تعمل، خطوة بخطوة:

  1. إيجاد الارتباك: يبحث النظام في أفكار الطالب (النموذج الأساسي) الخاصة. ويسأل: "أين تشعر بالارتباك؟" يستخدم خدعة رياضية بسيطة تسمى الاعتلاج (Entropy) للعثور على لحظات "مفرق الطرق" حيث يكون الطالب غير متأكد.
  2. الدفعة التباينية: يأخذ بضعة أمثلة على إصابة الطالب للحل الصحيح وبضعة أمثلة على إصابته للحل الخاطئ. ثم يقول: "في لحظات الارتباك هذه، عندما أصبت، اخترت هذا المسار. وعندما أخطأت، اخترت ذاك المسار. تذكر أن تختار الأول".
  3. تغييرات مجهرية: يقوم فقط بتحديث جزء مجهري من دماغ النموذج (أقل من 1% من معاملاته) لتذكر هذه القاعدة.

النتائج: نفس الذكاء، تكلفة ضئيلة

اختبرت الورقة البحثية هذه الطريقة الجديدة مقابل مدربي الـ RL التقليديين المكلفين على ستة معايير مختلفة للرياضيات.

  • الأداء: حققت REASONMAXXER أداءً يضاهي، أو حتى يتفوق على، نماذج الـ RL المكلفة.
  • التكلفة: هذه هي الصدمة الكبرى.
    • التعلم التعزيزي (RL) القياسي: يكلف ما بين 200 دولار و100,000 دولار للتدريب.
    • REASONMAXXER: يكلف حوالي 4 إلى 25 دولاراً للتدريب.
    • الوقت: يستغرق دقائق على بطاقة كمبيوتر واحدة، بينما يستغرق الـ RL أياماً أو أسابيع.

الخلاصة

تخلص الورقة البحثية إلى أن التوجه الكبير في الصناعة نحو استخدام التعلم التعزيزي (RL) الضخم والمكلف لتعليم التفكير للذكاء الاصطناعي قد يكون مبالغاً فيه.

"التفكير" ليس قوة خارقة جديدة نفتح مغاليقها؛ بل هو مجرد مسألة مساعدة الذكاء الاصطناعي على الالتزام بالخيار الصحيح عندما يكون غير متأكد.

نحن لا نحتاج إلى طاقم بناء ضخم لبناء منزل تم بناؤه بالفعل في معظمه؛ نحتاج فقط إلى عامل صيانة لشد بعض البراغي المرتخية في اللحظات الحرجة. REASONMAXXER هو ذلك العامل، وهو يقوم بالمهمة ببضعة سنتات.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →