← أحدث الأبحاث
💬 NLP

A Relative-Budget Theory for Reinforcement Learning with Verifiable Rewards in Large Language Model Reasoning

تقترح هذه الورقة نظرية الميزانية النسبية للتعلم التعزيزي في استدلال النماذج اللغوية الكبيرة، حيث تُعرّف كمية رئيسية ξ\xi تحكم كفاءة العينات عبر الأنظمة الناقصة والمتوازنة والوفيرة، وتثبت تجريبياً أن الميزانية النسبية بين 1.5 و2.0 ترفع أداء التعلم إلى حده الأقصى.

المؤلفون الأصليون: Akifumi Wachi, Hirota Kinoshita, Shokichi Takakura, Rei Higuchi, Taiji Suzuki

نُشر 2026-02-03
📖 1 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Akifumi Wachi, Hirota Kinoshita, Shokichi Takakura, Rei Higuchi, Taiji Suzuki

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لا يتوفر بعدُ أي شرح بهذه اللغة.

جرّب: AR, DE, EN, ES, FR, HI, IT, JA, KO, NL, PT, ZH

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →