💬 NLP
Nemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning Models
تقدم الورقة البحثية نموذج Nemotron-Cascade، وهو نموذج استدلال عام بقدرة 14 مليار معلمة يحقق أداءً هو الأفضل في فئته عبر مختلف المعايير من خلال توظيف استراتيجية تعزيز تعلم متدرجة ومجالية للتغلب على التحديات الهندسية والتدريبية المتمثلة في عدم التجانس عبر المجالات، مع إثبات أن محاذاة التعلم المعزز من التغذية الراجعة البشرية (RLHF) تعزز قدرات الاستدلال بشكل كبير بما يتجاوز مجرد تحسين التفضيلات.
Boxin Wang, Chankyu Lee, Nayeon Lee, Sheng-Chieh Lin, Wenliang Dai, Yang Chen, Yangyi Chen, Zhuolin Yang, Zihan Liu, Moh (…)2026-03-30