← أحدث الأبحاث
💬 NLP

Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation

إنّ Nemotron-Cascade 2 هو نموذج MoE مدمج بحجم 30 مليار معلمة، يحقق أداءً بمستوى الميدالية الذهبية في الرياضيات والمعلوماتية والبرمجة التنافسية من خلال تقنيات Cascade RL المتقدمة والتقطير متعدد المجالات القائم على السياسة (on-policy distillation)، مما يوفر كثافة ذكاء تزيد بـ 20 مرة عن النماذج الرائدة الأكبر حجماً.

المؤلفون الأصليون: Zhuolin Yang, Zihan Liu, Yang Chen, Wenliang Dai, Boxin Wang, Sheng-Chieh Lin, Chankyu Lee, Yangyi Chen, Dongfu Jiang, Jiafan He, Renjie Pi, Grace Lam, Nayeon Lee, Alexander Bukharin, Mohammad Shoeybi
نُشر 2026-03-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhuolin Yang, Zihan Liu, Yang Chen, Wenliang Dai, Boxin Wang, Sheng-Chieh Lin, Chankyu Lee, Yangyi Chen, Dongfu Jiang, Jiafan He, Renjie Pi, Grace Lam, Nayeon Lee, Alexander Bukharin, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك متدرباً نابغاً وشاباً يُدعى Nemotron-Cascade 2. هذا المتدرب هو "نموذج لغوي كبير" (LLM) — وهو ببساطة عقل حاسوبي فائق الذكاء يمكنه الكتابة، والبرمجة، وحل المسائل الرياضية، والعمل كمساعد رقمي.

ما يجعل هذا المتدرب مميزاً ليس فقط ضخامة عقله (فهو في الواقع مدمج، حيث يمتلك 30 مليار "عصبون" فقط، بينما يمتلك منافسوه مئات المليارات)، بل طريقة تدريبه.

إليك قصة كيف أصبح هذا المتدرب حائزاً على الميدالية الذهبية، مشروحة ببساطة.

1. المشكلة: معضلة "الجوكر" (الذي يجيد كل شيء لكنه لا يتقن شيئاً)

تخيل أنك تريد تدريب طالب ليكون عالم رياضيات من الطراز العالمي، وساحر برمجة، وموظف خدمة عملاء مهذب، كل ذلك في آن واحد.

  • إذا علمته الرياضيات أولاً، فقد ينسى كيف يكون مهذباً.
  • إذا علمته البرمجة بعد ذلك، فقد ينسى الرياضيات.
  • إذا حاولت تعليمه كل شيء في نفس الوقت، فسيصاب بالارتباك ولن يتعلم أي شيء بشكل جيد.

هذه هي المشكلة في معظم عمليات تدريب الذكاء الاصطناعي. الأمر يشبه محاولة التلاعب بالكرات في الهواء أثناء ركوب دراجة أحادية العجلة؛ غالباً ما ستسقط شيئاً ما.

2. الحل: طريقة التدريب "المتتالي" (Cascade)

قدم الباحثون في NVIDIA أسلوب تدريب جديداً يسمى Cascade RL (التعلم المعزز). فكر في هذا كأنه معسكر تدريبي رياضي متخصص.

بدلاً من جعل الطالب يفعل كل شيء دفعة واحدة، قاموا بتدريبه بترتيب محدد، مثل المستويات في لعبة فيديو:

  1. المستوى 1: اتباع التعليمات. أولاً، يتعلم الطالب كيف يستمع. "افعل ما أقوله بالضبط، لا أكثر ولا أقل".
  2. المستوى 2: مهارات متعددة المجالات. بعد ذلك، يتعلم استخدام الأدوات (مثل الآلات الحاسبة أو محررات الأكواد) وحل المسائل العلمية.
  3. المستوى 3: شبكة الأمان "التقطير" (Distillation). هذا هو السر الخفي. بعد كل مستويات قليلة، يتم إقران الطالب بـ "معلم" (نسخة سابقة من نفسه كانت بارعة في مهمة محددة). يقوم الطالب بتقليد أفضل عادات المعلم لضمان عدم نسيان ما تعلمه سابقاً. إنه يشبه طالباً يراجع ملاحظاته القديمة قبل الانتقال إلى فصل أكثر صعوبة.
  4. المستوى 4: المواءمة البشرية. أخيراً، يتعلم كيف يكون مفيداً، غير ضار، ومبدعاً، تماماً مثل المساعد البشري الجيد.

3. "التقطير داخل السياسة" (مرتبة السرير ذات الذاكرة المرنة)

أحد أكبر المخاطر في تدريب الذكاء الاصطناعي هو النسيان الكارثي. تخيل أنك تتعلم عزف البيانو، ثم تتعلم عزف الكمان، وفجأة تجد نفسك لا تتذكر أوتار البيانو.

أضاف الباحثون تقنية تسمى التقطير متعدد المجالات داخل السياسة (MOPD).

  • التشبيه: تخيل أن الطالب يركض في ماراثون. في كل مرة يتعب فيها ويبدأ شكله في الترهل (نسيان المهارات القديمة)، يركض بجانبه مدرب (المعلم)، ليريَه بالضبط كيف يمسك ذراعيه وكيف يتنفس. يقوم الطالب فوراً بتقليد هيئة المدرب المثالية.
  • النتيجة: يصبح الطالب أقوى في مجالات جديدة (مثل حل البراهين الرياضية الصعبة) دون أن يفقد قدرته على القيام بالأساسيات (مثل كتابة بريد إلكتروني مهذب).

4. النتائج: أداء "الميدالية الذهبية"

بفضل طريقة التدريب الذكية هذه، فإن Nemotron-Cascade 2 هو نموذج بـ 30 مليار معلمة (عقل صغير وفعال) يؤدي كأنه نموذج بـ 300 مليار معلمة (عقل ضخم).

  • الأولمبياد: في عام 2025، شارك هذا النموذج في الأولمبياد الدولي للرياضيات (IMO) والأولمبياد الدولي للمعلوماتية (IOI). هذه هي أصعب مسابقات الرياضيات والبرمجة لطلاب المدارس الثانوية في العالم.
  • النتيجة: لم يكتفِ بالنجاح فح، بل فاز بـ ميداليات ذهبية. لقد حل مسائل تتطلب عادةً مستوى دكتوراه في الرياضيات أو خبيراً رفيع المستوى في علوم الحاسوب.
  • الكفاءة: حقق ذلك باستخدام 20 ضعفاً أقل من المعلمات مقارنة بالنماذج التي كانت تحمل الرقم القياسي السابق. إنه يشبه سيارة رياضية مدمجة تفوز بسباق ضد شاحنة ضخمة.

5. لماذا هذا مهم؟

  • الأصغر هو الأفضل: لم تعد بحاجة إلى حاسوب خارق بحجم مبنى لحل المشكلات المعقدة. هذا النموذج فعال بما يكفي ليعمل على أجهزة أصغر.
  • المصدر المفتوح: لم يخفِ المبتكرون "السر الخفي". لقد أطلقوا النموذج، وبيانات التدريب، والأساليب ليستخدمها الجميع. إنه يشبه إعطاء العالم وصفة الكعكة المثالية، وليس مجرد بيع الكعكة.
  • مهارات العالم الحقيقي: هو ليس جيداً في الرياضيات فحسب؛ بل هو أيضاً بارع في كتابة الأكواد، وتصحيح البرمجيات، والعمل كمساعد يمكنه استخدام الأدوات لإنجاز المهام.

باختاًصر

Nemotron-Cascade 2 هو ذكاء اصطناعي صغير وعالي الكفاءة، تعلم كيف يكون عبقرياً من خلال التدريب بترتيب "متتالي" صارم وخطوة بخوة، مع التحقق باستمرار من عمله مقابل أفضل أدائه السابق لضمان عدم نسيان أي مهارة. النتيجة هي نموذج يتفوق بمراحل على حجمه، حيث يفوز بميداليات ذهبية في الرياضيات والبرمجة مع بقائه صغيراً وسريعاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →