← أحدث الأبحاث
💻 computer science

Aryabhata 2: Scaling Reinforcement Learning for Advanced STEM Reasoning

تقدم الورقة البحثية "Aryabhata 2"، وهو نموذج لغوي مدرب بالتعلم التعزيزي يعتمد على GPT-OSS-20B، والذي يحقق أداءً فائقاً وكفاءة أعلى في عدد الرموز (tokens) في الاختبارات التنافسية لمجالات العلوم والتكنولوجيا والهندسة والرياضيات (STEM) مثل JEE وNEET، وذلك من خلال الاستفادة من منهج تعليمي عالي الجودة واستكشاف التوسع التدريجي.

المؤلفون الأصليون: Ritvik Rastogi, Vishal Singh, Tejas Chaudhari, Sandeep Varma

نُشر 2026-05-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ritvik Rastogi, Vishal Singh, Tejas Chaudhari, Sandeep Varma

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك طالباً عبقرياً ولكنه مشتت قليلاً يُدعى GPT-OSS-20B. هذا الطالب قرأ مكتبة ضخمة من الكتب ويعرف الكثير من الحقائق، ولكن عندما تطلب منه حل مسألة رياضية أو علمية معقدة متعددة الخطوات (مثل تلك الموجودة في أصعب امتحانات دخول الكليات في الهند)، فإنه أحياناً يسترسل في الكلام، أو يرتبك، أو يستغرق وقتاً طويلاً في كتابة الإجابة. قد يصل إلى الإجابة الصحيحة، لكنه يستخدم الكثير من "الحبر" (رموز الكمبيوتر/Tokens) للقيقام بذلك، مما يجعله مكلفاً وبطيئاً.

أراد مؤلفو هذه الورقة البحثية تحويل هذا الطالب إلى بطل في حل المشكلات دون شراء "دماغ أكبر" (نموذج أكبر). لقد ابتكروا طالباً جديداً يُدعى Aryabhata 2.

إليك كيف فعلوا ذلك، مشروحاً عبر تشبيهات بسيطة:

1. ساحة التدريب: مدرب صارم

بدلاً من مجرد ترك الطالب يقرأ المزيد من الكتب (وهو ما يفعله التدريب القياسي)، قام الباحثون بدور المدرب الصارم باستخدام التعلم المعزز (Reinforcement Learning).

  • نظام المكافأة: تخيل لعبة فيديو حيث تحصل فقط على النقاط إذا حللت لغزاً بشكل صحيح وَشرحته بوضوح. إذا حصل الطالب على الإجابة بشكل خاطئ، يحصل على صفر من النقاط. وإذا حصل على الإجابة صحيحة ولكنه كتب مقالاً من 10 صفحات بينما كان يكفي شرح من فقرة واحدة، فإنه يحصل على درجة أقل.
  • "القاضي": لم يكتفِ المدرب بالثقة في كلام الطالب. لقد استخدموا "قاضياً" فائق الذكاء (ذكاء اصطناعي آخر) لفحص كل خطوة بمفردها. إذا لم تكن الحسابات الرياضية دقيقة أو كان المنطق معيباً، يتم رفض الإجابة فوراً.

2. المنهج الدراسي: من السهل إلى المستحيل

لم يلقِ الباحثون بالطالب في العمق مباشرة. بل بنوا له معسكراً تدريبياً من ثلاثة مستويات:

  • المستوى 1 (التنسيق): أولاً، علموه كيفية إمساك القلم بشكل صحيح. ركزوا على التأكد من أن الإجابة تبدو مرتبة وتتبع هيكلاً محدداً.
  • المستوى 2 (العمل الشاق): بعد ذلك، أعطوه آلاف المسائل التدريبية. ومع تحسن مستوى الطالب، جعل المدرب المسائل أكثر صعوبة. إذا استمر الطالب في الحصول على نسبة 70% صحيحة، يقوم المدرب باستبدال الأسئلة بأسئلة أكثر دهاءً وتعقيداً.
  • المستوى 3 (الورقة الرابحة): أخيراً، تركوا الطالب يجرب طرقاً عديدة لحل نفس المسألة الصعبة في وقت واحد. تخيل أن تطلب من الطالب تجربة 128 مساراً مختلفاً لحل متاهة في آن واحد. ساعد هذا في اكتشاف طرق مختصرة ذكية لم يكن قد رآها من قبل.

3. السر الخفي: "الاستكشاف الموسع"

عادةً عند تدريب الذكاء الاصطنا المصمم، قد تطلب منه حل مسألة مرة واحدة. لكن Aryabhata 2 تم تدريبه على توليد محاولات عديدة مختلفة لكل سؤال.

  • التشبيه: فكر في الأمر كأنك محقق يحل جريمة. بدلاً من اتباع حدس واحد، يرسل المحقق 128 فريقاً مختلفاً للبحث عن الأدلة. إذا وجد حتى فريق واحد فقط الدليل الصحيح، تُحل القضية. ساعدت هذه الطريقة النموذج على إيجاد "المسار الذهبي" للإجابة بشكل أسرع وأكثر موثوقية.

4. النتائج: أسرع، أذكى، وأكثر رشاقة

عندما اختبروا Aryabhata 2 في امتحانات حقيقية (مثل JEE و NEET) وحتى في مسابقات الرياضيات فائقة الصعوبة (مثل AIME)، كانت النتائج مبهرة:

  • دقة أفضل: لقد حل مسائل صحيحة أكثر من "نموذجه الأب" (GPT-OSS-20B) بل وتفوق على بعض النماذج الأكبر والأكثر تكلفة.
  • توفير "الرموز" (Tokens): هذا هو الفوز الأكبر. فالنموذج الأصلي غالباً ما يكتب شروحات طويلة ومتعرجة. تعلم Aryabhata 2 أن يكون موجزاً. لقد استخدم كلمات (رموز) أقل بنسبة تصل إلى 64% للحصول على نفس النتيجة (أو نتيجة أفضل).
    • التشبيه: إذا كان النموذج القديم يشبه سائحاً يلتقط 100 صورة للعثور على اللقطة المثالية، فإن Aryabhata 2 يشبه مصوراً محترفاً يلتقط اللقطة المثالية بضغطة واحدة.

الخلاصة

تزعم الورقة أنه من خلال استخدام مجموعة محددة للغاية وعالية الجودة من أسئلة التدريب وطريقة تدريب متعددة المراحل وذكية، حولوا نموذج ذكاء اصطناعي قياسي بـ 20 مليار معلمة إلى خبير متخصص في الاستنتاج العلمي والتقني (STEM). لم يكن بحاجة لأن يكون نموذجاً ضخماً ليكون ذكياً؛ بل احتاج فقط إلى النوع الصحيح من الممارسة ومدرب يعرف تماماً كيف يكافئ السلوك الجيد.

ما لم يدّعوه:
لا تدعي هذه الورقة أن هذا الذكاء الاصطناعي يمكنه استبدال المعلمين البشر، أو تشخيص الحالات الطبية، أو يُستخدم في المحادثات العامة. إنه مصمم خصيصاً لحل مسائل العلوم والرياضيات والهندسة الموجودة في الامتحانات التنافسية، ليعمل كمعلم خصوصي عالي الكفاءة لهذه المواد المحددة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →