← أحدث الأبحاث
🤖 machine learning

Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning

تُعد Molt إطار عمل مفتوح المصدر، مدمج ومبني أصلياً على PyTorch، صُمم لتبسيط أبحاث التعلم التعزيزي الوكيل عبر تمكين التعديلات الخوارزمية من البداية إلى النهاية دون التضحية بالأداء، مع تقديم تكافؤ إحصائي مع حزم Megatron المتطورة مع ضمان اتساق الكود البرمجي ووضوح البنية.

المؤلفون الأصليون: Jian Hu, Huiying Li, Hao Zhang, Binfeng Xu, Yifan Zhang, Shaokun Zhang, Hemil Desai, Michael Demoret, Pavlo Molchanov, Jan Kautz, Yi Dong

نُشر 2026-07-27
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jian Hu, Huiying Li, Hao Zhang, Binfeng Xu, Yifan Zhang, Shaokun Zhang, Hemil Desai, Michael Demoret, Pavlo Molchanov, Jan Kautz, Yi Dong

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل عالماً لا تكتفي فيه الحواسيب بالإجابة على الأسئلة، بل تخوض فيه مغامرات حقيقية، وتحل الألغاز، وتكتب الأكواد، وحتى تلعب الألعاب لتتعلم كيف تصبح أكثر ذكاءً. هذا هو الأفق المثير لـ التعلم التعزيزي الوكيل (Agentic Reinforcement Learning). فكر في الأمر كتدريب شخصية في لعبة فيديو، ليس عبر إعطائها نصاً مكتوباً، بل بتركها تلعب اللعبة، وترتكب الأخطاء، وتتعلم من المكافآت التي تحصل عليها. الهدف هو بناء وكلاء ذكاء اصطناعي يمكنهم التفكير بأنفسهم، واستخدام الأدوات، والتعامل مع المهام المعقدة متعددة الخطوات.

ومع ذلك، فإن بناء هؤلاء الوكلاء الأذكياء يشبه حالياً محاولة إصلاح سيارة سباق بينما هي تنطلق بسرعة 200 ميل في الساعة. إن أدوات البرمجيات التي يستخدمها الباحثون لتدريب هؤلاء الوكلاء ضخمة ومعقدة ومبنية للمصانع الصناعية العملاقة. إذا أراد باحث تجربة فكرة جديدة — مثل تغيير كيفية تعلم الوكيل من خطأ ما — فغالباً ما يتعين عليه البحث عبر طبقات من الأكواد المربكة، تماماً كفك تشابك كرة ضخمة من الخيوط. وهذا يجعل التجربة بطيئة ومحبطة. السؤال الكبير هو: هل يمكننا بناء نظام تدريب قوي وسريع بما يكفي لأكبر الحواسيب الفائقة، وفي الوقت نفسه بسيط ونقي بما يكفي لباحث واحد ليفهمه ويعدله في غضون ظهيرة يوم واحد؟

تقدم هذه الورقة البحثية Molt، وهو إطار عمل تدريبي جديد صُمم لحل هذه المشكلة تحديداً. يرى المؤلفون، وهم فريق من شركة NVIDIA، أنك لست بحاجة إلى آلة ضخمة ومعقدة لتدريب ذكاء اصطناعي قوي؛ بل تحتاج فقط إلى آلة أكثر نظافة وقابلية للقراءة. لقد بنوا Molt ليكون إطار عمل "أصيلاً في PyTorch" (PyTorch-native)، مما يعني أنه يتحدث نفس لغة أكثر أدوات برمجة الذكاء الاصطناعي شيوعاً، ويحافظ على كل شيء في مكان واحد.

النتيجة الرئيسية للورقة البحثية هي أن Molt فعال للغاية. فهو صغير بما يكفي لكي يتمكن باحث بشري (أو حتى مساعد برمجة يعمل بالذكاء الاصطناعي) من قراءة قاعدة الكود بأكملها وفهم كيفية تعلم الوكيل من البداية إلى النهاية. وعلى الرغم من كونه أصغر وأبسط بكثير من الأنظمة الأخرى، فقد قاس المؤلفون أداءه ووجدوا أنه مكافئ إحصائياً للأنظمة الأكثر تقدماً وضخامة المستخدمة اليوم. وفي اختبار مباشر، درب MolT نموذج ذكاء اصطناعي بنفس سرعة منافس معقد، مما يثبت أنك لست بحاجة للتضحية بالسرعة من أجل البساطة.

تجادل الورقة البحثية صراحة ضد فكرة أن تعقيد "النطاق الفائق" (hyperscale) ضروري للبحث الجيد. فهم يرفضون التصور الذي يقضي بوجوب توريث الباحثين آلاف الأسطر من الأكواد المربكة لمجرد إجراء تجربة. بدلاً من ذلك، يظهرون أنه من خلال الحفاظ على الكود نظيفاً ومركزاً على الخوارزمية الأساسية، يمكنك تحقيق نفس النتائج. كما أنهم يفندون فكرة أن "انزياح الرموز" (token drift) — حيث تولد الحواسب كلمة ثم تعد نسخة مختلفة منها أثناء التدريب — أمر مقبول؛ إذ يضمن Molt تدريب الذكاء الاصطناعي على نفس الرموز التي ولدها بالضبط، مما يمنع حدوث أخطاء خفية.

باختصار، Molt هو حلقة تدريب "رشاقة" تسمح للباحثين بالتحرك بسرعة دون كسر الأشياء. إنه يستخدم إعداداً ذكياً حيث يولد الذكاء الاصطناه إجابات، ويرسلها عبر طابور بسيط، ويتدرب فوراً، كل ذلك مع الاحتفاظ بسجل مثالي لكل خطوة. وقد قاس المؤلفون ذلك على نموذج ضخم مكون من 35 مليار بارامتر، بل وأظهروا نجاحه أيضاً على نموذج مكون من 700 مليار بارامتر، مما يشير إلى أن هذا النهج البسيط يمكن أن يتوسع ليصل إلى أكبر تحديات الذكاء الاصطناعي دون الحاجة إلى أن يصبح معقداً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →