← أحدث الأبحاث
📊 statistics

Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling

تقدم هذه الورقة البحثية Seesaw، وهو إطار عمل مبني على أسس منهجية يعمل على تسريع التدريب المسبق للنماذج اللغوية الكبيرة من خلال زيادة حجم الدفعة (batch size) وتعديل معدل التعلم في آن واحد للحفاظ على ديناميكيات الخسارة، مما يقلل وقت التدريب الفعلي بنسبة 36% تقريبًا مقارنة بجداول اضمحلال جيب التمام القياسية مع مطابقة الأداء عند تساوي العمليات الحسابية العائمة (FLOPs).

المؤلفون الأصليون: Alexandru Meterez, Depen Morwani, Jingfeng Wu, Costin-Andrei Oncescu, Cengiz Pehlevan, Sham Kakade

نُشر 2026-07-28
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Alexandru Meterez, Depen Morwani, Jingfeng Wu, Costin-Andrei Oncescu, Cengiz Pehlevan, Sham Kakade

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت عملاق وذكي للغاية فهم العالم من خلال تغذيته بجبل من الكتب. تُسمى هذه العملية "التدريب"، وهي المكون السري وراء برامج الدردشة الآلية وأدوات الذكاء الاصطناعي التي نراها اليوم. لكي يتعلم الروبوت جيداً، يحتاج إلى شيئين رئيسيين: "معدل التعلم"، وهو يشبه مدى تغيير رأيه بعد قراءة صفحة واحدة، و"حجم الدفعة"، وهو عدد الصفحات التي يقرؤها قبل أن يتوقف ليفكر ويعدل مساره.

لفترة طويلة، اعتقد العلماء أن أفضل طريقة لتسريع العملية هي مجرد إطعام الروبوت صفحات أكثر في المرة الواحدة (حجم دفعة أكبر) حتى يتمكن من معالجة البيانات بشكل أسرع. ولكن هناك عقبة: إذا كنت تغذيه بصفحات كثيرة جداً في المرة الواحدة دون تغيير طريقة تفكيره، فسيصاب بالارتباك ويتوقف عن التعلم بكفاءة. الأمر يشبه محاولة تعلم لغة عبر قراءة موسوعة كاملة في جلسة واحدة؛ قد تحصل على الحقائق، لكنك لن تفهم القواعد. السؤال الكبير الذي طرحه الباحثون هو: كيف نوازن بين قراءة المزيد من الصفحات والتفكير بعمق كافٍ للتعلم بشكل أسرع، دون أن يفقد الروبوت تركيزه؟

تقدم هذه الورقة البحثية استراتيجية ذكية جديدة تسمى Seesaw (الأرجوحة) لحل عملية التوازن هذه. فقد اكتشف الباحثون قاعدة رياضية تعمل مثل أرجوحة مثالية: كلما ضاعفت عدد الصفحات التي يقرؤها الروبوت في المرة الواحدة (حجم الدفعة)، لا ينبغي لك فقط إبقاء معدل التعلم كما هو أو تقسيمه إلى النصف. بدلاً من ذلك، يجب عليك ضبط معدل التعلم بمقدار محدد للغاية، وهو القسمة على الجذر التربيعي لـ 2 (حوالي 1.41).

فكر في الأمر بهذه الطوة: إذا ضاعفت حجم مجموعة الدراسة الخاصة بك (حجم الدفعة)، فلن تحتاج إلى إبطاء سرعة حديثك (معدل التعلم) بقدر ما قد تعتقد. باستخدام إيقاع "Seesaw" المحدد هذا، يمكن للروبوت معالجة نفس كمية المعلومات في خطوات أقل. أثبت المؤلفون ذلك رياضياً لمهام تعلم بسيطة، ثم اختبروه على نماذج لغوية ضخمة تحتوي على 150 مليون و300 مليون و600 مليون معامل (parameter). ووجدوا أنه باستخدام Seesaw، يمكنهم تدريب هذه النماذج بشكل أسرع بنسبة 36% تقريباً في الوقت الفعلي (وقت الساعة الحقيقية) مقارنة بالطرق القياسية، مع تحقيق نفس المستوى من الذكاء تماماً.

كما تحذر الورقة صراحة من الطمع الزائد. فإذا حاولت زيادة حجم الدفعة بقوة شديدة دون ضبط معدل التعلم بشكل صحيح، فإن عملية تعلم الروبوت تصبح غير مستقرة وتتوقف عن التحسن. أظهر المؤلفون أن هناك "نقطة تحول" حيث تنهار الرياضيات، وتظل طريقة Seesaw الخاصة بهم في الجانب الآمن من ذلك الخط. باختصار، Seesaw ليست مجرد تخمين؛ بل هي وصفة قائمة على أسس رياضية تسمح لنماذج الذكاء الاصطناعي بتعلم نفس الدروس في وقت أقل بكثير، مما يقربنا من بناء ذكاء اصطناعي أكثر ذكاءً دون الانتظار لأشهر حتى ينتهي التدريب.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →