PlexRL: Cluster-Level Orchestration of Serviceized LLM Execution for RLVR
يُعد PlexRL بيئة تشغيل على مستوى العنقود تعمل على تحسين كفاءة تدريب التعلم التعزيزي بالمكافآت القابلة للتحقق (RLVR) من خلال تعدد الإرسال لخدمات النماذج اللغوية الكبيرة الموحدة عبر المهام لملء الفجوات الهيكلية الخاملة، مما يقلل تكاليف وحدات معالجة الرسومات للمستخدم بنسبة تصل إلى 37.58% دون عمليات نقل مكلفة للنماذج.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تدير مخبزاً ضخماً فائق التقنية. في هذا المخبز، لديك نوعان رئيسيان من العمل: الخبز (الذي يتطلب فرناً ضخماً وباهظ الثمن)، والتزيين (الذي يتطلب محطة أصغر وأسرع).
في عالم الذكاء الاصطناعي، وتحديداً عند تدريب نماذج "الاستنتاج" (مثل تلك التي تحل المسائل الرياضية)، يكون "الخبز" هو مرحلة التدريب (Training)، ويكون "التزيين" هو مرحلة التشغيل/الإنتاج (Rollout) (حيث يقوم الذكاء الاصطناعي بتوليد الإجابات).
المشكلة: متلازمة "الفرن الفارغ"
تعمل معظم عمليات تدريب الذكاء الاصطناعي الحالية مثل مخبز يحصل فيه كل طلب على فرن ومحطة تزيين خاصة به، حتى لو لم تكن مستخدمة طوال الوقت.
- المخبز "المجزأ": لديك فريق للخبز وفريق آخر للتزيين، لكنهما يعملان بنظام النوبات. عندما يعمل الخبازون، يجلس المزينون دون عمل. وعندما يعمل المزينون، يجلس الخبازون دون عمل. أنت تدفع ثمن فريقين كاملين، لكن واحداً فقط يعمل في كل مرة.
- المخبز "المتمركز": تضع فريق الخبز وفريق التزيين في نفس الغرفة لتوفير المساحة. لكن الفرن ضخم جداً (لأن نماذج الذكاء الاصطناعي ضخمة)، لذا يتعين على فريق التزيين الانتظار حتى ينتهي الخبازون قبل أن يتمكنوا حتى من لمس الطاولة. غالباً ما يكون الفرن أكبر بكثير من مهام التزيين الصغيرة، مما يهدر الطاقة.
- المخبز "غير المتزامن": تحاول جعل المزينين يعملون على كعكات الأمس بينما يعمل الخبازون على كعكات اليوم. هذا يساعد قليلاً، ولكن في النهاية، يصبح التوقيت فوضوياً، وينتهي بك الأمر إما بانتظار الكعك ليصبح قديماً أو بالانتظار بلا جدوى.
تسمي الورقة البحثية هذا "عدم الكفاءة المحلية للمهمة" (job-local inefficiency). كل مهمة تدريب ذكاء اصطناعي لديها هذه "الفجوات الخاملة" حيث تظل شرائح الكمبيوتر (GPUs) باهظة الثمن ثابتة دون القيام بأي شيء.
الحل: PlexRL (نظام "المطبخ المشترك")
قام المؤلفون ببناء نظام يسمى PlexRL. بدلاً من إعطاء كل مهمة ذكاء اصطناعي مطبخها الخاص، يحول PlexRL مركز البيانات بأكم له إلى مطبخ واحد ضخم ومشترك.
إليك كيف يعمل، باستخدام تشبيه المخبز:
- المدير المركزي (المجدول): تخيل رئيساً للطهاة لا يهتم أي طلب مخبز يتم إعداده حالياً، بل يهتم فقط بالمهام. يرى أن المهمة (أ) تقوم حالياً بـ "التزيين" (باستخدام جزء صغير من الفرن)، والمهمة (ب) تقوم بـ "الخبز" (باستخدام الجزء الكبير).
- تقسيم الوقت: يدرك المدير أنه بينما تنتظر المهمة (أ) وصول أداة ما، يمكن للمهمة (ب) استخدام نفس الفرن لبضع ثوانٍ. يقوم PlexRL بسرعة بتبديل "الحالة" (الوصفة والكعكة الحالية) داخل وخارج الفرن.
- عدم تحريك الفرن: عادةً، يستغرق نقل فرن ضخم إلى مطبخ جديد وقتاً طويلاً. PlexRL ذكي: فهو يبقي الفرن في مكانه ويقوم فقط بتبديل المكونات (ذاكرة نموذج الذكاء الاصطناعي) داخل وخارج الفرن بسرعة كبيرة. إنه يستخدم "مديراً للحالة" لتتبع مكان كل مكون، سواء كان على الطاولة (ذاكرة سريعة) أو في المجمد (تخزين أبطأ).
الخدعة السحرية: الفجوات "غير المترابطة"
السر يكمكمن في أن "أوقات الخمول" لمهام الذكاء الاصطناعي المختلفة نادراً ما تحدث في نفس الوقت.
- المهمة (أ) قد تكون في انتظار استدعاء أداة ما (توقف طويل).
- المهمة (ب) قد تكون في منتصف حسابات رياضية مكثفة (لا يوجد توقف).
يقوم PlexRL بملء فترة توقف المهمة (أ) بعمل المهمة (ب). الأمر يشبه سائق سيارة أجرة يأخذ راكباً متجهاً شمالاً، ثم يأخذ فوراً راكباً آخر متجهاً جنوباً، بدلاً من العودة إلى المرآب وهو فارغ.
النتائج
اختبرت الورقة البحثية هذا النظام على مجموعة ضخمة مكونة من 2,048 شريحة كمبيوتر (GPU) تقوم بتدريب نماذج ذكاء اصطناعي ذات أحجام مختلفة (من الصغيرة إلى الضخمة).
- توفير التكاليف: من خلال ملء كل تلك الفجوات الفارغة، خفضوا تكلفة التدريب بنسبة تصل إلى 37.58%. هذا يشبه الحصول على خصم بنسبة 37% على فاتورة الكهرباء الخاصة بك بمجرد أن تكون أكثر ذكاءً في تحديد وقت تشغيل الأضواء.
- السرعة: لم يؤثر ذلك على تعلم الذكاء الاصطناعي. لقد تعلمت النماذج بنفس الكفاءة كما في السابق؛ لقد وصلت فقط باستخدام موارد أقل.
- المرونة: لا يزال بإمكان الباحثين تجربة طرق جديدة أو غريبة أو معقدة لتدريب الذكاء الاصطناعي دون الحاجة إلى إعادة كتابة النظام بالكامل. يتولى PlexRL التعامل مع "السباكة" المعقدة لنقل البيانات حول، مما يسمح للباحثين بالتركيز على الرياضيات.
باختصار
PlexRL هو نظام يمنع معاملة مهام تدريب الذكاء الاصطنافت كجزر معزولة. بدلاً من ذلك، يعاملها كنظام حافلات مدينة مزدحم ومشترك. إنه يضمن أن "الحافلات" باهظة الثمن (شرائح الكمبيوتر) لا تسير أبداً وهي فارغة. من خلال التبديل الذكي لمختلف المهام داخل وخارج نفس الأجهزة، فإنه يوفر كمية هائلة من المال وقوة الحوسبة دون جعل الذكاء الاصطناعي أقل ذكاءً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.