← أحدث الأبحاث
🤖 machine learning

Spend Your Rollouts Where It Counts: Rollout Allocation for Group-Based RL Post-Training

تقدم هذه الورقة Pilot-Commit، وهو إطار عمل لتخصيص التدفق (rollout) مدرك للميزانية يقوم بتحديد وتحديد أولويات المطالبات عالية التباين ديناميكيًا أثناء مرحلة ما بعد التدريب القائمة على التعلم المعزز المجموعي (group-based RL)، مما يقلل تكاليف أخذ العينات بشكل كبير ويسرع التقارب مقارنة بالطرق الحالية مثل GRPO وDAPO.

المؤلفون الأصليون: Woojeong Kim, Ziyi Yang, Jing Nathan Yan, Jialu Liu

نُشر 2026-05-27
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Woojeong Kim, Ziyi Yang, Jing Nathan Yan, Jialu Liu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك معلم يحاول مساعدة طالب على تعلم الرياضيات. لديك كمية محدودة من الوقت والطاقة (ميزانيتك) لتقديم مسائل تدريبية للطالب.

في عالم الذكاء الاصطناعي، وتحديداً عند تعليم النماذج اللغوية الكبيرة (LLMs) لتصبح أفضل في التفكير المنطقي، يكون "الطالب" هو الذكاء الاصطناعي، و"مسائل التدريب" تسمى العمليات التجريبية (rollouts). العملية التجريبية هي ببساطة محاولة الذكاء الاصطناعي لحل مسألة ما وتوليد إجابة لها.

المشكلة: إضاعة الوقت في الأسئلة السهلة أو المستحيلة

تعمل معظم طرق تدريب الذكاء الاصطناعي الحالية مثل معلم يوزع نفس عدد مسائل التدريب على كل الطلاب بشكل عشوائي، بغض النظر عما إذا كان الطالب يعرف الإجابة بالفعل أو يجد السؤال مستحيلاً.

  • مشكلة "السهل للغاية": إذا كانت المسألة سهلة جداً لدرجة أن الذكاء الاصطناعي يجيب عليها بشكل صحيح في كل مرة، فلا يوجد شيء جديد ليتعلمه. ومع ذلك، لا يزال الكمبيوتر يهدر الوقت في توليد الإجابات لها.
  • مشكلة "الصعب للغاية": إذا كانت المسألة صعبة جداً لدرجة أن الذكاء الاصطناعي يخطئ فيها في كل مرة، فهي أيضاً لا تعلمه الكثير لأن الإشارة تكون مشوشة للغاية.
  • منطقة "المثالية": يتعلم الذكاء الاصطناعي بشكل أفضل عندما تكون المسألة صعبة بما يكفي بحيث ينجح أحياناً ويخطئ أحياناً أخرى. هذا "الارتباك" يخلق إشارة تعلم قوية.

الأساليب الحالية (مثل GRPO و DAPO) تعامل كل مسألة بنفس الطريقة، مما يهدر قدرة حوسبة باهظة الثمن على الأسئلة "السهلة جداً" و"الصعبة جداً".

الحل: Pilot-Commit (التجربة ثم الالتزام)

يقترح مؤلفو هذه الورقة استراتيجية جديدة تسمى Pilot-Commit. فكر في الأمر كمعلم ذكي يستخدم عملية من خطوتين لتحديد المسائل التي تستحق وقت الطالب.

الخطوة 1: التجربة (اختبار المذاق)

قبل الالتزام بدرس كامل، يعطي المعلم الطالب "لمحة" صغيرة من المسألة (محاولات سريعة قليلة).

  • إذا أجاب الطالب بشكل صحيح في كل مرة؟ يضع المعلم علامة "سهل للغاية" ويتخطى المسألة في الوقت الحالي.
  • إذا أخطأ الطالب في كل مرة؟ يضع المعلم علامة "صعب للغاية" ويضعها جانباً لوقت لاحق.
  • إذا كان الطالب يعاني ولكنه ينجح أحياناً؟ يضع المعلم علامة "مثالي" (Goldilocks) (أي أنها مناسبة تماماً).

الخطوة 2: الالتزام (الدرس الرئيسي)

يأخذ المعلم الوقت والطاقة المتبقيين ويصرفهما فقط على مسائل "المثالية" التي تم تحديدها في مرحلة التجربة. إنه يتجاهل المسائل السهلة والمستحيلة.

لماذا هذا الأمر مهم؟

يدعي البحث أن طريقة "Pilot-Commit" تجعل الذكاء الاصطناعي يتعلم بشكل أسرع بكثير لأنها تتوقف عن إضاعة المال على المسائل التي لا تعلمه أي شيء جديد.

  • النتائج: في الاختبارات المتعلقة بمسائل الرياضيات، وصلت هذه الطريقة إلى نفس مستوى الدقة التي حققتها الطرق القديمة ولكن باستخدام عدد أقل بكثير من محاولات التدريب (العمليات التجريبية).
    • كانت أسرع بمعدل يصل إلى 1.9 مرة من إحدى الطرق القياسية (GRPO).
    • وكانت أسرع بمعدل يصل إلى 4.0 مرات من طريقة أخرى (DAPO).

تشبيه "الإبعاد"

تذكر الورقة أيضاً ميزة تسمى "الإبعاد" (Eviction). تخيل أنه مع زيادة ذكاء الطالب، تصبح بعض المسائل التي كانت يوماً ما "مثالية" هي مسائل "سهلة للغاية". يلاحظ نظام Pilot-Commit هذا، ويقوم بإزالة تلك المسالم التي تم حلها نهائياً من قائمة الأشياء التي يجب التدرب عليها، مما يضمن أن الكمبيوتر لن يهدر ثانية واحدة عليها مرة أخرى.

ملخص

باختصار، Pilot-Commit هو نظام ذكي لإدارة الميزانية في تدريب الذكاء الاصطناعي. بدلاً من التدرب على كل شيء بشكل أعمى، يقوم باختبار بعض المسائل بسرعة ليرى أي منها مفيد حقاً للتعلم، ثم يصب كل موارده في تلك التحديات المحددة. هذا يسمح للذكاء الاصطناعي بالوصول إلى مهارات رياضية خبيرة باستخدام قدر أقل بكثير من قدرة الحوسبة والوقت.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →