Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR
تقدم هذه الورقة البحثية SARA، وهي طريقة تخصيص تدحرج تتابعية تكيفية تعمل على تحسين كفاءة الحوسبة في التعلم التعزيزي مع المكافآت القابلة للتحقق (RLVR) من خلال اتخاذ قرار ديناميكي بشأن الاستمرار في أخذ عينات المحفزات أو التخلي عنها بناءً على إشارات الفعالية المبكرة، مما يقلل بشكل كبير من عمليات التدحرج الضائعة مع الحفاظ على أداء النموذج أو تحسينه.
المؤلفون الأصليون:Pixel Nomand, Elena Voss, Marcus Hale, Sofia Reyes
تخيل أنك تدير مسابقة طبخ ضخمة لتدريب روبوت طباخ. الهدف هو تعليم الروبوت كيفية حل الألغاز المعقدة، مثل المسائل الرياضية أو التخطيط لرحلة، من خلال جعله يجرب آلاف الوصفات والحصول على "نعم، لقد نجح الأمر!" أو "لا، لقد فشل!" لكل محاولة. تسمى هذه العملية "التعلم التعزيزي بالمكافآت القابلة للتحقق". المشكلة هي أن الروبوت بطيء ومكلف في التشغيل؛ ففي كل مرة يجرب فيها وصفة، يستهلك كمية هائلة من قوة الحاسوب (تسمى عمليات المحاكاة أو الـ rollouts).
إليك المشكلة: غالبًا ما يعلق الروبوت في حلقة مفرغة. فأحيانًا، يجرب وصفة سهلة جدًا وينجح فيها في كل مرة، وفي أحيان أخرى، يجرب وصفة صعبة للغاية ويفشل فيها في كل مرة. في كلتا الحالتين، تكون النتيجة مملة ومتوقعة. إذا كانت كل محاولة في مجموعة معينة ناجحة، أو كل محاولة فاشلة، فإن الروبوت لا يتعلم شيئًا جديدًا لأنه لا يوجد عنصر مفاجأة لتحليله. إنه يشبه معلمًا يصحح اختبارًا حيث حصل جميع الطلاب على 100% أو 0%؛ فلا يستطيع المعلم معرفة من يحتاج إلى المساعدة أو من هو مستعد للمستوى التالي. الطريقة الحالية لإصلاح ذلك هي الاستمرار في الطبخ حتى نجد ما يكفي من "المجموعات المختلطة" (بعضها صحيح وبعضها خاطئ)، لكن هذا يهدر الكثير من الطاقة على تلك المجموعات المملة والمتوقعة.
تقدم هذه الورقة البحثية استراتيجية جديدة ذكية تسمى SARA (تخصيص المحاكاة المتتابع والتكيفي) لوقف إهدار هذه الطاقة. بدلًا من الطبخ بشكل أعمى لمجموعات كاملة من الوصفات والأمل في الحصول على نتيجة جيدة، يعمل SARA مثل "مساعد طباخ" ذكي يتذوق الطبق بعد بضع لقمات فقط. إذا أدرك الطباخ مبكرًا أن وصفة ما ستكون كارثة مطلقة (كلها خاطئة) أو فوزًا مضمونًا (كلها صحيحة)، فإن SARA يوقف الطبخ لتلك الوصفة فورًا. إنه يرمي بقية المكونات لتلك الوصفة المحددة ويستخدم الطاقة التي تم توفيرها لبدء طبخ وصفة جديدة وغير معروفة.
اختبر المؤلفون هذا على مسائل الرياضيات والتخطيط باستخدام نماذج ذكاء اصطناği صغيرة على بطاقة رسوميات واحدة. ووجدوا أن SARA فعال للغاية؛ فقد تمكن من تدريب الروبوت بنفس كفاءة الطرق القديمة المهدرة للطاقة، ولكنه استخدم عدد محاولات (rollouts) أقل بنسبة 22%. والأفضل من ذلك، عندما دمجوا SARA مع طريقة تخمن أي الوصفات قد تكون مثيرة للاهتمام، كانت النتيجة هي أفضل دقة حتى الآن، باستخدام عدد محاولات أقل بنسبة 67% من النهج القياسي الذي "يجرب كل شيء". تثبت الورقة رياضيًا أن التوقف المبكر هذا موثوق ولا يتخلص بالخطأ من فرص التعلم الجيدة. باختصار، يعلم SARA الروبوت أن يتوقف عندما يكون في وضع جيد (أو سيئ) وأن ينفق طاقته فقط على الألغاز التي تجعله أكثر ذكاءً بالفعل.
ملخص تقني: SARA (تخصيص التوليد المتكيف المتسلسل)
بيان المشكلة
تعاني عملية التعلم المعزز بالمكافآت القابلة للتحقق (RLVR) حالياً من اختناق ناتج عن تكلفة توليد المخرجات (rollout generation). في المقدرات القائمة على المجموعات مثل تحسين السياسة النسبية للمجموعة (GRPO)، تعتمد مساهمة المطالبة (prompt) في تدرج السياسة على تباين المكافآت داخل مجموعتها التي تم أخذ عينات منها. إذا كانت المجموعة "مشبعة" (جميع الاستجابات صحيحة أو جميعها خاطئة)، فإن تباين المكافأة يكون صفراً، مما يؤدي إلى تلاشي الميزة المعيارية (normalized advantage) وانعدام إشارة التعلم.
تواجه الطرق الحالية للتخفيف من هذا الهدر مقايضة:
التقييم ثم التصفية (مثل العينات الديناميكية/DS): تقوم هذه الطرق بالإفراط في أخذ عينات من مجموعة مرشحة كبيرة، وتوليد مجموعات كاملة لجميع المطالبات، ثم استبعاد المجموعات المشبعة. وبينما يضمن ذلك الحصول على مجموعة نظيفة من المجموعات الفعالة، إلا أنه يتكبد تكلفة توليد هائلة (غالباً 4 أضعاف أو أكثر من العينات المنتظمة) لأنه يدفع مقابل التوليد الكامل للمطالبات التي سيتم استبعادها في النهاية.
التنبؤ ثم الاختيار: تقدر هذه الطرق صعوبة المطالبة قبل أخذ العينات لإعطاء الأولوية للمطالبات الواعدة. وبينما تتجنب هذه الطرق عمليات التوليد الإضافية، إلا أنها تعتمد على توقعات قد تكون هشة عندما تتغير السياسة بسرعة، مما يؤدي إلى دفعات ملوثة إذا كانت التوقعات غير دقيقة.
تقرر كلتا الطريقتين مستوى "المطالبة" (prompt level) قبل ملاحظة الديناميكيات الداخلية للمجموعة. ومع ذلك، لاحظت الورقة أن فعالية المجموعة غالباً ما تُحسم مبكراً ضمن تسلسل عمليات التوليد الخاصة بها. لذا، فإن إنفاق ميزانية مجموعة كاملة على مطالبة كشفت بالفعل أنها ستكون مشبعة يعد هدراً حوسبياً.
المنهجية: SARA
يقترح المؤلفون SARA (تخصيص التوليد المتكيف المتسلسل)، والذي يعيد صياغة جمع التوليد لكل خطوة كمسألة تخصيص متسلسل مقيدة بالميزانية (التوقف الأمثل). بدلاً من توليد عدد ثابت من المخرجات (k) لكل مطالبة، يقوم SARA بفحص المطالبات في جولات مجمعة، مع تحديث المعتقدات واتخاذ القرارات بناءً على النتائج الملحوظة.
الآليات الجوهرية
النمذجة البايزية (Bayesian Modeling): لكل مطالبة q، يحتفظ SARA بتوزيع خلفي (posterior distribution) من نوع "بيتا" على معدل النجاح الكامن γq. في البداية، يتم استخدام توزيع سابق منتظم. بعد ملاحظة n من المخرجات مع s من النجاحات، يتم تحديث التوزيع الخلفي إلى Beta(α0+s,β0+n−s).
متنبئ الفعالية ذو الصيغة المغلقة: يحسب SARA احتمال التنبؤ الخلفي (peff) بأن تكون المجموعة ذات حجم k "فعالة" (نتائج مختلطة) بناءً على السوابق الحالية.
إذا كان السوابق مختلطة بالفعل (1≤s≤n−1)، فإن peff=1.
إذا كان السوابق كلها فشل أو كلها نجاح، يتم حساب peff تحليلياً باستخدام دالة بيتا. وبالنسبة لتوزيع سابق منتظم وسوابق كلها فشل، يتبسط هذا إلى peff(n,0)=k+1k−n.
قاعدة توقف ثنائية العتبة: بناءً على peff، يطبق SARA قاعدة قرار متسلسلة تشبه اختبار نسبة الاحتمال المتسلسل (SPRT) لـ "والد":
الالتزام (COMMIT): إذا كانت المجموعة مختلطة (فعالة)، يتم إضافتها إلى دفعة التدريب فوراً.
التخلي (ABANDON): إذا انخفضت peff عن عتبة دنيا τlow، تُعتبر المطالبة من المرجح أنها مشبعة. يتم تحرير الميزانية المتبقية لهذه المطالبة.
الاستمرار (CONTINUE): خلاف ذلك، تحصل المطالبة على مخرج واحد إضافي.
إعادة تخصيص الميزانية: يتم تحرير الميزانية من المطالبات المتخلى عنها وإعادة تخصيصها فوراً لمطالبات جديدة من المجموعة. هذا يضمن أن الميزانية الإجمالية الثابتة تحقق عدداً أكبر من المجموعات الفعالة مقارنة بالتخصيص المنتظم.
الخصائص الخوارزمية
التعامد (Orthogonality): يعمل SARA في مرحلة جمع التوليد، مما يجعله متوافقاً مع أي استراتيجية لاختيار المطالبات (على سبيل المثال، يمكن دمجه مع العينات الديناميكية).
لا توجد عمليات توليد إضافية: على عكس الطرق التنبؤية التي تتطلب استدعاءات لنماذج مساعدة لتقدير الصعوبة، يستخدم SARA فقط المخرات التي كان سيولدها المحسن على أي حال.
التزامن: تعمل الخوارزمية في دفعات متزامنة مع الجولات للحفاظ على إنتاجية الاستدلال، وهي تتطلب عادةً 2-4 جولات تزامن فقط لكل خطوة.
المساهمات الرئيسية
إعادة صياغة المشكلة: حدد المؤلفون "القابلية للتقرير المبكر" لفعالية المجموعة وأعادوا صياغة جمع التوليد كمسألة تخصيص متسلسل، وهي متميزة عن اختيار المطالبة على مستوى المطالبة.
خوارزمية SARA: اشتقوا متنبئ "بيتا-ثنائي الحد" (Beta-Binomial) ذا صيغة مغلقة وقاعدة توقف ثنائية العتبة، مما خلق مخصصاً لا يتطلب التنبؤ والتوليد يندمج في خطوط أنابيب GRPO الحالية.
الضمانات النظرية:
موثوقية التخلي: احتمال التخلي الخاطئ عن مجموعة فعالة محدود بالعتبة τlow.
توفير التوليد: العدد المتوقع للمخرات المستهلكة لكل مطالبة هو أقل بصرامة من k الثابت المستخدم في العينات الديناميكية (DS)، مع زيادة التوفير مع نمو حجم المجموعة k.
هيمنة العائد: عند ميزانية ثابتة، يضمن SARA عدداً أعلى أو مساوياً من المجموعات الفعالة مقارنة بالتخصيص المنتظم.
الارتباط بالتدرج: تعظيم عائد المجموعات الفعالة يؤدي مباشرة إلى تعظيم الحد الأدنى لمعيار مربع تدرج GRPO المتوقع.
التحقق التجريبي: تجارب واسعة النطي على مهام الاستدلال المنطقي والتخطيط باستخدام نماذج 1.5B و 3B.
النتائج التجريبية
تم التقييم على وحدة معالجة رسومية واحدة باستخدام نماذج R1-Distill-Qwen-1.5B و Qwen2.5-3B على مجموعات بيانات مثل MATH و AIME24 و Countdown:
الكفاءة مقابل العينات الديناميكية (DS): يطابق SARA دقة العينات الديناميكية (التي تستخدم "أوراكل" لتصفية المجموعات المشبعة) بينما يستخدم 22% أقل من المخرات.
التركيب مع الاختيار التنبئي: يؤدي الجمع بين SARA والعينات الديناميكية (SARA+DPS) إلى أفضل دقة، متفوقاً قليلاً على "أوراكل" العينات الديناميكية، مع استخدام 67% أقل من المخرات مقارنة بـ DS.
توفير الرموز (Tokens): نظرًا لأن مسارات "الفشل الكلي" المتخلى عنها تميل لأن تكون الأطول، فإن توفير الرموز يكون أكثر بروزاً من توفير المخرات.
المتانة: على عكس الاختيار التنبئي، الذي يتدهور مع تغير السياسة، يحافظ SARA على نسبة دفعة فعالة تقارب 100% طوال التدريب من خلال الاعتماد على التحقق داخل العينة.
التوافق: يحسن SARA الأداء عبر خوارزميات RL المختلفة (PPO, GRPO, RLOO, Reinforce++) عند استبدال جمع المخرات المنتظم.
الأهمية والادعاءات
تدعي الورقة أن SARA يقدم حلاً "يجمع بين أفضل ما في العالمين" من خلال القضاء على الحاجة إلى الإفراط في أخذ العينات المكلف (مثل DS) وتجنب هشاشة التوقعات قبل أخذ العينات. ومن خلال الاستفادة من الأدلة الإحصائية الموجودة داخل مجموعة المخرات نفسها، يحقق SARA كفاءة تدريب عالية دون الحاجة إلى استدعاءات نماذج مساعدة.
يضع المؤلفون SARA كرافعة كفاءة أساسية لـ RLVR، خاصة مع زيادة أحجام المجموعات لتقليل التباين. ويشيرون إلى أنه بينما يفترض المنهج مكافآت ثنائية قابلة للتحقق ومخرات مستقلة وموزعة بشكل متماثل (i.i.d) داخل المجموعة، فإن منطق التخصيص المتسلسل لـ SARA متعامد مع طرق اختيار المطالبة والتحكم في الطول، مما يسمح بتوسعات مستقبلية للمكافآت المستمرة والمخرات ذات الهيكل الشجري. يوضح العمل أن توفيرات حوسبية كبيرة في مرحلة ما بعد التدريب لنماذج الاستدلال (Reasoning-LLM) يمكن تحقيقها من خلال استراتيجيات التوقف الأمثل بدلاً من مجرد تحسين اختيار المطالبات.