Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO
تحدد هذه الورقة وتُعالج انحياز التجميع في التعلم المعزز من نمط GRPO باستخدام المكافآت القابلة للتحقق عبر اقتراح "التجميع المتوازن"، وهي طريقة تقوم بمتوسط تدرجات مستوى الرمز (token-level gradients) للاستجابات الإيجابية والسلبية بشكل منفصل قبل إعادة دمجها، مما يؤدي إلى تحسين استقرار التدريب والأداء عبر اختبارات الاستدلال والبرمجة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
الصورة الكبيرة: تعليم الذكاء الاصطناعي حل الألغاز
تخيل أنك تقوم بتدريب روبوت على حل مسائل رياضية أو كتابة أكواد برمجية. تعطيه أمراً (Prompt)، ويحاول هو توليد إجابة. لتعليمه، تستخدم طريقة تسمى التعلم التعزيزي بالمكافآت القابلة للتحقق (RLVR).
فكر في الأمر كأنه برنامج مسابقات. يقوم الروبوت (الذكاء الاصطناعي) بتوليد عدة إجابات مختلفة (استجابات) لسؤال واحد. ثم يقوم حكم (برنامج كمبيوتر بسيط) بفحصها:
- إذا كانت الإجابة صحيحة، يحصل الروبوت على "إبهام للأعلى" (مكافأة إيجابية).
- إذا كانت خاطئة، يحصل على "إبهام للأسفل" (مكافأة سلبية).
الهدف هو تعليم الروبوت توليد المزيد من الإجابات ذات "الإبهام للأعلى" وتقليل الإجابات ذات "الإبهام للأسفل". تركز الورقة البحثية على طريقة تدريب محددة تسمى GRPO، وهي مشهورة لأنها بسيطة وتعمل بشكل جيد.
المشكلة: كيف نحسب الأصوات؟
القضية الجوهرية التي تعالجها الورقة هي سؤال دقيق ولكنه حاسم: عندما يولد الروبوت مجموعة من الإجابات، كيف نحسب "الدرس المتوسط" للتعلم منه؟
قد يولد الروبوت 16 إجابة في وقت واحد. بعضها قصير (5 كلمات)، وبعضها طويل (500 كلمة). بعضها صحيح، وبعضها خاطئ. تحتاج خوارزمية التدريب إلى دمج كل هذه الكلمات الفردية في "تحديث" واحد كبير لتحسين دماغ الروبوت.
هناك طريقتان رئيسيتان كان الناس يستخدمونهما، وتجادل الورقة بأن كلتيهما تحتوي على عيب خفي:
1. طريقة "عدد الكلمات" (تجميع الرموز - Token Aggregation)
- كيف تعمل: تقوم بعدّ كل كلمة (رمز) من كل الإجابات وتجمع متوسطها جميعاً.
- العيب (الشرير الثرثار): تخيل مجموعة من الطلاب يؤدون اختباراً.
- الطالب (أ): أجاب بشكل صحيح وكتب شرحاً موجزاً جداً (10 كلمات).
- الطالب (ب): أجاب بشكل خاطئ وكتب مقالاً طويلاً ومسهباً (500 كلمة).
- إذا قمت فقط بعدّ الكلمات، فإن إجابة الطالب (ب) الخاطئة سيكون لها "وزن" أكبر بـ 50 مرة من إجابة الطالب (أ) الصحيحة في المتوسط.
- النتيجة: يصاب الذكاء الاصطناعي بالارتباك. يعتقد أن الإجابات الطويلة والخاطئة أكثر أهمية لأنها تشغل مساحة أكبر. يُسمى هذا "الاقتران بين الإشارة والطول" (Sign-Length Coupling)؛ حيث يتسبب طول الإجابة بالخطأ في تغيير إشارة (الدرس) (سواء كان إيجابياً أو سلبياً).
2. طريقة "لكل شخص" (تجميع التسلسل - Sequence Aggregation)
- كيف تعمل: تقوم أولاً بحساب متوسط الدرس لكل إجابة على حدة، ثم تحسب متوسط تلك الإجابات معاً.
- العيب (الناخب الكسول): باستخدام مثال الطلاب نفسه:
- الطالب (أ) (قصير، صحيح): يحصل على صوت واحد.
- الطالب (ب) (طويل، خاطئ): يحصل على صوت واحد.
- النتيجة: هذا يحل مشكلة "الشرير الثرثار". ولكن الآن، يعامل الإجابة المكونة من 10 كلمات تماماً مثل الإجابة المكونة من 500 كلمة. إذا تعلم الذكاء الاصطناعي الكثير من شرح طويل ومفصل، فإن هذه الطريقة تتجاهل ذلك الجهد الإضافي. إنها "تقلل من وزن" الاستجابات الطويلة، وتتعامل معها كما لو كانت بسيطة مثل الاستجابات القصيرة.
الحل: "التجميع المتوازن" (Balanced Aggregation - BA)
تقترح المؤلفة طريقة جديدة تسمى التجميع المتوازن (BA). إنها تشبه حكماً ذكياً يصلح عيوب الطريقتين السابقتين.
كيف تعمل:
- فرز الإجابات: أولاً، يقوم الحكم بفصل الإجابات إلى كومتين: كومة "الجيد" (إبهام للأعلى) وكومة "السيئ" (إبهام للأسفل).
- عد الكلمات داخل كل كومة: داخل كومة "الجيد"، يتم عد جميع الكلمات وحساب متوسطها. داخل كومة "السيئ"، يتم عد جميع الكلمات وحساب متوسطها.
- موازنة الكومات: أخيراً، يتم دمج الكومتين. ولكن هنا تكمن الحيلة: لا يتم خلطهما عشوائياً. بل يتأكدون من أن كومة "الجيد" وكومة "السيئ" لهما تأثير متساوٍ على القرار النهائي، بغض النظر عن عدد الكلمات في كل كومة.
التشبيه:
تخيل مجلساً بلدياً يصوت على إنشاء حديقة جديدة.
- الطريقة القديمة 1 (عدد الكلمات): الأشخاص الذين يتحدثون لفترة أطول يحصلون على أصوات أكثر، حتى لو كانوا مخطئين.
- الطريقة القديمة 2 (لكل شخص): كل شخص يحصل على صوت واحد، حتى لو كتب أحد الأشخاص تقريراً من 50 صفحة بينما قال آخر "نعم" فقط.
- التجميع المتوازن: ينقسم المجلس إلى مجموعتين: "مع الحديقة" و"ضد الحديقة". يقومون بمتوسط الحجج داخل كل مجموعة. ثم يعطون مجموعة "المؤيدين" ومجموعة "المعارضين" وزناً متساوياً في القرار النهائي، مما يضمن أن طول الحجج لا يحرف النتيجة.
ماذا وجدوا؟
اختبر الباحثون هذه الطريقة الجديدة على نموذجين مختلفين من الذكاء الاصطناعي (Qwen2.5-Math-7B و Qwen3-1.7B) باستخدام مجموعات بيانات رياضية وبرمجية.
- الاستقرار هو المفتاح: غالباً ما كانت الطرق القديمة تعمل بشكل جيد في البداية، لكنها كانت تنهار أو تصبح غير مستقرة لاحقاً أثناء التدريب. كانت طريقة "عدد الكلمات" غير مستقرة بشكل خاص عندما بدأ الذكاء الاصطناعي في كتابة إجابات طويلة جداً وخاطئة.
- نتائج أفضل: أنتجت طريقة التجميع المتوازن (BA) باستمرار نتائج نهائية أفضل. كانت أكثر استقراراً، مما يعني أن الذكاء الاصطناعي يتعلم بثبات دون تقلبات حادة في الأداء.
- لماذا يهم هذا؟: تظهر الورقة أن "أفضل" طريقة لتدريب الذكاء الاصطناعي تعتمد على مدى تباين طول الإجابات.
- إذا كانت الإجابات تتباين بشكل هائل في الطول، فإن طريقة "عدد الكلمات" قد تكون محفوفة بالمخاطر.
- إذا كان الفرق بين أطوال الإجابات "الجيدة" و"السيئة" كبيراً جداً، فإن طريقة "لكل شخص" قد تكون غير عادلة.
- التجميع المتوازن يعمل بشكل جيد في كلا الحالتين لأنه يعالج التحيز المحدد لكل طريقة.
الخلاصة
تخلص الورقة إلى أن كيفية "خلط المكونات" (تجميع البيانات) في تدريب الذكاء الاصطناعي ليست مجرد تفصيل تقني صغير؛ بل هي خيار تصميمي رئيسي يحدد ما إذا كان الذكاء الاصطناعي سيتعلم بفعالية أم سيصاب بالارتباك. من خلال فصل الأمثلة "الجيدة" و"السيئة" قبل حساب المتوسط، ابتكر المؤلفون طريقة أكثر قوة واستقراراً وفعالية لتعليم الذكاء الاصطناعي التفكير والبرمجة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.