Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity
تحدد هذه الورقة أن أهداف التعلم المعزز القياسية ذات المكافآت القابلة للتحقق (RLVR) تؤدي إلى انهيار التنوع لكونها غير مبالية بتوزيع الكتلة الاحتمالية بين الحلول الصحيحة، وتقترح تحسين السياسة الموحدة الصحيحة (UCPO) لفرض توزيع موحد على المخرات الصالحة، مما يحسن بشكل كبير تنوع وتغطية العينات المتعددة مع الحفاظ على دقة المحاولة الواحدة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة بحثية بعنوان "تحسين السياسة الموحدة الصحيحة" (Uniform-Correct Policy Optimization) بلغة بسيطة وباستخدام تشبيهات من الحياة اليومية.
المشكلة الكبرى: فخ نهج "المقاس الواحد الذي يناسب الجميع"
تخيل أنك تقوم بتدريب طالب عبقري لحل المسائل الرياضية. تقول له: "هدفك هو إيجاد الإجابة الصحيحة".
في عالم الذكاء الاصطناعي، يسمى هذا RLVR (التعلم التعزيزي مع المكافآت القابلة للتحقق). يحاول الذكاء الاصطناعي حل مسألة ما، وإذا كانت الإجابة صحيحة، فإنه يحصل على "نجمة ذهبية".
المشكلة:
تجادل الورقة البحثية بأن طرق التدريب القياسية (مثل GRPO) تركز بشكل مفرط على الحصول على النجمة الذهبية، ولا تهتم بـ كيفية حصول الطالب عليها.
تخيل مسألة رياضية يمكن حلها بثلاث طرق مختلفة وصحيحة (الطريقة أ، الطريقة ب، والطريقة ج).
- الطريقة القديمة (GRPO): يحاول الذكاء الاصطناعي تجربة الطرق الثلاث. وبالصدفة البحتة، يحل مسألة ما باستخدام الطريقة (أ). فيحصل على نجمة ذهبية. وبما أنه حصل على نجمة، يعتقد الذكاء الاصطناعي: "الطريقة (أ) هي الأفضل! سأفعل ذلك في المرة القادمة". ويتوقف عن تجربة الطريقتين (ب) و(ج).
- النتيجة: يصبح الذكاء الاصطناعي بارعاً في الطريقة (أ). إنه يحصل على الإجابة الصحيحة في كل مرة تقريباً عندما يحاول لمرة واحدة (Pass@1). ولكن إذا طلبت منه المحاولة 64 مرة لترى ما إذا كان بإمكانه إيجاد أي حل، فإنه يفشل. لماذا؟ لأنه نسي الطريقتين (ب) و(ج). لقد انهار في عادة واحدة ضيقة.
تسمي الورقة البحثية هذا بـ "انهيار التنوع" (Diversity Collapse). يصبح الذكاء الاصطناعي مثل "لاعب بمهارة واحدة فقط".
التشخيص: لماذا يحدث هذا؟
وجد المؤلفون سببين رئيسيين لحدوث ذلك:
- الهدف غامض للغاية: تنص قاعدة التدريب على: "عظم عدد الإجابات الصحيحة". لكنها لا تقول: "عظم عدد الإجابات الصحيحة واستخدم كل الطرق الممكنة أيضاً". لذلك، فإن الذكاء الاصطناعي غير مبالٍ؛ فهو لا يعرف أنه يجب أن يكون متنوعاً.
- دورة "الغني يزداد غنى":
- تخيل أن الذكاء الاصطناعي يميل قليلاً بالصدفة لاختيار الطريقة (أ).
- وبما أنه يختار الطريقة (أ) بشكل متكرر، فإنه يحصل على ممارسة أكثر معها.
- تجعل تحديثات التدريب الطريقة (أ) أقوى.
- الآن يختار الطريقة (أ) بشكل أكثر تكراراً.
- في النهاية، لا يتم اختيار الطريقتين (ب) و(ج) أبداً، لذا لا يحصل الذكاء الاصطناعي على فرصة لتعلمهما مجدداً. وهكذا تموت هاتان الطريقتان.
الحل: السياسة "الموحدة-الصحيحة"
تساءل المؤلفون: "ما هي الطريقة المثالية لتصرف الذكاء الاصطناعي عندما تكون هناك إجابات صحيحة متعددة؟"
خلصوا إلى أن الذكاء الاصطناعي يجب أن يكون "موحداً-صحيحاً" (Uniform-Correct).
- موحد (Uniform): يجب أن يعامل كل حل صحيح (الطريقة أ، ب، وج) بنفس الطريقة تماماً. يجب أن يعطي كل منها فرصة متساوية (33% لكل منها).
- صحيح (Correct): يجب ألا يضيع الوقت في الإجابات الخاطئة.
فكر في هذا مثل طاهٍ يعرف ثلاث طرق مختلفة لصنع "أومليت" مثالي. "الطاهي الموحد-الصحيح" لا يلتزم بالطريقة الأولى التي صنعها؛ بل يدور بالتساوي عبر الطرق الثلاث لكي لا ينسى أبداً كيفية صنع الأخريات.
الأداة الجديدة: UCPO
لإصلاح فخ نهج "المقاس الواحد الذي يناسب الجميع"، طور المؤلفون طريقة تدريب جديدة تسمى UCPO (تحسين السياسة الموحدة الصحيحة).
كيف تعمل (التشبيه):
تخيل أن الذكاء الاصطناعي هو معلم يصحح درجات فصل من الطلاب (الحلول المختلفة).
- الطريقة القديمة (GRPO): المعلم يمدح فقط الطالب الذي رفع يده أولاً. الطلاب الآخرون يظلون صامتين وفي النهاية يتوقفون عن رفع أيديهم.
- الطريقة الجديدة (UCPO): ينظر المعلم إلى الفصل بأكم، فإذا كان الطالب (أ) قد رفع يده كثيراً، يقول المعلم: "أحسنت، ولكننا سنعطي مكافأة خاصة للطالب (ب) والطالب (ج) اللذين لم يرفعا أيديهما كثيراً".
تضيف UCPO "عقوبة" إلى التدريب. إذا بدأ الذكاء الاصطناعي في تفضيل حل واحد أكثر من اللازم، فإن التدريب يدفع به عكس الاتجاه ويقول: "لا، يجب عليك توزيع انتباهك بشكل أكثر توازناً عبر جميع الإجابات الصحيحة".
النتائج: ماذا حدث؟
اختبر الفريق هذه الطريقة على ثلاثة نماذج ذكاء اصطناعي مختلفة (من الصغير إلى الكبير) باستخدام اختبارات رياضية صعبة (مثل مسابقة AIME للرياضيات).
- بقيت الدقة عالية: ظل الذكاء الاصطناعي جيداً في إيجاد الإجابة الصحيحة من المحاولة الأولى (Pass@1) تماماً مثل الطرق القديمة.
- انفجر التنوع: عندما طلبوا من الذكاء الاصطناعي إنشاء 64 محاولة مختلفة، وجد الكثير من الحلول الفريدة والصحيحة.
- في الاختبار الأصعب (AIME24)، حسنت الطريقة الجديدة القدرة على إيجاد أي حل صحيح ضمن 64 محاولة بنسبة 10%.
- زاد تنوع المعادلات الرياضية المستخدمة في الإجابات بنسبة 45%.
الملخص
تظهر الورقة البحثية أن التدريب القياسي لنماذج الذكاء الاصطناعي يجعلها جامدة للغاية؛ فهي تجد طريقة واحدة لتكون صحيحة، وتلتزم بها، وتنسى جميع الطرق الأخرى الصالحة. الطريقة الجديدة، UCPO، تجبر الذكاء الاصطناعي على إبقاء جميع خياراته مفتوحة ومعاملة كل مسار صحيح كمسار ذي قيمة متساوية. وهذا يجعل الذكاء الاصطناعي أكثر قوة وإبداعاً دون المساس بدقته.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.