Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR
تقدم هذه الورقة البحثية خوارزمية "تحسين سياسة التسلسل غير المنحاز للطول" (LUSPO)، وهي خوارزمية جديدة تُحلل وتُصحح نظرياً انحياز الطول في "تحسين سياسة تسلسل المجموعة" (GSPO) لمنع انهيار طول الاستجابة، مما يحقق أداءً هو الأفضل من نوعه في مهام الاستدلال الرياضي ومتعدد الوسائط.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تقوم بتدريب طالب عبقري (نموذج ذكاء اصطناعي) لحل الألغاز الرياضية والمنطقية المعقدة. لمساعدته على التعلم، تستخدم طريقة تسمى التعلم المعزز بالمكافآت القابلة للتحقق (RLVR). فكر في الأمر كمدرب يعطي الطالب مسألة، ويتركه يحاول حلها، ثم يتحقق من الإجابة. إذا كانت الإجابة صحيحة، يحصل على نجمة ذهبية؛ وإذا كانت خاطئة، يكتفي بقول "حاول مرة أخرى" بلطف.
مع مرور الوقت، يتعلم الطالب كيف يفكر لفترة أطول وأعمق، عبر تقسيم المسائل الكبيرة إلى خطوات صغيرة. عملية "التفكير بصوت عالٍ" هذه أمر بالغ الأهمية لحل المهام الصعبة.
ومع ذلك، اكتشف مؤلفو هذه الورقة البحثية عيبًا خفيًا في كيفية تقييم طرق التدريب الحالية (تحديدًا الخوارزميات المسماة GRPO و GSPO) للطلاب.
المشكلة: فخ "الإجابة القصيرة"
تخيل أن المدرب يقوم بتصحيح اختبار.
- العيب: نظام التصحيح الحالي يعاقب الطلاب عن طريق الخطأ إذا كتبوا شروحات طويلة ومفصلة، حتى لو كانت تلك الشروحات صحيحة. الأمر يشبه معلمًا يعطي درجة أقل لطالب كتب مقالاً مثالياً من 5 صفحات مقارنة بطالب كتب مقالاً من صفحة واحدة، وذلك ببساطة لأن رياضيات معادلة التصحيح تحابي المقالات الأقصر.
- النتيجة: يدرك الطلاب (نماذج الذكاء الاصطناعي) بسرعة أنه لكي يحصلوا على أفضل درجة، يجب عليهم التوقف عن التفكير بعمق وتقديم إجابات قصيرة وسريعة فقط.
- الانهيار: في تجارب الورقة البحثية، تسببت إحدى الطرق الشائعة (GSPO) في حدوث "انهيار" في استجابات الذكاء الاصطناعي. بدأ الذكاء الاصطناعي يعطي إجابات موجزة وكسولة للغاية، فاقداً قدرته على التفكير المنطقي في المسائل المعقدة. كان الأمر أشبه بعداء ماراثون قرر فجأة المشي لأن خط النهاية يتم تقريبه في كل مرة يخطو فيها خطوة طويلة.
الحل: LUSPO (المدرب العادل)
اقترح المؤلفون، فانفان ليو وفريقه من "Meituan"، طريقة جديدة تسمى تحسين سياسة التسلسل غير المنحاز للطول (LUSPO).
فكر في LUSPO كمدرب جديد وأكثر عدلاً يقوم بإصلاح معادلة التصحيح.
- الإصلاح: يقول المدرب الجديد: "لا يهم إذا كانت إجابتك تتكون من 10 كلمات أو 1,000 كلمة. إذا كان الاستنتاج صحيحًا، فستحصل على الدرجة كاملة". لقد قاموا بتعديل الرياضيات بحيث لا يؤدي طول الإجابة إلى رفع أو خفض الدرجة بشكل غير عادل.
- التشبيه: إذا كانت الطريقة القديمة تشبه الحكم على خطاب بناءً على عدد الكلمات القليلة التي استخدمتها، فإن LUSPO يشبه الحكم بناءً على مدى جودة توصيل أفكارك، بغض النظر عما إذا كنت تحدثت لمدة 5 دقائق أو 30 دقيقة.
ماذا حدث عندما جربوا ذلك؟
اختبر الفريق هذه "المدرب العادل" الجديد على أنواع مختلفة من نماذج الذكاء الاصطناعي (بعضها يقرأ النصوص فقط، وبعضها يمكنه أيضًا رؤية الصور والرسوم البيانية).
- بدأ الذكاء الاصطناعي يفكر لفترة أطول: بدلاً من تقليص إجاباتهم، بدأت النماذج في كتابة شروحات أطول وأكثر تفصيلاً. لقد كانوا مستعدين لاستغراق الوقت في "التفكير" في المسألة.
- نتائج أفضل: لأن النماذج بدأت تفكر بعمق أكبر، أصبحت أفضل في حل الألغاز الرياضية والمنطقية الصعبة. في الاختبارات، سجلت النماذج المدربة بأسلوب LUSPO درجات أعلى من تلك التي تدربت بالأساليب القديمة.
- على سبيل المثال، في اختبار رياضي صعب (AIME24)، حسنت الطريقة الجديدة الدرجات بنسبة تصل إلى 6.9% في نموذج واحد و 2.9% في نموذج آخر.
- وفي الألغاز البصرية (النظر إلى المخططات والرسوم البيانية)، تفوقت أيضًا على أفضل الطرق السابقة.
- الاستقرار: أصبحت عملية التدريب أكثر استقرارًا. لم تصبح النماذج مرتبكة أو تبدأ في تقديم إجابات كسولة؛ بل استمرت في تحسين قدرتها على التفكير المنطقي باستمرار.
الخلاصة
تظهر الورقة البحثية أن الطريقة التي ندرب بها الذكاء الاصطناعي حاليًا على "التفكير" تحتوي على خطأ برمجي خفي يجعلهم يرغبون في أن يكونوا كسالى وموجزين. ومن خلال إصلاح هذا الخطأ باستخدام LUSPO، يصبح الذكاء الاصطناعي طالبًا أكثر اجتهادًا، مستعدًا لكتابة حلول طويلة ومفصلة ودقيقة للمسائل المعقدة. إنه تغيير بسيط في الرياضيات يؤدي إلى سلوك ذكاء اصطناعي أكثر ذكاءً بكثير.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.