GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy
تقدم هذه الورقة البحثية GTPO وGRPO-S، وهما خوارزميتان جديدتان للتعلم التعزيزي تعملان على تعزيز استدلال النماذج اللغوية الكبيرة من خلال تنفيذ تشكيل مكافأة ديناميكي قائم على الإنتروبيا لتحقيق تخصيص دقيق للمسؤولية (credit assignment) على مستوى الرمز (token-level) ومستوى التسلسل (sequence-level)، مما يتغلب على القيود ذات الحبيبات الخشنة التي تعاني منها الأساليب الحالية مثل GRPO وDAPO.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة البحث "GTPO و GRPO-S: تشكيل المكافأة على مستوى الرمز (Token) والتسلسل باستخدام إنتروبيا السياسة" باستخدام لغة بسيطة وتشبيهات إبداعية.
المشكلة الكبرى: درجة "الكل أو لا شيء"
تخيل أنك تُعلّم طالباً (الذكاء الاصطناعي) كيفية حل مسألة رياضية طويلة ومعقدة للغاية. يكتب الطالب حلاً يتكون من 50 خطوة.
- الخطوات من 1 إلى 49 كانت عبقرية، منطقية، وصحيحة.
- الخطوة 50 (الإجابة النهائية) كانت خاطئة بسبب خطأ حسابي بسيط.
في الأساليب السائدة حالياً (مثل GRPO)، ينظر المعلم إلى النتيجة النهائية، ويرى أنها خاطئة، فيعطي المقال المكون من 50 خطوة درجة رسوب كاملة (صفر نقطة).
- النتيجة: يعتقد الطالب: "أوه، يبدو أن الخطوات من 1 إلى 49 كانت بلا فائدة أيضاً". فينسى الأجزاء الجيدة وقد يحاول نهجاً مختلفاً وعشوائياً تماماً في المرة القادﻤة.
- الخلل: يُسمى هذا "تخصيص الائتمان خشن الحبيبات" (Coarse-grained credit assignment). فهو يعامل سلسلة التفكير بأكملها ككتلة واحدة، متجاهلاً أن معظمها كان مثالياً بالفعل.
الحل: بوصلة "الإنتروبيا"
يقترح مؤلفو هذه الورقة طريقة جديدة لتقييم الطالب. لقد قدموا مفهوماً يسمى "إنتروبيا السياسة" (Policy Entropy).
فكر في الإنتروبيا كمقياس لـ "التفكير بعمق" أو "عدم اليقين".
- الإنتروبيا المنخفضة: يكون الطالب واثقاً جداً من نفسه. هو فقط يكتب ما يعرفه بالفعل (مثل: "1 + 1 = 2").
- الإنتروبيا العالية: الطالب يتوقف قليلاً، ويفكر في خيارات متعددة، ويصارع اتخاذ قرار صعب. إنه يستكشف مسارات مختلفة.
تجادل الورقة بأن الإنتروبيا العالية جيدة عندما تكون على صواب (فهذا يعني أنك استكشفت المسار الصحيح بعناية)، ولكن الإنتروبيا العالية سيئة عندما تكون على خطأ (فهذا يعني أنك كنت تخمن بثقة في الاتجاه الخاطئ).
الخوارزميتان الجديدتان
قدمت الورقة نوعين جديدين من "المعلمين" (الخوارزميات) اللذين يستخدمان بوصلة الإنتروبيا هذه لتقديم تغذية راجعة أفضل.
1. GTPO (تحسين سياسة الرموز الجماعية)
التشبيه: المعلم "المُحدد" (The Highlighter Teacher)
بدلاً من تقييم المقال بأكło، يقوم GTPO بتقييم كل كلمة (رمز/Token) بشكل فردي.
- إذا كان المقال صحيحاً: يقوم المعلم بتحديد الكلمات التي تردد فيها الطالب أو استكشف فيها خيارات مختلفة (إنتروبيا عالية) ويعطيها نقاط مكافأة إضافية. هذا يخبر الطالب: "عمل جيد، لقد فكرت بعمق في هذه الخطوة تحديداً!"
- إذا كان المقال غير صحيح: يبحث المعلم عن الكلمات التي كان فيها الطالب واثقاً جداً من نفسه ولكنه مخطئ (إنتروبيا منخفضة). ويعطي هذه الكلمات عقوبة شديدة. هذا يخبر الطالب: "لقد كنت واثقاً جداً من نفسك هنا، وكنت مخطئاً. لا تكن واثقاً بهذا الشكل في المرة القادمة".
لماذا يساعد هذا: إنه يحافظ على الأجزاء الجيدة من عملية الاستنتاج ويعاقب لحظات الثقة المفرطة المحددة التي أدت إلى الفشل.
2. GRPO-S (GRPO على مستوى التسلسل)
التشبيه: معلم "الشهادة المدرسية"
أحياناً، يكون تقييم كل كلمة على حدة بطيئاً جداً أو مرهقاً من الناحية الحسابية. GRPO-S هو نسخة أخف وزناً.
- بدلاً من النظر إلى الكلمات الفردية، ينظر إلى متوسط "جهد التفكير" للمقال بأكمله.
- إذا كان المقال صحيحاً: يتحقق مما إذا كان: "هل فكر الطالب بعمق واستكشف؟" إذا كان الأمر كذلك، يحصل المقال بأكمله على دفعة للأعلى.
- إذا كان المقال غير صحيح: يتحقق مما إذا كان: "هل كان الطالب مخطئاً بثقة؟" إذا كان الأمر كذلك، يحصل المقال بأكمله على عقوبة أكبر.
لماذا يساعد هذا: إنه أسرع ولكنه لا يزال أذكى من طريقة "الكل أو لا شيء" القديمة. وهو مفيد بشكل خاص في الحفاظ على استقرار الطالب أثناء مهام الاستنتاج الطويلة جداً.
النتائج: ماذا حدث؟
اختبر المؤلفون هؤلاء المعلمين الجدد في اختبارات رياضية صعبة (مثل AIME و MATH).
- الطريقة القديمة (GRPO/DAPO): غالباً ما كان الطالب يتعثر. فإما أن يستسلم بسرعة كبيرة أو "يعلق" في حلقة مفرغة من الإجابات الواثقة ولكن الخاطئة (انهيار السياسة - Policy Collapse).
- الطريقة الجديدة (GTPO/GRPO-S):
- الاستكشاف: استمر الطلاب في تجربة مسارات مختلفة لفترة أطول لأنهم كوفئوا على "التفكير بعمق" (الإنتروبيا العالية) عندما كانوا على صواب.
- الدقة: تعلموا التوقف عن كونهم مخطئين بثقة.
- الأداء: حققوا درجات أعلى بكثير في المسائل الرياضية الصعبة، وحلوا سلاسل استنتاج أكثر تعقيداً مما سبق.
ملخص في جملة واحدة
تعلم هذه الورقة نماذج الذكاء الاصطناعي ألا تعامل سلسلة التفكير الطويلة كدرجة واحدة "نجاح أو رسوب"، بل تعطيها بدلاً من ذلك شهادة تفصيلية تكافئها على التفكير بعمق عندما تكون على صواب وعلى التواضع عندما تكون على خطأ، مما يؤدي إلى استنتاج أكثر ذكاءً بكثير.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.