Constrained Group Relative Policy Optimization
تقدم هذه الورقة البحثية خوارزمية "Constrained GRPO"، وهي امتداد قائم على طريقة "لاغرانج" لتحسين عملية تحسين السياسة النسبي للمجموعات (Group Relative Policy Optimization)، والتي تعمل على تحسين فرض القيود واستقرار التدريب من خلال تحويل المزايا المعيارية إلى قيم عددية بدلاً من المكافآت الخام، وذلك للقضاء على آثار الاقتران الضارة الناتجة عن التقييس داخل المجموعة الواحدة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم الذكاء الاصطناعي سريع التطور، يقوم الباحثون بتعليم النماذج الحاسوبية الضخمة حل المشكلات المعقدة، من قيادة السيارات ذاتية القيادة إلى حل الألغاز الرياضية الصعبة. تتعلم هذه النماذج عن طريق التجربة والخطأ، وهي عملية تُعرف باسم "التعلم التعزيزي". تخيل طالباً يحاول حل متاهة؛ فهو يتلقى مكافأة عند الوصول إلى المخرج وعقوبة عند الاصطدام بجدار. بمرور الوقت، يتعلم الطالب كيفية تعظيم المكافآت وتجنب العقوبات. ومع ذلك، يبرز تحدٍ كبير عندما نريد من النموذج اتباع قواعد صارمة، مثل "عدم الاصطدام بالمشاة أبداً" أو "استخدام قواعد لغوية صحيحة دائماً"، مع محاولة أن يكون مفيداً في الوقت نفسه. إذا كانت القواعد صارمة للغاية، فقد يصبح النموذج عديم الفائدة؛ وإذا كانت فضفاضة للغاية، فقد يكسرها. ولحل هذه المشكلة، يستخدم العلماء إطاراً رياضياً يوازن بين الرغبة في النجاح والحاجة إلى الالتزام بالقيود، مع تعديل أهمية كل قاعدة أثناء تعلم النموذج.
لقد أصبحت طريقة شائعة لتعليم هذه النماذج، تسمى "تحسين السياسة النسبي للمجموعات" (Group Relative Policy Optimization)، مفضلة لأنها فعالة ولا تتطلب نموذج "حكم" منفصل لتقييم كل خطوة. بدلاً من ذلك، تقوم بمقارنة مجموعة من الإجابات المولدة لنفس السؤال لتحديد أي منها أفضل. وبينما تعمل هذه الطريقة بشكل جيد للمهام العامة، وجد الباحثون أن تطبيقها على قواعد السلامة الصارمة كان أمراً صعباً. وفي دراسة جديدة، اكتشف فريق من معهد "ميلا" (Mila) في كيبيك ومعهد "إيكول بوليتكنيك مونتريال" أن الطريقة القياسية لدمج الأهداف المختلفة في درجة واحدة كانت في الواقع تكسر قدرة النظام على اتباع القواعد. وقد قدموا نهجاً جديداً يسمى "تحسين السياسة النسبي للمجموعات المقيد" (Constrained Group Relative Policy Optimization)، والذي يعالج هذا الخلل ويسمح للنماذج بتعلم سلوكيات معقدة مع الالتزام الصارم بحدود السلامة.
كانت المشكلة الجوهرية التي حددها الباحثون هي كيفية تعامل الكمبيوتر مع أهداف متعددة في وقت واحد. في النهج القياسي، يأخذ النموذج جميع مكافآته وعقوباته، ويمزجها معاً في رقم واحد، ثم يقوم بتطبيع (normalization) هذا الرقم لتسهيل التعلم منه. وقد أظهر الباحثون أن عملية المزج هذه تخلق تداخلاً خفياً. فعندما يعدل الكمبيوتر وزن قاعدة واحدة، فإنه يغير دون قصد الأهمية النسبية لجميع القواعد الأخرى أيضاً. الأمر يشبه محاولة ضبط مستوى صوت آلة موسيقية واحدة في فرقة أوركسترا عن طريق تدوير مقبض يغير أيضاً توازن الفرقة بأكملها؛ قد تحاول جعل الكمان أعلى صوتاً، ولكن في القيام بذلك، تجعل الطبول هادئة جداً والفلويت عالياً جداً عن طريق الخطأ. وهذا يجعل من الصعب جداً على النموذج معرفة أي قاعدة يجب اتباعها بالضبط، مما يؤدي غالباً إلى تجاهل النموذج لقيود السلامة أو عدم استقراره أثناء التدريب.
ولإصلاح ذلك، قام الباحثون بتغيير ترتيب العمليات. فبدلاً من مزج المكافآات والعقوبات أولاً، تركوا النموذج يحسب قيمة كل قاعدة على حدة ويقوم بتطبيعها بشكل فردي. وفقط بعد معاملة كل قاعدة بإنصاف بمفردها، يقومون بدمجها باستخدام الأوزان المتعلمة. هذا التغيير البسيط يزيل التداخل الخفي. ومن خلال إبقاء الإشارات منفصلة حتى النهاية، يمكن للنموذج أن يرى بوضوح مدى تحسنه في كل قاعدة محددة. والنتيجة هي عملية تعلم أكثر استقراراً وقابلية للتنبؤ. وقد اختبر الباحثون هذه الطالة الجديدة في ثلاث بيئات مختلفة تماماً: لعبة بسيطة قائمة على الشبكة حيث يتعين على العميل تجنب الحمم وإدارة البطارية، ومحاكاة واقعية للقيادة الذاتية تتضمن آلاف السيناريوهات المرورية المعقدة، ومهمة استدلال رياضي تتضمن مسائل لفظية من المستوى المدرسي.
في اللعبة القائمة على الشبكة، سمحت الطريقة الجديدة للعميل بالتعلم بسلاسة أكبر. فقد تسبب النهج القياسي في جعل العميل حذراً للغاية، حيث يتجنب الحمم بشدة لدرجة أنه بالكاد يتحرك، بينما سمحت الطريقة الجديدة للعميل باستخدام "ميزانية" المخاطرة المتاحة له بفعالية، ليصل إلى الهدف مع البقاء آمناً. وفي محاكاة القيادة الذاتية، أنتج النهج الجديد سائقين ليسوا فقط أكثر أماناً، بل وأكثر فعالية في إكمال مساراتهم أيضاً. حققت النماذج التي تم تدريبها بالطريقة الجديدة درجات أعلى في الامتثال للسلامة وتقدم المسار مقارنة بالطرق السابقة التي كانت تمزج الإشارات أولاً. لقد نجحوا في تجنب الاصطدامات واتباع قوانين المرور دون التضحية بقدرتهم على المضي قدماً في القيادة، وهو توازن عانت منه الطرق الأخرى.
تضمن الاختبار النهائي تعليم نموذج لغوي لحل المسائل الرياضية مع ضمان أن تكون الإجابات قصيرة، ومنسقة بشكل صحيح، وتحتوي على أرقام صالحة. هنا، أثبتت الطريقة الجديدة تفوقها مرة أخرى. فالنماذج التي تم تدريبها باستخدام نهج المزج القياسي غالباً ما كانت تضحي بالصحة من أجل جعل إجاباتها أقصر أو لتناسب تنسيقاً معيناً. في المقابل، ضمنت الطريقة الجديدة أن يعطي النموذج الأولوية لصحة الرياضيات، مع الحفاظ في الوقت نفسه على معاييد عالية للتنسيق والطول. وعبر أحجام مختلفة من النماذج الحاسوبية، من الصغيرة التي تبلغ 1.5 مليار معلمة إلى الكبيرة التي تبلغ 7 مليارات معلمة، أنتج النهج الجديد باستمرار نتائج أكثر دقة دون الحاجة إلى مكونات تدريب إضافية مكلفة.
تشير النتائج إلى أن الطريقة التي ندمج بها إشارات التعلم المختلفة لا تقل أهمية عن الإشارات نفسها. فمن خلال تغيير بسيط في الترتيب الذي يعالج به الكمبيوتر مكافآته وقواعده، تمكن الباحثون من إنشاء نظام يحترم القيود بشكل أكثر موثوقية. لا يقدم هذا العمل مجرد تحسين طفيف؛ بل يوفر مساراً أوضح لتدريب الذكاء الاصطناعي للعمل بأمان في العالم الحقيقي، حيث يكون اتباع القواعد في كثير من الأحيان بنفس أهمية تحقيق الهدف. وتؤكد الدراسة أنه عندما نريد من الذكاء الاصطناعي أن يكون قادراً وآمناً في آن واحد، يجب ألا نسمح للطريقة التي نقيس بها النجاح بإرباك النموذج حول ما يفترض به القيام به بالفعل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.