GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents
تقدم الورقة البحثية إطار العمل GROW، وهو إطار للتعلم التعزيزي يعمل على تكييف تحسين السياسة النسبية للمجموعة (GRPO) لوكلاء نماذج الرؤية واللغة في العوالم المفتوحة من خلال تفكيك المسارات الكاملة إلى عينات حالة-فعل للتغلب على قيود طول السياق، محققةً أداءً هو الأفضل على الإطلاق في أكثر من 800 مهمة في ماينكرافت.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تعلم روبوتًا كيف يلعب لعبة فيديو معقدة مثل Minecraft. يمتلك الروبوت كاميرا (عينيه) ويمكنه الكتابة على لوحة المفاتيح وتحريك الفأرة (يديه). هدفه هو إكمال مهام مثل "بناء منزل"، "تعدين الذهب"، أو "هزيمة وحش".
لفترة طويلة، كانت أفضل طريقة لتعليم هذه الروبوتات هي الضبط الدقيق الخاضع للإشراف (SFT). فكر في الأمر كأنك تعرض على الروبوت فيديو للاعب بشري خبير يلعب اللعبة بشكل مثالي وتقول له: "انسخ تمامًا ما فعله". المشكلة هي أن العثور على ساعات من اللعب البشري المثالي أمر مكلف، وإذا قام الروبوت بمجرد حفظ الفيديو، فسيصاب بالارتباك عندما تتغير اللعبة قليلًا.
بعد ذلك، جرب الباحثون التعلم التعزيزي (RL)، وتحديدًا خوارزمية تسمى GRPO. هذا يشبه ترك الروبوت يلعب اللعبة، يفشل، ينجح، ويتعلم من النتائج. ومع ذلك، كان لـ GRPO القياسي عيب رئيسي عند تطبيقه على الألعاب ذات العوالم المفتوحة: فقد تعامل مع جلسة اللعب بأكملها كدرس واحد طويل.
المشكلة: الدرس "الطويل جدًا"
تخيل أنك تحاول تعلم كيفية خبز كعكة.
- GRPO القياسي يشبه تسليمك كتابًا مكونًا من 500 صفحة يتضمن قصة طفولتك، ونشرة الطقس قبل ثلاثة أيام، والوصفة، وقصة كلب جارك، وكل ذلك مختلط معًا. يخبرك الكتاب: "لقد خبزت كعكة جيدة في النهاية، لذا فإن كل شيء في هذا الكتاب المكون من 500 صفحة كان جيدًا".
- في الورقة البحثية، يُطلق على هذا اسم "المسار الكامل" (full trajectory). بينما يلعب الروبوت Minecraft، يصبح تاريخ ما رآه وفعله أطول وأطول. وفي النهاية، يصبح "الكتاب" ضخمًا جدًا ومليئًا بالضجيج غير ذي الصلة (مثل المشي ذهابًا وإيابًا لمدة 10 دقائق قبل العثور على كتلة)، مما يجعل الروبوت يشعر بالإرهاق ولا يستطيع معرفة أي حركة محددة أدت إلى النجاح.
الحل: GROW (نهج "بطاقة الوصفة")
يقترح المؤلفون إطار عمل جديد يسمى GROW (محاذاة GRPO مع نمذجة الحالة-الإجراء).
بدلاً من إعطاء الروبوت الكتاب المكون من 500 صفحة بالكامل، يقوم GROW بتقسيم جلسة اللعب إلى قطع صغيرة تشبه بطاقات الوصفة.
- تفكيك الحالة-الإجراء (State-Action Decomposition): يقوم GROW بتفكيك جلسة اللعب الطويلة إلى لحظات فردية: "انظر إلى الكتلة" + "انقر بالفأرة" + "ضربة المعول".
- التغذية الراجعة الذكية: إذا نجح الروبوت في النهاية، لا يقول GROW "كل شيء في اللعبة بأكملها كان رائعًا". بدلًا من ذلك، ينظر إلى البطاقات المحددة التي أدت إلى الفوز. يقول: "الحركة التي قمت بها قبل 5 ثوانٍ من العثور على الذهب كانت جيدة جدًا. أما الحركة التي قمت بها قبل 20 دقيقة عندما كنت تمشي فقط؟ فقد كانت جيدة فحسب".
كيف يعمل (التشبيه)
فكر في مدرب يدرب لاعب كرة قدم.
- الطريقة القديمة (GRPO القياسي): يشاهد المدرب المباراة بأكملها لمدة 90 دقيقة، ويرى اللاعب يسجل هدفًا، ثم يصرخ: "عمل رائع! لقد فعلت كل شيء بشكل صحيح من الدقيقة الأولى حتى الأخيرة!" يصاب اللاعب بالارتباك لأنه في الواقع قام بتمريرة سيئة للغاية في الدقيقة العاشرة كادت أن تضيع المباراة.
- طريقة GROW: يقوم المدرب بتفكيك المباراة. "تلك التمريرة في الدقيقة العاشرة كانت مهملة. لكن الركضة التي قمت بها في الدقيقة 80؟ مثالية. والركلة في الدقيقة 89؟ عبقرية". يتعلم اللاعب تحديدًا أي إجراءات يجب عليه تكرارها.
"السحر" الرياضي
تتضمن الورقة البحثية برهانًا رياضيًا (التحليل البديل - Surrogate Analysis) لطمأنتنا بأن نهج "تقطيع الدرس" هذا لا يزال صالحًا.
- المخاوف: تتطلب الرياضيات المعتادة لهذا النوع من التعلم عادةً مقارنة محاولات مختلفة من نفس نقطة البداية تمامًا. يقوم GROW بمقارنة لحظات مختلفة في الوقت، وهي جميعًا مختلفة.
- النتيجة: أثبت المؤلفون أنه على الرغم من اختلاف نقاط البداية، فإن "الدرجة" التي يحصل عليها الروبوت لا تزال تعكس بدقة مدى جودة استراتيجيته. إنه يشبه تقييم طالب في اختبار رياضيات: حتى لو كانت الأسئلة مختلفة، فإن الدرجة النهائية لا تزال تخبرك ما إذا كان يتحسن في الرياضيات أم لا.
النتائج: هزيمة اللعبة
اختبر الفريق نظام GROW على أكثر من 800 مهمة مختلفة في Minecraft، تتراوح بين التنقل في الكهوف إلى صنع الأدوات ومحاربة الوحوش.
- معدل النجاح: تفوق GROW بشكل كبير على الطرق السابقة. على سبيل المثال، في "مهام واجهة المستخدم الرسومية" (GUI tasks) (استخدام قوائم اللعبة لصنع العناصر)، قفز النجاح من حوالي 39% إلى 68%.
- الكفاءة: لم يربح الروبوت أكثر فحسب؛ بل ربح بسرعة أكبر. لقد استغرق خطوات أقل لإكمال المهام لأنه تعلم تجاهل "الضجيج" والتركيز على الحركات التي تهم حقًا.
- التعميم: لم يقم الروبوت بمجرد حفظ الألعاب المحددة التي تدرب عليها. لقد تعلم مهارات عامة (مثل كيفية البحث عن هدف أو كيفية استخدام القائمة) سمحت له بالنجاح في مهام جديدة وغير مرئية لم يسبق له رؤيتها من قبل.
باختصار
GROW هو طريقة أذكى لتعليم وكلاء الذكاء الاصطناعي لعب ألعاب العوالم المفتوحة. بدلاً من إرهاقهم بتواريخ طويلة وفوضوية لجلسات لعبهم بأكملها، يقوم بتفكيك اللعبة إلى خطوات صغيرة وواضحة. يساعد هذا الذكاء الاصطناعي على فهم أي الإجراءات تؤدي إلى النجاح بالضبط، مما يسمح له بالتعلم بشكل أسرع، واللعب بشكل أفضل، والتعامل مع التحديات الجديدة دون ارتباك.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.