← أحدث الأبحاث
🤖 machine learning

Zero Shot Coordination for Sparse Reward Tasks with Diverse Reward Shapings

تتناول هذه الورقة تحدي التنسيق في حالة "الصفر من التدريب المسبق" (Zero-Shot Coordination) في بيئة التعلم المعزز متعدد الوكلاء ذات المكافآت الشحيحة، وذلك عبر اقتراح طريقة تدريب تجميعية تعتمد على تشكيل مكافآت عشوائي، مما يحسن بشكل كبير من تعاون الوكلاء مع شركاء يستخدمون استراتيجيات مختلفة لتشكيل المكافآت في بيئة "أوفر كوكد" (Overcooked).

المؤلفون الأصليون: Keenan Powell, Peihong Yu, Pratap Tokekar

نُشر 2026-04-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Keenan Powell, Peihong Yu, Pratap Tokekar

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتعليم مجموعة من الروبوتات كيفية الطبخ معاً في مطبخ مزدحم. الهدف بسيط: صنع أكبر عدد ممكن من أنواع الحساء قبل انتهاء الوقت. ومع ذلك، هناك عقبة؛ فأنت لا تدربهم للعمل مع شريك محدد تعرفه، بل تدربهم للعمل مع أي روبوت قد يقابلونه في المستقبل، حتى لو كان ذلك الروبوت قد تم تدريبه بواسطة شركة مختلفة، أو باستخدام كمبيوتر مختلف، أو باستخدام مجموعة مختلفة قليلاً من القواعد.

هذه هي مشكلة التنسيق صفري الاستباق (Zero-Shot Coordination - ZSC). الأمر يشبه محاولة الرقص مع غريب دون أن تتدربا معاً من قبل. إذا تعلم كلاكما نفس حركات الرقص تماماً، فستكونان مثاليين. ولكن إذا تعلم شريكك نسخة مختلفة قليلاً من الرقص، فقد تطأ قدماه على قدميك.

المشكلة: "هدف واحد، دوافع مختلفة"

في الماضي، حاول الباحثون حل هذه المشكلة عبر إعطاء جميع الروبوتات نفس "بطاقة النقاط" (دالة المكافأة) تماماً. إذا وضع الروبوت بصلة في القدر، يحصل على نقطة. إذا التقط طبقاً، يحصل على نقطة.

لكن في العالم الحقيقي، قد تتشارك الروبوتات (أو السيارات ذاتية القيادة، أو الطائرات بدون طيار) نفس الهدف الكبير (الوصول إلى الوجهة أو طبخ الحساء)، لكنها قد تقدر الخطوات بشكل مختلف.

  • الروبوت (أ) قد يعتقد: "السرعة هي كل شيء! سأحصل على نقاط مقابل التحرك بسرعة."
  • الروبوت (ب) قد يعتقد: "الأمان هو كل شيء! سأحصل على نقاط مقابل توخي الحذر."

إذا دربت الروبوت الخاص بك فقط ليعمل مع روبوتات "السرعة"، فسيفشل فشلاً ذريعاً عندما يُقرن بروبوت "الأمان". تجادل الورقة البحثية بأن الأساليب الحالية لم تأخذ هذا في الاعتبار؛ فقد افترضت أن الجميع لديهم نفس "بطاقة النقاط" الداخلية.

الحل: "معسكر التدريب المتنوع"

يقترح المؤلفون طريقة جديدة لتدريب هذه الروبوتات. بدلاً من تدريبهم جميعاً باستخدام نفس بطاقة النقاط، يقومون بإنشاء معسكر تدريب متنوع.

لقد استخدموا أربع طرق مختلفة لإنشاء مجموعة متنوعة من "بطاقات النقاط" (التي تسمى تشكيل المكافآت) ليتعلم عليها الروبوتات:

  1. المدرب القائم على النماذج اللغوية الكبيرة (LLM): يطلبون من ذكاء اصطناعي فائق الذكاء (نموذج لغوي كبير) النظر في الأمثلة لما نجح وما فشل، ثم كتابة قائمة جديدة من القواعد التي من شأنها خلق أنواع مختلفة من الروبوتات.
  2. مدرب الشبكة البديلة (Surrogate Network): يقومون بتدريب ذكاء اصطناعي صغير وبسيط للتنبؤ بالقواعد التي ستؤدي إلى أفضل نتائج للطبخ. ثم يختار أفضل القواعد أداءً من قائمة ضخمة من الاحتمالات.
  3. مدرب الشبكة الطبقية (Stratified Grid): هذا يشبه المنظم الدقيق. يأخذون كل قاعدة ممكنة (مثل "مقدار تقدير السرعة" أو "مقدار تقدير الأمان") ويقسمون النطاق إلى شرائح متساوية. ثم يختارون قاعدة واحدة من كل شريحة لضمان تغطية كامل الطيف من الاحتمالات دون تفويت أي شيء.
  4. المدرب العشوائي: يختارون القواعد عشوائياً تماماً. (وهي المجموعة الضابطة، مثل رمي النرد).

المجموعة (Ensemble): "فريق النجوم"

بمجرد تدريب العديد من هذه الروبوتات باستخدام كتب القواعد المختلفة هذه، لا يكتفون باختيار واحد منها لاستخدامه. بدلاً من ذلك، ينشئون مجموعة (Ensemble).

فكر في هذا الأمر كأنه فريق خارق. عندما يدخل الروبوت إلى المطبخ للعمل مع غريب، فإنه لا يتصرف فقط كـ "الروبوت أ" أو "الروبوت ب"، بل يتصرف كـ لجنة. إنه يسأل جميع النسخ المختلفة من نفسه (تلك التي تدربت على قواعد مختلفة) عما يجب أن تفعله، ثم يذهب مع الإجابة الأكثر شيوعاً.

هذا يجعل الروبوت قابلاً للتكيف بشكل مذهه. لقد رأى كل طريقة ممكنة للتفكير في المشكلة، لذا يمكنه التعاون مع غريب، بغض النظر عن الطريقة التي يفكر بها ذلك الغريب.

النتائج: طبخ النجاح

اختبر الباحثون هذا في لعبة Overcooked (وهي لعبة فيديو شهيرة عن الطبخ التعاوني). وضعوا "فريق النجوم" الخاص بهم في مواجهة روبوتات تم تدريبها باستخدام قواعد غير معروفة تماماً.

  • النتيجة: حققت طريقتهم نجاحاً هائلاً. مقارنة بالأساليب القديمة، حسن روبوتاتهم أداءهم بنسبة 62% إلى 119%.
  • الفائزون: كان "المدرب الشبكي الطبقي" (المنظم الدقيق) و"الشبكة البديلة" (المتنبئ) هما أفضل المدربين. لقد شكلا فرقاً يمكنها التعامل مع الغرباء بفعالية أكبر.
  • المفاجأة: حتى "المدرب العشوائي" (الذي اختار القواعد بمجرد رمي النرد) كان أداؤه أفضل من الأساليب المعيارية القديمة، مما يثبت أن مجرد وجود بعض التنوع أفضل من عدم وجوده على الإطلاق.

الخلاصة الكبرى

تظهر الورقة البحثية أنه لتعليم الروبوتات كيفية التعاون مع الغرباء، لا ينبغي لك تعليمهم طريقة واحدة فقط للتفكير. بل يجب عليك تعليمهم مجموعة متنوعة من طرق التفكير من خلال منحهم "بطاقات نقاط" مختلفة أثناء التدريب. ومن خلال دمج كل تلك وجهات النظر في فريق واحد ذكي، يمكنهم التكيف مع أي شريك يقابلونه، حتى لو كان ذلك الشريك يلعب وفقاً لمجموعة مختلفة تماماً من القواعد.

باختصار: إذا كنت تريد أن تكون شريك رقص جيداً لأي شخص، فلا تتعلم رقصة واحدة فقط. تعلم القليل من كل شيء، ثم دع لجنتك الداخلية تقرر أفضل حركة عندما تخطو على أرضية الرقص.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →