Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks
تقدم هذه الورقة COSPLAY، وهو إطار عمل تطوري مشترك حيث يعمل وكيل قرار يعتمد على نموذج لغوي كبير ووكيل إدارة مهارات بشكل تعاوني لاكتشاف وصقل واسترجاع مهارات مهيكلة من عمليات التشغيل غير المصنفة، مما يحسن بشكل كبير الأداء طويل المدى في بيئات الألعاب مقارنة بالنماذج اللغوية الكبيرة الرائدة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت ذكي جداً، ولكنه نساي قليلاً، كيف يلعب لعبة فيديو معقدة مثل Diplomacy أو Super Mario.
يمتلك الروبوت عقلاً ضخماً (نموذج لغوي كبير، أو LLM) يعرف الكثير عن العالم. ومع ذلك، عندما يواجه لعبة طويلة ومعقدة، فإنه غالباً ما يتوه. ينسى ما فعله قبل خمس دقائق، ولا يعرف متى يغير استراتيجيته، ويستمر في ارتكاب نفس الخطأ مراراً وتكراراً. الأمر يشبه طباخاً يعرف كيف يقطع الخضروات، لكنه يستمر في محاولة خبز كعكة باستخدام مطرقة لأنه نسي الوصفة.
يقدم هذا البحث نظاماً جديداً يسمى COS-PLAY لإصلاح ذلك. فكر في COS-PLAY ليس كروبوت واحد، بل كـ فريق من اثنين من الزملاء يعملان معاً في المطبخ.
الزميلان
- الطاهي (وكيل اتخاذ القرار): هذا هو الروبوت الذي يلعب اللعبة. مهمته هي النظر إلى الشاشة، وتقرير ما يجب فعله تالياً، والضغط على الأزرار.
- مساعد الطاهي (وكيل بنك المهارات): هذا هو روبوت ثانٍ، مهمته الوحيدة هي مراقبة الطاهي، وتدوين الملاحظات، وتنظيم "كتاب الوصفات".
كيف يعملان معاً (التطور المشترك)
في الأيام الخوالي، كنت ستخبر الطاهي فقط: "إليك الوصفة، الآن اطبخ!". وإذا فشل الطاهي، سيتعين عليك إعادة كتابة الوصفة بالكامل من الصفر.
مع COS-PLAY، تصبح العملية حلقة مستمرة من التعلم:
الخطوة 1: الطاهي يحاول الطبخ
يلعب الطاهي جولة من اللعبة. أحياناً يبدع، وأحياناً يحرق الخبز. هو لا يعرف لماذا فشل، هو فقط يعرف النتيجة.
الخطوة 2: مساعد الطاهي يراقب ويكتب
بينما يلعب الطاهي، يراقبه مساعد الطاهي عن كثب. يرى نمطاً: "أوه، في كل مرة يحرك فيها الطاهي الجيش إلى الحدود، يستغرق الأمر عادةً 3 جولات لاستطلاع العدو، ثم جولتين لتجهيز الهجوم".
يأخذ مساعد الطاهي هذا التسلسل الفوضوي من الأفعال ويحوله إلى "بطاقة مهارة" نظيفة وقابلة لإعادة الاستخدام (مثل بطاقة وصفة).
- تقول بطاقة المهارة: "عندما ترى العدو عند الحدود، قم بهذه الخطوات الخمس بالترتيب لاستطلاعهم. توقف عندما ترى علماً أحمر".
الخطوة 3: الطاهي يحصل على أداة جديدة
يضع مساعد الطاهي هذه "بطاقة المهارة" الجديدة في كتاب الوصفات (بنك المهارات).
الآن، عندما يبدأ الطاهي اللعبة التالية، ليس عليه اكتشاف كل شيء من الصفر. يمكنه فتح كتاب الوصفات، والعثور على بطاقة "استطلاع الحدود"، واتباع التعليمات.
الخطوة 4: تستمر الحلقة
- إذا استخدم الطاهي البطاقة وفاز، يقول مساعد الطاهي: "رائع! هذه البطاقة تعمل".
- إذا استخدمها الطاهي وخسر، يقول مساعد الطاهي: "همم، هذه البطاقة لم تعمل هنا. دعنا نعدل الوصفة".
- قد يلاحظ مساعد الطاهي أيضاً أن الطاهي يقوم بشيء عبقري من تلقاء نفسه، فيضيف بطاقة جديدة إلى الكتاب.
بمرور الوقت، يصبح الطاهي أكثر ذكاءً لأن لديه مكتبة أفضل من الحيل، ويصبح كتاب الوصفات أفضل لأنه يتم تحديثه باستمرار بما يعمل بالفعل. إنهما "يتطوران معاً"؛ ينموان معاً.
لماذا هذا أمر مهم للغاية
مشكلة "مجرد امتلاك عقل":
نماذج الذكاء الاصطناًعي الكبيرة تشبه العباقرة ذوي مدى الانتباه القصير. يمكنهم كتابة قصيدة، ولكن إذا طلبت منهم لعب لعبة استراتيجية مكونة من 50 خطوة، فسوف يرتبكون في منتصف الطريق. ينسون خطتهم.
الحل:
يمنح COS-PLAY الذكاء الاصطناعي ذاكرة لـ "الكتل". بدلاً من تذكر كل ضغطة زر منفردة، يتذكر "كتل" من السلوك (المهارات).
- تشبيه: تخيل أنك تحاول كتابة رواية. إذا حاولت تذكر كل حرف تكتبه، فستجن. لكن إذا تذكرت "كتابة فصل عن رحلة البطل"، ثم "كتابة فصل عن خطة الشرير"، فسيكون الأمر أسهل بكثير. يعلم COS-PLAY الذكاء الاصطناعي التفكير في "فصول"، وليس في "حروف".
النتائج: "سحر" النظام
اختبر الباحثون هذا على ست ألعاب مختلفة، من الألغاز البسيطة مثل 2048 إلى ألعاب الاستراتيجية الاجتماعية المعقدة مثل Diplomacy (حيث يتعين عليك التفاوض مع لاعبين آخرين).
- النتيجة: على الرغم من أنهم استخدموا نموذج ذكاء اصطناعي صغير نسبياً (نموذج "8B"، وهو ما يعادل جهاز كمبيوتر محمول قياسي)، إلا أنه أدى أداءً أفضل من أكبر نماذج الذكاء الاصطناعي في العالم (مثل GPT-5 أو Gemini) في هذه الألعاب.
- لماذا؟ لأن النماذج الكبيرة كانت تحاول "التفكير" في كل خطوة، بينما كان النموذج الصغير المزود بـ COS-PLAY يمتلك مكتبة من الاستراتيجيات المثبتة ليستمد منها. كان الأمر أشبه بموظف مبتدئ يمتلك دليلاً مثالياً يتفوق على عبقري يضطر لاكتشاف كل شيء أثناء العمل.
"نمط الفشل" (تحول مضحك)
نظر البحث أيضاً في كيفية فشل النظام.
- الذكاء الاصطناوي القديم: عندما يفشل، فإنه غالباً ما ينهار. يصاب بالارتباك، ويصاب بالذعر، ويفقد كل ما بناه.
- COS-PLAY: عندما يفشل، فإنه عادة ما يستقر (يتوقف عن التقدم). يظل عالقاً في فعل الشيء نفسه مراراً وتكراراً (مثل الهامستر على عجلة)، لكنه نادراً ما يفقد كل شيء. لديه "شبكة أمان" مبنية في مهاراته تمنع الكوارث الشاملة.
باختصار
COS-PLAY هو نظام يتعلم فيه الذكاء الاصطناዊ لعب الألعاب من خلال تعليم نفسه مكتبة من الحيل أثناء اللعب.
- اللاعب يستخدم الحيل للفوز.
- المكتبِيّ يراقب اللاعب، ويدون الحيل التي تنجح، ويرمي تلك التي لا تنجح.
together، يصبحان أفضل فأفضل، محولين الروبوت المرتبك إلى استراتيجي ماهر.
إنه الفرق بين طالب يحاول حفظ كتاب مدرسي كامل في ليلة واحدة، وبين طالب يبني مجموعة من البطاقات التعليمية، ويراجعها، ويحسن دليل دراسته كل يوم.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.