← أحدث الأبحاث
🤖 AI

UnityMAS-O: A General RL Optimization Framework for LLM-Based Multi-Agent Systems

يُعد UnityMAS-O إطار عمل عام للتعلم المعزز يعمل على تحسين الأنظمة متعددة الوكلاء القائمة على النماذج اللغوية الكبيرة من خلال معاملة سير العمل بأكمله كوحدة تدريب، وفصل الأدوار المنطقية عن معلمات النموذج عبر تجريد مرن رباعي الكائنات، وإظهار مكاسب أداء كبيرة عبر مهام متنوعة مثل الإجابة على الأسئلة وتوليد الأكواد البرمجية.

المؤلفون الأصليون: Yiqun Chen, Wei Yang, Erhan Zhang, Shijie Wang, Qi Liu, Zechun Niu, Bin Zhang, Haitao Li, Rui Li, Lingyong Yan, Jinyuan Feng, Biqing Qi, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao

نُشر 2026-05-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yiqun Chen, Wei Yang, Erhan Zhang, Shijie Wang, Qi Liu, Zechun Niu, Bin Zhang, Haitao Li, Rui Li, Lingyong Yan, Jinyuan Feng, Biqing Qi, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك فريقًا من المساعدين الذكيّين (AI) يعملون معًا لحل لغز معقد، مثل كتابة برنامج كمبيوتر أو إيجاد إجابة لسؤال صعب. في الوقت الحالي، معظم هذه الفرق تشبه مجموعة من الأشخاص الذين أُعطوا نصًا صارمًا؛ فهم يعرفون ماذا يقولون ومتى يقولونه لأن إنسانًا كتب القواعد، لكنهم لم يتعلموا فعليًا كيفية العمل معًا بشكل أفضل من تلقاء أنفسهم. إذا ارتكب أحد الأشخاص خطأً، فقد يفشل الفريق بأكمله، ولن يعرف النظام كيفية إصلاح ذلك.

UnityMAS-O هو "صالة تدريب" جديدة مصممة لتعليم فرق الذكاء الاصطناعي هذه كيفية التعلم من تجاربها الخاصة، تمامًا كما تتدرب فرق الرياضة للفوز بالمباراة.

إليك كيف يعمل ذلك، باستخدام تشبيهات بسيطة:

1. المشكلة: الفريق "المبرمج بنص" مقابل الفريق "المتعلم"

في الوقت الحالي، إذا أردت من فريق ذكاء اصطناعي حل مشكلة، عليك كتابة كل خطوة يدويًا: "أولاً، يقوم الباحث بالبحث عن المعلومات. ثم يقوم الكاتب بكتابة مسودة. ثم يقوم الناقد بمراجعتها."

  • المشكلة: إذا وجد الباحث معلومات سيئة، فلن يستطيع الكاتب إصلاحها لأنه لم يتم تدريبه على التعامل مع المعلومات السيئة. وهكذا يظل الفريق عالقًا في نفس الأخطاء.
  • حل UnityMAS-O: بدلاً من مجرد إعطائهم نصًا، يعامل UnityMAS-O الفريق بأكمله كوحدة واحدة يمكن تدريبها. فهو يسم يسمح للفريق بلعب "اللعبة"، ورؤية ما يحدث، ثم تعديل "أدمغتهم" ليعملوا بشكل أفضل في المرة القادمة.

2. اللبنات الأربع الأساسية (الخطة التكتيكية)

لتدريب الفريق، يستخدم UnityMAS-O أربع أدوات رئيسية، والتي يسميها البحث "كائنات من الدرجة الأولى":

  • الأدوار المنطقية (الوصف الوظيفي): أنت تحدد من يفعل ماذا. هناك "المخطط"، و"الباحث"، و"المبرمج"، و"المتأمل". فكر في هذه الأدوار كأنها مسميات وظيفية على بطاقة عمل.
  • مخطط سير العمل (المخطط الانسيابي): أنت ترسم خريطة توضح كيف يتحرك الفريق. هل يتحدث المخطط إلى الباحث أولاً؟ هل يعملون بالتوازي؟ هذا هو "كتيب قواعد" الفريق.
  • رسم خرائط الدماغ (من الذي يفكر؟): هذه ميزة ذكية. يمكنك أن تقرر ما إذا كان لكل دور عقل فريد خاص به (نموذج ذكاء اصطناعي منفصل)، أو إذا كانوا جميعًا يتشاركون عقلًا واحدًا ضخمًا، أو إذا كانت بعض الأدوار تتشارك عقلًا بينما يمتلك البعض الآخر عقولًا خاصة بهم. الأمر يشبه تحديد ما إذا كان أعضاء فريقك هم جميعًا نفس الشخص يرتدي قبعات مختلفة، أم أنهم أشخاص مختلفون تمامًا.
  • بطاقة النقاط (المكافآت): هذا هو الجزء الأهم. في الماضي، كنت تعطي درجة في النهاية فقط (مثل: "هل نجح الكود؟"). أما UnityMAS-O فيعطي درجات عند كل خطوة.
    • مثال: إذا وجد الباحث دليلًا جيدًا حقًا، يحصل على نقطة صغيرة "عمل جيد" فورًا. وإذا ارتكب المبرمج خطأً قام المتأمل بإصلاحه، يحصل المتأمل على نقاط مقابل الإصلاح. هذا يساعد الفريق على تعلم بالضبط من فعل الصواب أو الخطأ.

3. كيف يحدث التدريب (المدرب واللاعبون)

النظام مبني مثل منظمة رياضية محترفة:

  • المتحكم المركزي (المدرب): هذا هو المدير الرئيسي. هو من يدير اللعبة، ويخبر اللاعبين متى يتحركون، ويتابع النتيجة. هو لا يقوم بالجهد الذهني الشاق؛ بل يدير التدفق فقط.
  • مجموعات العمال (اللاعبون): هؤلاء هم نماذج الذكاء الاصطناعي الفعلية التي تقوم بالعمل. هم يولدون الإجابات، ويخزنون "ذاكرة العضلات" (البيانات)، ويحدثون مهاراتهم بناءً على ملاحظات المدرب.
  • الحلقة: يرسل المدرب مهمة -> يقوم اللاعبون بمهامهم -> يتحقق المدرب من النتائج ويخصص النقاط -> يقوم اللاعبون بتحديث أدمغتهم للقيام بعمل أفضل في المرة القادمة.

4. ماذا حدث عندما جربوا ذلك؟

اختبر الباحثون النظام على نوعين رئيسيين من المهام:

  • الإجابة على الأسئلة (عمل المحققين): طلبوا من فرق الذكاء الاصطناعي إيجاد إجابات لأسئلة صعبة.
    • النتيجة: قبل التدريب، كانت فرق الذكاء الاصطناعي الصغيرة تفشل تمامًا. بعد التدريب باستخدام UnityMAS-O، أصبحوا أفضل بكثير. حتى الفرق الصغيرة تعلمت كيفية إيجاد الأدلة الصحيحة وكتابة إجابات أفضل.
  • توليد الكود (بناة البرمجيات): طلبوا من فرق الذكاء الاصطناعي كتابة كود برمجي يجتاز جميع الاختبارات.
    • النتيجة: الفرق المدربة كتبت أكوادًا تعمل بشكل أكثر تكرارًا. ومن المثير للاهتمام، أنها أصبحت أكثر كفاءة أيضًا؛ حيث احتاجوا إلى عدد أقل من "المحاولات" (جولات التحقق) للحصول على الكود الصحيح، مما يعني أنهم أضاعوا وقتًا وطاقة أقل.

5. لماذا هذا مهم؟

يزعم البحث أن UnityMAS-O هو "إطار عمل عام". وهذا يعني أنك لست بحاجة لبناء نظام تدريب جديد في كل مرة تريد فيها إنشاء فريق ذكاء اصطناعي جديد. ما عليك سوى تحديد الأدوار، ورسم المخطط الانسيابي، ووضع قواعد تسجيل النقاط، وسيتولى UnityMAS-O الباقي.

إنه يحول النص الجامد المكتوب يدويًا إلى فريق مرن وقابل للتدريب يمكنه التعلم كيفية التنسيق، والتخصص، وتحسين أدائه الخاص بمرور الوقت. يظهر البحث أن هذا يعمل لمهام البحث، وكتابة الكود، وربما وظائف معقدة أخرى، مما يثبت أنه يمكن تعليم فرق الذكاء الاصطناعي كيفية العمل معًا بفعالية، وليس فقط اتباع الأوامر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →