← أحدث الأبحاث
💻 computer science

A Comprehensive Survey on Multi-Agent Cooperative Decision-Making: Scenarios, Approaches, Challenges and Perspectives

تقدم هذه الورقة مسحاً شاملاً لاتخاذ القرار التعاوني متعدد الوكلاء، بدءاً من تحليل بيئات المحاكاة وتصنيف النهج السائدة، قبل التركيز بعمق على منهجيات ومزايا وتحديات التعلم المعزز العميق متعدد الوكلاء والتقنيات القائمة على النماذج اللغوية الكبيرة مع تحديد اتجاهات البحث المستقبلية.

المؤلفون الأصليون: Weiqiang Jin, Hongyang Du, Shixiang Tang, Biao Zhao, Guang Yang

نُشر 2026-09-01
📖 7 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Weiqiang Jin, Hongyang Du, Shixiang Tang, Biao Zhao, Guang Yang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في عالم الذكاء الاصطناعي، يوجد فرق واضح بين عقل عبقري واحد وفريق منسق. لعقود من الزمن، ركز الباحثون على تعليم حاسوب واحد كيفية حل مشكلة ما، مثل لاعب شطرنج محترف أو روبوت يتنقل في متاهة. تعلمت هذه الأنظمة من خلال التجربة والخطأ، حيث كانت تعدل أفعالها بناءً على المكافآت أو العقوبات حتى تتقن مهمة محددة. ومع ذلك، فإن العالم الحقيقي نادراً ما يقدم مشكلات يمكن حلها بواسطة فاعل واحد بمعزل عن الآخرين. فحركة المرور، ومهام الإنقاذ، وأرضيات المصانع تتضمن العديد من الفاعلين المستقلين الذين يتحركون في آن واحد، ويتخذ كل منهم قرارات تؤثر على الآخرين. هذا هو مجال الأنظمة متعددة الوكلاء، حيث لا يقتصر الهدف على الذكاء الفردي فحسب، بل على التعاون الجماعي. ويكمكم التحدي في جعل هذه الكيانات المستقلة تعمل معاً دون وجود قائد مركزي يملي كل حركة، خاصة عندما تكون البيئة فوضوية، والقواعد غير واضحة، والمخاطر عالية.

ترسم دراسة استقصائية شاملة جديدة أجراها الباحثون وي كويانغ جين، وهونغ يانغ دو، وشي شيانغ تانغ، وبياو تشاو، وغوانغ يانغ، الخارطة الحالية لهذا المجال المعقد. لقد جمع المؤلفون وحللوا الأساليب الرائدة المستخدمة لتعليم مجموعات من الوكلاء الاصطناعيين كيفية التعاون، بدءاً من كتب القواعد الصارمة وصولاً إلى الاستراتيجيات المرنة القائمة على التعلم. ويعمل عملهم كدليل عبر الأدوات والبيئات المختلفة التي يستخدمها العلماء لاختبار هذه الأفكار، من محاكاة ألعاب الفيديو إلى التطبيقات الواقعية في القيادة الذاتية والاستجابة للكوارث. وتسلط الدراسة الضوء على تحول كبير في كيفية بناء هذه الأنظمة؛ فبينما اعتمدت الأساليب القديمة على التعليمات المبرمجة مسبقاً أو النماذج الرياضية للمنافسة، فإن النهج الأكثر واعدية الآن تتضمن وكلاء يتعلمون من الخبرة، ومؤخراً، وكلاء يستخدمون نماذج لغوية متقدمة للتفكير والتواصل مثل البشر.

بدأ الباحثون بتصنيف الطرق المختلفة التي تُصمم بها هذه الأنظمة، حيث حددوا خمس فئات رئيسية لاتخاذ القرار. تعتمد الفئة الأولى على قواعد ثابتة، حيث يتبع الوكلاء مجموعة صارمة من التعليمات، تماماً مثل إشارة المرور التي تغير ألوانها بناءً على مؤقت زمني. وتستخدم الفئة الثانية نظرية الألعاب، حيث تعامل التفاعلات كتحركات استراتيجية يحاول الوكلاء من خلالها التفوق على بعضهم البعض أو التعاون للوصول إلى نتيجة مستقرة. أما الفئة الثالثة فتستخدم الخوارزميات التطورية، التي تحاكي الانتقاء الطبيعي عبر اختبار العديد من تنويعات الاستراتيجية والاحتفاظ بالأفضل منها. وبينما تعتبر هذه الأساليب التقليدية مفيدة، تجد الدراسة أنها غالباً ما تعاني عندما تتغير البيئة بسرعة أو عندما يصبح عدد الوكلاء كبيراً جداً. إنها تشبه نصاً جامداً لا يمكنه التكيف إذا نسي الممثلون أدوارهم أو إذا تغير المسرح بشكل غير متوقع.

في المقابل، تضع الدراسة أكبر قدر من التركيز على نهجين جديدين أكثر ديناميكية: التعلم التعزيزي متعدد الوكلاء والنماذج اللغوية الكبيرة. في التعلم التعزيزي متعدد الوكلاء، يتعلم الوكلاء من خلال التفاعل مع بعضهم البعض ومع بيئتهم. هم لا يبدأون بدليل تعليمات؛ بل يكتشفون استراتيجيات فعالة من خلال المحاولات المتكررة، ويتلقون تغذية راجعة حول ما إذا كانت أفعالهم قد ساعدت المجموعة على النجاح. ويفصل المؤلفون كيفية تدريب هذه الأنظمة، وغالباً ما يتم ذلك باستخدام طريقة يتدرب فيها الوكلاء معاً في مركز مركزي لتعلم أفضل الاستراتيجيات، ولكنهم يعملون بشكل مستقل في العالم الحقيقي، معتمدين فقط على ما يمكنهم رؤيته وسماعه. وهذا يسمح لهم بالتنسيق دون الحاجة إلى اتصال دائم بـ "عقل مركزي".

أما التركيز الرئيسي الثاني فهو على الأنظمة المدعومة بالنماذج اللغوية الكبيرة، وهي نفس التكنولوجيا التي تقف وراء برامج الدردشة الحديثة. تستخدم هذه الوكلاء اللغة الطبيعية لفهم المهام، وتخطيط خطواتهم، والتحدث مع زملائهم. وبدلاً من مجرد الاستجابة للمكافآت الفورية، يمكنهم قراءة تعليمات معقدة، وتقسيمها إلى أهداف أصغر، ومناقشة أفضل السبل للمضي قدماً مع زملائهم. وتشير الدراسة إلى أن هذا النهج جيد بشكل خاص في التعامل مع المهام التي تتطلب التفكير أو فهم السياق، مثل فريق من الروبوتات يعمل معاً لبناء هيكل أو مجموعة من الشخصيات الافتراضية التي تمثل سيناريو اجتماعياً. ومع ذلك، يشير المؤلفون أيضاً إلى أن هذه الأنظمة القائمة على اللغة لا تزال في طور النمو وتواجه تحديات في التوسع لتشمل مجموعات كبيرة دون أن تصبح مرتبكة أو غير فعالة.

لاختبار هذه الأفكار، يعتمد الباحثون بكثافة على بيئات المحاكاة، التي تعمل كساحات تدريب رقمية. وتراجع الدراسة المنصات الأكثر شعبية، والتي تتراوح من محاكاة الجسيمات البسيطة حيث تتحرك النقاط حول الشاشة إلى بيئات معقدة وواقعية مثل StarCraft II، وهي لعبة استراتيجية في الوقت الفعلي تُستخدم لاختبار التنسيق العسكري. تسمح هذه البيئات للعلماء بإنشاء سيناريوهات قد تكون خطيرة جداً، أو مكلفة، أو بطيئة للغاية لاختبارها في العالم الحقيقي. ويؤكد المؤلفون أن اختيار المحاكاة أمر بالغ الأهمية؛ فالنظام الذي يعمل جيداً في لعبة بسيطة ومسيطر عليها قد يفشل تماماً في موقف حقيقي فوضوي وغير متوقع. كما يسلطون الضوء على منصات جديدة مصممة خصيصاً للوكلاء القائمين على اللغة، حيث ينصب التركال على التواصل والتفاعل الاجتماعي بدلاً من مجرد الحركة الفيزيائية.

ثم تنتقل الورقة إلى التطبيقات العملية، مبينةً كيف تُطبق هذه النظريات على مشكلات حقيقية. ففي القيادة الذاتية، تساعد الأنظمة متعددة الوكلاء السيارات على التنقل في التقاطعات والاندماج في الطرق السريعة من خلال التنبؤ بأفعال المركبات الأخرى. وفي عمليات الإنقاذ من الكوارث، يمكن لفرق الطائرات بدون طيار التنسيق للبحث في مساحات واسعة عن ناجين، ومشاركة المعلومات لتغطية مساحة أكبر بكما يمكن لطائرة واحدة القيام به. وفي الزراعة، يمكن للروبوتات العمل معاً لمراقبة المحاصيل وإدارة الموارد. كما تنظر الدراسة في كيفية استخدام هذه الأنظمة في الألعاب والمحاكاة الاجتماعية، حيث تتفاعل الشخصيات الافتراضية مع بعضها البعض ومع اللاعبين البشر بطرق تبدو طبيعية واستجابية.

وعلى الرغم من هذه التطورات، يحدد الباحثون عقبات كبيرة لا تزال قائمة. أحد التحديات الرئيسية هو الطبيعة "غير المستقرة" للبيئات متعددة الوكلاء؛ فبما أن كل وكيل يتعلم ويغير سلوكه في نفس الوقت، فإن البيئة تتغير باستمرار، مما يجعل من الصعب على أي وكيل بمفرده التنبؤ بما سيحدث بعد ذلك. هذا يشبه محاولة تعلم رقصة حيث يقوم كل شريك بابتكار خطوات جديدة أثناء الرقص. مشكلة أخرى هي مشكلة "تحديد المسؤولية" (credit assignment): فعندما تنجح المجموعة أو تفشل، يصعب معرفة أي وكيل محدد ساهم أكثر في النتيجة. وهذا يجعل من الصعب معرفة السلوكيات التي يجب تشجيعها وتلك التي يجب ردعها. علاوة على ذلك، مع زيادة عدد الوكلاء، تزدัง تعقيدات التنسيق بينهم بشكل أسّي، مما يؤدي غالباً إلى استنزاف الموارد الحوسبية الحالية.

كما تتناول الدراسة حدود النهج الجديدة القائمة على اللغة. فبينما يتميز هؤلاء الوكلاء بالقدرة على التفكير والتواصل، إلا أنهم قد "يهلوسون" أحياناً، مولدين معلومات خاطئة تنتشر عبر المجموعة وتؤدي إلى قرارات سيئة. كما أنهم يواجهون صعوبة في المهام التي تتطلب وعياً مكانياً دقيقاً أو ردود فعل فيزيائية سريعة، وهي المجالات التي لا تزال الأساليب التقليدية تتفوق فيها. ويقترح المؤلفون أن المستقبل يكمن في دمج هذه القوى المختلفة؛ فمن خلال دمج القدرة على التفكير للنماذج اللغوية مع قدرة التعلم التعزيزي على التكيف، يأمل الباحثون في إنشاء أنظمة تكون ذكية وقوية في آن واحد.

وبالنظر إلى المستقبل، يحدد المؤلفون عدة اتجاهات واعدة للبحث المستقبلي. ويقترحون أن الجيل القادم من الأنظمة متعددة الوكلاء سيقوم على الأرجح بدمج تقنيات مختلفة، باستخدام النماذج اللغوية لمساعدة الوكلاء على فهم التعليمات المعقدة وتخطيط الأهداف طويلة المدى، بينما يستخدم التعلم التعزيزي لتنفيذ تلك الخطط بكفاءة. كما يرون حاجة إلى طرق أفضل لتقييم هذه الأنظمة، بالانتقال من مجرد معدلات النجاح البسيطة إلى قياس مدى قدرة الوكلاء على التعاون والتواصل والتكيف مع المواقف الجديدة. وأخيراً، يتطرقون إلى الاعتبارات الأخلاقية، مشيرين إلى أنه مع زيادة اندماج هذه الأنظمة في المجتمع، سيكون ضمان كونها آمنة وشفافة وعادلة أمراً لا يقل أهمية عن جعلها ذكية.

لا تدعي هذه الدراسة أنها حلت مشكلات التعاون متعدد الوكلاء، بل إنها تقدم خارطة واضحة ومفصلة لمكان وقوف هذا المجال اليوم. وهي تظهر أنه بينما حققنا تقدماً ملحوظاً في تعليم الآلات كيفية العمل معاً، لا يزال هناك الكثير لنتعلمه حول كيفية جعل هذه الفرق موثوقة، وقابلة للتوسع، وفعالة في الواقع المعقد للعالم البشري. ومن خلال الجمع بين أحدث الأساليب والبيئات والتطبيقات، يقدم المؤلفون أساساً للموجة القادمة من الاكتشافات، موجهين الباحثين نحو مستقبل يمكن فيه للوكلاء الاصطناعيين التعاون بسلاسة لحل التحديات المعقدة في عصرنا.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →