🤖 machine learning

Independent Learning of Nash Equilibria in Partially Observable Markov Potential Games with Decoupled Dynamics

تقترح هذه الورقة خوارزمية تعلم مستقلة لألعاب ماركوف ذات الإمكانات الجزئية الملاحظة ذات الديناميكيات المنفصلة، والتي تحقق تقارب توازن ناش التقريبي بتعقيد شبه متعدد الحدود من خلال الاستفادة من استقرار المرشح لتقريب المشكلة عبر نوافذ تاريخية محدودة ولعبة ماركوف بديلة ذات إمكانات قريبة.

Philip Jordan, Maryam Kamgarpour2026-05-08
📊 statistics

Optimizing Social Utility in Sequential Experiments

تقترح هذه الورقة بروتوكول تجريب متسلسل حيث يقوم المنظم بدعم تكاليف تجارب المطور جزئياً للتغلب على الحواجز المالية في المجالات عالية المخاطر، مبرهنةً من خلال نموذج عملية ماركوف لاتخاذ القرار القائم على الاعتقاد أن هذا النهج يمكن أن يزيد المنفعة الاجتماعية بنسبة تزيد عن 35% مقارنة بالطرق القياسية غير المتسلسلة.

Ander Artola Velasco, Stratis Tsirtsis, Manuel Gomez-Rodriguez2026-05-08
🤖 machine learning

Coordination Matters: Evaluation of Cooperative Multi-Agent Reinforcement Learning

تجادل هذه الورقة بأن المقاييس القياسية القائمة على العائد غير كافية لتقييم التعلم التعزيزي متعدد الوكلاء التعاوني، وتقترح إطار تقييم مدركًا للتنسيق، تم تجسيده عبر بيئة الاختبار STAT، والذي يكشف عن اختلافات جوهرية في آليات تنسيق الوكلاء وتحديات القابلية للتوسع التي غالبًا ما تحجبها درجات الأداء الإجمالية.

Maria Ana Cardei, Matthew Landers, Afsaneh Doryab2026-05-08
🤖 machine learning

Cross-Modal Navigation with Multi-Agent Reinforcement Learning

تقدم هذه الورقة البحثية CRONA، وهو إطار عمل للتعلم التعزيزي متعدد الوكلاء للملاحة عبر الوسائط، يستفيد من وكلاء متخصصين في الوسائط مع ناقد مركزي لتحقيق ملاحة مجسدة قوية وفعالة، لا سيما في البيئات المعقدة حيث تعاني النماذج أحادية الوكيل.

Shuo Liu, Xinzichen Li, Christopher Amato2026-05-08
💬 NLP

Recursive Agent Optimization

تقدم الورقة البحثية "تحسين الوكيل المتكرر" (RAO)، وهو إطار عمل للتعلم التعزيزي يدرب الوكلاء على تفويض المهام الفرعية لأنفسهم بشكل متكرر، مما يؤدي إلى تحسين كفاءة التدريب، وتمكين القابلية للتوسع بما يتجاوز حدود السياق، وتعزيز القدرة على التعميم في المشكلات المعقدة من خلال استراتيجيات فرق تسد.

Apurva Gandhi, Satyaki Chakraborty, Xiangjun Wang, Aviral Kumar, Graham Neubig2026-05-08
💻 computer science

Governed Collaborative Memory as Artificial Selection in LLM-Based Multi-Agent Systems

تؤطر هذه الورقة تحدي اختيار الذاكرات المستمرة في الأنظمة متعددة الوكلاء القائمة على النماذج اللغوية الكبيرة بوصفه "ذاكرة تعاونية محكومة"، مقترحةً أجندة تصميمية تعامل حوكمة الذاكرة كنظام انتخاب اصطناعي لضمان الجودة المعرفية، ودقة المصدر، والحالة المؤسسية القابلة للتتبع، بدلاً من الاعتماد حصراً على دقة الاسترجاع.

Diego F. Cuadros, Abdoul-Aziz Maiga, Helen Meskhidze, Andre Curtis-Trudel2026-05-07
🤖 AI

Agent Island: A Saturation- and Contamination-Resistant Benchmark from Multiagent Games

تقدم هذه الورقة "Agent Island"، وهو معيار اختبار ديناميكي متعدد اللاعبين صُمم للتغلب على مشكلات التشبع والتلوث في التقييمات الثابتة من خلال جعل وكلاء النماذج اللغوية يتنافسون في ألعاب تكيفية من التعاون والصراع، حيث يكشف نظام ترتيب بايزي (Bayesian) أن نموذج gpt-5.5 من OpenAI يتفوق بشكل كبير على النماذج الأخرى، بينما يُظهر أيضاً انحيازاً ملموساً لنفس المزود في سلوك التصويت.

Connacher Murphy2026-05-07
💻 computer science

Tree-based Credit Assignment for Multi-Agent Memory System

تقترح الورقة البحثية TreeMem، وهي طريقة لتعيين الائتمان قائمة على الأشجار تستمد إشارات تحسين خاصة بكل وكيل من مكافآت المهام النهائية عبر المتوسط الحسابي لـ مونت كارلو فوق خط إنتاج ذي بنية شجرية، مما يتيح تدريب أنظمة الذاكرة متعددة الوكلاء بفعالية دون الحاجة إلى تعليقات توضيحية مكلفة خاصة بالمهام.

Marina Mao, Alexandr Liu, Pengbo Li, Siheng Li, Bo Zhou, Xiang Wang2026-05-07
🤖 machine learning

Graph-SND: Sparse Aggregation for Behavioral Diversity in Multi-Agent Reinforcement Learning

تقدم هذه الورقة Graph-SND، وهي طريقة تجميع متفرقة وقابلة للتوسع تقرب مقياس تنوع النظام العصبي (SND) ذو التكلفة التربيعية في التعلم المعزز متعدد الوكلاء عبر حساب المتوسطات الموزونة على حواف رسوم بيانية عشوائية، مما يتيح قياساً وتحكماً فعالين في التنوع السلوكي لفرق الوكلاء الكبيرة دون تغيير المعنى الدلالي للمقياس.

Shawn Ray2026-05-07
💻 computer science

The Hive Mind is a Single Reinforcement Learning Agent

تثبت هذه الورقة أن "العقل الجمعي" الناشئ عن سرب من الوكلاء المحاكيين تماماً، مثل نحل العسل، يكافئ رياضياً وكيل تعلم تعزيزي عبر الإنترنت واحداً يستخدم خوارزمية جديدة للمبتدئ متعدد الأذرع تسمى "تعلم ميونارد-كروس" لتحسين اتخاذ القرار الجماعي.

Karthik Soma, Yann Bouteiller, Heiko Hamann, Giovanni Beltrame2026-05-06