🤖 machine learning

Generalized Intention Modeling in Multi-Agent Reinforcement Learning

تقترح هذه الورقة إطار عمل لنمذجة الخصم متكيف مع المهام، يتعلم مزيجاً من تمثيلات النوايا مدفوعاً بالأداء، ويقدم تمثيلاً جديداً قائماً على المعلومات المتبادلة لالتقاط معلومات الخصم الأكثر صلة بالعوائد المستقبلية للوكيل الذاتي، مما يؤدي إلى التفوق على الأساليب الحالية عبر مهام متنوعة لتعلم التعزيز متعدد الوكلاء.

Mateusz Odrowaz-Sypniewski, Jasmine Bayrooti, Ajay Shankar, Amanda Prorok2026-06-01
🌀 nonlinear sciences

Social welfare optimisation under institutional reward and punishment

تُطوّر هذه الورقة إطاراً يرتكز على الرفاهية للحوافز المؤسسية في المعضلات الاجتماعية، حيث تُبين أن مخططات المكافأة أو العقاب المثلى غالباً ما تختلف اختلافاً جوهرياً عن تلك التي تكتفي فقط بتقليل التكلفة أو تعظيم وتيرة التعاون، وتوفر الشروط التحليلية والخوارزميات لتحديد هذه الاستراتيجيات التي تعظم الرفاهية.

Van An Nguyen, Vuong Khang Huynh, Huu Loi Bui, Hai Anh Ha, Quang Dung Le, Tan Dat Nguyen, Ngoc Ngu Nguyen, Zhao Song, Ma (…)2026-06-01
🤖 AI

Dreaming Of Others: Latent Teammate Modeling In World Models For Multi-Agent Reinforcement Learning

تقترح هذه الورقة إطار عمل جديد للتعلم التعزيزي متعدد الوكلاء يعمل على تعزيز نماذج العالم من نمط "Dreamer" عبر تحليل الحالات الكامنة إلى مكونات بيئية ومكونات زملاء، وتوظيف رأس "نظرية العقل" لاستنتاج نوايا الشركاء، مما يمكّن الوكلاء من تحقيق التنسيق في حالات الصفر أو القليل من الأمثلة من خلال محاكاة السلوك الاجتماعي.

Tomas Leroy-Stone2026-06-01
🤖 machine learning

Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition

تقترح هذه الورقة إطار عمل جديد لتعلم التعزيز متعدد الوكلاء غير المتصل (offline multi-agent reinforcement learning) يعالج تحديات الانزياح التوزيعي والتنسيق متعدد الأنماط في المهام التعاونية من خلال توظيف طريقة تفكيك الدرجة التسلسلية (sequential score decomposition) مدمجة مع نماذج توليدية قائمة على الانتشار (diffusion-based generative models) لتوجيه تحديثات السياسة نحو مناطق عالية المكافأة وضمن التوزيع، محققةً أداءً هو الأفضل في فئته عبر معايير اختبار متنوعة.

Dan Qiao, Wenhao Li, Shanchao Yang, Hongyuan Zha, Baoxiang Wang2026-05-29✓ Author reviewed
💻 computer science

An Agent-Centric Dynamical Systems Perspective on Multi-Agent Reinforcement Learning

تقترح هذه الورقة إطار عمل مبتكر ينمذج تدريب التعلم المعزز متعدد الوكلاء كأنظمة ديناميكية عشوائية مقترنة لتحليل استقرار وحساسية كل وكيل بشكل دقيق، مما يتغلب على قيود تقريبات المجال المتوسط التقليدية في التقاط العشوائية المتأصلة وتحسين موثوقية النشر العملي.

James Rudd-Jones, María Pérez-Ortiz, Mirco Musolesi2026-05-29
💻 computer science

ValueFlow: Measuring the Propagation of Value Perturbations in Multi-Agent LLM Systems

تقدم الورقة البحثية إطار عمل "ValueFlow"، الذي يحدد كمياً كيفية انتقال اضطرابات القيم عبر أنظمة النماذج اللغوية الكبيرة متعددة الوكلاء من خلال تفكيك انحراف القيم إلى قابلية التأثر على مستوى الوكيل والآثار الهيكلية على مستوى النظام، مما يثبت أن محاذاة القيم هي في الأساس خاصية على مستوى النظام تشكلها طوبولوجيا التفاعل.

Jinnuo Liu, Chuke Liu, Hua Shen2026-05-29
💻 computer science

Scaling Multi-agent Systems: A Smart Middleware for Improving Agent Interactions

تقدم هذه الورقة البحثية عُقد النسيج المعرفي (CFN)، وهي طبقة برمجيات وسيطة مبتكرة تستفيد من الذاكرة النشطة والتعلم التعزيزي لتحسين الطوبولوجيا، والأمن، والمحاذاة الدلالية ديناميكيًا في الأنظمة متعددة الوكلاء، مما يؤدي إلى تحسين الأداء بنسبة تزيد عن 10% مقارنة بالتواصل المباشر بين الوكيل والآخر.

Charles Fleming, Guillaume De Saint Marc, Ramana Kompella, Peter Bosch, Vijoy Pandey2026-05-29
💻 computer science

A Multi-Agent Feedback System for Detecting and Describing News Events in Satellite Imagery

تقدم هذه الورقة SkyScraper، وهو نظام متعدد الوكلاء تكراري يقوم بترميز الأخبار جغرافياً لتوليد تعليقات توضيحية لتسلسلات الصور الساتلية، مما نجح في تنسيق مجموعة بيانات أحداث جديدة متعددة الفترات الزمنية تضم 5,000 تسلسل، وأظهر تحسناً بمقدار خمسة أضعاف في اكتشاف الأحداث مقارنة بالطرق التقليدية.

Madeline Anderson, Mikhail Klassen, Ash Hoover, Kerri Cahoy2026-05-29
🤖 AI

Review Arcade: On the Human Alignment and Gameability of LLM Reviews

تقيم هذه الورقة تجريبياً المراجعات التي أنشأتها النماذج اللغوية الكبيرة على أوراق مراجعة ACL Rolling لعام 2025، لتجد أنه بينما يظل التوافق مع المراجعات البشرية محدوداً وغير متسق، يمكن للمؤلفين "التلاعب" بالنظام بفعالية من خلال مراجعة أعمالهم بشكل تكراري بناءً على ملاحظات النماذج اللغوية الكبيرة لتحقيق زيادات ذات دلالة إحصائية في الدرجات لما يصل إلى 35% من المشاركات.

Hans Ole Hatzel, Sebastian Steindl, Jan Strich2026-05-29
🤖 AI

Hallucination Mitigation with Agentic AI, Nested Learning, and AI Sustainability via Semantic Caching

تُثبت هذه الورقة أن مسار العمل متعدد الوكلاء المستوحى من نموذج HOPE والمعزز بالذاكرة، والذي يستخدم التخزين المؤقت الدلالي ومراحل المراجعة التدريجية، يمكنه تقليل هلوسة النماذج اللغوية الكبيرة بشكل كبير، وتحسين الكفاءة التشغيلية عبر خفض استهلاك الطاقة، وتعزيز قابلية التدقيق دون الحاجة إلى إعادة تدريب النموذج.

Diego Gosmar, Deborah A. Dahl2026-05-29