🤖 AI

SmartEval: A Benchmark for Evaluating LLM-Generated Smart Contracts from Natural Language Specifications

تقدم هذه الورقة SmartEval، وهو معيار شامل يتميز بمتن يضم 9,000 عقد Solidity من إنشاء النماذج اللغوية الكبيرة، ومعيار تقييم خماسي الأبعاد، ومسار عمل تم التحقق من صحته يكشف عن أنماط فشل مميزة بينما يوضح أن العقود التي أنشأتها النماذج اللغوية الكبيرة يمكن أن تتفوق على التنفيذات الحقيقية في الالتزام الوظيفي.

Abhinav Goel, Agostino Capponi, Alfio Gliozzo, Chaitya Shah2026-05-12
🤖 AI

CalBench: Evaluating Coordination-Privacy Trade-offs in Multi-Agent LLMs

تُعد CalBench بيئة تقييم مضبوطة للنماذج اللغوية الكبيرة متعددة الوكلاء، تستخدم مهمة جدولة تقويم لا مركزية تتضمن معلومات خاصة لقياس جودة التنسيق، وكفاءة التواصل، والعدالة، وتسرب الخصوصية بدقة مقابل الحلول المثلى والأساسية.

Chelsea Zou, Yiheng Yao, Selena She, Robert D. Hawkins2026-05-12
🤖 AI

EnactToM: An Evolving Benchmark for Functional Theory of Mind in Embodied Agents

تقدم الورقة البحثية EnactToM، وهو معيار مرجعي تم التحقق منه بدقة ومتطور لـ 300 مهمة متعددة الوكلاء متجسدة، يكشف عن فجوة حرجة في نماذج الذكاء الاصطناعي الرائدة الحالية، والتي تتفوق في أسئلة الاعتقاد الحرفي لكنها تفشل تماماً (بنسبة نجاح 0.0%) في نظرية العقل الوظيفية المطلوبة للتصرف بناءً على المعتقدات الضمنية في البيئات المعقدة ذات الرؤية الجزئية.

Gurusha Juneja, Dylan Lu, Saaket Agashe, Parth Diwane, Edward Gunn, Jayanth Srinivasa, Gaowen Liu, William Yang Wang, Ya (…)2026-05-12
🤖 AI

RADAR: Redundancy-Aware Diffusion for Multi-Agent Communication Structure Generation

إنَّ RADAR هو إطار عمل توليدي يعتمد على الاستعلام ويدرك التكرار، يستخدم الانتشار الرسومي المتقطع المشروط لتحسين طوبولوجيا الاتصال متعدد الوكلاء ديناميكيًا، مما يحقق دقة أعلى، واستهلاكًا أقل للرموز، ومتانة أكبر مقارنة بالطرق الحالية.

Zhen Zhang, Wanjing Zhou, Juncheng Li, Hao Fei, Jun Wen, Wei Ji2026-05-12
🤖 machine learning

PC3D: Zero-Shot Cooperation Across Variable Rosters via Personalized Context Distillation

تقترح الورقة البحثية طريقة PC3D، التي تمكن وكلاء التعلم المعزز متعدد الوكلاء اللامركزي من تحقيق تعاون صفري الاستباق (zero-shot cooperation) عبر قوائم فرق متغيرة من خلال استخلاص سياقات تنسيق مخصصة من معلم مركزي إلى سياسات محلية تتكيف لاستعادة المعلومات ذات الصلة للفريق من سجلات التفاعل.

Ahmet Onur Akman, Rafał Kucharski2026-05-12
🤖 AI

The Bystander Effect in Multi-Agent Reasoning: Quantifying Cognitive Loafing in Collaborative Interactions

تتحدى هذه الورقة البحثية الافتراض القائل بأن التعاون بين الوكلاء المتعددين يحسن بطبيعته من قدرة النماذج اللغوية الكبيرة على الاستنتاج، وذلك من خلال إثبات أن الضغط الاجتماعي المحاكى يؤدي إلى تفعيل "تأثير المارة" و"التراخي المعرفي"، مما يتسبب في دفع النماذج إلى كبت استنتاجاتها الداخلية الصحيحة لصالح الامتثال الاجتماعي المتملق، وهو ما يكشف عن ثغرات هيكلية حرجة في الطبوغرافيات التعاونية غير المنظمة.

Dahlia Shehata, Ming Li2026-05-12
🔬 physics

Conformity Generates Collective Misalignment in AI Agents Societies

تُثبت هذه الورقة أن مجموعات من وكلاء الذكاء الاصطناعي المتوافقين فردياً يمكن أن تنحرف جماعياً نحو حالات مستقرة من عدم التوافق بسبب ديناميكيات الامتثال، مما يكشف أن ضمانات السلامة الفردية لا تضمن السلامة الجماعية ويسلط الضوء على خطر نقاط التحول غير القابلة للانعكاس المدفوعة بالتأثير الاجتماعي.

Giordano De Marzo, Alessandro Bellina, Claudio Castellano, Viola Priesemann, David Garcia2026-05-12
⚡ electrical engineering

Decentralized Contingency MPC based on Safe Sets for Nonlinear Multi-agent Collision Avoidance

تقترح هذه الورقة إطار عمل للتحكم التنبئي بالنماذج للطوارئ بشكل لا مركزي للأنظمة متعددة الوكلاء غير الخطية، والذي يضمن حركة خالية من الاصطدام وإمكانية تحقيق متكررة باستخدام معلومات الحالة فقط، وذلك عبر ربط المسارات الاسمية بشهادات الطوارئ وآلية تحديث هندسية جديدة للمجموعات الآمنة.

Max Studt, Georg Schildbach2026-05-12
💬 NLP

From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems

تُعرّف هذه الدراسة المسحية "أنظمة الذكاء الاصطناعي المركبة" بوصفها نموذجاً ناشئاً يدمج النماذج اللغوية الكبيرة مع مكونات خارجية مثل أدوات الاسترجاع والوكلاء، مقترحةً تصنيفاً موحداً وتحليلاً للنماذج التأسيسية مثل تقنية "التوليد المعزز بالاسترجاع" (RAG) ووكلاء النماذج اللغوية الكبيرة لمعالة التجزئة الحالية وتوجيه الأبحاث المستقبلية في مجال الذكاء الاصطناعي على مستوى الأنظمة.

Jiayi Chen, Junyi Ye, Guiling Wang2026-05-11
🤖 AI

LLM-Based Agents for Competitive Landscape Mapping in Drug Asset Due Diligence

تقدم هذه الورقة نظام وكيل يعتمد على النماذج اللغوية الكبيرة (LLM) لتقييم الأصول الدوائية، وتقوم بمعايرته من خلال تحويل مذكرات رأس المال الاستثماري غير المنظمة إلى مجموعة بيانات تقييم مهيكلة، محققةً نسبة استدعاء بلغت 83% في اكتشاف المنافسين، ومقلصةً وقت إنجاز المحلل من 2.5 يوم إلى حوالي 3 ساعات تقريباً.

Vlad Vinogradov (Optic Inc), Alisa Vinogradova (AI Expert), Dmitrii Radkevich (Optic Inc), Ilya Yasny (Optic Inc), Dmitr (…)2026-05-11