🤖 AI

TodyComm: Task-Oriented Dynamic Communication for Multi-Round LLM-based Multi-Agent System

تقدم الورقة البحثية TodyComm، وهو خوارزمية اتصالات ديناميكية موجهة نحو المهام تعمل على تحسين التعاون متعدد الوكلاء القائم على النماذج اللغوية الكبيرة عبر جولات متعددة من خلال توليد توبولوجيا تكيفية مدفوعة بالسلوك عبر التدرج السياساتي، مما يتفوق بذلك على الأساليب ذات البنية الثابتة في البيئات العدائية الديناميكية والبيئات ذات عرض النطاق الترددي المحدود مع الحفاظ على كفاءة الرموز (tokens) والقابلية للتوسع.

Wenzhe Fan, Tommaso Tognoli, Henry Peng Zou, Chunyu Miao, Yibo Wang, Xinhua Zhang2026-05-12
🤖 machine learning

Efficient Estimation of Kernel Surrogate Models for Task Attribution

تقدم هذه الورقة نماذج بديلة قائمة على النواة مع إجراء تقدير فعال يعتمد على التدرج لالتقاط التفاعلات غير الخطية للمهام بدقة من أجل عزو المهام بشكل قابل للتوسع، مما يتفوق بشكل كبير على البدائل الخطية ودوال التأثير في الارتباط مع الحقيقة الأرضية وأداء اختيار البيانات اللاحق.

Zhenshuo Zhang, Minxuan Duan, Hongyang R. Zhang2026-05-12
🤖 AI

Agent-Omit: Adaptive Context Omission for Efficient LLM Agents

تقدم هذه الورقة البحثية Agent-Omit، وهو إطار تدريب موحد يعزز كفاءة وكلاء النماذج اللغوية الكبيرة (LLM) من خلال تمكينهم من حذف الأفكار والملاحظات الزائدة بشكل تكيفي عبر الضبط الدقيق للبداية الباردة والتعلم التعزيزي المدرك للحذف، محققاً توازناً فائقاً بين الفعالية والكفاءة عبر معايير قياس متعددة.

Yansong Ning, Jun Fang, Naiqiang Tan, Hao Liu2026-05-12
🤖 AI

SE-Bench: Benchmarking Self-Evolution with Knowledge Internalization

تقدم هذه الورقة SE-Bench، وهي بيئة تشخيصية تعمل على تعمية مكتبة NumPy لتقييم التطور الذاتي بدقة من خلال عزل استيعاب المعرفة عن المعرفة المسبقة وتعقيد الاستدلال، مما يكشف أن التدريب بنظام الكتاب المغلق واللعب الذاتي أكثر فعالية من التدريب بنظام الكتاب المفتوح أو التعلم المعزز القياسي في دمج المعرفة الجديدة في أوزان النموذج.

Jiarui Yuan, Tailin Jin, Weize Chen, Zeyuan Liu2026-05-12
🤖 AI

When Agents Say One Thing and Do Another: Validating Elicited Beliefs from LLMs

تقترح هذه الورقة إطاراً قائماً على نظرية القرار للتحقق من الاتساق بين معتقدات الاحتمالية المستخلصة من النماذج اللغوية الكبيرة وبين قراراتها، كاشفةً أنه بينما تُظهر حتى أقوى النماذج تباينات طفيفة بين معتقداتها المعلنة وأفعالها، فإن هذه المعتقدات ليست ملخصات مثالية للمعلومات التي توجه خياراتها.

Khurram Yamin, Jingjing Tang, Santiago Cortes-Gomez, Amit Sharma, Eric Horvitz, Bryan Wilder2026-05-12
🤖 AI

HyPER: Bridging Exploration and Exploitation for Scalable LLM Reasoning with Hypothesis Path Expansion and Reduction

يُعدُّ HYPER سياسة تحكم آنية وخالية من التدريب لنماذج "خليط الخبراء" (mixture-of-experts)، حيث يوازن ديناميكيًا بين الاستكشاف والاستغلال أثناء التفكير في وقت الاختبار من خلال إدارة مجمع للفرضيات عبر التوسع، والتحسين على مستوى الرمز (token)، والتجميع القائم على الثقة، مما يؤدي إلى تحسين الدقة بشكل كبير مع تقليل استخدام الرموز.

Shengxuan Qiu, Haochen Huang, Shuzhang Zhong, Pengfei Zuo, Meng Li2026-05-12
🤖 machine learning

Breaking the Grid: Distance-Guided Reinforcement Learning in Large Discrete Action Spaces

تقدم هذه الورقة البحثية خوارزمية التعلم المعزز الموجه بالمسافة (DGRL)، وهي خوارزمية مبتكرة تتغلب على لعنة الأبعاد في فضاءات الأفعال المنفصلة الكبيرة (التي تصل إلى 102010^{20} فعلًا) من خلال الجمع بين الأحياء الديناميكية المأخوذة بالعينة والتحديثات القائمة على المسافة لتحويل تحسين السياسة إلى مهمة انحدار مستقرة، مما يحقق تحسينات كبيرة في الأداء والتقارب مقارنة بأحدث الأساليب المتبعة.

Heiko Hoppe, Fabian Akkerman, Wouter van Heeswijk, Maximilian Schiffer2026-05-12
💬 NLP

EcoGym: Evaluating LLMs for Long-Horizon Plan-and-Execute in Interactive Economies

تقدم هذه الورقة EcoGym، وهو معيار مفتوح المصدر ومبتكر يتميز بثلاث بيئات اقتصادية تفاعلية متنوعة وطويلة الأمد، صُممت لتقييم التماسك الاستراتيجي وقوة التنفيذ للوكلاء القائمين على النماذج اللغوية الكبيرة، مما يكشف أن النماذج الحالية تعاني في تحسين التخطيط رفيع المستوى وتنفيذ الإجراءات الفعالة في آن واحد عبر سيناريوهات متباينة.

Xavier Hu, Jinxiang Xia, Shengze Xu, Kangqi Song, Yishuo Yuan, Guibin Zhang, JinCheng Ren, Boyu Feng, Li Lu, Tieyong Zen (…)2026-05-12
🤖 AI

Formal Policy Enforcement for Real-World Agentic Systems

تقدم هذه الورقة إطار عمل FORGE، الذي يستفيد من البرمجة الموجهة بالجوانب والتحقق الرسمي القائم على Datalog لفرض سياسات أمنية بضمانات صارمة عبر الأنظمة الوكيلة، معالجةً بذلك حدود الامتثال القائم على المطالبات باللغة الطبيعية في البيئات متعددة الوكلاء.

Nils Palumbo, Sarthak Choudhary, Jihye Choi, Guy Amir, Prasad Chalasani, Somesh Jha2026-05-12
🤖 AI

Faithful Autoformalization via Roundtrip Verification and Repair

تقترح هذه الورقة إطار عمل للتحقق من الرحلة الكاملة يضمن الترجمة الوفية من اللغة الطبيعية إلى اللغة الرسمية عبر الترجمة التكرارية العكسية إلى اللغة الطبيعية، والتحقق من التكافؤ المنطقي، وتطبيق إصلاحات محددة النطاق موجهة بالتشخيص لتصحيح الأخطاء دون الحاجة إلى تعليقات توضيحية للحقيقة الأرضية.

Daneshvar Amrollahi, Jerry Lopez, Clark Barrett2026-05-12