💬 NLP

Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory

تقدم هذه الورقة Evo-Memory، وهو معيار وإطار عمل شامل للبث المصمم لتقييم وتعزيز قدرات الذاكرة ذاتية التطور لوكلاء النماذج اللغوية الكبيرة (LLM) في بيئات المهام المستمرة والديناميكية، والتي تتميز بمسار ReMem المقترح الذي يدمج الاستنتاج، والأفعال، وتحديثات الذاكرة من أجل التحسين المستمر.

Tianxin Wei, Noveen Sachdeva, Benjamin Coleman, Zhankui He, Yuanchen Bei, Xuying Ning, Mengting Ai, Yunzhe Li, Jingrui H (…)2026-05-19
💬 NLP

SignRoundV2: Toward Closing the Performance Gap in Extremely Low-Bit Post-Training Quantization for LLMs

تُعد SignRoundV2 إطار عمل للكمية ما بعد التدريب يستخدم استراتيجية دقة مختلطة تكيفية وتقنيات تثبيت خفيفة الوزن لتقليص الفجوة في الأداء بين النماذج اللغوية الكبيرة المكممة وتلك ذات الدقة الكاملة بشكل كبير، محققةً نتائج تقترب من فقدان البيانات في إعدادات MXFP المختلطة وتحسينات جوهرية في كمية الأوزان فقط عند مستوى 2 بت الصعب.

Wenhua Cheng, Weiwei Zhang, Heng Guo, Haihao Shen, Zaner Ma2026-05-19
💬 NLP

ShareChat: A Dataset of Chatbot Conversations in the Wild

تقدم هذه الورقة البحثية ShareChat، وهي مجموعة بيانات ضخمة متعددة المنصات تضم 142,808 محادثة حقيقية مع روبوتات الدردشة تحافظ على خصائص الواجهة الأصلية عبر 95 لغة لتمكين تقييم أكثر واقعية للنماذج اللغوية الكبيرة بما يتجاوز المعايير الموحدة التي تقتصر على النصوص فقط.

Yueru Yan, Tuc Nguyen, Bo Su, Melissa Lieffers, Thai Le2026-05-19
💬 NLP

Lying with Truths: Open-Channel Multi-Agent Collusion for Belief Manipulation via Generative Montage

تقدم هذه الورقة البحثية "المونتاج التوليدي" (Generative Montage)، وهو هجوم تواطؤ معرفي مبتكر حيث تستغل الوكلاء المستقلون نزعات الاستنتاج لدى النماذج اللغوية الكبيرة للتلاعب بالمعتقدات عبر تركيب سرديات مضللة من أدلة حقيقية متاحة علنًا، مما يكشف أن حتى النماذج المتقدمة معرضة بشدة لمثل هذا التلاعب القائم على الحقيقة.

Jinwei Hu, Xinmiao Huang, Youcheng Sun, Yi Dong, Xiaowei Huang2026-05-19
🤖 machine learning

The Illusion of Specialization: Unveiling the Domain-Invariant "Standing Committee" in Mixture-of-Experts Models

تتحدى هذه الورقة الافتراض السائد بأن نماذج "خليط الخبراء" (Mixture-of-Experts) تحقق التخصص في المجالات من خلال التوجيه المتفرق، وذلك عبر إثبات وجود "لجنة ثابتة" من الخبراء غير متغيرة المجالات تتعامل باستمرار مع غالبية كتلة التوجيه، مما يكشف عن انحياز هيكلي نحو الحوسبة المركزية قد يعيق كفاءة التدريب.

Yan Wang, Yitao Xu, Nanhan Shen, Jinyan Su, Jimin Huang, Zining Zhu2026-05-19
💬 NLP

KASER: Knowledge-Aligned Student Error Simulator for Open-Ended Coding Tasks

تقدم هذه الورقة البحثية KASER، وهو نهج جديد قائم على التعلم التعزيزي يعمل على مواءمة توليد الأخطاء مع معرفة الطالب لمحاكاة أخطاء برمجية متنوعة ودقيقة بفعالية، متفوقاً بذلك على النماذج المرجعية الحالية في كل من التنبؤ بالأخطاء وتنوع الكود البرمجي في مجموعات البيانات الواقعية.

Zhangqi Duan, Nigel Fernandez, Andrew Lan2026-05-19
💬 NLP

Double-Calibration: Towards Reliable LLMs via Calibrating Knowledge and Reasoning Confidence

تقدم الورقة البحثية إطار عمل DoublyCal، الذي يعزز دقة وموثوقية النماذج اللغوية الكبيرة (LLMs) ذات الصندوق الأسود من خلال توظيف نموذج وكيل خفيف الوزن لتوليد أدلة من الرسوم البيانية للمعرفة ذات ثقة مُعايرة، مما يمكّن النموذج اللغوي الكبير من إنتاج تنبؤات مُعايرة جيداً تعود في أصلها إلى عدم اليقين في الأدلة الداعمة.

Yuyin Lu, Ziran Liang, Yanghui Rao, Wenqi Fan, Fu Lee Wang, Qing Li2026-05-19
💻 computer science

Agentic AI Governance and Lifecycle Management in Healthcare

تقترح هذه الورقة إطار عمل لإدارة دورة حياة الوكيل الموحدة (UALM)، يتميز ببنية مستوية لخطة التحكم مكونة من خمس طبقات ونموذج نضج، وذلك لمعالجة تحديات انتشار الوكلاء والمساءلة في مجال الرعاية الصحية من خلال تمكين الإشراف الجاهز للتدقيق والتوسع الآمن لسير عمل الذكاء الاصطناعي الوكيل.

Chandra Prakash, Mary Lind, Avneesh Sisodia2026-05-19
💻 computer science

Inference-Time Diversity in RL-Trained Lean Theorem Provers: A Diagnostic Study

تكشف هذه الدراسة أن مبرهنات "لين" (Lean) التي تم تدريبها باستخدام التعلم التعزيزي تعاني من انهيار النمط أثناء وقت الاستدلال، وهو ما يمكن التخفيف من حدته بفعالية عبر تطبيق جدول زمني ثابت من هياكل التكتيكات المتنوعة لاستعادة مكاسب كبيرة في الأداء، في حين ثبت أن إعادة صياغة المطالبات والتعليقات غير ذات الصلة غير فعالة أو ضارة.

Zachary Burton2026-05-19
🤖 machine learning

PyHealth 2.0: A Comprehensive Open-Source Toolkit for Accessible and Reproducible Clinical Deep Learning

تُعد PyHealth 2.0 مجموعة أدوات محسنة مفتوحة المصدر تعمل على دمقرطة أبحاث التعلم العميق السريري من خلال توحيد مجموعات البيانات والنماذج والمهام المتنوعة في إطار عمل واحد عالي الكفاءة يتيح النمذجة التنبؤية في سبعة أسطر من الكود البرمدي فقط، مع تقليل التكاليف الحسابية وحواجز الخبرة في هذا المجال بشكل كبير.

John Wu, Yongda Fan, Zhenbang Wu, Paul Landes, Eric Schrock, Sayeed Sajjad Razin, Arjun Chatterjee, Naveen Baskaran, Jos (…)2026-05-19