💬 NLP

KASER: Knowledge-Aligned Student Error Simulator for Open-Ended Coding Tasks

تقدم هذه الورقة البحثية KASER، وهو نهج جديد قائم على التعلم التعزيزي يعمل على مواءمة توليد الأخطاء مع معرفة الطالب لمحاكاة أخطاء برمجية متنوعة ودقيقة بفعالية، متفوقاً بذلك على النماذج المرجعية الحالية في كل من التنبؤ بالأخطاء وتنوع الكود البرمجي في مجموعات البيانات الواقعية.

Zhangqi Duan, Nigel Fernandez, Andrew Lan2026-05-19
💬 NLP

Double-Calibration: Towards Reliable LLMs via Calibrating Knowledge and Reasoning Confidence

تقدم الورقة البحثية إطار عمل DoublyCal، الذي يعزز دقة وموثوقية النماذج اللغوية الكبيرة (LLMs) ذات الصندوق الأسود من خلال توظيف نموذج وكيل خفيف الوزن لتوليد أدلة من الرسوم البيانية للمعرفة ذات ثقة مُعايرة، مما يمكّن النموذج اللغوي الكبير من إنتاج تنبؤات مُعايرة جيداً تعود في أصلها إلى عدم اليقين في الأدلة الداعمة.

Yuyin Lu, Ziran Liang, Yanghui Rao, Wenqi Fan, Fu Lee Wang, Qing Li2026-05-19
💻 computer science

Agentic AI Governance and Lifecycle Management in Healthcare

تقترح هذه الورقة إطار عمل لإدارة دورة حياة الوكيل الموحدة (UALM)، يتميز ببنية مستوية لخطة التحكم مكونة من خمس طبقات ونموذج نضج، وذلك لمعالجة تحديات انتشار الوكلاء والمساءلة في مجال الرعاية الصحية من خلال تمكين الإشراف الجاهز للتدقيق والتوسع الآمن لسير عمل الذكاء الاصطناعي الوكيل.

Chandra Prakash, Mary Lind, Avneesh Sisodia2026-05-19
💻 computer science

Inference-Time Diversity in RL-Trained Lean Theorem Provers: A Diagnostic Study

تكشف هذه الدراسة أن مبرهنات "لين" (Lean) التي تم تدريبها باستخدام التعلم التعزيزي تعاني من انهيار النمط أثناء وقت الاستدلال، وهو ما يمكن التخفيف من حدته بفعالية عبر تطبيق جدول زمني ثابت من هياكل التكتيكات المتنوعة لاستعادة مكاسب كبيرة في الأداء، في حين ثبت أن إعادة صياغة المطالبات والتعليقات غير ذات الصلة غير فعالة أو ضارة.

Zachary Burton2026-05-19
🤖 machine learning

PyHealth 2.0: A Comprehensive Open-Source Toolkit for Accessible and Reproducible Clinical Deep Learning

تُعد PyHealth 2.0 مجموعة أدوات محسنة مفتوحة المصدر تعمل على دمقرطة أبحاث التعلم العميق السريري من خلال توحيد مجموعات البيانات والنماذج والمهام المتنوعة في إطار عمل واحد عالي الكفاءة يتيح النمذجة التنبؤية في سبعة أسطر من الكود البرمدي فقط، مع تقليل التكاليف الحسابية وحواجز الخبرة في هذا المجال بشكل كبير.

John Wu, Yongda Fan, Zhenbang Wu, Paul Landes, Eric Schrock, Sayeed Sajjad Razin, Arjun Chatterjee, Naveen Baskaran, Jos (…)2026-05-19
💻 computer science

Enhancing Table Reasoning with Deterministic Table-State Rewards

تقدم هذه الورقة TABROUGE، وهو مقياس مكافأة حتمي لا يتطلب تدريباً يعتمد على أطول سلسلة فرعية مشتركة، وإطار عمل RE-TAB لتعزيز دقة استدلال النماذج اللغوية الكبيرة على الجداول متعدد الخطوات بشكل كبير من خلال توفير تغذية راجعة قابلة للتوسع ومستندة إلى الاستعلام للحالات المتوسطة دون الاعتماد على نماذج متعلمة أو منفذين خارجيين.

Tung Sum Thomas Kwok, Xinyu Wang, Hengzhi He, Xiaofeng Lin, Peng Lu, Liheng Ma, Chunhe Wang, Chun Ho Mak, Yuyu Luo, Ying (…)2026-05-19
🤖 machine learning

LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning

تقترح الورقة البحثية إطار عمل LaDi-RL، وهو إطار للتعلم المعزز يستخدم نماذج الانتشار الكامن لتوليد مسارات استدلال مهيكلة، ويستخدم عمليات تدحرج نصية كامنة هرمية لفصل جودة التخطيط الكامن عن أخطاء فك التشفيد النصي، مما يمنع انهيار الإنتروبيا ويتفوق بشكل كبير على التعلم المعزز التقليدي القائم على مستوى الرمز (token-level) في مهام الاستدلال البرمجي والرياضي.

Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang, Yi-An Ma, Lianhui Qin2026-05-19
💬 NLP

Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models

تقدم هذه الورقة البحثية "بحث البيانات العميق" (DDR) ومعياره المرجعي المقابل، DDR-Bench، لتقييم الذكاء الاستقصائي للنماذج اللغوية الكبيرة الوكيلية في استخراج الرؤى ذاتياً من البيانات الخام، كاشفةً أنه بينما تُظهر النماذج الرائدة وكالة ناشئة، فإن الاستكشاف الفعال طويل الأمد يتطلب استراتيجيات جوهرية تتجاوز مجرد التوسع أو الهيكلة.

Wei Liu, Peijie Yu, Michele Orini, Yali Du, Yulan He2026-05-19
💻 computer science

CVE-Factory: Scaling Expert-Level Agentic Tasks for Code Security Vulnerability

تقدم هذه الورقة CVE-Factory، وهو إطار عمل متعدد الوكلاء يقوم تلقائيًا بتحويل بيانات CVE الوصفية المتفرقة إلى مهام أمنية عالية الجودة وقابلة للتنفيذ لإنشاء معيار LiveCVEBench ومجموعة بيانات تدريب واسعة النطاق، مما يحسن بشكل كبير قدرات اكتشاف الثغرات الأمنية لوكلاء الكود.

Xianzhen Luo, Jingyuan Zhang, Shiqi Zhou, Rain Huang, Chuan Xiao, Qingfu Zhu, Zhiyuan Ma, Xing Yue, Yang Yue, Wencong Ze (…)2026-05-19
🤖 machine learning

Mitigating Conversational Inertia in Multi-Turn Agents

تحدد هذه الورقة البحثية ظاهرة "القصور الذاتي الحواري" في وكلاء النماذج اللغوية الكبيرة متعددة الدورات، حيث تحاكي النماذج استجاباتها السابقة بشكل خاطئ، وتقترح إطار عمل لتعلم تفضيل السياق يعمل على معايرة النموذج لتفضيل الإجراءات ذات القصور الذاتي المنخفض، مما يوازن بين الاستكشاف والاستغلال لتحسين الأداء عبر مختلف البيئات الوكيلية.

Yang Wan, Zheng Cao, Zhenhao Zhang, Zhengwen Zeng, Shuheng Shen, Changhua Meng, Linchao Zhu2026-05-19