💻 computer science

Enhancing Table Reasoning with Deterministic Table-State Rewards

تقدم هذه الورقة TABROUGE، وهو مقياس مكافأة حتمي لا يتطلب تدريباً يعتمد على أطول سلسلة فرعية مشتركة، وإطار عمل RE-TAB لتعزيز دقة استدلال النماذج اللغوية الكبيرة على الجداول متعدد الخطوات بشكل كبير من خلال توفير تغذية راجعة قابلة للتوسع ومستندة إلى الاستعلام للحالات المتوسطة دون الاعتماد على نماذج متعلمة أو منفذين خارجيين.

Tung Sum Thomas Kwok, Xinyu Wang, Hengzhi He, Xiaofeng Lin, Peng Lu, Liheng Ma, Chunhe Wang, Chun Ho Mak, Yuyu Luo, Ying (…)2026-05-19
🤖 machine learning

LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning

تقترح الورقة البحثية إطار عمل LaDi-RL، وهو إطار للتعلم المعزز يستخدم نماذج الانتشار الكامن لتوليد مسارات استدلال مهيكلة، ويستخدم عمليات تدحرج نصية كامنة هرمية لفصل جودة التخطيط الكامن عن أخطاء فك التشفيد النصي، مما يمنع انهيار الإنتروبيا ويتفوق بشكل كبير على التعلم المعزز التقليدي القائم على مستوى الرمز (token-level) في مهام الاستدلال البرمجي والرياضي.

Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang, Yi-An Ma, Lianhui Qin2026-05-19
💬 NLP

Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models

تقدم هذه الورقة البحثية "بحث البيانات العميق" (DDR) ومعياره المرجعي المقابل، DDR-Bench، لتقييم الذكاء الاستقصائي للنماذج اللغوية الكبيرة الوكيلية في استخراج الرؤى ذاتياً من البيانات الخام، كاشفةً أنه بينما تُظهر النماذج الرائدة وكالة ناشئة، فإن الاستكشاف الفعال طويل الأمد يتطلب استراتيجيات جوهرية تتجاوز مجرد التوسع أو الهيكلة.

Wei Liu, Peijie Yu, Michele Orini, Yali Du, Yulan He2026-05-19
💻 computer science

CVE-Factory: Scaling Expert-Level Agentic Tasks for Code Security Vulnerability

تقدم هذه الورقة CVE-Factory، وهو إطار عمل متعدد الوكلاء يقوم تلقائيًا بتحويل بيانات CVE الوصفية المتفرقة إلى مهام أمنية عالية الجودة وقابلة للتنفيذ لإنشاء معيار LiveCVEBench ومجموعة بيانات تدريب واسعة النطاق، مما يحسن بشكل كبير قدرات اكتشاف الثغرات الأمنية لوكلاء الكود.

Xianzhen Luo, Jingyuan Zhang, Shiqi Zhou, Rain Huang, Chuan Xiao, Qingfu Zhu, Zhiyuan Ma, Xing Yue, Yang Yue, Wencong Ze (…)2026-05-19
🤖 machine learning

Mitigating Conversational Inertia in Multi-Turn Agents

تحدد هذه الورقة البحثية ظاهرة "القصور الذاتي الحواري" في وكلاء النماذج اللغوية الكبيرة متعددة الدورات، حيث تحاكي النماذج استجاباتها السابقة بشكل خاطئ، وتقترح إطار عمل لتعلم تفضيل السياق يعمل على معايرة النموذج لتفضيل الإجراءات ذات القصور الذاتي المنخفض، مما يوازن بين الاستكشاف والاستغلال لتحسين الأداء عبر مختلف البيئات الوكيلية.

Yang Wan, Zheng Cao, Zhenhao Zhang, Zhengwen Zeng, Shuheng Shen, Changhua Meng, Linchao Zhu2026-05-19
💻 computer science

Position: Universal Time Series Foundation Models Rest on a Category Error

تجادل هذه الورقة الموقعة بأن السعي وراء نماذج تأسيسية عالمية للسلاسل الزمنية معيب جوهرياً بسبب خطأ فئوي بين الحاويات الهيكلية والأنماط الدلالية، داعيةً بدلاً من ذلك إلى نموذج "وكيل التحكم السببي" الذي ينظم حلّالين متخصصين للتعامل بفعالية مع الانزياح التوزيعي وتحولات الأنظمة الناتجة عن التدخل.

Xilin Dai, Wanxu Cai, Zhijian Xu, Qiang Xu2026-05-19
🤖 machine learning

SuReNav: Superpixel Graph-based Constraint Relaxation for Navigation in Over-constrained Environments

يُعد SuReNav إطار عمل قائماً على رسوم بيانية للـ superpixel يعالج مشكلة الملاحة شديدة القيود في البيئات شبه المستقرة من خلال استخدام شبكات عصبية رسومية مدربة على نماذج بشرية لتخفيف القيود الإقليمية، مما يتيح تخطيط مسارات آمناً وفعالاً ويحاكي السلوك البشري في كل من البيئات الحضرية المحاكية والواقعية.

Keonyoung Koh, Moonkyeong Jung, Samuel Seungsup Lee, Daehyung Park2026-05-19
🤖 AI

The Laplacian Keyboard: Beyond the Linear Span

تقدم الورقة البحثية "لوحة مفاتيح لابلاتسيان" (Laplacian Keyboard)، وهي إطار عمل هرمي يبني مكتبة من السلوكيات غير المرتبطة بمهمة محددة من المتجهات الذاتية لـ "لابلاتسيان"، وتتعلم سياسة ميتا لدمجها ديناميكيًا، متجاوزةً بذلك قيود التعبير في التحكم الصفري القائم على الامتداد الخطي، ومحققةً كفاءة عينة فائقة في التعلم المعزز.

Siddarth Chandrasekar, Marlos C. Machado2026-05-19
🤖 AI

GRAFT: Decoupling Ranking and Calibration for Survival Analysis

تقترح الورقة البحثية نموذج GRAFT، وهو نموذج هجين جديد لتحليل البقاء يفصل بين التصنيف الإنذاري والمعايرة من خلال الجمع بين نموذج AFT خطي وشبكة عصبية متبقية غير خطية واختيار الميزات العشوائي، محققاً بذلك أداءً فائقاً في التمييز والمعايرة في سياقات البيانات عالية الأبعاد والمبتورة.

Mohammad Ashhad, Robert Hoehndorf, Ricardo Henao2026-05-19
🤖 AI

Self-Supervised Bootstrapping of Action-Predictive Embodied Reasoning

تقدم الورقة البحثية R&B-EnCoRe، وهو إطار عمل للتعلم الذاتي غير الخاضع للإشراف، يقوم بتعزيز الاستدلال المجسد من خلال اعتباره متغيرًا كامنًا لاستخلاص استراتيجيات التنبؤ بالأفعال من المعرفة ذات النطاق الواسع المتاحة على الإنترنت، مما يحسن بشكل كبير أداء عمليات المناولة، والملاحة، والقيادة عبر مختلف نماذج الـ VLA دون الاعتماد على قوالب جامدة أو مكافآت خارجية.

Milan Ganai, Katie Luo, Jonas Frey, Clark Barrett, Marco Pavone2026-05-19