🔢 mathematics

Extensions of Robbins-Siegmund Theorem with Applications in Reinforcement Learning

توسع هذه الورقة نظرية "روبنز-سيجموند" للتعامل مع شبه المارتينجالات ذات الحدود من الدرجة صفر القابلة للجمع التربيعي (بدلاً من القابلة للجمع) بموجب فرضية طفيفة جديدة، مما يؤدي إلى إرساء معدلات تقارب وحدود تركيز جديدة تحقق أول ضمانات للتقارب شبه المؤكد لتعلم QQ مع التقريب الدالي الخطي.

Xinyu Liu, Zixuan Xie, Shangtong Zhang2026-05-28
💬 NLP

Regression Language Models for Code

تقدم هذه الورقة نموذج لغة انحدار (RLM) موحداً وخفيف الوزن يستفيد من مشفر نموذج لغة كبير (LLM) مجمد للتنبؤ بدقة بمقاييس تنفيذ الكود المتنوعة — بما في ذلك بصمة الذاكرة، وزمن الاستجابة، والدقة — عبر لغات برمجة متعددة ومنصات أجهزة مختلفة، متفوقاً بذلك على النهج السابقة القائمة على هندسة الميزات والرسوم البيانية دون الحاجة إلى تخصيص خاص لكل مهمة.

Yash Akhauri, Xingyou Song, Arissa Wongpanich, Bryan Lewandowski, Mohamed S. Abdelfattah2026-05-28
⚡ electrical engineering

Long-Term Mapping of the Douro River Plume with Multi-Agent Reinforcement Learning

تقترح هذه الورقة إطار عمل لتعلم تعزيزي متعدد الوكلاء يتسم بكفاءة الطاقة والاتصال، يدمج انحدار العملية الغاوسية الزمكاني مع منسق مركزي، لرسم خريطة لانتشار نهر دورو عبر عدة أيام بفعالية، مما يظهر دقة وقابلية توسع فائقتين مقارنة بالمعايير المرجعية الحالية.

Nicolò Dal Fabbro, Milad Mesbahi, Renato Mendes, João Borges de Sousa, George J. Pappas2026-05-28
⚡ electrical engineering

Falsification-driven reinforcement learning for maritime motion planning

تقترح هذه الورقة نهجاً للتعلم المعزز القائم على التفنيد، والذي يولد سيناريوهات تدريب عدائية بناءً على مواصفات المنطق الزمني الإشاري لتحسين الامتثال لقواعد حركة المرور البحرية في تخطيط حركة السفن ذاتية القيادة.

Marlon Müller, Florian Finkeldei, Hanna Krasowski, Murat Arcak, Matthias Althoff2026-05-28
🤖 machine learning

A Broader View of Thompson Sampling

توضح هذه الورقة الآلية الكامنة وراء نجاح "أخذ عينات تومسونون" (Thompson Sampling) من خلال إعادة صياغته كخوارزمية تحسين عبر الإنترنت تحاكي سياسة "بيلمان" المثلى المستقرة، حيث يتم تنظيم الجشع بواسطة عدم اليقين المتبقي، مما يقدم إطاراً جديداً لفهم ديناميكياته وتحسين السياسات.

Yanlin Qu, Hongseok Namkoong, Assaf Zeevi2026-05-28
💬 NLP

EAGer: Entropy-Aware GEneRation for Adaptive Inference-Time Scaling

تُعد EAGer طريقةً لتوسيع نطاق الاستدلال أثناء وقت الاستنتاج، وهي خالية من التدريب ومعتمدة على الإنتروبيا، حيث تقوم بتخصيص الموارد الحسابية ديناميكيًا عبر تفرع مسارات الاستدلال فقط عند الرموز ذات عدم اليقين العالي، مما يقلل من استخدام الرموز بنسبة تصل إلى 64% مع تحسين أداء Pass@k بشكل كبير في اختبارات الاستدلال المعقدة.

Daniel Scalena, Leonidas Zotos, Elisabetta Fersini, Malvina Nissim, Ahmet Üstün2026-05-28
⚡ electrical engineering

An Empirical Study on Variance-based MC Dropout Uncertainty-Error Correlation in 2D Brain Tumor Segmentation

تُظهر هذه الدراسة التجريبية أن عدم اليقين القائم على تباين إسقاط مونت كارلو (MC Dropout) يُظهر ارتباطات عالمية ضعيفة وارتباطات حدودية مهملة مع أخطاء التجزئة في تصوير الرنين المغناطيسي لأورام الدماغ ثنائية الأبعاد، مما يشير إلى أنه يقدم فائدة محدودة لتحديد موقع الخطأ مقارنة بتمثيلات عدم اليقين البديلة.

Saumya B2026-05-28
📊 statistics

Cost-Sensitive Evaluation for Binary Classifiers

تقدم هذه الورقة "الدقة الموزونة" (WA) كمعيار تقييم حساس للتكلفة وإطار عمل عام لإعادة التوزين بهدف مواءمة تحسين المصنف الثنائي مع تقليل "إجمالي تكلفة التصنيف"، مما يثبت أن تعظيم الدقة الموزونة يكافئ تقليل التكاليف في ظل التكاليف الموحدة ويظل قويًا عبر سيناريوهات عدم التوازن والتكلفة المتنوعة.

Pierangelo Lombardo, Antonio Casoli, Cristian Cingolani, Shola Oshodi, Michele Zanatta2026-05-28
💬 NLP

Assessing Factual Music Comprehension in Large Audio Language Models

تنتقد هذه الورقة القيود المتعلقة بالدقة الواقعية لتقييمات MusicQA الحالية لنماذج اللغة الصوتية الكبيرة، وتقدم معياراً جديداً وبروتوكولاً مهيكلاً باستخدام درجات الدقة والاستدعاء وF1 لتقييم فهم الموسيقى موضوعياً عبر ست مهام استرجاع على ثلاث مجموعات بيانات متنوعة.

Daniel Chenyu Lin, Michael Freeman, John Thickstun2026-05-28
🤖 AI

SynthTools: A Framework for Scaling Synthetic Tools for Agent Development

تقدم الورقة البحثية SynthTools، وهو إطار عمل يعتمد كلياً على النماذج اللغوية الكبيرة (LLM) يقوم تلقائياً بتوليد والتحقق من وتوسيع نطاق بيئات ومهام الأدوات الاصطناعية المتنوعة، مما يثبت أن تدريب الوكلاء على هذه البيانات الاصطناعية يحسن بشكل كبير أداءهم في استخدام الأدوات في الاختبارات المعيارية الواقعية.

Tommaso Castellani, Naimeng Ye, Daksh Mittal, Thomson Yen, Emmanouil Koukoumidis, William Zeng, Hongseok Namkoong2026-05-28