🤖 machine learning

Commit to the Bit: Reactive Reinforcement Learning Done Right

تقدم هذه الورقة البحثية خوارزمية "التعلم بـ Q الملتزم" (Committed Q-learning)، وهي خوارزمية جديدة تحقق التقارب شبه المؤكد نحو سياسة تفاعلية مثلى في البيئات الحتمية ذات الإدراك الجزئي، وذلك بموجب افتراض "متانة إعادة التوصيل" (rewire-robustness) الأضعف، من خلال جعل سياسة السلوك تلتزم بإجراء واحد لكل سمة حتى يتغير الإدراك.

Onno Eberhard, Claire Vernade, Michael Muehlebach2026-05-28
📊 statistics

Adaptive Bandit Algorithms for Contextual Matching Markets

تقترح هذه الورقة خوارزميات "بانديت" (bandit) تكيُّفية لأسواق المطابقة السياقية ذات المنفعات الخطية، محققةً ندمًا لوغاريتميًا متعدد المرات يعتمد على الحالة في السياقات العشوائية، وندمًا دون خطي غير معتمد على الحالة في السياقات التنافسية، وذلك من خلال معالجة عدم الاستقرار الناتج عن التحولات السياقية الطفيفة.

Shiyun Lin, Simon Mauras, Vianney Perchet, Nadav Merlis2026-05-28
🤖 machine learning

Compositional Generalization in Autoregressive Models via Logit Composition

تقدم هذه الورقة استراتيجية مبدئية لتركيب اللوجيت (logit composition) للنماذج ذات الترتيب الذاتي، مستوحاة من طرق الانتشار، والتي تضمن التحكم الإسقاطي على الفضاءات الجزئية للمخرجات وتحافظ على تعميم الطول في ظل فرضيات الشروط المتجزئة.

Aakash Kumar, Maria Sofia Bucarelli, Emanuele Natale2026-05-28
🤖 machine learning

Learning to Assess the Reliability of Number-of-Runs Estimation in Stochastic Optimization

تقترح هذه الورقة نهجاً قائماً على التعلم يقوم بتدريب مصنفات على سمات إحصائية من بيانات مرجعية واسعة النطاق للتنبؤ بموثوقية تقديرات عدد الدورات التكيفية في التحسين العشوائي، مما مكن بنجاح من اكتشاف التقديرات غير الموثوقة ضمن إعدادات محددة للمُحسّن مع تسليط الضوء على القيود في التعميم عبر إعدادات متنوعة.

Sara Gjorgjieva, Eva Tuba, Tome Eftimov2026-05-28
🔬 physics

Hybrid Neural World Models

تقدم هذه الورقة نماذج العالم العصبية الهجينة، وهي إطار عمل ذو شبكة واحدة يتنبأ بالديناميكيات الفيزيائية بسرعة فائقة مقارنة بالمحللات الكلاسيكية مع توليد خريطة خطأ ضمنية للكشف عن الانقطاعات الحادة مثل الصدمات والاتصالات، مما يتيح آلية تراجع تقلل أخطاء التنبؤ بشكل كبير دون الحاجة إلى معايرة إضافية أو معرفة بالمعادلات الحاكمة.

Pranav Lakshmanan, Paras Chopra2026-05-28✓ Author reviewed
💰 quantitative finance

Insurance Pricing Optimization via Off-Policy Evaluation

تقترح هذه الورقة إطار عمل لتحسين تسعير التأمين من خلال دمج التقييم خارج السياسة مع مُقدِّر جديد لدرجة عكسية كيرنلية لدرجة الميل، وإثبات أن تمثيل معلمات السياسة القائم على الشبكات العصبية يتفوق على التقنيات الحالية في بيئة تأمين سفر اصطناعية.

Sascha Günther, Dimitri Semenovich, Mario V. Wüthrich2026-05-28
🤖 machine learning

Learning the Error Patterns of Language Models

تقدم هذه الورقة "مرشحات البادئة" (prefix filters) وخوارزمية "بالا" (Palla) لتعلم وتطبيق قيود خاصة بالمجال بكفاءة، والتي تلتقط وتصحح أنماط أخطاء النماذج اللغوية الكبيرة الشائعة، مما يحسن بشكل كبير من صلاحية المخرجات مثل معدلات تجميع لغة تايب سكريبت (TypeScript).

Jinwoo Kim, Taylor Berg-KirkPatrick, Loris D'Antoni2026-05-28
🤖 machine learning

Dimensionality Reduction for Robust Federated Learning: A Theoretical Analysis and Convergence Guarantee

تقترح هذه الورقة تقنية "تقليل الأبعاد المسقط" (PDR)، وهي إطار عمل شامل يعمل على تسريع التعلم الاتحادي القوي عبر ضغط التدرجات بواسطة الإسقاط العشوائي المتناثر لتحقيق التعقيد الحسابي الأمثل وضمانات التقارب المثبتة، مع تضخيم طفيف فقط في حد خطأ بيزنطية الأدنى.

Shiyuan Zuo, Jiashuo Li, Rongfei Fan, Han Hu, Jie Xu2026-05-28
🤖 machine learning

Detecting Diffusion-Generated Time Series Under Generator Shift

تقدم هذه الورقة أول استكشاف منهجي للكشف عن السلاسل الزمنية المولدة بواسطة نماذج الانتشار (diffusion) في ظل تغير المولد، مما يثبت أن مصنف الصندوق الأسود البسيط يتفوق بشكل كبير على الطرق القائمة على إعادة البناء ذات الصندوق الأبيض، وهو ما يكشف أن الكشف عن السلاسل الزمنية لا يمكن نقله مباشرة من مجال الصور.

Zhi Wen Soi, Aditya Shankar, Gert Lek, Abele Mălan, Daniel Neider, Jian-Jia Chen, Lydia Chen2026-05-28
🤖 machine learning

Score Based Error Correcting Code Decoder

تقدم هذه الورقة البحثية SB-ECC، وهو فك تشفير قائم على الدرجة (score-based decoder) يصيغ تصحيح الخطأ كعملية إزالة ضجيج في زمن مستمر عبر معادلة تفاضلية عادية لتدفق الاحتمالية العصبية (neural probability-flow ODE)، محققاً أداءً فائقاً لمعدل خطأ البتات عبر إعدادات ترميز متنوعة دون الحاجة إلى تقدير نسبة الإشارة إلى الضجيج، مع تمكين مقايضات مرنة بين زمن الاستجابة والدقة.

Alon Helvits, Eliya Nachmani2026-05-28