🤖 machine learning

ANNEAL: Adapting LLM Agents via Governed Symbolic Patch Learning

يُعدُّ ANNEAL عميلاً عصبياً-رمزياً يضمن القضاء الآمن والمستمر على أخطاء التنفيذ المتكررة عبر تحويل الإخفاقات إلى تعديلات محكومة ومحققة لمخطط معرفي لعملية رمزية دون تعديل أوزان النماذج التأسيسية.

Safayat Bin Hakim, Keyan Guo, Wenkai Tan, Alvaro Velasquez, Shouhuai Xu, Houbing Herbert Song2026-05-19
🤖 machine learning

SignMuon: Communication-Efficient Distributed Muon Optimization

يُعد SignMuon مُحسِّنًا موزعًا ببت واحد (1-bit) وفعالًا في التواصل، يجمع بين إطار عمل الخطوة القطبية (polar-step) المدرك للمصفوفات الخاص بـ Muon وتجميع تصويت الأغلبية الخاص بـ signSGD لتحقيق دقة متطورة وخفض كبير في عرض النطاق الترددي أثناء تدريب الشبكات العصبية واسعة النطاق.

Neel Mishra, Kushagara Trivedi, Pawan Kumar2026-05-19
🤖 machine learning

When Actions Disappear: Adversarial Action Removal in Self-Play Reinforcement Learning

تتقصى هذه الورقة البحثية حجب الأفعال العدائي في التعلم التعزيزي عبر اللعب الذاتي، حيث تُثبت أن الإزالة الانتقائية للأفعال القانونية تسبب ضرراً أكبر بكثير من الاضطرابات، ويستمر هذا التأثير عبر خوارزميات ومجالات متنوعة، كما يستغل نقاط اتخاذ القرار عالية القيمة دون السماح بالتعافي.

Arahan Kujur2026-05-19
🤖 machine learning

A Structural Threshold in Decision Capacity Governs Collapse in Self-Play Reinforcement Learning

تُثبت هذه الورقة أن وكلاء التعلم التعزيزي القائم على اللعب الذاتي يمرون بانهيار حاد وعكوس نحو فقدان شبه أقصى فقط عندما يتم استبعاد جميع القرارات الطارئة ذات الوصول الإيجابي، مما يؤسس لعتبة هيكلية حيث يحول الحفاظ حتى على قرار واحد من هذا النوع دون التقارب الكارثي المدفوع بالتكيف المشترك تحت القيد.

Arahan Kujur2026-05-19✓ Author reviewed
🤖 machine learning

Investigating Action Encodings in Recurrent Neural Networks in Reinforcement Learning

تتقصى هذه الورقة كيفية تأثير الطرق المختلفة لدمج معلومات الإجراء في دالة تحديث الحالة للشبكات العصبية المتكررة على أداء التعلم التعزيزي، مقدمةً تقييمات تجريبية ومناقشةً لتحديات التصميم المستقبلية.

Matthew Schlegel, Volodymyr Tkachuk, Adam White, Martha White2026-05-19
🧬 biology

A Machine Learning Framework for EEG-Based Prediction of Treatment Efficacy in Chronic Neck Pain

تقدم هذه الورقة إطار عمل للتعلم الآلي يستخدم معالجة مسبقة صارمة خاصة بكل نمط لبيانات تخطيط كهربائية الدماغ (EEG) وتخطيط كهربائية العضلات (EMG)، مستندةً إلى مراجعة أدبية واسعة النطاق، للتنبؤ بفعالية العلاج لدى المرضى الذين يعانون من آلام الرقبة المزمنة ودعم اختيار العلاج الشخصي.

Xiru Wang, Aiden Li, Hongzhao Tan, Stevie Foglia, Aimee Nelson, Zhen Gao2026-05-19
🤖 machine learning

Orth-Dion: Eliminating Geometric Mismatch in Distributed Low-Rank Spectral Optimization

تحدد هذه الورقة أن التباعد البطيء لمحسن "ديون" (Dion) ينبع من عدم تطابق هندسي ناتج عن تطبيع الأعمدة، وتقترح "أورث-ديون" (Orth-Dion)، وهي طريقة تستخدم التعامد عبر تحليل QR للقضاء على عدم التطابق هذا وتحقيق معدلات تقارب تماثل طرق الطيف كاملة الرتبة دون زيادة تكاليف الاتصال.

Tatsuhiro Nakamori, Laura Gomezjurado Gonzalez, Ganesh Talluri, Ansh Tiwari, Hideyuki Kawashima, Ioannis Mitliagkas, Gui (…)2026-05-19
🤖 machine learning

DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models

يعالج DACA-GRRO أوجه القصور في أساليب التعلم التعزيزي الحالية لنماذج الانتشار اللغوية من خلال تقديم درجات تقدم إزالة الضجيج واحتمالية القناع الطبقي لتمكين التخصيص الائتماني الزمني وتقليل انحياز المجال المتوسط، مما يؤدي إلى تحسينات كبيرة في الأداء عبر مختلف معايير الاستدلال والتوليد.

Amin Karimi Monsefi, Dominic Culver, Nikhil Bhendawade, Lokesh Boominathan, Manuel R. Ciosici, Yizhe Zhang, Irina Belous (…)2026-05-19
🤖 machine learning

A Production-Ready RL Framework for Personalized Utility Tuning with Pareto Sweeping in Pinterest Recommender Systems

تقدم هذه الورقة PRL-PUTS، وهو إطار عمل للتعلم التعزيزي جاهز للإنتاج ومستقل عن نظام الترتيب (ranker-independent)، يقوم بأتمتة ضبط أوزان المنفعة الشخصية عبر مسح باريتو (Pareto sweeping) لتحسين المقايضات متعددة الأهداف ديناميكيًا في الصفحة الرئيسية لـ Pinterest، مما أدى إلى تحسينات كبيرة في التفاعل دون إضافة أي تأخير في وقت الخدمة.

Yichu Zhou, Mehdi Ben Ayed, Lin Yang, Jiacong He, Andreanne Lemay, Jiaye Wang, Jaewon Yang, Josie Zeng, Dhruvil Deven Ba (…)2026-05-19
🤖 machine learning

Goal-Conditioned Supervised Learning for LLM Fine-Tuning

تقدم هذه الورقة البحثية التعلم الخاضع للإشراف الموجه بالأهداف (GCSL)، وهو إطار عمل فعال للضبط الدقيق غير المتصل الذي يعامل إشارات التغذية الراجعة كأهداف صريحة ويستفيد من اللغة الطبيعية لتوجيه النماذج اللغوية الكبيرة نحو تحقيق عتبات الجودة باستمرار، مما يجعله يتفوق على الطرق الخاضعة للإشراف القياسية مع تجنب التكاليف الباهظة للتعلم التعزيزي المتصل.

Shijun Li, Kaiwen Dong, Xiang Gao, Joydeep Ghosh2026-05-19