🤖 machine learning

Can an MLP Absorb Its Own Skip Connection?

تُظهر الورقة البحثية أنه بالنسبة لمعظم دوال التنشيط الشائعة (مثل ReGLU وSwiGLU وGELU) وتوزيعات الأوزان العامة، لا يمكن استيعاب الوصلة التخطي (skip connection) ضمن طبقة MLP خالية من المتبقي (residual-free) وبنفس العرض، مما يعني أن البنى ذات الوصلات التخطي والبنى الخالية من المتبقي تمثل فئات دالية مختلفة جوهرياً.

Antonij Mijoski, Marko Karbevski2026-04-28
🤖 machine learning

OptProver: Bridging Olympiad and Optimization through Continual Training in Formal Theorem Proving

يقدم OptProver مسار تدريب مستمر يُمكّن مبرهنة أولمبية المستوى من نقل قدراتها الاستدلالية بنجاح إلى مجال التحسين في مرحلة البكالوريوس من خلال بيانات منسقة من قبل خبراء وهدف تعلم تفضيلات متخصص.

Chenyi Li, Yanchen Nie, Zhengyu Ming, Gong Zhang, Kun Yuan, Zaiwen Wen2026-04-28
🤖 machine learning

Quasi-Equivariant Metanetworks

تقدم هذه الورقة "شبه التكافؤ" (quasi-equivariance)، وهو إطار عمل مبتكر للشبكات الفائقة (metanetworks) يتجاوز القيود الصارمة للتكافؤ المطلق ليعمل بشكل أفضل على احترام التناظرات الهيكلية والهوية الوظيفية مع الحفاظ على قدرة تعبيرية تمثيلية عالية عبر مختلف البنيات العصبية.

Viet-Hoang Tran, An Nguyen, Benoît Guérand, Thieu N. Vo, Tan M. Nguyen2026-04-28
🤖 machine learning

Impact of Age Specialized Models for Hypoglycemia Classification

تستقصي هذه الورقة ما إذا كانت النماذج المتخصصة حسب العمر تحسن التنبؤ بنقص سكر الدم لدى مرضى السكري من النوع الأول باستخدام بيانات مراقبة الجلوكوز المستمرة، ووجدت أنه في حين تستفيد نماذج الفئات العمرية المحددة من الأطفال تحديداً، فإن النموذج القائم على السكان ككل يؤدي بشكل مماثل أو متفوق عبر معظم الفئات العمرية بسبب تشابه أنماط نقص سكر الدم على المدى القصير.

Beyza Cinar, Maria Maleshkova2026-04-28
🤖 machine learning

Transformer as an Euler Discretization of Score-based Variational Flow

تقترح هذه الورقة إطاراً نظرياً يسمى التدفق المتغير القائم على الدرجة (SVFlow) يوحد بنية المحول (Transformer) من خلال إثبات أن مكوناته —بما في ذلك الانتباه متعدد الرؤوس، وخلية Mixture of Experts/FFN، والتبقي-التطبيع— يمكن اعتبارها عملية تقريب "أويلر" لنظام ديناميكي مستمر الزمن.

Huadong Liao2026-04-28
🤖 machine learning

SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning

تُظهر الورقة البحثية أن مسار (SFT-then-RL) القياسي يتفوق في الواقع على أساليب السياسة المختلطة الحديثة، مما يكشف أن الادعاءات السابقة بخلاف ذلك كانت مبنية على خطوط أساس معيبة ناتجة عن أخطاء برمجية محددة في DeepSpeed وOpenRLHF.

Alexis Limozin, Eduard Durech, Torsten Hoefler, Imanol Schlag, Valentina Pyatkin2026-04-28
🤖 machine learning

FAIR_XAI: Improving Multimodal Foundation Model Fairness via Explainability for Wellbeing Assessment

تتقصى هذه الورقة مدى عدالة وشفافية نماذج الرؤية واللغة (VLMs) في تقييم الصحة النفسية، كاشفةً أنه بينما يمكن للتدخلات القائمة على القابلية للتفسير أن تحسن الاتساق الإجرائي، إلا أنها غالباً ما تفشل في ضمان نتائج عادلة بل ويمكن أن تؤدي حتى إلى تفاقم التحيزات الديموغرافية.

Sophie Chiang, Tom Brennan, Fethiye Irmak Dogan, Jiaee Cheong, Hatice Gunes2026-04-28
🤖 machine learning

Reparameterization through Coverings and Topological Weight Priors

تقترح هذه الورقة تقنية إعادة بارامترية معممة للمشفرات التلقائية التباينية (VAEs) تتيح التدريب على فضاءات كامنة ذات طوبولوجيا غير بديهية من خلال استخدام الخرائط المغطية لجعل تباعد كولباك - ليبلر (KL-divergence) قابلاً للحل تحليلياً، وهو ما تم إثباته من خلال بناء "KleinVAE" ذي فضاء كامن على شكل زجاجة كلاين.

Maxim Beketov, Pavel Snopov2026-04-28
🤖 machine learning

Symmetric Equilibrium Propagation for Thermodynamic Diffusion Training

تقترح هذه الورقة البحثية "انتشار التوازن المتماثل"، وهي طريقة تدريب محلية وفعالة في استهلاك الطاقة تسمح للركائز التناظرية بتدريب نماذج الانتشار مباشرة على الرقاقة، محققةً ميزة طاقة متوقعة تتراوح بين 10310^3 إلى 10410^4 ضعف مقارنة بوحدات معالجة الرسومات من خلال استخدام التنبيه المتماثل لتقليل انحياز التدرج.

Aditi De2026-04-28
🤖 machine learning

One Size Fits None: Heuristic Collapse in LLM Investment Advice

تتقصى الورقة البحثية ظاهرة "الانهيار الاستدلالي" في النماذج اللغوية الكبيرة الرائدة، حيث وجدت أن هذه النماذج، عند تقديم نصائح استثمارية، تعتمد بشكل منهجي ومفرط على عامل واحد (القدرة على تحمل المخاطر) مع تجاهل المعلومات السياقية الأخرى بالغة الأهمية، وهي مشكلة تستمر رغم زيادة حجم النموذج أو تعزيزه بالبحث عبر الويب.

Jillian Ross, Andrew W. Lo2026-04-28