🤖 machine learning

Distribution-Aware Reward: Reinforcement Learning over Predictive Distributions for LLM Regression

تقدم هذه الورقة البحثية "المكافأة المدركة للتوزيع" (Distribution-Aware Reward)، وهي هدف للتعلم التعزيزي يعمل على تحسين النماذج اللغوية الكبيرة لتوليد توزيعات تنبؤية معايرة لمهام الانحدار من خلال تقييم عينات متعددة تم فك تشفيرها باستخدام درجة الاحتمالية المستمرة المرتبة (Continuous Ranked Probability Score)، مما يؤدي إلى تحسين تقدير عدم اليقين، وأداء التصنيف، والمتانة مقارنة بطرق تدريب التقدير النقطي التقليدية.

Jungsoo Park, Hyungjoo Chae, Ethan Mendes, Jay DeYoung, Varsha Kishore, Wei Xu, Alan Ritter2026-05-21
🤖 machine learning

Hack-Verifiable Environments: Towards Evaluating Reward Hacking at Scale

تقدم هذه الورقة نموذج تقييم جديد ومعيار "Hack-Verifiable TextArena"، الذي يدمج فرص استغلال المكافآت القابلة للكشف مباشرة في البيئات لتمكين قياس حتمي وآلي وقابل للتوسع لكيفية استغلال النماذج اللغوية لمثل هذه الثغرات.

Amit Roth, Ankur Samanta, Matan Halevy, Yoav Levine, Yonathan Efroni2026-05-21
🤖 machine learning

The Hidden Signal of Verifier Strictness: Controlling and Improving Step-Wise Verification via Selective Latent Steering

تقدم هذه الورقة بحثًا حول VerifySteer، وهي طريقة تتحكم في صرامة التحقق خطوة بخطوة وتحسنها من خلال اكتشاف وتوجيه إشارات الحالة الخفية انتقائيًا عند حدود الفقرات، مما يؤدي إلى التفوق على النماذج المرجعية الحالية بتكلفة حوسبية أقل بكثير.

Yefan Zhou, Yilun Zhou, Austin Xu, Soroush Vosoughi, Shafiq Joty, Jiang Gui2026-05-21
📊 statistics

Correcting Stochastic Update Bias in Preconditioned Language Model Optimizers

تحدد هذه الورقة وتصحح انحيازين في العينات المحدودة في مُحسّنات النماذج اللغوية ذات المسبقات الشرطية —وهما اقتران التدرج بالمسبق الشرطي وانحياز الارتداد غير الخطي— وذلك عبر اقتراح إطار عمل أحادي الدفعة يجمع بين التكييف المتقاطع المتبادل والارتداد المصحح للتباين، مما يقلل من خسارة ما قبل التدريب ويحسن الأداء عبر نماذج مثل AdamW وSophia وShampoo.

Nikhil Nayak, Julia White, Urchade Zaratiana, Kelton Zhang, Henrijs Princis, Dhruv Atreja, Henry Fawcett, Matthew Thomas (…)2026-05-21
🤖 machine learning

ShapeBench: A Scalable Benchmark and Diagnostic Suite for Standardized Evaluation in Aerodynamic Shape Optimization

تقدم هذه الورقة ShapeBench، وهو معيار مفتوح المصدر وقابل للتوسع ومجموعة أدوات تشخيصية تضم 103 مهام متنوعة لتحسين الأشكال الديناميكية الهوائية ونماذج مرجعية قياسية لتمكين التقييم العادل والمنهجي لكل من طرق التحسين الكلاسيكية وتلك القائمة على النماذج اللغوية الكبيرة، مما يكشف عن تباين كبير في الأداء عبر فئات المشكلات والحاجة إلى نهج أكثر عمومية.

Shaghayegh Fazliani, Krissh Chawla, Jack Guo, Yiren Shen, Matthias Ihme, Madeleine Udell2026-05-21
💬 NLP

The Illusion of Intervention: Your LLM-Simulated Experiment is an Observational Study

تحذر هذه الورقة من أن التجارب التي تحاكيها النماذج اللغوية الكبيرة تعاني من "انحراف المستخدم" بسبب التدريب على بيانات رصدية، مما يؤدي إلى إدخال تحيز مربك، وتقترح استخدام نتائج ضابطة سلبية للكشف عن هذه المشكلة وتوصيفات شخصية منقحة للتخفيف من حدتها.

Victoria Lin, Taedong Yun, Maja Matarić, John Canny, Arthur Gretton, Alexander D'Amour2026-05-21
🤖 machine learning

Causal Machine Learning Is Not a Panacea: A Roadmap for Observational Causal Inference in Health

تقدم هذه الورقة خارطة طريق للتطبيق المسؤول لتعلم الآلة السببي على البيانات الصحية الرصدية، مؤكدةً أنه في حين يوفر هذا النهج قدرات قوية لتوليد الفرضيات، فإن صحته تعتمد على استيفاء الافتراضات السببية بصرامة وتبرير خيارات النمذجة لتجنب النتائج المتحيزة.

Donna Tjandra (Division of Computer Science and Engineering, University of Michigan, Ann Arbor, Michigan, United States) (…)2026-05-21
🤖 machine learning

Interaction Locality in Hierarchical Recursive Reasoning

تقدم هذه الورقة البحثية "محلية التفاعل" (interaction locality)، وهو إطار عمل مدرك للمهمة والهندسة يستخدم رقع التنشيط واستئصال الميزات لإثبات أن نماذج الاستدلال الهرمي والعودي (HRM و TRM) تحل المهام المكانية المعقدة من خلال تجميع عمليات كتابة المعلومات المحلية في هياكل عالمية، وهو نمط يتناقض مع المحلية المركزة عند الحدود الملحوظة في النماذج المجسمة ثلاثية الأبعاد واسعة النطاق.

Yosuke Miyanishi, Tetsuro Morimura2026-05-21
🤖 machine learning

Beyond Numerical Features: CNN-Driven Algorithm Selection via Contour Plots for Continuous Black-Box Optimization

تقترح هذه الورقة طريقة مبتكرة لاختيار الخوارزمية لكل حالة على حدة في التحسين المستمر للصندوق الأسود، تستخدم شبكة عصبية تلافيفية (CNN) لتحليل المخططات الكنتورية المرئية للمناظر الطبيعية التي تم فحصها، مما يثبت أن هذا النهج القائم على الصور يتفوق على أفضل خوارزمية منفردة ويظل منافسًا للطرق التقليدية القائمة على الميزات دون الاعتماد على واصفات مصممة يدويًا.

Yiliang Yuan, Xiang Shi, Mustafa Misir2026-05-21
🤖 machine learning

Instant GPU Efficiency Visibility at Fleet Scale

تقدم هذه الورقة "استغلال العمليات العائمة الإجمالي" (OFU)، وهو مقياس لكفاءة وحدة معالجة الرسومات على مستوى الأجهزة، غير معتمد على أدوات القياس، ومستمد من عدادات الأداء على الشريحة، والذي يحقق دقة عالية في التنبؤ بـ "كفاءة استخدام العمليات العائمة" (MFU) على مستوى التطبيقات عبر مختلف أعباء العمل وأجيال وحدات معالجة الرسومات، مما يتيح مراقبة فعالة على نطاق الأساطيل وكشف تراجعات الكفاءة.

Connor Pedersen, Dong H. Ahn, Michel Migdal, Collin Neale, Nik Konyuchenko2026-05-21