🤖 machine learning

A Bitter Lesson for Data Filtering

تتحدى هذه الورقة الحكمة التقليدية التي تعتبر تصفية البيانات أمراً ضرورياً للتدريب المسبق للنماذج الضخمة، حيث تثبت من خلال دراسات التوسع في أنظمة الحوسبة العالية وندرة البيانات أن النماذج الضخمة المدربة بشكل كافٍ تستفيد في الواقع من تضمين البيانات منخفضة الجودة والمشتتة بدلاً من تصفيتها واستبعادها.

Christopher Mohri, John Duchi, Tatsunori Hashimoto2026-05-20
🤖 machine learning

Unlocking the Potential of Continual Model Merging: An ODE Perspective

تقترح هذه الورقة البحثية ODE-M، وهو إطار عمل جديد لدمج النماذج المستمرة يستفيد من منظور المعادلات التفاضلية العادية لتتبع مسارات منخفضة الخسارة في فضاء المعلمات، مما يؤدي بفعالية إلى تخفيف النسيان الكارثي والتفوق على الأساليب الحالية في اختبارات المهام غير المتجانسة.

Lihong Lin, Haidong Kang2026-05-20
💬 NLP

CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization

تقدم الورقة البحثية تحسين سياسة الأدلة التباينية (CEPO)، وهي طريقة جديدة للتقطير الذاتي في التعلم المعزز من التغذية الراجعة عبر النماذج اللغوية (RLVR) تستفيد من كل من المخرجات الصحيحة والمرفوضة لتوليد إشارة مكافأة تباينية، مما يحدد بدقة خطوات الاستدلال الحاسمة مع تجنب تسرب المعلومات والتفوق على النماذج المرجعية الحالية مثل GRPO في معايير الاستدلال الرياضي متعدد الوسائط.

Ahmed Heakl, Abdelrahman M. Shaker, Youssef Mohamed, Rania Elbadry, Omar Fetouh, Fahad Shahbaz Khan, Salman Khan2026-05-20
🤖 machine learning

When the Majority Votes Wrong, the Intervention Timing for Test-Time Reinforcement Learning Hides in the Extinction Window

تجادل هذه الورقة بأن المكاسب المسجلة لتعلم التعزيز في وقت الاختبار (TTRL) غالباً ما تكون وهمية بسبب القمع غير العكسي للإجابات الصحيحة في "نافذة انقراض الإجابة الصحيحة"، وتقترح إطار عمل TTRL-Guard، الذي يستخدم مراقبة معدل الانقلاب وآليات الحفاظ على الأقلية للتخفيف من هذا الضرر وتحسين الأداء بشكل كبير في معايير الاستدلال الرياضي.

Hongxiang Lin, Zhirui Kuai, Erpeng Xue, Lei Wang2026-05-20
🤖 machine learning

Implicit Bias of Mirror Flow in Homogeneous Neural Networks: Sparse and Dense Feature Learning

تُوصِف هذه الورقة البحثية الانحياز الضمني لتدفق المرآة في الشبكات العصبية المتجانسة عبر اشتقاق معادلة توازن جديدة وإثبات أن خرائط المرآة المتميزة، رغم تقاربها نحو نفس حل الهامش الأقصى، يمكن أن تستحث سلوكيات تعلم ميزات متفاوتة للغاية تتراوح بين التنشيطات المتفرقة والكثيفة.

Tom Jacobs, Guido Montufar2026-05-20
🤖 machine learning

Quantifying the Pre-training Dividend: Generative versus Latent Self-Supervised Learning for Time Series Foundation Models

تُرسخ هذه الورقة إطاراً منضبطاً يثبت أن التدريب المسبق ذاتي الإشراف يحقق عوائد كبيرة في تصنيف السلاسل الزمنية وكشف الشذوذ، ولكنه يقدم فوائد هامشية في التنبؤ، وهو تفاوت مدفوع بمقايضة عدم التغير في الدقة التي تحبذ بنيات المحاذاة الكامنة على النماذج التوليدية.

Noam Major, Kathy Razmadze, Yoli Shavit2026-05-20
🤖 machine learning

Sampling-Based Safe Reinforcement Learning

تقدم هذه الورقة البحثية التعلم المعزز الآمن القائم على أخذ العينات (SBSRL)، وهو خوارزمية قائمة على النموذج تضمن السلامة أثناء تعلم التحكم المستمر من خلال فرض القيود عبر عينات الديناميكيات وإدارة عدم اليقين المعرفي، مما يوفر ضمانات سلامة نظرية ويحقق استكشافاً فعالاً في كل من المحاكاة والأجهزة الروبوتية في العالم الحقيقي.

Luca Vignola, Bruce D. Lee, Manish Prajapat, Manuel Wendl, Melanie Zeilinger, Andreas Krause, Yarden As2026-05-20
💬 NLP

Drifting Objectives for Refining Discrete Diffusion Language Models

تقدم هذه الورقة TokenDrift، وهو هدف تدريب مبتكر يطوع مبادئ الانجراف المستمر لنماذج اللغة ذات الانتشار المنفصل عبر رفع التنبؤات الفئوية إلى سمات الرموز الناعمة من أجل صقل غير متماثل، مما يحسن جودة التوليد بشكل كبير عند خطوات أخذ العينات المنخفضة.

Daisuke Oba, Hiroki Furuta, Naoaki Okazaki2026-05-20
🤖 machine learning

Adynamical systems view of training generativemodels and the memorization phenomenon

تستخدم هذه الورقة منظور الأنظمة الديناميكية، مستفيدة من ديناميكيات المقياس الزمني المزدوج في التدرج الاشتقاقي العشوائي والنتائج الحديثة حول انهيار النموذج، لتقديم تفسير من منظور نظرية النظم لظاهرة الحفظ في النماذج التوليدية حيث تظل المخرجات ثابتة لفترات طويلة أثناء التدريب.

Siva Athreya, Chiranjib Bhattacharya, Vivek S. Borkar2026-05-20
🤖 machine learning

The Silent Hyperparameter: Quantifying the Impact of Inference Backends on LLM Reproducibility

تكشف هذه الورقة أن اختيار خلفية الاستدلال يعمل كمعلمة فائقة (hyperparameter) حاسمة، وإن كانت غير مُبلغ عنها غالباً، يمكنها تغيير درجات معايير النماذج اللغوية الكبيرة بمقدار يصل إلى 16.6 نقطة مئوية بسبب تحسينات مستوى النظام، مما يحث المجتمع على توحيد تقارير حزمة الاستدلال لضمان قابلية التكرار.

David Pape, Jonathan Evertz, Lea Schönherr2026-05-20