🤖 machine learning

Data filtering methods for training language models

تقدم هذه الورقة تحليلاً مقارناً بين التعلم الواثق (Confident Learning) ورسم خرائط مجموعة البيانات (Dataset Cartography) للكشف عن أخطاء التصنيف في مجموعات بيانات تصنيف النصوص الروسية، مما يوضح أنه بينما يتفوق كلا الأسلوبين على الإزالة العشوائية، فإن فعاليتهما في تحسين أداء النموذج تعتمد بشكل كبير على حجم مجموعة البيانات ومستويات الضجيج، حيث يحقق التعلم الواثق مكاسب كبيرة في مجموعات البيانات الصغيرة والمشوبة بالضجيج.

Egor Shevchenko, Elena Bruches2026-05-29
🤖 machine learning

Cert-LAS: Toward Certified Model Ownership Verification for Text-to-Image Diffusion Models via Layer-Adaptive Smoothing

تقدم هذه الورقة Cert-LAS، وهي أول طريقة معتمدة للتحقق من ملكية النموذج لنماذج الانتشار من نص إلى صورة، والتي تستخدم التنعيم المتكيف مع الطبقات لضمان الكشف الموثوق عن العلامة المائية حتى في ظل هجمات الإزالة الخبيثة.

Leyi Qi, Yiming Li, Siyuan Liang, Zhengzhong Tu, Dacheng Tao2026-05-29
📊 statistics

CB-SLICE: Concept-Based Interpretable Error Slice Discovery

تقدم الورقة البحثية CB-SLICE، وهي طريقة لاكتشاف شرائح الخطأ القائمة على المفاهيم تستفيد من نماذج عنق الزجاجة للمفاهيم لتحديد الإخفاقات المنهجية للنماذج من خلال تجميع العينات ذات التنبؤات الخاطئة للمفاهذ المشتركة، مما يوفر تفسيرات أكثر دقة وقابلية للتفسير من النهج الحالية.

Yael Konforti, Mateo Espinosa Zarlenga, Elaf Almahmoud, Mateja Jamnik2026-05-29
🤖 machine learning

HARP: Hadamard-Preconditioned Adaptive Rotation Processor for Extreme LLM Quantization

يقدم HARP معالجًا متعامدًا ثنائي الجانب، مهيكلاً وقابلاً للتعلم، يقوم بتكييف أساس التكميم مع طبقات محددة وبيانات معايرة معينة، مما يحسن دقة تكميم النماذج اللغوية الكبيرة ذات البتات المنخفضة للغاية (2-4 بت) بشكل كبير مقارنة بطرق هادامارد الثابتة مع الحفاظ على كفاءة النشر.

Artur Zagitov, Gleb Molodtsov, Aleksandr Beznosikov2026-05-29
🤖 machine learning

Feedback-to-Rubrics: Can We Learn Expert Criteria from Inline Comments?

تقترح هذه الورقة وتقيم طريقة للاستنتاج التلقائي لمعايير التقييم القابلة لإعادة الاستخدام والمكتوبة بلغة طبيعية من التعليقات المضمنة المتراكمة، مبرهنةً على أن هذه المعايير المستخلصة يمكنها دعم التنبؤ بالتعليقات، وفهم معايير التقييم، والمراجعة التلقائية للمخرجات بفعالية في بيئات واقعية ومسيطر عليها.

Kotaro Yoshida, So Kuroki, Yuki Imajuku, Taishi Nakamura, Ryunosuke Iwai, Haruki Goda, Takuya Akiba2026-05-29
🤖 machine learning

ESPO: Early-Stopping Proximal Policy Optimization

تقترح الورقة البحثية خوارزمية ESPO (تحسين السياسة القريبة بوقف مبكر)، وهي خوارزمية تعلم تعزيزي تعمل على إنهاء مسارات الاستدلال الفاشلة ديناميكيًا للقضاء على الضجيج وتوفير الحوسبة، مما يؤدي إلى تحسين أداء الاستدلال الرياضي في اختبارات معيارية مثل AIME وMATH-500 مع تقليل استخدام الرموز (tokens) بنسبة تزيد عن 20%.

Zihang Li, Rui Zhou, Yingcheng Shi, Wenhan Yu, Zhewen Tan, Zixiang Liu, Zeming Li, Binhua Li, Yongbin Li, Tong Yang, Jie (…)2026-05-29
📊 statistics

Open Problem: Separating Geometric and Algorithmic Compression via Cayley-Table Completion

تقترح هذه الورقة استخدام إكمال جدول كلي (Cayley-table completion) كمنصة اختبار معيارية لمعالجة فشل التعلم العميق في استقراء القواعد الجبرية المنفصلة، مما يتحدى المجتمع العلمي لإرساء حدود استرداد دقيقة رسمية وتعميم فرضيات التسطيح المستمر لاكتشاف البديهيات الخوارزمية المنفصلة بشكل ذاتي.

Dongsung Huh2026-05-29
🤖 machine learning

LaRA: Layer-wise Representation Analysis for Detecting Data Contamination in RL Post-Training

تقدم هذه الورقة LaRA، وهو إطار عمل لتحليل التمثيلات على مستوى الطبقات يكتشف تلوث البيانات في النماذج اللغوية الكبيرة التي خضعت للضبط اللاحق باستخدام التعلم المعزز، وذلك من خلال تحديد الانحرافات الهندسية مثل حساسية الاضطراب المتزايدة، والانهيار الاتجاهي، والصلابة المحلية، متفوقاً بذلك على طرق الكشف الحالية القائمة على مستوى المخرجات.

Minju Gwak, Minseo Kwak, Dongseok Lee, Guijin Son, Alan Ritter, Jaehyung Kim2026-05-29
🤖 machine learning

Reducing Experimental Testing in Space Propulsion Film Cooling Analyses by Pixelwise Generative Image Interpolation

تقترح هذه الورقة نهجاً خفيف الوزن ومعتمداً على المعرفة للتعلم الآلي باستخدام الاستيفاء التوليدي للصور على مستوى البكسل لإعادة بناء بيانات تبريد الأفلام عالية الدقة من قياسات تجريبية متفرقة، مما يقلل الحاجة إلى الاختبارات الفيزيائية المكثفة في تطوير أنظمة الدفع الفضائي.

Adam T. Müller, Philipp J. Teuffel, Konstantin Manassis, Nicolaj C. Stache2026-05-29
🤖 machine learning

Midpoint Generative Models

تقدم هذه الورقة نماذج منتصف المسافة التوليدية (MGM)، وهو إطار عمل مبدئي يستفيد من تماثل مطابقة التدفق عند نقطة المنتصف لتعريف مقياس تباين جديد، مما يتيح تدريب نماذج توليدية تنافسية ذات خطوة واحدة من خلال هدف تبايني قابل للحل.

Daniil Shlenskii, Nikita Gushchin, Lev Novitskiy, Dmitry V. Dylov, Alexander Korotin2026-05-29