🤖 machine learning

RL Fine-Tuning Heals OOD Forgetting in SFT

تتحدى هذه الورقة المفهوم القائل بأن "الضبط الدقيق الخاضع للإشراف (SFT) يحفظ، بينما التعلم المعزز (RL) يعمم" من خلال إثبات، عبر تحليلات نقطة التحقق والتحليل الطيفي، أن الضبط الدقيق الخاضع للإشراف غالبًا ما يسبب نسيانًا للبيانات خارج التوزيع، وهو ما يتم استعادته لاحقًا بواسطة التعلم المعزز، وهي عملية استعادة مرتبطة بدوران المتجهات المنفردة وليس بتغيرات في القيم المنفردة.

Hangzhan Jin, Sitao Luan, Tianwei Ni, Sicheng Lyu, Guillaume Rabusseau, Reihaneh Rabbany, Doina Precup, Mohammad Hamdaqa2026-05-12
🤖 machine learning

Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision

تقدم الورقة البحثية إطار عمل "الحوسبة كمعلم" (CaT)، الذي يحول عمليات التوليد المتوازية أثناء وقت الاستدلال إلى إشراف خالٍ من المراجع عبر تجميع المراجع الزائفة والمعايير المقترحة ذاتياً، مما يمكّن النماذج من تحقيق مكاسب أداء كبيرة في المجالات القابلة للتحقق وغير القابلة للتحقق دون الاعتماد على الملصقات البشرية.

Dulhan Jayalath, Shashwat Goel, Thomas Foster, Parag Jain, Suchin Gururangan, Cheng Zhang, Anirudh Goyal, Alan Schelten2026-05-12
📊 statistics

Estimating Heterogeneous Causal Effect on Networks via Orthogonal Learning

تقترح هذه الورقة إطار تعلم متعامد ثنائي المراحل يجمع بين الشبكات العصبية الرسومية ونموذج يعتمد على الانتباه قابل للتفسير لتقدير الآثار السببية المباشرة والتبادلية غير المتجانسة على الشبكات بمتانة، مع توفير تقدير دقيق لعدم اليقين.

Yuanchen Wu, Yubai Yuan2026-05-12
📊 statistics

High-probability zeroth-order online convex optimisation beyond Euclidean geometry

تضع هذه الورقة حدوداً موحدة للندم ذي الاحتمالية العالية للتحسين الكهفي عبر الإنترنت من الدرجة الصفرية مع خسائر لـ q\ell_q-ليبتشيتز وتنظيم p\ell_p-باستخدام أخذ عينات مقياس المخروط، مما يثبت المثالية لـ q[1,2]q \in [1,2] مع تحديد فجوة جوهرية لـ q>2q > 2.

David Janz, El-Mahdi El-Mhamdi, Arya Akhavan2026-05-12
🤖 machine learning

GLAI: GreenLightningAI for Accelerated Training through Knowledge Decoupling

تقدم GreenLightningAI (GLAI) كتلة معمارية مبتكرة تفصل بين المعرفة الهيكلية والكمية من خلال تثبيت أنماط التنشيط المستقرة لتحسين الأوزان العددية فقط، مما يؤدي إلى تسريع التدريب بنسبة 40% تقريبًا مع الحفاظ على الدقة أو تحسينها مقارنة بالشبكات العصبية متعددة الطبقات (MLPs) التقليدية.

Jose I. Mestre, Alberto Fernández-Hernández, Cristian Pérez-Corral, Manuel F. Dolz, Jose Duato, Enrique S. Quintana-Ortí2026-05-12
🤖 machine learning

Adaptive Memory Momentum via a Model-Based Framework for Deep Learning Optimization

تقدم هذه الورقة إطار عمل جديداً قائماً على النموذج يسمى "الذاكرة التكيفية" (Adaptive Memory)، والذي يضبط معامل الزخم ديناميكياً أثناء التدريب من خلال تقريب دالة الهدف باستخدام مستويين، مما يظهر أداءً فائقاً على المحسنات القياسية مثل SGD وAdamW عبر مهام متنوعة دون الحاجة إلى ضبط إضافي للمعلمات الفائقة.

Kristi Topollai, Anna Choromanska2026-05-12
🤖 machine learning

NEO: No-Optimization Test-Time Adaptation through Latent Re-Centering

تُعد NEO طريقةً للتكيف عند وقت الاختبار (Test-Time Adaptation) خالية من المعلمات الفائقة (hyperparameter-free) وفعالة حاسوبياً، تعمل على تحسين متانة النموذج ومعايرته في ظل تغير التوزيعات من خلال إعادة تمركز تمثيلات البيانات المستهدفة عند الأصل، محققةً دقةً فائقة عبر مجموعات بيانات وأجهزة متعددة مع حد أدنى من العبء الحسابي.

Alexander Murphy, Michal Danilowski, Soumyajit Chatterjee, Abhirup Ghosh2026-05-12✓ Author reviewed
🤖 machine learning

Control-Augmented Autoregressive Diffusion for Data Assimilation

تقدم هذه الورقة إطار عمل للانتشار ذاتي الانحدار معزز بالتحكم، يستفيد من متحكم مُدرب مسبقاً (offline) لحقن تصحيحات خطوة بخطوة أثناء عملية إزالة الضجيج، مما يحسن بشكل كبير سرعة واستقرار ودقة استيعاب البيانات للمعادلات التفاضلية الجزئية ذات الطابع الزماني المكاني الفوضوي مقارنة بالنماذج المرجعية القائمة على الانتشار الحالية.

Prakhar Srivastava, Farrin Marouf Sofian, Francesco Immorlano, Kushagra Pandey, Stephan Mandt2026-05-12
🔢 mathematics

Differentially Private Spectral Graph Clustering: Balancing Privacy, Accuracy, and Efficiency

تقدم هذه الورقة طريقة لتجميع الرسوم البيانية الطيفية بخصوصية تفاضلية تستخدم آلية خلط المصفوفات لتحقيق ضمانات خصوصية متلاشية ومعدلات خطأ في التصنيف تبلغ O~(1/n)\tilde{O}(1/n)، مما يتفوق بشكل كبير على النماذج المرجعية الحالية لـ PCA الخاصة مع توفير إطار عمل موحد لتحليل الخطأ وخوارزمية خاصة لتقدير عدد المجتمعات.

Antti Koskela, Mohamed Seif, H. Vincent Poor, Andrea J. Goldsmith2026-05-12
🔢 mathematics

Black-Box Detection of LLM-Generated Text Using Generalized Jensen-Shannon Divergence

تقدم الورقة البحثية SurpMark، وهو كاشف قوي للصندوق الأسود للنصوص المولدة بواسطة النماذج اللغوية الكبيرة (LLM)، يستفيد من ديناميكيات مفاجأة الرموز (token surprisal) ومقياس تباعد جينسن-شانون المعمم للتمييز بفعالية بين الكتابة البشرية والآلية دون الحاجة إلى الوصول إلى النموذج المصدر.

Shuangyi Chen, Ashish Khisti2026-05-12