📊 statistics

A Unified Pair-GRPO Family: From Implicit to Explicit Preference Constraints for Stable and General RL Alignment

تقدم هذه الورقة عائلة Pair-GRPO، وهي إطار نظري موحد يضم متغيري Soft-Pair-GRPO وHard-Pair-GRPO اللذين يستفيدان من التفضيلات الثنائية الزوجية والقيود الصريحة لمعالجة عدم الاستقرار، والتباين العالي، والغموض في التعلم المعزز من التغذية الراجعة البشرية (RLHF) السائد، مما يحقق جودة محاذاة وقدرة على التعميم متفوقة عبر كل من مهام اللغة والتحكم المستمر.

Hao Yu2026-05-08
🤖 machine learning

Independent Learning of Nash Equilibria in Partially Observable Markov Potential Games with Decoupled Dynamics

تقترح هذه الورقة خوارزمية تعلم مستقلة لألعاب ماركوف ذات الإمكانات الجزئية الملاحظة ذات الديناميكيات المنفصلة، والتي تحقق تقارب توازن ناش التقريبي بتعقيد شبه متعدد الحدود من خلال الاستفادة من استقرار المرشح لتقريب المشكلة عبر نوافذ تاريخية محدودة ولعبة ماركوف بديلة ذات إمكانات قريبة.

Philip Jordan, Maryam Kamgarpour2026-05-08
🤖 machine learning

Empirical Evidence for Simply Connected Decision Regions in Image Classifiers

تقدم هذه الورقة أدلة تجريبية على أن مناطق القرار في مصنفات الصور العميقة هي مناطق متصلة ببساطة، وليست مجرد متصلة مساريًا، وذلك من خلال اقتراح والتحقق من صحة إجراء ملء الشبكة الرباعية التكراري الذي يبني أسطحًا حافظة للتسميات ومحدودة بحلقات مغلقة.

Arjhun Swaminathan, Mete Akgün2026-05-08
🤖 machine learning

Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level

تقترح هذه الورقة البحثية "التقطير غير المتماثل في السياسة المتبعة" (AOPD)، وهو إطار تدريب مبتكر يعالج نقاط الضعف الهيكلية في التقطير القياسي للسياسة المتبعة من خلال استبدال التعزيز السلبي غير الفعال بتقليل التباعد الموضعي، مما يحقق أداءً فائقاً في الاستدلال الرياضي والتكيف مع استخدام الأدوات مع الحفاظ على إنتروبيا سياسة أعلى.

Nan Jia, Haojin Yang, Xing Ma, Jiesong Lian, Shuailiang Zhang, Weipeng Zhang, Ke Zeng, Xunliang Cai, Zequn Sun2026-05-08
⚡ electrical engineering

Consistent Geometric Deep Learning via Hilbert Bundles and Cellular Sheaves

تقدم هذه الورقة HilbNets، وهو إطار عمل جديد للتعلم العميق الهندسي يستخدم لابلاتسيان الاتصال (connection Laplacians) على حزم هيلبرت (Hilbert bundles) لتمكين التعلم الالتفافي المتسق والقابل للنقل للإشارات ذات الأبعاد اللانهائية على النطاقات غير المنتظمة، وذلك من خلال إثبات أن تقريبات غلافها الخلوي المنفصل (discrete cellular sheaf approximations) تتقارب مع العمليات المستمرة الكامنة وراءها.

Kartik Tandon, Julian Gould, Tanishq Bhatia, Francesca Dominici, Alejandro Ribeiro, Claudio Battiloro2026-05-08
🤖 machine learning

SparseForge: Efficient Semi-Structured LLM Sparsification via Annealing of Hessian-Guided Soft-Mask

تُعد SparseForge إطار عمل لما بعد التدريب يعمل على تعزيز كفاءة التخفيف شبه المهيكل للنماذج اللغوية الكبيرة من خلال الجمع بين تقدير الأهمية الموجه بـ "هسيان" (Hessian) والتقليل التدريجي الناعم للقناع، مما يحقق دقة فائقة بعدد أقل بكثير من رموز إعادة التدريب مقارنة بالطرق الحالية.

Liu Hanzuo, Chaofan Lin, Weixuan Sun, Yulong Wang, Key, Rayying, Mingyu Gao2026-05-08
🤖 machine learning

FRInGe: Distribution-Space Integrated Gradients with Fisher--Rao Geometry

تقترح الورقة البحثية FRInGe، وهي طريقة عزو مبتكرة تستبدل المراجع المدخلة الاستدلالية والمسارات الخطية المستقيمة بمرجع يعتمد على الحد الأقصى للإنتروبيا واستكمال جيوديسي لـ "فيشر-راو" في فضاء التوزيع التنبؤي لإنتاج تفسيرات أكثر متانة وتوجهاً نحو المعايرة لنماذج التعلم العميق.

Gabriele Martino, Sebastian Tschiatschek2026-05-08
📊 statistics

Decoupled PFNs: Identifiable Epistemic-Aleatoric Decomposition via Structured Synthetic Priors

تقترح هذه الورقة شبكات PFN المفككة (Decoupled PFNs)، وهي طريقة تستفيد من الأولويات الاصطناعية القابلة للتحكم لفصل عدم اليقين الإبستيمي (المعرفي) والآليات العشوائية (aleatoric) صراحةً في الشبكات الملائمة للأولويات (Prior-Fitted Networks)، مما يتيح اتخاذ قرارات متسلسلة أكثر فعالية في البيئات الصاخبة وغير متجانسة التباين عبر إعطاء الأولوية لعدم اليقين الإبستيمي لعملية الاستحواذ.

Richard Bergna, Stefan Depeweg, José Miguel Hernández-Lobato2026-05-08
🤖 machine learning

FREPix: Frequency-Heterogeneous Flow Matching for Pixel-Space Image Generation

يقدم FrePix إطار عمل لمطابقة التدفق غير متجانس التردد لتوليد الصور في فضاء البكسل، والذي يقوم صراحةً بتفكيك وتدريب مكونات التردد المنخفض والتردد العالي بشكل منفصل، محققاً درجات FID تنافسية على مجموعة بيانات ImageNet مع تمكين التوليد الفعال من الخشن إلى الناعم.

Mingfeng Lin, Jiakun Chen, Liang Han, Liqiang Nie2026-05-08
🤖 machine learning

Federated Cross-Client Subgraph Pattern Detection

تتناول هذه الورقة تحدي اكتشاف أنماط المخططات الفرعية عبر المخططات الموزعة من خلال اقتراح إطار عمل اتحادي يعمل على مزامنة تضمينات العقد الوسيطة طبقة تلو الأخرى، مما يقلص فجوة التمثيل بين الشبكات العصبية للمخططات المحلية والمركزية دون الكشف عن البيانات الخام.

Selin Ceydeli, Rui Wang, Kubilay Atasu2026-05-08