🤖 machine learning

Zero Shot Coordination for Sparse Reward Tasks with Diverse Reward Shapings

تتناول هذه الورقة تحدي التنسيق في حالة "الصفر من التدريب المسبق" (Zero-Shot Coordination) في بيئة التعلم المعزز متعدد الوكلاء ذات المكافآت الشحيحة، وذلك عبر اقتراح طريقة تدريب تجميعية تعتمد على تشكيل مكافآت عشوائي، مما يحسن بشكل كبير من تعاون الوكلاء مع شركاء يستخدمون استراتيجيات مختلفة لتشكيل المكافآت في بيئة "أوفر كوكد" (Overcooked).

Keenan Powell, Peihong Yu, Pratap Tokekar2026-04-29
🤖 machine learning

Knowledge Distillation Must Account for What It Loses

تجادل هذه الورقة الموقفية بأن تقطير المعرفة لا ينبغي تقييمه فقط من خلال أداء المهام المستبق، بل من خلال الحفاظ على قدرات المعلم الحرجة مثل السلامة واليقين، مقترحةً إطار عمل جديدًا لـ "التقطير المسؤول" يبلغ صراحةً عما يُفقد أثناء عملية الضغط.

Wenshuo Wang2026-04-29
🤖 machine learning

Evaluation without Generation: Non-Generative Assessment of Harmful Model Specialization with Applications to CSAM

تقدم هذه الورقة "الاستقصاء الغاوسي" (Gaussian probing)، وهو أسلوب تقييم غير توليدي يقيم التخصص الضار للنماذج، مثل المحتوى المتعلق بالاستغلال الجنسي للأطفال (CSAM)، من خلال تحليل اضطرابات التمثيل الداخلي في مهايئات "LoRA"، مما يتيح تدقيقاً قابلاً للتوسع ومتوافقاً قانونياً في الحالات التي يُحظر فيها التوليد القائم على المخرجات التقليدية.

Vinith M. Suriyakumar, Ayush Sekhari, Lena Stempfle, Robertson Wang, Michael Simpson, Rebecca Portnoff, Marzyeh Ghassemi (…)2026-04-29
💬 NLP

Frictive Policy Optimization for LLMs: Epistemic Intervention, Risk-Sensitive Control, and Reflective Alignment

تقدم هذه الورقة "تحسين السياسة الاحتكاكية" (FPO)، وهو إطار عمل مبتكر يعيد صياغة محاذاة النماذج اللغوية الكبيرة كمسألة تحكم معرفي حساسة للمخاطر، حيث تتعلم الوكلاء كيفية النشر الاستراتيجي للتدخلات مثل الاستيضاح والرفض لإدارة عدم اليقين والمخاطر المعيارية، بدلاً من مجرد التحسين من أجل مكافآت المهام الفورية.

James Pustejovsky, Nikhil Krishnaswamy2026-04-29
⚛️ quantum physics

Quantum Dynamics via Score Matching on Bohmian Trajectories

تقترح هذه الورقة طريقة مبتكرة لحل معادلة شرودنغر المعتمدة على الزمن من خلال نمذجة مسارات بوم (Bohmian trajectories) كتدفق معياري ذاتي الاتساق، حيث تتعلم شبكة عصبية دالة الدرجة (score function) لاستعادة الديناميكا الكمومية للدوال الموجية عديمة العقد.

Lei Wang2026-04-29
🤖 machine learning

Gradient-Direction Sensitivity Reveals Linear-Centroid Coupling Hidden by Optimizer Trajectories

تُثبت هذه الورقة أن تحليل تدرجات الخسارة بدلاً من تحديثات المُحسِّن يكشف عن اقتران قوي، كان مخفياً في السابق، بين الحساسية لاتجاه التدرج وميزات فرضية المركز الخطي، مما يُظهر أن تقييد تحديثات الانتباه في فضاءات فرعية منخفضة الرتبة يُسرع عملية "الاستيعاب المفاجئ" (grokking)، بينما تكون التحديثات الطبيعية كاملة الرتبة فائضة الرتبة بشكل كبير.

Yongzhong Xu2026-04-29
🤖 machine learning

The Role of Symmetry in Optimizing Overparameterized Networks

تُبين هذه الورقة أن الإفراط في المعلمات (overparameterization) في الشبكات العصبية يُحسّن التدريب من خلال إدخال تماثلات في فضاء الأوزان تعمل كمعالجة مسبقة قطرية (diagonal preconditioning) لتحسين شرطية هسيان (Hessian conditioning) وزيادة الكتلة الاحتمالية للقيم الصغرى العالمية بالقرب من التهيئات النموذجية، مما يؤدي إلى تسريع التقارب.

Kusha Sareen, Mohammad Pedramfar, Sékou-Oumar Kaba, Mehran Shakerinava, Siamak Ravanbakhsh2026-04-29
🤖 machine learning

Prior-Aligned Data Cleaning for Tabular Foundation Models

تقدم هذه الورقة البحثية L2C2، وهو إطار عمل للتعلم التعزيزي العميق يعمل على تحسين تنظيف البيانات الجدولية كعملية محاذاة مسبقة لسد الفجوة التوزيعية بين البيانات الواقعية غير النظيفة والبوادر الاصطناعية للنماذج التأسيسية الجدولية، مما يحسن دقة الصفرية بشكل كبير ويمكّن من النقل الفعال عبر مجموعات البيانات.

Laure Berti-Equille2026-04-29
🤖 machine learning

Making AI-Assisted Grant Evaluation Auditable without Exposing the Model

تقترح هذه الورقة بنية قائمة على بيئة التنفيذ الموثوقة (TEE) تستخدم التوثيق عن بُعد لإنشاء حزم تقييم موقعة وقابلة للتدقيق لمراجعات المنح المدعومة بالذكاء الاصطناعي، مما يضمن شفافية العملية ومقاومة حقن الأوامر دون الكشف عن أوزان النماذج المملوكة أو منطق التسجيل.

Kemal Bicakci2026-04-29
💬 NLP

BARRED: Synthetic Training of Custom Policy Guardrails via Asymmetric Debate

يُعد BARRED إطار عمل يُنشئ بيانات تدريب اصطناعية عالية الدقة من خلال تفكيك أبعاد المجال والمناظرة بين الوكلاء المتعددين، مما يُمكّن النماذج اللغوية الصغيرة من التفوق على النماذج اللغوية الكبيرة المملوكة والأكثر تطوراً والأنظمة المخصصة للحماية في فرض السياسات المخصصة دون الحاجة إلى تعليق بشري مكثف.

Arnon Mazza, Elad Levi2026-04-29