🤖 AI

FormalRewardBench: A Benchmark for Formal Theorem Proving Reward Models

تقدم هذه الورقة البحثية FormalRewardBench، وهو أول معيار لتقييم نماذج المكافأة في إثبات النظريات الصورية باستخدام 250 زوجًا من التفضيلات التي أعدها خبراء، كاشفةً أن النماذج اللغوية الكبيرة الرائدة تتفوق على أدوات إثبات النظريات المتخصصة في تقييم جودة الإثبات، ومسلطةً الضوء على أوجه القصور في النماذج الحالية في التمييز بين البراهين الصحيحة ومختلف الأخطاء المُحقونة.

Zeynel A. Uluşan, Burak S. Akbudak, Can S. Erer, Gözde Gül Şahin2026-05-12
🤖 AI

Scaling Vision Models Does Not Consistently Improve Localisation-Based Explanation Quality

تُظهر هذه الدراسة أن توسيع نطاق نماذج الرؤية الحاسوبية لا يعزز باستمرار جودة تفسيراتها القائمة على التحديد المكاني، حيث غالبًا ما تؤدي البنيات الأصغر أداءً يضاهي أو يتفوق على البنيات الأكبر، مما يسلط الضوء على الحاجة إلى تقييم القدرة على التفسير صراحةً جنبًا إلى جنب مع دقة التنبؤ في التطبيقات الحرجة للسلامة.

Mateusz Cedro, Marcin Chlebus2026-05-12
📊 statistics

Coarsening Linear Non-Gaussian Causal Models with Cycles

تقترح هذه الورقة طريقة لتعلم مخططات بيانية موجهة (DAGs) سببية منخفضة الأبعاد من نماذج خطية غير غاوسية عالية الأبعاد ذات دورات، مبرهنةً على أن مثل هذه الملخصات قابلة للتمييز، وثابتة عبر فئات التكافؤ الرصدي، وقابلة للحوسبة في زمن تكعيبي مع حدود صريحة للتعقيد العيني.

Francisco Madaleno, Francisco C Pereira, Alex Markham2026-05-12
🤖 AI

Automated Approach for Solving Infinite-state Polynomial Reachability Games

تقدم هذه الورقة خوارزمية مؤتمتة سليمة، وشبه كاملة، وذات تعقيد زمني تحت أسي، تستخدم شهادات الترتيب لحل ألعاب الوصول متعددة الحدود ذات الحالة اللانهائية، حيث تنجح في حساب استراتيجيات الفوز للاعب REACH في سيناريوهات صعبة مثل لعبة "سندريلا-زوجة الأب" (Cinderella-Stepmother) التي فشلت فيها الطرق السابقة.

Krishnendu Chatterjee, Ehsan Kafshdar Goharshady, Mehrdad Karrabi, Maximilian Seeliger, {\DJ}or{\dj}e Žikelić2026-05-12
🤖 AI

When Reviews Disagree: Fine-Grained Contradiction Analysis in Scientific Peer Reviews

تقدم هذه الورقة البحثية RevCI، وهو معيار مرجعي جديد يتضمن تعليقات توضيحية على مستوى الأدلة وتسميات لشدة التدرج لتناقضات مراجعة الأقران العلمية، إلى جانب IMPACT، وهو إطار عمل متعدد الوكلاء، ونموذجه المقطر TIDE، والتي تتفوق جميعها على النماذج المرجعية الحالية في تحديد وتقييم شدة الخلافات بين المراجعين.

Sandeep Kumar, Yash Kamdar, Abid Hossain, Bharti Kumari, Tanik Saikh, Asif Ekbal2026-05-12
🤖 AI

MTA-RL: Robust Urban Driving via Multi-modal Transformer-based 3D Affordances and Reinforcement Learning

تقدم هذه الورقة MTA-RL، وهو إطار عمل مبتكر يعزز القيادة الذاتية الحضرية القوية من خلال دمج بيانات RGB وLiDAR عبر محول متعدد الوسائط (Multi-modal Transformer) لتوليد تمثيلات إمكانات ثلاثية الأبعاد (3D affordance) صريحة، والتي تعمل كفضاء ملاحظة مدمج لسياسة التعلم المعزز لتحقيق أداء متفوق، وكفاءة في أخذ العينات، وتعميم صفري مقارنة بالنماذج المرجعية الحالية.

Guangli Chen, Dianzhao Li, Wenjian Zhong, Bangquan Xie, Ostap Okhrin2026-05-12
🤖 AI

DynGhost: Temporally-Modelled Transformer for Dynamic Ghost Imaging with Quantum Detectors

تُعد DynGhost بنية قائمة على المحولات (transformer) تستفيد من كتل الانتباه المكاني والزماني المتناوبة إلى جانب إطار تدريب واعٍ بالكم لتجاوز قيود الطرق الحالية في التصوير الشبح الديناميكي، محققةً أداء إعادة بناء فائقاً في ظل ظروف واقعية تعاني من نقص الفوتونات وضجيج بواسون.

Vittorio Palladino, Ahmet Enis Cetin2026-05-12
🤖 AI

LegalCiteBench: Evaluating Citation Reliability in Legal Language Models

تقدم هذه الورقة LegalCiteBench، وهو معيار مرجعي شامل يوضح أن النماذج اللغوية الكبيرة الحالية تعاني بشكل كبير في مهام الاستشهاد القانوني بنظام الكتاب المفتوح، حيث تولد بشكل متكرر مراجع تبدو منطقية ولكنها غير صحيحة بمعدلات تضليل عالية رغم التحسينات في حجم النماذج أو التدريب المسبق المتخصص في المجال.

Sijia Chen, Hang Yin, Shunfan Zhou2026-05-12
🤖 AI

TRACE: Distilling Where It Matters via Token-Routed Self On-Policy Alignment

تقترح الورقة البحثية TRACE، وهي طريقة تقطير ذاتي موجهة بالرموز (token-routed self-distillation) تطبق تباعد كولباك - ليبلر (KL divergence) بشكل انتقائي على الأجزاء الحرجة المحددة من قبل المقيّم أثناء التعلم المعزز بمكافآت قابلة للتحقق، مما يقلل من هدر التدرج وتسرب المعلومات المميزة لتحسين الاستدلال الرياضي طويل المدى والتعميم خارج نطاق التوزيع بشكل كبير مقارنة بنماذج GRPO القياسية ونماذج التقطير الذاتي للاستجابة الكاملة.

Jiaxuan Wang, Xuan Ouyang, Zhiyu Chen, Yulan Hu, Zheng Pan, Xin Li, Lan-Zhe Guo2026-05-12
🤖 machine learning

Empty SPACE: Cross-Attention Sparsity for Concept Erasure in Diffusion Models

تقترح الورقة البحثية SPACE، وهي طريقة فعالة من حيث استهلاك الذاكرة تعمل على استحثاث التناثر بشكل تكراري في معاملات الانتباه المتقاطع لمحو مفاهيم محددة بفعالية من نماذج الانتشار واسعة النطاق مع الحفاظ على المتانة ضد المطالبات العدائية.

Nicola Novello, Andrea M. Tonello2026-05-12