🤖 AI

Reward Hacking in Rubric-Based Reinforcement Learning

تتقصى هذه الورقة ظاهرة "اختراق المكافأة" (reward hacking) في التعلم المعزز القائم على المعايير، حيث تُبين أنه على الرغم من أن أجهزة التحقق الأكثر قوة تقلل من الاستغلال، إلا أنها لا تستطيع منع السياسات تماماً من التلاعب بالمعايير غير المكتملة لتحقيق مكاسب صورية تفشل في الترجمة إلى تحسينات حقيقية في الجودة أو تتماشى مع أحكام البشر المستقلة عن تلك المعايير.

Anas Mahmoud, MohammadHossein Rezaei, Zihao Wang, Anisha Gunjal, Bing Liu, Yunzhong He2026-05-13
🤖 AI

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

تُعد OmniNFT إطار عمل جديد للتعلم التعزيزي للانتشار عبر الإنترنت والمدرك للنماذج، والذي يعزز التوليد المشترك للصوت والفيديو من خلال معالجة عدم الاتساق متعدد الأهداف، واختلال التوازن في التدرج، والتعيين الموحد للائتمان عبر التوجيه المتميز لكل نمط، والجراحة التدريجية للتدرج، وإعادة وزن الخسارة حسب المنطقة.

Guohui Zhang, XiaoXiao Ma, Jie Huang, Hang Xu, Hu Yu, Siming Fu, Yuming Li, Zeyue Xue, Lin Song, Haoyang Huang, Nan Duan (…)2026-05-13
🤖 machine learning

Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training

تقترح هذه الورقة وتثبت تجريبياً مبدأ مكافأة "من الشحيح إلى الكثيف" لمرحلة ما بعد التدريب للنماذج اللغوية، مظهرةً أن تخصيص البيانات القابلة للتحقق النادرة لتدريب نموذج معلم قوي بمكافآت شحيحة قبل نقل سلوكه إلى نموذج طالب أصغر عبر إشراف كثيف يتفوق على التعلم المعزز المباشر الشحيح على النموذج الطالب.

Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang, Alborz Geramifard2026-05-13
🤖 machine learning

Learning, Fast and Slow: Towards LLMs That Adapt Continually

تقدم هذه الورقة البحثية "التدريب السريع-البطيء" (FST)، وهو إطار عمل يجمع بين معاملات النموذج الثابتة ("الأوزان البطيئة") والسياق المُحسَّن ("الأوزان السريعة") لتمكين النماذج اللغوية الكبيرة من التعلم من التغذية الراجعة النصية بكفاءة أكبر، وتحقيق أداء أعلى، والحفاظ على مرونة أكبر مع تقليل النسيان الكارثي بشكل كبير مقارنة بطرق تحديث المعاملات التقليدية.

Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal, Joseph E. Gonzalez, Matei Zaharia, Kurt Keutzer, Inderjit S Dhillon, Ri (…)2026-05-13
🤖 machine learning

AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward

تقترح الورقة البحثية AlphaGRPO، وهو إطار عمل يعزز قدرات التوليد والتحسين الذاتي التأملي للنماذج متعددة الوسائط الموحدة دون مرحلة بدء بارد عبر تطبيق تحسين السياسة النسبي المجموعي الموجه بمكافأة التحقق التفكيكية (DVReward) المبتكرة من أجل إشراف مستقر وقابل للتفسير.

Runhui Huang, Jie Wu, Rui Yang, Zhe Liu, Hengshuang Zhao2026-05-13
🤖 AI

Learning Strategic Value and Cooperation in Multi-Player Stochastic Games through Side Payments

تقدم هذه الورقة وتحلل مفهومين جديدين للقيمة، وهما HS-S وCoco-S، للألعاب العشوائية متعددة اللاعبين ذات المدفوعات الجانبية، حيث تؤسس لأسسهم البديهية، وتثبت تكافؤهما في إعدادات اللاعبين الاثنين مع بيان تباينهما في المجموعات الأكبر، وتوفر خوارزميات لحسابهم والتحقق التجريبي منهم.

Yixin Chen, Jeffrey Richley, Darleen Perez-Lavin, Jessica Singh Syal, Solmaz Kia, Alan Kuhnle2026-05-12
🤖 AI

An Insight into Security Code Review with LLMs: Capabilities, Obstacles, and Influential Factors

تُظهر هذه الدراسة التجريبية أن النماذج اللغوية الكبيرة، ولا سيما تلك المُحسّنة في مجال الاستنتاج مثل DeepSeek-R1، تتفوق بشكل كبير على أدوات التحليل الساكن المتطورة في مراجعة الأكواد الأمنية، مع تحديد أن استراتيجيات هندسة الأوامر، وتعقيد الكود، وحجم الملف هي عوامل حاسمة تؤثر على دقة الكشف وجودة الاستجابة لديها.

Jiaxin Yu, Peng Liang, Yujia Fu, Amjed Tahir, Mojtaba Shahin, Chong Wang, Yangxiao Cai2026-05-12
🤖 AI

Virtual Personas for Language Models via an Anthology of Backstories

تقدم هذه الورقة "Anthology"، وهي طريقة تُهيئ النماذج اللغوية الكبيرة بناءً على سرديات حياتية مفتوحة (قصص خلفية) لإنشاء شخصيات افتراضية، مما يُظهر تحسينات ملحوظة في مطابقة توزيعات الاستجابة البشرية والاتساق التجريبي عبر ثلاثة مسوحات ممثلة وطنياً.

Suhong Moon, Marwa Abdulhai, Minwoo Kang, Joseph Suh, Widyadewi Soedarmadji, Eran Kohen Behar, David M. Chan, John Canny2026-05-12
🤖 machine learning

Explaining Graph Neural Networks for Node Similarity on Graphs

تتقصى هذه الورقة البحثية قابلية التفسير في البحث عن التشابه في الرسوم البيانية من خلال تقييم المعلومات المتبادلة وطرق التفسير القائمة على التدرج للشبكات العصبية الرسومية، مما يثبت أن النهج القائم على التدرج يقدم تفسيرات متفوقة من حيث القابلية للتنفيذ والاتساق والتبسيط لدرجات تشابه العقد.

Daniel Daza, Cuong Xuan Chu, Trung-Kien Tran, Daria Stepanova, Michael Cochez, Paul Groth2026-05-12
🔢 mathematics

Automated conjecturing with \emph{TxGraffiti}

تقدم هذه الورقة تصميم ومبادئ جوهرية ومنهجية تعتمد على البيانات لبرنامج \emph{TxGraffiti}، وهو برنامج حاسوبي يعمل على أتمتة توليد التخمينات الرياضية — لا سيما في نظرية المخططات — مع تسليط الضوء على مساهماته في الأدبيات العلمية وتقديم واجهة ويب تفاعلية جديدة.

Randy Davila2026-05-12