🤖 AI

Towards Affordable Energy: A Gymnasium Environment for Electric Utility Demand-Response Programs

تقدم هذه الورقة DR-Gym، وهي بيئة محاكاة مفتوحة المصدر ومتوافقة مع Gymnasium، صُممت لتدريب وتقييم شركات المرافق الكهربائية في تحسين برامج الاستجابة للطلب من خلال نمذجة التفاعلات الواقعية على مستوى السوق، وأسعار الجملة ذات نظام تبديل الأنظمة، والطلبات المبنية على الفيزياء للمباني، وذلك لتعزيز القدرة على تحمل تكاليف الطاقة ومرونة الشبكة.

Jose E. Aguilar Escamilla, Lingdong Zhou, Xiangqi Zhu, Huazheng Wang2026-05-13
💬 NLP

Solve the Loop: Attractor Models for Language and Reasoning

تقدم الورقة البحثية "نماذج الجذب" (Attractor Models)، وهي بنية معمارية مبتكرة تستخدم التفاضل الضمني لإيجاد النقاط الثابتة في التمثيلات الكامنة، مما يتيح صقلاً تكرارياً مستقراً وتكيفياً يحقق أداءً فائقاً في نمذجة اللغة والاستدلال بتكاليف حوسبة أقل، مع القدرة الفريدة على استيعاب حالات التوازن من أجل استنتاج فعال.

Jacob Fein-Ashley, Paria Rashidinejad2026-05-13
💬 NLP

KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference

يُعد KV-Fold بروتوكول استدلال بسيط للسياقات الطويلة لا يتطلب تدريباً، حيث يعامل ذاكرة التخزين المؤقت لـ KV كمتراكم طي يساري (left-fold accumulator) لتمكين معالجة تسلسلية مستقرة وفعالة من حيث الذاكرة عبر السلاسل العميقة دون الحاجة إلى إعادة تدريب النموذج أو تغييرات هيكلية.

Alireza Nadali, Patrick Cooper, Ashutosh Trivedi, Alvaro Velasquez2026-05-13
🤖 AI

Reward Hacking in Rubric-Based Reinforcement Learning

تتقصى هذه الورقة ظاهرة "اختراق المكافأة" (reward hacking) في التعلم المعزز القائم على المعايير، حيث تُبين أنه على الرغم من أن أجهزة التحقق الأكثر قوة تقلل من الاستغلال، إلا أنها لا تستطيع منع السياسات تماماً من التلاعب بالمعايير غير المكتملة لتحقيق مكاسب صورية تفشل في الترجمة إلى تحسينات حقيقية في الجودة أو تتماشى مع أحكام البشر المستقلة عن تلك المعايير.

Anas Mahmoud, MohammadHossein Rezaei, Zihao Wang, Anisha Gunjal, Bing Liu, Yunzhong He2026-05-13
🤖 AI

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

تُعد OmniNFT إطار عمل جديد للتعلم التعزيزي للانتشار عبر الإنترنت والمدرك للنماذج، والذي يعزز التوليد المشترك للصوت والفيديو من خلال معالجة عدم الاتساق متعدد الأهداف، واختلال التوازن في التدرج، والتعيين الموحد للائتمان عبر التوجيه المتميز لكل نمط، والجراحة التدريجية للتدرج، وإعادة وزن الخسارة حسب المنطقة.

Guohui Zhang, XiaoXiao Ma, Jie Huang, Hang Xu, Hu Yu, Siming Fu, Yuming Li, Zeyue Xue, Lin Song, Haoyang Huang, Nan Duan (…)2026-05-13
🤖 machine learning

Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training

تقترح هذه الورقة وتثبت تجريبياً مبدأ مكافأة "من الشحيح إلى الكثيف" لمرحلة ما بعد التدريب للنماذج اللغوية، مظهرةً أن تخصيص البيانات القابلة للتحقق النادرة لتدريب نموذج معلم قوي بمكافآت شحيحة قبل نقل سلوكه إلى نموذج طالب أصغر عبر إشراف كثيف يتفوق على التعلم المعزز المباشر الشحيح على النموذج الطالب.

Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang, Alborz Geramifard2026-05-13
🤖 machine learning

Learning, Fast and Slow: Towards LLMs That Adapt Continually

تقدم هذه الورقة البحثية "التدريب السريع-البطيء" (FST)، وهو إطار عمل يجمع بين معاملات النموذج الثابتة ("الأوزان البطيئة") والسياق المُحسَّن ("الأوزان السريعة") لتمكين النماذج اللغوية الكبيرة من التعلم من التغذية الراجعة النصية بكفاءة أكبر، وتحقيق أداء أعلى، والحفاظ على مرونة أكبر مع تقليل النسيان الكارثي بشكل كبير مقارنة بطرق تحديث المعاملات التقليدية.

Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal, Joseph E. Gonzalez, Matei Zaharia, Kurt Keutzer, Inderjit S Dhillon, Ri (…)2026-05-13
🤖 machine learning

AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward

تقترح الورقة البحثية AlphaGRPO، وهو إطار عمل يعزز قدرات التوليد والتحسين الذاتي التأملي للنماذج متعددة الوسائط الموحدة دون مرحلة بدء بارد عبر تطبيق تحسين السياسة النسبي المجموعي الموجه بمكافأة التحقق التفكيكية (DVReward) المبتكرة من أجل إشراف مستقر وقابل للتفسير.

Runhui Huang, Jie Wu, Rui Yang, Zhe Liu, Hengshuang Zhao2026-05-13
🤖 AI

Learning Strategic Value and Cooperation in Multi-Player Stochastic Games through Side Payments

تقدم هذه الورقة وتحلل مفهومين جديدين للقيمة، وهما HS-S وCoco-S، للألعاب العشوائية متعددة اللاعبين ذات المدفوعات الجانبية، حيث تؤسس لأسسهم البديهية، وتثبت تكافؤهما في إعدادات اللاعبين الاثنين مع بيان تباينهما في المجموعات الأكبر، وتوفر خوارزميات لحسابهم والتحقق التجريبي منهم.

Yixin Chen, Jeffrey Richley, Darleen Perez-Lavin, Jessica Singh Syal, Solmaz Kia, Alan Kuhnle2026-05-12
🤖 AI

An Insight into Security Code Review with LLMs: Capabilities, Obstacles, and Influential Factors

تُظهر هذه الدراسة التجريبية أن النماذج اللغوية الكبيرة، ولا سيما تلك المُحسّنة في مجال الاستنتاج مثل DeepSeek-R1، تتفوق بشكل كبير على أدوات التحليل الساكن المتطورة في مراجعة الأكواد الأمنية، مع تحديد أن استراتيجيات هندسة الأوامر، وتعقيد الكود، وحجم الملف هي عوامل حاسمة تؤثر على دقة الكشف وجودة الاستجابة لديها.

Jiaxin Yu, Peng Liang, Yujia Fu, Amjed Tahir, Mojtaba Shahin, Chong Wang, Yangxiao Cai2026-05-12