🤖 AI

CAAFC: Chronological Actionable Automated Fact-Checker for misinformation / non-factual hallucination detection and correction

تقدم الورقة البحثية إطار عمل CAAFC، وهو إطار عمل مبتكر يسد الفجوة بين التحقق الآلي من الحقائق والتحقق المهني من خلال اكتشاف وتصحيح الأخطاء الواقعية والهلوسة في الادعاءات والحوارات عبر مبررات قابلة للتنفيذ مدعومة بمصادر أولية وتحديثات ديناميكية للأدلة، متفوقاً بذلك على الأنظمة الحالية الرائدة.

Islam Eldifrawi, Shengrui Wang, Amine Trabelsi2026-05-13
⚡ electrical engineering

Enabling AI-Native Mobility in 6G: A Real-World Dataset for Handover, Beam Management, and Timing Advance

تقدم هذه الورقة مجموعة بيانات جديدة من الواقع تم جمعها من شبكة 6G منشورة تجارياً عبر سيناريوهات تنقل متنوعة، وتتميز بقياسات فريدة للتقدم الزمني (timing advance) لمعالجة نقص البيانات الواقعية لتدريب وتقييم نماذج الذكاء الاصطناعي وتعلم الآلة التي تهدف إلى تحسين عمليات التسليم، وإدارة الشعاع، وإجراءات التنقل.

Mannam Veera Narayana, Rohit Singh, Deepa M. R, Radha Krishna Ganti2026-05-13
🤖 AI

Towards Affordable Energy: A Gymnasium Environment for Electric Utility Demand-Response Programs

تقدم هذه الورقة DR-Gym، وهي بيئة محاكاة مفتوحة المصدر ومتوافقة مع Gymnasium، صُممت لتدريب وتقييم شركات المرافق الكهربائية في تحسين برامج الاستجابة للطلب من خلال نمذجة التفاعلات الواقعية على مستوى السوق، وأسعار الجملة ذات نظام تبديل الأنظمة، والطلبات المبنية على الفيزياء للمباني، وذلك لتعزيز القدرة على تحمل تكاليف الطاقة ومرونة الشبكة.

Jose E. Aguilar Escamilla, Lingdong Zhou, Xiangqi Zhu, Huazheng Wang2026-05-13
💬 NLP

Solve the Loop: Attractor Models for Language and Reasoning

تقدم الورقة البحثية "نماذج الجذب" (Attractor Models)، وهي بنية معمارية مبتكرة تستخدم التفاضل الضمني لإيجاد النقاط الثابتة في التمثيلات الكامنة، مما يتيح صقلاً تكرارياً مستقراً وتكيفياً يحقق أداءً فائقاً في نمذجة اللغة والاستدلال بتكاليف حوسبة أقل، مع القدرة الفريدة على استيعاب حالات التوازن من أجل استنتاج فعال.

Jacob Fein-Ashley, Paria Rashidinejad2026-05-13
💬 NLP

KV-Fold: One-Step KV-Cache Recurrence for Long-Context Inference

يُعد KV-Fold بروتوكول استدلال بسيط للسياقات الطويلة لا يتطلب تدريباً، حيث يعامل ذاكرة التخزين المؤقت لـ KV كمتراكم طي يساري (left-fold accumulator) لتمكين معالجة تسلسلية مستقرة وفعالة من حيث الذاكرة عبر السلاسل العميقة دون الحاجة إلى إعادة تدريب النموذج أو تغييرات هيكلية.

Alireza Nadali, Patrick Cooper, Ashutosh Trivedi, Alvaro Velasquez2026-05-13
🤖 AI

Reward Hacking in Rubric-Based Reinforcement Learning

تتقصى هذه الورقة ظاهرة "اختراق المكافأة" (reward hacking) في التعلم المعزز القائم على المعايير، حيث تُبين أنه على الرغم من أن أجهزة التحقق الأكثر قوة تقلل من الاستغلال، إلا أنها لا تستطيع منع السياسات تماماً من التلاعب بالمعايير غير المكتملة لتحقيق مكاسب صورية تفشل في الترجمة إلى تحسينات حقيقية في الجودة أو تتماشى مع أحكام البشر المستقلة عن تلك المعايير.

Anas Mahmoud, MohammadHossein Rezaei, Zihao Wang, Anisha Gunjal, Bing Liu, Yunzhong He2026-05-13
🤖 AI

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

تُعد OmniNFT إطار عمل جديد للتعلم التعزيزي للانتشار عبر الإنترنت والمدرك للنماذج، والذي يعزز التوليد المشترك للصوت والفيديو من خلال معالجة عدم الاتساق متعدد الأهداف، واختلال التوازن في التدرج، والتعيين الموحد للائتمان عبر التوجيه المتميز لكل نمط، والجراحة التدريجية للتدرج، وإعادة وزن الخسارة حسب المنطقة.

Guohui Zhang, XiaoXiao Ma, Jie Huang, Hang Xu, Hu Yu, Siming Fu, Yuming Li, Zeyue Xue, Lin Song, Haoyang Huang, Nan Duan (…)2026-05-13
🤖 machine learning

Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training

تقترح هذه الورقة وتثبت تجريبياً مبدأ مكافأة "من الشحيح إلى الكثيف" لمرحلة ما بعد التدريب للنماذج اللغوية، مظهرةً أن تخصيص البيانات القابلة للتحقق النادرة لتدريب نموذج معلم قوي بمكافآت شحيحة قبل نقل سلوكه إلى نموذج طالب أصغر عبر إشراف كثيف يتفوق على التعلم المعزز المباشر الشحيح على النموذج الطالب.

Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang, Alborz Geramifard2026-05-13
🤖 machine learning

Learning, Fast and Slow: Towards LLMs That Adapt Continually

تقدم هذه الورقة البحثية "التدريب السريع-البطيء" (FST)، وهو إطار عمل يجمع بين معاملات النموذج الثابتة ("الأوزان البطيئة") والسياق المُحسَّن ("الأوزان السريعة") لتمكين النماذج اللغوية الكبيرة من التعلم من التغذية الراجعة النصية بكفاءة أكبر، وتحقيق أداء أعلى، والحفاظ على مرونة أكبر مع تقليل النسيان الكارثي بشكل كبير مقارنة بطرق تحديث المعاملات التقليدية.

Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal, Joseph E. Gonzalez, Matei Zaharia, Kurt Keutzer, Inderjit S Dhillon, Ri (…)2026-05-13
🤖 machine learning

AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward

تقترح الورقة البحثية AlphaGRPO، وهو إطار عمل يعزز قدرات التوليد والتحسين الذاتي التأملي للنماذج متعددة الوسائط الموحدة دون مرحلة بدء بارد عبر تطبيق تحسين السياسة النسبي المجموعي الموجه بمكافأة التحقق التفكيكية (DVReward) المبتكرة من أجل إشراف مستقر وقابل للتفسير.

Runhui Huang, Jie Wu, Rui Yang, Zhe Liu, Hengshuang Zhao2026-05-13