🤖 AI

Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training

تقترح الورقة البحثية إطار عمل Sword، وهو نموذج عالم (World Model) قوي يوظف تعزيز الأسلوب الموجه بالبنية (Structure-Guided Style Augmentation) والتمهيد الكامن الديناميكي (Dynamic Latent Bootstrapping) للتخفيف من إخفاقات التعميم وتراكم الأخطاء في عمليات التشغيل المغلقة الحلقة (closed-loop rollouts)، مما يعزز بشكل كبير من دقة ونجاح تدريب ما بعد التعلم المعزز لسياسات الرؤية واللغة والعمل (Vision-Language-Action policies) على معيار LIBERO.

Jiaxuan Gao, Yongjian Guo, Zhong Guan, Wen Huang, Wanlun Ma, Xi Xiao, Junwu Xiong, Sheng Wen2026-05-11
🤖 AI

SOM: Structured Opponent Modeling for LLM-based Agents via Structural Causal Model

تقترح الورقة البحثية نموذج نمذجة الخصم المهيكل (SOM)، وهو إطار عمل ثنائي المراحل يستفيد من النماذج السببية الهيكلية لفصل بناء تمثيل الخصم عن التنبؤ بشكل صريح، مما يعزز دقة وقدرة الوكلاء القائمين على النماذج اللغوية الكبيرة (LLMs) على التكيف في البيئات متعددة الوكلاء الديناميكية.

Shiyue Cao, Pei Xu, Likun Yang, Lei Cui, Xiaotang Chen, Kaiqi Huang2026-05-11
💬 NLP

MedAction: Towards Active Multi-turn Clinical Diagnostic LLMs

تقدم الورقة البحثية MedAction، وهو مسار تقطير ذو بنية شجرية يولد مسارات تشخيص سريري متعددة الأدوار عالية الجودة باستخدام مقاييس مرتكزة على الرسوم البيانية للمعرفة لمعالجة أوجه القصور في النماذج اللغوية الكبيرة الحالية في التشخيص النشط، مما أدى إلى إنتاج مجموعة بيانات MedAction-32K ونماذج طبية مفتوحة المصدر ذات أداء فائق.

Hsin-Ling Hsu, Zizheng Wang, Donghua Zhang, Nai-Chia Chen, Jerry Wang, Jun-En Ding, Chia-Hsuan Hsu, Guoan Wang, Feng Liu (…)2026-05-11
🤖 machine learning

Generative Modeling with Flux Matching

تقدم هذه الورقة البحثية "مطابقة التدفق" (Flux Matching)، وهي نموذج توليدي جديد يعمم النماذج القائمة على الدرجة (score-based models) من خلال تخفيف شرط الحقول المتجهة المحافظة، مما يتيح مرونة أكبر في دمج الانحيازات الاستقرائية وتحقيق تطبيقات مثل أخذ العينات الأسرع والديناميكيات القابلة للتفسير.

Peter Pao-Huang, Xiaojie Qiu, Stefano Ermon2026-05-11
🤖 machine learning

Mage: Multi-Axis Evaluation of LLM-Generated Executable Game Scenes Beyond Compile-Pass Rate

تقدم الورقة البحثية "Mage"، وهو بروتوكول تقييم متعدد المحاور يكشف أن معدلات اجتياز مرحلة التجميع مضللة بالنسبة للمشاهد اللعبية المولدة بواسطة النماذج اللغوية الكبيرة، مما يثبت أنه بينما يؤدي التوليد المباشر من اللغة الطبيعية إلى الكود البرمجي إلى نجاح أعلى في وقت التشغيل، فإن تكييف المدخلات هيكلياً بناءً على تمثيلات وسيطة يعد أمراً ضرورياً لإنتاج مشغلات برمجية وفية وظيفياً ومتوافقة مع المجال.

Hugh Xuechen Liu, Kıvanç Tatar2026-05-11
🤖 AI

Confidence-Aware Alignment Makes Reasoning LLMs More Reliable

تقدم هذه الورقة إطار عمل CASPO، الذي يعزز موثوقية وكفاءة نماذج الاستدلال الكبيرة من خلال مواءمة الثقة على مستوى الرمز مع الصحة المنطقية عبر تحسين التفضيل المباشر، وتمكين التقليم الديناميكي لفروع الاستدلال غير المؤكدة عبر آلية الفكر المدرك للثقة (CaT).

Kejia Chen, Jiawen Zhang, Yihong Wu, Kewei Gao, Jian Lou, Zunlei Feng, Mingli Song, Ruoxi Jia2026-05-11
🤖 machine learning

MISA: Mixture of Indexer Sparse Attention for Long-Context LLM Inference

تقترح الورقة البحثية MISA، وهو نهج يعتمد على "خليط من الخبراء" يستبدل الفهرس متعدد الرؤوس المكلف حاسوبياً في آلية DeepSeek Sparse Attention بموجه خفيف الوزن لتنشيط عدد قليل فقط من الرؤوس لكل استعلام، مما يحقق دقة مقاربة للطريقة الأصلية مع تقليل زمن الاستجاف وتكاليف الذاكرة بشكل كبير في مهام السياق الطويل.

Ruijie Zhou, Fanxu Meng, Yufei Xu, Tongxuan Liu, Guangming Lu, Muhan Zhang, Wenjie Pei2026-05-11
🤖 AI

RELO: Reinforcement Learning to Localize for Visual Object Tracking

تقدم الورقة البحثية RELO، وهو أسلوب لتتبع الأجسام بصرياً يستبدل الأولويات المكانية المصممة يدوياً بسياسة تحديد مواقع قائمة على التعلم التعزيزي ومُحسّنة وفق مقاييس مباشرة مثل IoU وAUC، مع دمج انتشار الرموز الزمني المتوافق مع الطبقات لتحقيق أداء رائد في هذا المجال.

Xin Chen, Chuanyu Sun, Jiao Xu, Houwen Peng, Dong Wang, Huchuan Lu, Kede Ma2026-05-11
🤖 AI

Escaping the Diversity Trap in Robotic Manipulation via Anchor-Centric Adaptation

تحدد هذه الورقة "فخ التنوع" في تكييف نماذج الرؤية واللغة والعمل تحت ميزانيات بيانات صارمة، وتقترح إطار عمل "مقايضة التغطية والكثافة"، وتُقدم "التكيف المرتكز على المرتكزات" (ACA) — وهو أسلوب ذو مرحلتين يعطي الأولوية للعروض التوضيحية المتكررة عند المرتكزات الجوهرية قبل التوسع نحو الحدود — لتحسين موثوقية المهام الروبوتية بشكل كبير مقارنة باستراتيجيات أخذ العينات المتنوعة القياسية.

Yanzhe Chen, Kevin Yuchen Ma, Qi Lv, Yiqi Lin, Zechen Bai, Chen Gao, Mike Zheng Shou2026-05-11
🤖 AI

Offline Policy Optimization with Posterior Sampling

تقدم هذه الورقة البحثية "تحسين السياسة القائم على أخذ العينات اللاحقة" (PSPO)، وهو أسلوب تعلم تعزيزي غير متصل يعتمد على النموذج، يستفيد من الاستدلال البايزي والتحسين المقيد لتحقيق التوازن بين التعميم والمتانة عبر الاستخدام الفعال لديناميكيات خارج التوزيع مع منع استغلال النموذج.

Hongqiang Lin, Dongxu Zhang, Yiding Sun, Mingzhe Li, Ning Yang, Haijun Zhang2026-05-11