🤖 AI

Beyond Mode Collapse: Distribution Matching for Diverse Reasoning

تقدم هذه الورقة البحثية طريقة DMPO، وهي طريقة تحسين سياسة مطابقة التوزيع تخفف من حدة انهيار النمط في التعلم المعزز القائم على السياسة، وذلك عبر مواءمة السياسة مع توزيع مستهدف متناسب مع المكافأة، مما يحافظ على الاستكشاف ويحسن الأداء بشكل كبير عبر مهام استدلال متنوعة مثل التحسين المسائل الصعبة (NP-hard) والاستدلال الرياضي.

Xiaozhe Li, Yang Li, Xinyu Fang, Shengyuan Ding, Peiji Li, Yongkang Chen, Yichuan Ma, Tianyi Lyu, Linyang Li, Dahua Lin (…)2026-05-20
🤖 machine learning

Quantifying the Pre-training Dividend: Generative versus Latent Self-Supervised Learning for Time Series Foundation Models

تُرسخ هذه الورقة إطاراً منضبطاً يثبت أن التدريب المسبق ذاتي الإشراف يحقق عوائد كبيرة في تصنيف السلاسل الزمنية وكشف الشذوذ، ولكنه يقدم فوائد هامشية في التنبؤ، وهو تفاوت مدفوع بمقايضة عدم التغير في الدقة التي تحبذ بنيات المحاذاة الكامنة على النماذج التوليدية.

Noam Major, Kathy Razmadze, Yoli Shavit2026-05-20
🤖 machine learning

Sampling-Based Safe Reinforcement Learning

تقدم هذه الورقة البحثية التعلم المعزز الآمن القائم على أخذ العينات (SBSRL)، وهو خوارزمية قائمة على النموذج تضمن السلامة أثناء تعلم التحكم المستمر من خلال فرض القيود عبر عينات الديناميكيات وإدارة عدم اليقين المعرفي، مما يوفر ضمانات سلامة نظرية ويحقق استكشافاً فعالاً في كل من المحاكاة والأجهزة الروبوتية في العالم الحقيقي.

Luca Vignola, Bruce D. Lee, Manish Prajapat, Manuel Wendl, Melanie Zeilinger, Andreas Krause, Yarden As2026-05-20
🤖 AI

BLINKG: A Benchmark for LLM-Integrated Knowledge Graph Generation

تقدم هذه الورقة BLINKG، وهو معيار مصمم لتقييم فعالية النماذج اللغوية الكبيرة في أتمتة إنشاء الرسوم البيانية للمعرفة من خلال ربط مصادر البيانات غير المتجانسة بمصطلحات الأنطولوجيا، مما يكشف أنه بينما تظهر النماذج الحالية إمكانات واعدة، إلا أنها لا تزال تعاني مع السيناريوهات المعقدة وتتطلب مزيدًا من التطوير لتحقيق بناء شبه مؤتمت قوي.

Carla Castedo, Enrique Iglesias, Manuel Lama, Alberto Bugarin-Diz, Maria-Esther Vidal, David Chaves-Fraga2026-05-20
🤖 AI

Efficient Elicitation of Collective Disagreements

تقترح هذه الورقة إطاراً طبقياً و"مصفوفة التعددية" لتحديد الحد الأدنى من معلومات التفضيل المجمعة المطلوبة لحساب مقاييس الاختلاف المتنوعة، مبرهنةً على أن العديد من هذه المقاييس تتطلب بيانات تتجاوز مجرد المقارنات الثنائية البسيطة، ومقدمةً بروتوكولات استقاء البيانات لموازنة العبء الواقع على المشاركين مع دقة التقدير.

Mohamed Ouaguenouni, Felipe Garrido-Lucero, Umberto Grandi, César Hidalgo, Magdalena Tydrichova2026-05-20
🤖 AI

EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs

تقدم الورقة البحثية EgoCoT-Bench، وهو معيار مرجعي لفيديوهات منظور الشخص الأول (egocentric) دقيق التفاصيل يضم 3,172 زوجاً من الأسئلة والأجوبة القابلة للتحقق مع تعليقات توضيحية صريحة للمنطق خطوة بخطوة، مصمم لتقييم وتحسين قدرات الاستدلال المرتكزة على العمليات والمترابطة مع المحتوى في النماذج اللغوية الكبيرة متعددة الوسائط.

Yang Dai, Dian Jiao, Tianwei Lin, Wenqiao Zhang2026-05-20
🤖 machine learning

TORQ: Two-Level Orthogonal Rotation for MXFP4 Quantization

تقدم هذه الورقة البحثية TORQ، وهو إطار عمل للكمّ ما بعد التدريب لا يتطلب تدريباً، يستخدم دورات متعامدة ثنائية المستوى لمعالجة الاختلالات الهيكلية في كمّ تنشيط MXFP4 نظرياً، مما يقلص بشكل كبير فجوة الدقة بين الاستدلال بـ 4 بت ونماذج الدقة الكاملة في النماذج اللغوية الكبيرة.

Zukang Xu, Xing Hu, Dawei Yang2026-05-20
🤖 AI

SceneCode: Executable World Programs for Editable Indoor Scenes with Articulated Objects

يُعد SceneCode إطار عمل يعمل على تحويل المطالبات باللغة الطبيعية إلى مشاهد داخلية قابلة للتنفيذ ومدفوعة بالكود مع كائنات مفصلية، وذلك عبر توليد برامج بلندر بايثون (Blender Python) والتحقق من صحتها، مما يتيح تخليق عوالم قابلة للتحرير وجاهزة فيزيائياً تتجاوز قيود تمثيلات الشبكات الساكنة (static mesh).

Puyi Wang, Yuhao Wang, Linjie Li, Zhengyuan Yang, Kevin Qinghong Lin, Yangguang Li, Yu Cheng2026-05-20
🤖 AI

Towards Multi-Model LLM Schedulers: Empirical Insights into Offloading and Preemption

تقدم هذه الورقة دراسة تجريبية تكشف أن جدولة النماذج اللغوية الكبيرة متعددة النماذج على أجهزة غير متجانسة تواجه تدهوراً كبيراً في الأداء يعتمد على النموذج نتيجة لعمليات الإزاحة من المعالج المركزي إلى معالج الرسوميات (CPU-GPU offloading)، وعبئاً كبيراً في عمليات الاستباق مدفوعاً بإعادة تحميل الحالة، مما يحدد العوامل الحاسمة لتصميم الجدولة من الجيل التالي الأكثر كفاءة.

Mert Yildiz, Pietro Spadaccino, Alexey Rolich, Francesca Cuomo, Andrea Baiocchi2026-05-20
🤖 AI

Formal Skill: Programmable Runtime Skills for Efficient and Accurate LLM Agents

تقدم هذه الورقة البحثية "المهارة الرسمية" (Formal Skill)، وهي تجريد أصيل في وقت التشغيل يستبدل التعليمات غير الرسمية باللغة الطبيعية بآلات حالة قابلة للتنفيذ ومخططات JSON لتعزيز كفاءة ودقة وقابلية إنفاذ وكلاء النماذج اللغوية الكبيرة، كما يتضح من الأداء المتفوق لإطار عمل FairyClaw مفتوح المصدر على اختبار Harness-Bench.

Xi Zhang, Meijun Gao, Yuntian Zhao, Xinyu Tan, Yilun Yao, Feiyu Wang, Yanshu Wang, Dingsiyi, Tong Yang2026-05-20