🤖 AI

LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning

تقترح هذه الورقة البحثية LiteGUI، وهو نموذج تدريب جديد خالٍ من الضبط الدقيق الموجه (SFT-free) يجمع بين التقطير الموجّه القائم على السياسة (Guided On-policy Distillation) وإطار عمل GRPO ثنائي المستوى متعدد الحلول، لتعزيز أداء وكلاء واجهة المستخدم الرسومية (GUI) خفيفة الوزن والمخصصة للأجهزة، مما يمكّن النماذج بمقياس 2B/3B من تحقيق نتائج رائدة تضاهي النماذج الأكبر حجمًا بكثير.

Yubin Wu, Zicheng Cai, Liping Ning, Hua Wang, Zhi Chen, Yaohua Tang, Hao Chen2026-05-11
🤖 AI

Model-Driven Policy Optimization in Differentiable Simulators via Stochastic Exploration

تقدم هذه الورقة البحثية "تحسين السياسة القائم على النموذج" (MDPO)، وهو إطار عمل يعزز التخطيط التفاضلي في المجالات غير الخطية والهجينة الصعبة من خلال حقن ضوضاء عشوائية تعتمد على الزمن بشكل تكيفي في فضاء العمل، مما يحسن الاستكشاف وجودة الحل مقارنة بكل من الطرق التفاضلية الحتمية والأسالسة المرجعية المتطورة غير القائمة على النماذج.

Yuval Aroosh, Ayal Taitler2026-05-11
🤖 AI

From Feasible to Practical: Pareto-Optimal Synthesis Planning

تقدم هذه الورقة MORetro*، وهو خوارزمية بحث متعددة الأهداف تولد مسارات تخليق مثالية لباريتو من خلال الموازنة بين معايير متضاربة مثل التكلفة والاستدامة، مما يوائم تخطيط التخليق بمساعدة الحاسوب مع اتخاذ القرار الصناعي في العالم الحقيقي.

Friedrich Hastedt, Dongda Zhang, Antonio del Rio Chanona2026-05-11
🤖 machine learning

Why Self-Inconsistency Arises in GNN Explanations and How to Exploit It

تتقصى هذه الورقة أسباب عدم الاتساق الذاتي في تفسيرات الشبكات العصبية الرسومية، مقترحةً فرضية تعيين الإشارة الكامنة لتفسير حساسية الحواف، ومقدمةً استراتيجية "إزالة الضجيج الذاتي" التي لا تتطلب تدريباً والتي تعمل بفعالية على معايرة التفسيرات بأقل قدر من التكاليف الحسابية.

Wenxin Tai, Yaqian Liu, Ting Zhong, Fan Zhou2026-05-11
🤖 AI

Multi-Environment POMDPs with Finite-Horizon Objectives

تثبت هذه الورقة أن حساب السياسات المثلى لعمليات اتخاذ القرار المارقة ذات البيئات المتعددة (multi-environment POMDPs) ذات الأهداف ذات الأفق المحدود هو مسألة كاملة من فئة PSPACE، كما تقدم خوارزمية عملية تتفوق بشكل كبير على الأساليب الحالية في الاختبارات المعيارية الكلاسيكية.

Léonard Brice, Filip Cano, Krishnendu Chatterjee, Thomas A. Henzinger, Stefanie Muroya2026-05-11
🤖 AI

Implicit Preference Alignment for Human Image Animation

تقترح هذه الورقة البحثية "محاذاة التفضيل الضمني" (IPA)، وهو إطار عمل فعال من حيث كفاءة البيانات لمرحلة ما بعد التدريب، يعمل على تعزيز توليد حركة اليد عالية الدقة في تحريك صور البشر من خلال محاذاة النماذج مع عينات عالية الجودة ذاتية التوليد دون الحاجة إلى بيانات تفضيل مقترنة باهظة التكلفة.

Yuanzhi Wang, Xuhua Ren, Jiaxiang Cheng, Bing Ma, Kai Yu, Tianxiang Zheng, Qinglin Lu, Zhen Cui2026-05-11
📊 statistics

Ensemble Distributionally Robust Bayesian Optimisation

تقترح هذه الورقة خوارزمية قابلة للتطبيق حاسوبياً للتحسين البايزي المتين توزيعياً بنظام التجميع، والتي تتعامل مع السياق المستمر في ظل عدم اليقين التوزيعي، محققةً حدود ندم دون خطية نظرية محسنة ومظهرةً أداءً تجريبياً قوياً.

Tigran Ramazyan, Denis Derkach2026-05-11
🤖 AI

Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding

يُعد Response-G1 إطار عمل مبتكرًا لا يتطلب ضبطًا دقيقًا، حيث يعزز الفهم الاستباقي للفيديو المتدفق من خلال نمذجة المحاذاة بين أدلة الفيديو المتراكمة وشروط الاستعلام صراحةً عبر الرسوم البيانية للمشاهد، مما يتيح اتخاذ قرارات أكثر دقة وقابلية للتفسير بشأن توقيت الاستجابة.

Ke Ma, Jiaqi Tang, Bin Guo, Xueting Han, Ruonan Xu, Qingfeng He, Ziheng Wang, Xu Wang, Qifeng Chen, Zhiwen Yu, Yunhao Li (…)2026-05-11
💬 NLP

Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States

تقدم هذه الورقة POISE، وهي طريقة للتعلم التعزيزي تستفيد من مسبار خفيف الوزن يتم تدريبه على الحالات الداخلية لنموذج السياسة لتقدير خطوط الأساس للقيمة بتكلفة ضئيلة، مما يحقق تحسيناً مستقراً وفعالاً للسياسة دون العبء الحسابي للمنتقدات المنفصلة أو عمليات التدحرج المتعددة.

Yunho Choi, Jongwon Lim, Woojin Ahn, Minjae Oh, Jeonghoon Shim, Yohan Jo2026-05-11
📊 statistics

Revisiting Transformer Layer Parameterization Through Causal Energy Minimization

تقدم هذه الورقة "تقليل الطاقة السببية" (CEM)، وهو إطار عمل يعيد تفسير طبقات الـ Transformer كخطوات تحسين على دوال طاقة شرطية لاستخلاص بنيات مقيدة وفعالة في المعلمات تضاهي النماذج المرجعية القياسية في مهام نمذجة اللغة.

Jin Xu, Camille Couturier, Victor Rühle, Saravan Rajmohan, James Hensman2026-05-11