🤖 machine learning

Collaborative Yet Personalized Policy Training: Single-Timescale Federated Actor-Critic

تقترح هذه الورقة إطار عمل "ممثل-ناقد" اتحادي أحادي المقياس الزمني يوازن بين التعلم التعاوني والتخصيص من خلال مشاركة فضاء جزئي خطي مشترك مع الحفاظ على مكونات السياسة المحلية، محققاً تقارباً في زمن محدد مع تسريع خطي بالنسبة لعدد الوكلاء، ومظهراً أداءً فائقاً في المهام غير المتجانسة.

Leo Muxing Wang, Pengkun Yang, Lili Su2026-05-15
💻 computer science

Efficient Generative Retrieval for E-commerce Search with Semantic Cluster IDs and Expert-Guided RL

تقدم هذه الورقة البحثية CQ-SID وEG-GRPO، وهو إطار عمل استرجاع توليدي عملي للتجارة الإلكترونية يستفيد من معرفات العناقيد الدلالية الهرمية والتعلم المعزز الموجه بالخبراء لتحقيق تحسينات كبيرة في كفاءة الاستدعاء، ومحاذاة الترتيب، ومقاييس الأعمال الرئيسية مثل إجمالي قيمة البضائع (GMV) في أنظمة الإنتاج الواقعية.

Jianbo Zhu, Xing Fang, Jing Wang, Mingmin Jin, Bokang Wang, Guangxin Song, Zhenyu Xie, Junjie Bai2026-05-15
🤖 machine learning

Prompting Policies for Multi-step Reasoning and Tool-Use in Black-box LLMs with Iterative Distillation of Experience

تقترح هذه الورقة إطار عمل للتعلم التعزيزي يعمل على تحسين نموذج "مُحفز" (prompter) خفيف الوزن من خلال التقطير التكراري للخبرة لتعزيز قدرات الاستدلال متعدد الخطوات واستخدام الأدوات للنماذج اللغوية الكبيرة (LLMs) ذات الصندوق الأسود والمجمدة بشكل كبير، محققةً أداءً وكفاءة في العينات يتفوقان على النماذج التطورية المرجعية الحالية.

Krishna Sayana, Ketan Todi, Ambarish Jash2026-05-15
💻 computer science

Stateful Reasoning via Insight Replay

تقدم هذه الورقة البحثية **InsightReplay**، وهي طريقة استدلال حالة (stateful) تقوم باستخراج وإعادة تشغيل الرؤى الوسيطة الحرجة بشكل دوري بالقرب من حدود التوليد لمنع تدهور الانتباه في مسارات "سلسلة الأفكار" (Chain-of-Thought) الطويلة، مما يحقق تحسينات متسقة في الدقة عبر مختلف أحجام النماذج ومعايير الاستدلال.

Bin Lei, Caiwen Ding, Jiachen Yang, Ang Li, Xin Eric Wang2026-05-15
💻 computer science

OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance

يُعد OmniDrop إطار عمل لتقليم الرموز (tokens) على مستوى الطبقات وخالٍ من التدريب للنماذج اللغوية الكبيرة متعددة الوسائط، حيث يستخدم استعلامات نصية ودرجة تنوع زمني لإزالة الرموز السمعية البصرية الزائدة تدريجياً داخل طبقات فك التشفيد، مما يحقق انخفاضاً كبيراً في زمن الاستجابة واستهلاك الذاكرة مع التفوق على النماذج المرجعية الحالية في الأداء.

Yeo Jeong Park, Hyemi Jang, Minseo Choi, Jongsun Lee, Jooyoung Choi, Yongkweon Jeon2026-05-15
💻 computer science

From Table to Cell: Attention for Better Reasoning with TABALIGN

تقدم الورقة البحثية TABALIGN، وهو إطار عمل استدلالي مبتكر يستفيد من مخطط لغوي يعتمد على نموذج الانتشار المقنع ومدقق تحقق يعتمد على انتباه تجذير الخلايا للتغلب على قيود النماذج ذات التوليد الذاتي في الاستدلال متعدد الخطوات على الجداول، محققاً مكاسب كبيرة في الدقة والكفاءة عبر ثمانية معايير قياسية.

Tung Sum Thomas Kwok, Zeyong Zhang, Xinyu Wang, Chunhe Wang, Xiaofeng Lin, Hanwei Wu, Lei Ding, Guang Cheng, Zhijiang Gu (…)2026-05-15
💻 computer science

LEMON: Learning Executable Multi-Agent Orchestration via Counterfactual Reinforcement Learning

يُعد LEMON منسقاً جديداً يعتمد على النماذج اللغوية الكبيرة (LLM)، يستخدم التعلم المعزز القائم على التفكير المضاد لتوليد مواصفات متعددة الوكلاء قابلة للتنفيذ عبر دمج الأدوار، والواجبات، والقدرات، والارتباطات، محققاً أداءً رائداً في مختلف معايير الاستدلال والبرمجة.

Xudong Chen, Yixin Liu, Hua Wei, Kaize Ding2026-05-15
💻 computer science

Head Forcing: Long Autoregressive Video Generation via Head Heterogeneity

تقترح الورقة البحثية "Head Forcing"، وهو إطار عمل لا يتطلب تدريباً، يعمل على تخفيف تراكم الأخطاء وفقدان السياق في توليد الفيديو بالتسلسل التلقائي الطويل عبر تخصيص استراتيجيات مختلفة لمخزن (KV cache) لرؤوس الانتباه المتباينة وظيفياً، مما يتيح التوليد لمدة دقائق والتفاعل مع مطالبات متعددة دون تدريب إضافي.

Jiahao Tian, Yiwei Wang, Gang Yu, Chi Zhang2026-05-15
💻 computer science

Deepchecks: Evaluating Retrieval-Augmented Generation (RAG)

تقدم هذه الورقة Deepchecks، وهو إطار عمل شامل مصمم لمعالجة التحديات المعقدة لتقييم أنظمة التوليد المعزز بالاسترجاع (RAG) من خلال توفير تقييم متعدد الأوجه، وتحليل الأسباب الجذرية، ومراقبة الإنتاج لضمان الموثوقية، والصلة، والتوافق مع المتطلبات الخاصة بالتطبيق.

Assaf Gerner, Netta Madvil, Nadav Barak, Alex Zaikman, Jonatan Liberman, Liron Hamra, Rotem Brazilay, Shay Tsadok, Yaron (…)2026-05-15
💻 computer science

PROVE: A Perceptual RemOVal cohErence Benchmark for Visual Media

تقدم هذه الورقة إطار عمل PROVE، الذي يتكون من مقياسي RC-S وRC-T المتوافقين مع الإدراك ومجموعة بيانات PROVE-Bench، لمعالجة أوجه القصور في طرق التقييم الحالية من خلال توفير تقييم أكثر دقة لتماسك إزالة الكائنات في الوسائط المرئية بما يتوافق بشكل أفضل مع الحكم البشري.

Fuhao Li, Shaofeng You, Jiagao Hu, Yu Liu, Yuxuan Chen, Zepeng Wang, Fei Wang, Daiguo Zhou, Jian Luan2026-05-15