🤖 machine learning

Hölder Policy Optimisation

تقدم هذه الورقة HölderPO، وهو إطار عمل لتعظيم السياسة المعممة يعمل على ضبط معامل متوسط هولدر ديناميكيًا لموازنة تركيز التدرج واستقرار التباين، مما يحل قيود التجميع الثابت في تحسين السياسة النسبية للمجموعات (GRPO) ويحقق أداءً هو الأفضل في فئته على الاختبارات المرجعية الرياضية والموجهة نحو المهام.

Yuxiang Chen, Dingli Liang, Yihang Chen, Ziqin Gong, Chenyang Le, Zhaokai Wang, Jiachen Zhu, Lingyu Yang, Jianghao Lin (…)2026-05-13
🤖 machine learning

Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction

تحدد هذه الورقة مشكلة "اللوجيتس القديمة المفقودة" (missing old logits) الحرجة في التعلم التعزيزي الوكيل غير المتزامن التي تعطل دلالات التصحيح خارج السياسة، وتقترح ثلاث استراتيجيات دقيقة وطريقة تقريبية لاستعادة أو تقريب هذه القيم، وتوضح أن نهج PPO-EWMA المنقح يحسن بشكل كبير من سرعة التدريب وأداء التحسين.

Zhong Guan, Yongjian Guo, Haoran Sun, Wen Huang, Shuai Di, Xiong Jun Wu, Likang Wu, Hongke Zhao2026-05-13
🤖 AI

Clausal Deletion Backdoors for QBF: a Parameterized Complexity Approach

تقدم هذه الورقة نهجاً للتعقيد المُعلمي لصيغ بول (QBF) باستخدام الأبواب الخلفية لحذف البنود، حيث تثبت أنه بينما يعد إيجاد مثل هذه الأبواب الخلفية لصيغ هورن (Horn formulas) صعباً من فئة W[1]، فإن المشكلة تصبح قابلة للحل في وقت محدد بمعلم (FPT) لفئات القواعد الأساسية لـ 2-CNF والمعادلات الخطية، مما يعزز الفهم النظري لقابلية حل صيغ بول (QBF) بما يتجاوز قيود البادئة التقليدية.

Leif Eriksson, Victor Lagerkvist, Sebastian Ordyniak, George Osipov, Fahad Panolan, Mateusz Rychlicki2026-05-13
🤖 AI

The Deepfakes We Missed: We Built Detectors for a Threat That Didn't Arrive

تجادل هذه الورقة الموقفية بأن تركيز مجتمع تعلم الآلة لمدة عقد من الزمن على كشف التزييف العميق للشخصيات العامة قد انحرف عن الواقع، حيث تحولت التهديدات المهيمنة الفعلية إلى الصور الحميمة غير الرضائية، وعمليات الاحتيال عبر استنساخ الصوت، والاحتيال العاطفي، مما خلق عنق زجاجة حرجاً في الدفاع الواقعي يتطلب إعادة توازن فورية لأجندات البحث.

Shaina Raza2026-05-13
⚡ electrical engineering

Learning What Matters: Adaptive Information-Theoretic Objectives for Robot Exploration

تقترح هذه الورقة تصميم التجربة شبه الأمثل (QOED)، وهو هدف معلوماتي تكيفي يعزز استكشاف الروبوت من خلال تحديد اتجاهات المعلمات القابلة للملاحظة وتثبيط التأثيرات المزعجة، مما يحسن بشكل كبير من كفاءة البيانات وأداء السياسة في كل من المهام المحاكية والواقعية.

Youwei Yu, Jionghao Wang, Zhengming Yu, Wenping Wang, Lantao Liu2026-05-13
🤖 AI

Autonomy and Agency in Agentic AI: Architectural Tactics for Regulated Contexts

تقترح هذه الورقة إطار عمل مبدئي لنشر الذكاء الاصطناعي الوكيل في السياقات التنظيمية من خلال تقديم فضاء تصميم ثنائي الأبعاد مقترن من الاستقلالية والوكالة، مدعوم بستة تكتيكات معمارية ومعايير نشر رئيسية لضمان أن تكون المسؤولية والقابلية للتدقيق والقابلية للتراجع متأصلة في تصميم النظام.

Damir Safin, Dian Balta2026-05-13
🤖 AI

Large Language Models as Amortized Pareto-Front Generators for Constrained Bi-Objective Convex Optimization

تقدم الورقة البحثية إطار عمل DIPS، وهو إطار عمل متكامل (end-to-end) يعمل على ضبط النماذج اللغوية الكبيرة لإنتاج جبهات باريتو (Pareto fronts) عالية الجودة وقابلة للتنفيذ مباشرة من الأوصاف النصية لمسائل الأمثلة المحدبة ثنائية الأهداف المقيدة، محققاً أداءً يقارب المثالية مع أوقات استدلال أسرع بكثير مقارنة بالطرق التكرارية التقليدية.

Peipei Xu, SiYuan Ma, Yaohua Liu, Yu Wu, Guanliang Liu, Yang Zhang, Yong Liu2026-05-13
🤖 AI

It's Not the Size: Harness Design Determines Operational Stability in Small Language Models

تُثبت هذه الورقة أنه بالنسبة للنماذج اللغوية الصغيرة (2-3 مليار معلمة)، فإن خط أنابيب هيكلي مكون من 4 مراحل يتفوق بشكل كبير على التلقين الخام أو الأغلفة الدنيا من حيث الاستقرار التشغيلي والنجاح في المهام، بينما يكشف أيضاً أن السقالات غير الكافية يمكن أن تؤدي إلى انهيار في التنسيق الهيكلي في نماذج معينة.

Yong-eun Cho2026-05-13✓ Author reviewed ⓘ
🤖 AI

Rollout Cards: A Reproducibility Standard for Agent Research

تتناول هذه الورقة تحديات قابلية التكرار في أبحاث الوكلاء من خلال تقديم "بطاقات التدفق" (rollout cards)، وهي تنسيق نشر معياري يحفظ سجلات التدفق الخام ويعلن صراحةً عن قواعد التقارير لضمان تقييم شفاف وقابل للتحقق للأنظمة الوكيلية.

Charlie Masters, Ziyuan Liu, Stefano V. Albrecht2026-05-13✓ Author reviewed ⓘ
🤖 AI

BoolXLLM: LLM-Assisted Explainability for Boolean Models

تقدم هذه الورقة البحثية BoolXLLM، وهو إطار عمل هجين يدمج النماذج اللغوية الكبيرة في مسار تعلم القواعد البولينية لتعزيز القابلية للتفسير لأصحاب المصلحة غير التقنيين من خلال توجيه اختيار الميزات، والتوصية بعتبات ذات معنى، وترجمة القواعد المنطقية الرسمية إلى تفسيرات باللغة الطبيعية سهلة الوصول مع الحفاظ على أداء تنبؤي تنافسي.

Du Cheng, Serdar Kadioglu, Xin Wang2026-05-13