💬 NLP

Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards

تقدم هذه الورقة نموذج مكافأة المعايير (RRM)، وهو دالة مكافأة موجهة نحو العمليات تقيم مسارات الاستدلال مقابل معايير محددة للمسألة لمعاقبة العيوب المنطقية و"الخطوات الإعجازية" بفعالية، مما يؤدي إلى تحسين دقة الاستدلال الرياضي وتقليل استغلال المكافأة بشكل كبير مقارنة بالإشراف القائم على النتيجة فقط.

Youliang Yuan, Qiuyang Mang, Jingbang Chen, Hong Wan, Xiaoyuan Liu, Junjielong Xu, Jen-tse Huang, Wenxuan Wang, Wenxiang (…)2026-04-20
💬 NLP

EvoTest: Evolutionary Test-Time Learning for Self-Improving Agentic Systems

تقدم الورقة البحثية EvoTest، وهو إطار عمل تطوري للتعلم أثناء وقت الاختبار يُمكّن الوكلاء الاصطناعيين من تحسين أدائهم ذاتياً أثناء اللعب دون الحاجة إلى تدرجات أو ضبط دقيق، وذلك عبر تطوير تكوين النظام الخاص بهم بواسطة "وكيل المطور" (Evolver Agent)، مما أظهر أداءً فائقاً على معيار Jericho Test-Time Learning (J-TTL) الجديد مقارنة بطرق التكيف الحالية.

Yufei He, Juncheng Liu, Yue Liu, Yibo Li, Tri Cao, Zhiyuan Hu, Xinxing Xu, Bryan Hooi2026-04-20
💬 NLP

FACTS: Table Summarization via Offline Template Generation with Agentic Workflows

تقدم الورقة البحثية FACTS، وهو سير عمل وكيل (agentic workflow) يقوم بإنشاء قوالب SQL وJinja2 غير قابلة للاستخدام في وضع عدم الاتصال (offline) لتمكين تلخيص الجداول المرتكز على الاستعلام بشكل سريع ودقيق ومتوافق مع الخصوصية دون الحاجة إلى ضبط دقيق مكلف أو تعريض البيانات الحساسة للخطر.

Ye Yuan, Mohammad Amin Shabani, Siqi Liu2026-04-20
💬 NLP

Wisdom is Knowing What not to Say: Hallucination-Free LLMs Unlearning via Attention Shifting

تقدم هذه الورقة إطار عمل "تحويل الانتباه" (AS)، وهو نهج مبتكر لإلغاء التعلم الآلي يوازن بين الحفاظ على المنفعة ومنع الهلوسة من خلال توظيف كبت الحفاظ على السياق وتشكيل الاستجابة المقاومة للهلوسة لإزالة المعرفة الحساسة انتقائياً من النماذج اللغوية الكبيرة دون المساس بأدائها العام.

Chenchen Tan, Youyang Qu, Xinghao Li, Hui Zhang, Shujie Cui, Cunjian Chen, Longxiang Gao2026-04-20
💬 NLP

Power to the Clients: Federated Learning in a Dictatorship Setting

تقدم هذه الورقة وتحلل "العملاء الدكتاتوريين" (dictator clients)، وهم فئة جديدة من المشاركين الخبيثين في التعلم الاتحادي القادرين على محو مساهمات العملاء الآخرين تماماً مع الحفاظ على مساهماتهم الخاصة، مستكشفةً تأثيرهم من خلال تحليل التقارب النظري والتقييمات التجريبية عبر سيناريوهات تعاونية وعدائية متنوعة.

Mohammadsajad Alipour, Mohammad Mohammadi Amiri2026-04-20
💬 NLP

Understanding New-Knowledge-Induced Factual Hallucinations in LLMs: Analysis and Interpretation

تتقصى هذه الورقة كيف يؤدي الضبط الدقيق للنماذج اللغوية الكبيرة على معارف جديدة إلى إحداث هلوسات واقعية من خلال إثبات أن درجة عدم الألفة ضمن أنواع معرفية محددة تقود هذه الأخطاء عبر إضعاف الانتباه للكيانات الرئيسية، وهي آلية يمكن التخفيف من حدتها عن طريق إعادة إدخال المعرفة المعروفة لاستعادة أنماط الانتباه.

Renfei Dang, Peng Hu, Zhejian Lai, Changjiang Gao, Min Zhang, Shujian Huang2026-04-20
💬 NLP

Reading Between the Lines: The One-Sided Conversation Problem

تقدم هذه الورقة مشكلة المحادثة أحادية الجانب (1SC) كإطار عمل للاستدلال والتعلم من تسجيلات الحوارات ذات المتحدث الواحد، مبرهنةً على أن الجمع بين سياق الدور المستقبلي وطول العبارة يحسن عملية إعادة البناء، وأن الملخصات عالية الجودة يمكن إنتاجها دون إعادة بناء الأدوار المفقودة بالكامل، مما يساهم في تطوير الذكاء الاصطناكلي للمحادثات المراعي للخصوصية.

Victoria Ebert, Rishabh Singh, Tuochao Chen, Noah A. Smith, Shyamnath Gollakota2026-04-20
⚡ electrical engineering

MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models

تقدم هذه الورقة MTR-DuplexBench، وهو معيار مرجعي جديد مصمم لتقييم نماذج لغة الكلام كاملة الازدواج (Full-Duplex) بشكل شامل عبر المحادثات متعددة الجولات من خلال معالجة تحديات مثل تداخل حدود الأدوار وعدم اتساق السياق عبر إطار تقييم متعدد الأبعاد يغطي سمات المحادثة، وجودة الحوار، واتباع التعليمات، والسلامة.

He Zhang, Wenqian Cui, Haoning Xu, Xiaohui Li, Lei Zhu, Haoli Bai, Shaohua Ma, Irwin King2026-04-20
💬 NLP

Losses that Cook: Topological Optimal Transport for Structured Recipe Generation

تقدم هذه الورقة البحثية فقدان النقل الأمثل الطوبولوجي وأهدافًا مركبة أخرى لتحسين توليد الوصفات المهيكلة، مما يظهر مكاسب كبيرة في دقة المكونات، والتماسك الإجرائي، والتفضيل البشري مقارنةً بالتدريب القياسي باستخدام الإنتروبيا المتقاطعة.

Mattia Ottoborgo, Daniele Rege Cambrin, Paolo Garza2026-04-20
💬 NLP

RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models

تقدم هذه الورقة RedBench، وهو مجموعة بيانات عالمية شاملة ومعيارية تجمع 29,362 عينة عبر 22 فئة من فئات المخاطر و19 مجالاً لمعالجة عدم الاتساق في موارد اختبار الاختراق الحالية وتمكين التقييمات المنهجية للثغرات الأمنية في النماذج اللغوية الكبيرة.

Quy-Anh Dang, Chris Ngo, Truong-Son Hy2026-04-20