💻 computer science

Ask, Condition or Abstain: Reinforcement Learning for Missing-Premise Reasoning

تقدم هذه الورقة إطار عمل التعلم المعزز ACA-RL ومعيار Missing-Premise Benchmark (MPB) اللذين يمكّنان نماذج الاستدلال من التعامل بفعالية مع الاستعلامات غير محددة المعالم عبر تعلم طلب المعلومات المفقودة، أو ربط الإجابات بالمجاهيل، أو الامتناع عن الإجابة، بدلاً من فرض استجابات غير صحيحة.

Yongqi Tong, Zhenyu Zhang, Zimi Liu, Kewei Fu, Mingli Song, Haofei Zhang, Junshao Zhang, Hong Zhu, Jiang-Ming Yang, Xin (…)2026-08-18
🤖 AI

Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning

تُعد Palmyra x6 نموذجاً لغوياً وكيلياً موجهاً للمؤسسات، يحقق أداءً هو الأفضل في فئته على معايير استخدام الأدوات من خلال نهج تدريب لاحق محافظ ومنضبط باستخدام الضبط الدقيق الخاضع للإشراف والمثبّت على مجموعة بيانات مدمجة ومحققة.

Peng Du, Kiran Kamble, Rakshith Vasudev, Zhizhuo Yang, Rohith Nadimpally, Arjun Krishna, Waseem Alshikh, Daniel M. Bikel2026-08-18
🤖 AI

When Do Explanations Help In-Context Learning? A Comparative Study of Natural Language Explanation Types and Faithfulness

تقدم هذه الورقة دراسة مقارنة عبر ستة معايير وأربعة نماذج تُظهر أنه في حين أن التفسيرات باللغة الطبيعية تعزز بشكل عام أداء التعلم داخل السياق، إلا أن فعاليتها تتباين بشكل كبير بناءً على مصدر التفسير (حيث تضاهي النماذج اللغوية الكبيرة الخارجية غالباً المبررات البشرية) واستراتيجية الاختيار، ولا سيما كشفها عن أن التصفية القائمة على الإخلاص تؤدي إلى نتائج غير متسقة وأن مقاييس الإخلاص المختلفة يمكن أن تؤدي إلى استنتاجات متباينة.

Mahdi Dhaini, Adam Dejl, Juraj Vladika, Volkan Özer, Barbara Plank, Gjergji Kasneci2026-08-18
🤖 machine learning

Toward Better Assessment of LLMs' Performance in Clinical Error Detection

تُظهر هذه الورقة أن المقاييس التجميعية القياسية مثل درجات F1 يمكن أن تكون مضللة في الكشف عن الأخطاء السريرية، حيث إنها غالبًا ما تحجب ضعف أداء التمييز الزوجي والتحيزات اللغوية في النماذج اللغوية الكبيرة، مما يستلزم اعتماد طرق تقييم زوجية من أجل تطبيقات سريرية أكثر أمانًا.

Yifan Zhang, Rahmatollah Beheshti2026-08-18
🤖 AI

Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies

تقدم هذه الورقة البحثية "Reconstruction" (إعادة البناء)، وهو معيار تقييم أعمى صُمم لاختبار ما إذا كان بإمكان النماذج اللغوية استعادة الأفكار البحثية الجوهرية للأوراق المنشورة باستخدام مراجعها السابقة للنشر فقط، مما يكشف أنه في حين تحقق النماذج الفردية نجاحًا متواضعًا، فإن خط إنتاج متعدد الوكلاء يجمع بين المراجعة عبر النماذج واختيار البطولة يحسن معدلات الاستعادة بشكل كبير لتصل إلى 23-42%.

Shaolong Chen, Yanlin Fei, Nazhou Liu, Xinmiao Yu, Lei Li, Rahul Thapa, Madalina Ciobanu, Qingqing Mao, Ritankar Das2026-08-18
💻 computer science

Does the LM Head Create a Harmful Gradient Bottleneck? A Causal Test

تتحدى هذه الورقة الفرضية القائلة بأن رأس نموذج اللغة (language-model head) يخلق عنق زجاجة ضاراً في عملية التحسين، وذلك من خلال إثبات أنه بينما يؤدي الضغط الهندسي للتدرج العكسي (backward gradient) إلى زيادة كبيرة في خسارة التحقق (validation loss)، فإن هذا التأثير أقل حدة بكثير من تأثير الرأس الأمامي المُحلل (factorized forward head)، مما يشير إلى أن إسقاط رأس نموذج اللغة ليس هو السبب الرئيسي لعدم كفاءة التدريب.

Anand Murugan2026-08-18
💻 computer science

Closing the Affective Loop: Multimodal Speaker-Listener Emotion-Dynamics-Aware Empathetic Social Robots

تقدم هذه الورقة نظام "AffectLoop"، وهو نظام روبوت اجتماعي متعدد الوسائط ومتعاطف يغلق الحلقة الوجدانية من خلال التتبع الديناميكي للحالات العاطفية لكل من المتحدث والمستمع لتوليد استجابات لفظية وجسدية متوافقة، والتي أظهرت دراسة تجريبية أنها تحسن رضا المستخدم والتعافي من الضيق بشكل ملحوظ مقارنة بالنماذج المعتمدة على النصوص فقط.

Zi Haur Pang, Casey Kennington, Tatsuya Kawahara2026-08-18
🤖 AI

Semantic Bandits: In-Context Exploration-Exploitation is Biased by Semantic Priors

تقدم هذه الورقة إطار عمل "المندوب الدلالي" (semantic bandit) لتوضيح أن مقايضات الاستكشاف والاستغلال في النماذج اللغوية الكبيرة تتأثر بشكل كبير بالبوادر الدلالية المستمدة من مرحلة ما قبل التدريب، حيث يمكن للتسميات المعلوماتية إما أن تعزز الأداء أو تضعفه اعتماداً على توافقها مع المكافآت، كما أن المكافآت السلبية تحفز الاستكشاف بشكل غير متناسب بسبب انحيازات النطاق المتوقعة.

David Eric Austin, Kaheer Suleman, Jackie Chi Kit Cheung2026-08-18
🤖 AI

Policy Iteration with Human Feedback: Bringing Post-Training RL to In-context Learning

تقدم هذه الورقة البحثية "تكرار السياسة مع التغذية الراجعة البشرية" (PIHF)، وهو إطار عمل يستفيد من ناقد يعتمد على نموذج لغوي وإشراف خبير سريري لتحسين السياسات ذات اللغة الطبيعية لتشخيص الأمراض النادرة بشكل تكراري، مما يظهر مكاسب كبيرة في الأداء عبر أحجام نماذج متنوعة دون تغيير أوزانها الأساسية.

Minh-Ha Nguyen, Cathy Shyr2026-08-18
🤖 machine learning

Proteus: Incremental Memory Activation for Long-Context Sequence Modeling

تقدم الورقة البحثية "Proteus"، وهو نموذج جديد للتنشيط التدريجي للذاكرة يعمل على توسيع سعة الذاكرة الفعالة بشكل تصاعدي للتخفيف من تداخل الرموز المبكر وتحسين القدرة على الاستبقاء، مما يظهر مكاسب أداء ثابتة عبر مختلف النماذج الرائدة ذات السياق الطويل.

Reza Bayat, Ali Behrouz, Vahab Mirrokni, Aaron Courville2026-08-18