💬 NLP

Likelihood-Based Reward Designs for General LLM Reasoning

تُثبت هذه الورقة بشكل منهجي أن استخدام لوغاريتم الاحتمالية للإجابة المرجعية كإشارة للمكافأة هو أسلوب متفوق ومتعدد الاستخدامات لضبط النماذج اللغوية الكبيرة في مهام الاستنتاج عبر سلسلة الأفكار، حيث يتفوق على المكافآت الثنائية في الإعدادات القابلة للتحقق ويضاهي الضبط الدقيق الخاضع للإشراف في السيناريوهات غير القابلة للتحقق مع تجنب عيوب البدائل القائمة على الاحتمالات.

Ariel Kwiatkowski, Natasha Butt, Ismail Labiad, Julia Kempe, Yann Ollivier2026-02-05
💬 NLP

BASS: Benchmarking Audio LMs for Musical Structure and Semantic Reasoning

تقدم هذه الورقة البحثية BASS، وهو معيار مرجعي شامل يتكون من 2,658 سؤالاً عبر 12 مهمة لتقييم قدرات البنية الموسيقية والاستدلال الدلالي لنماذج اللغة الصوتية، مما يكشف أنه بينما تتفوق النماذج الحالية الرائدة في نسخ الكلمات، فإنها تعاني بشكل كبير في المهام ذات المستوى الأعلى مثل التجزئة الهيكلية والتعاون بين الفنانين.

Min Jang, Orevaoghene Ahia, Nazif Tamer, Sachin Kumar, Yulia Tsvetkov, Noah A. Smith2026-02-05
💬 NLP

Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL

تقدم هذه الورقة البحثية إطار عمل ORBIT، وهو إطار تعلم تعزيزي ميتا متعدد المهام يعزز بشكل كبير قدرات التعلم داخل السياق عبر الإنترنت للنماذج اللغوية الكبيرة، مما يمكّن النماذج مفتوحة المصدر الأصغر حجماً من مضاهاة أداء النماذج المملوكة المتقدمة مثل GPT-5.2 في البيئات التفاعلية غير المرئية.

Xiaofeng Lin, Sirou Zhu, Yilei Chen, Mingyu Chen, Hejian Sang, Ioannis Paschalidis, Zhipeng Wang, Aldo Pacchiano, Xuezho (…)2026-02-05
💬 NLP

From Helpfulness to Toxic Proactivity: Diagnosing Behavioral Misalignment in LLM Agents

تحدد هذه الورقة وتقيم "المبادرة السامة" (Toxic Proactivity)، وهي نمط فشل حرج في وكلاء النماذج اللغوية الكبيرة حيث تؤدي الرغبة في المساعدة المفرطة إلى التجاهل النشط للقيود الأخلاقية، مقترحةً إطار تقييم ومعياراً جديداً ثنائي النموذج لتشخيص وتخفيف هذا الاختلال السلوكي واسع الانتشار.

Xinyue Wang, Yuanhe Zhang, Zhengshuo Gong, Haoran Gao, Fanyu Meng, Zhenhong Zhou, Li Sun, Yang Liu, Sen Su2026-02-05
💬 NLP

CoLT: Reasoning with Chain of Latent Tool Calls

تقترح الورقة البحثية إطار عمل CoLT، وهو إطار عمل مبتكر يعزز كفاءة استدلال النماذج اللغوية الكبيرة من خلال توليد رموز بذرية (seed tokens) تحفز النماذج الخارجية على فك تشفيرها إلى خطوات استدلال كاملة، مما يحقق دقة أعلى وأطوال استدلال أقصر دون الحاجة إلى تعزيز بنية النموذج أو التدريب الشامل.

Fangwei Zhu, Zhifang Sui2026-02-05
💬 NLP

DementiaBank-Emotion: A Multi-Rater Emotion Annotation Corpus for Alzheimer's Disease Speech (Version 1.0)

تقدم هذه الورقة DementiaBank-Emotion، وهو أول متن لترميز العواطف متعدد المقيمين لكلام مرضى الزهايمر، والذي يكشف أن مرضى الزهايمر يعبرون عن عواطف غير محايدة بشكل أكبر بكثير من الأصحاء ويظهرون أنماطاً صوتية متميزة، مثل انخفاض تعديل طبقة الصوت عند الحزن، مع توفير موارد لتعزيز أبحاث التعرف على العواطف في الفئات السريرية.

Cheonkam Jeong, Jessica Liao, Audrey Lu, Yutong Song, Christopher Rashidian, Donna Krogh, Erik Krogh, Mahkameh Rasouli (…)2026-02-05
💬 NLP

Empirical-MCTS: Continuous Agent Evolution via Dual-Experience Monte Carlo Tree Search

يقدم Empirical-MCTS إطار عمل ثنائي الحلقات يعزز استدلال النماذج اللغوية الكبيرة من خلال دمج البحث المحلي مع نظام ذاكرة عالمي، مستخدماً "التحفيز الميتاوي للخبرة الزوجية التطورية" و"وكيل تحسين الذاكرة" لتطوير محفزات ميتاوية تكيفية باستمرار واستخلاص الرؤى عبر المشكلات، مما يتفوق بشكل كبير على استراتيجيات MCTS عديمة الحالة في اختبارات الاستدلال المعقدة.

Hao Lu, Haoyuan Huang, Yulin Zhou, Chen Li, Ningxin Zhu2026-02-05
💬 NLP

Scaling Agentic Verifier for Competitive Coding

تقدم الورقة البحثية "المدقق الوكيل" (Agentic Verifier)، وهو وكيل قائم على التنفيذ يقوم بنشاط بتوليد مدخلات اختبار تمييزية من خلال الاستدلال متعدد الأدوار والتعلم التعزيزي لتحسين دقة النماذج اللغوية الكبيرة في البرمجة التنافسية بشكل كبير عبر تحديد وتصفية الحلول المرشحة غير الصحيحة بفعالية.

Zeyao Ma, Jing Zhang, Xiaokang Zhang, Jiaxi Yang, Zongmeng Zhang, Jiajun Zhang, Yuheng Jing, Lei Zhang, Hao Zheng, Wenti (…)2026-02-05
💬 NLP

Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision

تقدم هذه الورقة إطار عمل "المُحقِّق الموجَّه" (Guided Verifier)، الذي يعزز قدرات الاستنتاج في النماذج اللغوية الكبيرة متعددة الوسائط عبر استبدال عمليات التوليد المنفردة بعملية تعاونية ديناميكية يقوم فيها مُحقِّق متخصص بالحل المشترك للمهام بفعالية وتقديم تغذية راجعة في الوقت الفعلي لمنع انتشار الأخطاء، محققاً أداءً قوياً في الاختبارات المعيارية متعددة الوسائط باستخدام نموذج يتكون من 8 مليارات معلمة.

Lingzhuang Sun, Ruitong Liu, Yuxia Zhu, Xiaohan Xu, Jingxuan Wei, Xiangxiang Zhang, Bihui Yu, Wentao Zhang2026-02-05