💬 NLP

TRN-R1-Zero: Text-rich Network Reasoning via LLMs with Reinforcement Learning Only

تقترح الورقة البحثية TRN-R1-Zero، وهو إطار عمل لما بعد التدريب يتيح الاستنتاج صفري المعرفة (zero-shot reasoning) على الشبكات الغنية بالنصوص من خلال التحسين المباشر للنماذج اللغوية الكبيرة الأساسية عبر التعلم التعزيزي باستخدام آلية مكافأة مبتكرة تراعي الجوار، مما يلغي الحاجة إلى الضبط الدقيق الخاضع للإشراف أو التقطير مع تحقيق أداء فائق عبر مختلف الاختبارات المعيارية ومستويات المهام.

Yilun Liu, Ruihong Qiu, Zi Huang2026-04-22
💬 NLP

HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing

تقدم هذه الورقة HoWToBench، وهو معيار صيني واسع النطاق للكتابة، وتقترح شجرة الكتابة (ToW)، وهو إطار تقييم ذو بنية شجرية يعمل على نمذجة تجميع الميزات الفرعية بشكل صريح لتحقيق ارتباط عالٍ مع الأحكام البشرية ومتانة ضد الاضطرابات النصية، مما يعالج أوجه القصور في المقاييس الحالية في تقييم قدرات الكتابة لدى النماذج اللغوية الكبيرة التي تضاهي المستوى البشري.

Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Lin Fan, Yilin Zhou, Zikang Wang, Xiaotao Gu, Jie Tang, Hongning Wang, Minlie (…)2026-04-22
💬 NLP

The Rise of Verbal Tics in Large Language Models: A Systematic Analysis Across Frontier Models

تحلل هذه الورقة بشكل منهجي انتشار اللزمات اللفظية التكرارية عبر ثمانية من النماذج اللغوية الكبيرة المتطورة، حيث تقدم "مؤشر اللزمة اللفظية" للكشف عن تباينات كبيرة بين النماذج، وعلاقة عكسية قوية بين التملق والواقعية المتصورة، وتراكم هذه الأنماط الاصطناعية كنتيجة لبارادايغمات تدريب المحاذاة الحالية.

Shuai Wu, Xue Li, Yanna Feng, Yufang Li, Zhijun Wang, Ran Wang2026-04-22
💬 NLP

How Do Answer Tokens Read Reasoning Traces? Self-Reading Patterns in Thinking LLMs for Quantitative Reasoning

تستقصي هذه الورقة كيفية انتباه رموز الإجابة في النماذج اللغوية الكبيرة التي تعتمد على التفكير إلى مسارات الاستدلال أثناء المهام الكمية، حيث تحدد نمط "القراءة الذاتية الحميدة" المرتبط بالصحة، وتستفيد من هذه الرؤية لاقتراح طريقة توجيه خالية من التدريب تعمل على تحسين الدقة عبر توجيه الاستدلال نحو انتباه منظم ومرتكز على الأدلة.

Haoyang Chen, Yi Liu, Jianzhi Shao, Tao Zhang, Chengfu Huo, Wei Hu2026-04-22
💬 NLP

SCURank: Ranking Multiple Candidate Summaries with Summary Content Units for Enhanced Summarization

تقدم الورقة البحثية إطار عمل SCURank، الذي يعمل على تحسين تلخيص النصوص من خلال الاستفادة من وحدات محتوى الملخص (SCUs) لترتيب المرشحات المتنوعة التي تولدها النماذج اللغوية الكبيرة (LLMs) بفعالية، مما يتفوق بذلك على المقاييس التقليدية وطرق الترتيب غير المستقرة القائمة على النماذج اللغوية الكبيرة في تقطير الملخصات عالية الجودة إلى النماذج اللغوية الصغيرة.

Bo-Jyun Wang, Ying-Jia Lin, Hung-Yu Kao2026-04-22
💬 NLP

Talking to a Know-It-All GPT or a Second-Guesser Claude? How Repair reveals unreliable Multi-Turn Behavior in LLMs

تتقصى هذه الورقة كيفية تعامل النماذج اللغوية الكبيرة مع الإصلاح الحواري في الحوارات الرياضية متعددة الأدوار، كاشفةً أن النماذج المختلفة تُظهر أنماطاً متميزة وغير متوقعة من عدم الموثوقية، تتراوح بين المقاومة الجامدة والقابلية المفرطة للتأثر بتصحيح المستخدم.

Clara Lachenmaier, Hannah Bultmann, Sina Zarrieß2026-04-22
💬 NLP

Towards a Linguistic Evaluation of Narratives: A Quantitative Stylistic Framework

تقترح هذه الورقة إطاراً أسلوبياً كمياً يستخدم 33 سمة لغوية لتقييم الجودة السردية تلقائياً، حيث نجحت في التمييز بين النصوص الاحترافية وتلك ذات النشر الذاتي، متفوقةً على المقاييس التقليدية عند التحقق منها مقابل التقييمات البشرية.

Alessandro Maisto2026-04-22
💬 NLP

CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks

تقدم الورقة البحثية CulturALL، وهو معيار شامل يتكون من 2,610 مهمة قائمة على السياق عبر 14 لغة و51 منطقة، صُمم لتقييم الكفاءة متعددة اللغات والثقافات للنماذج اللغوية الكبيرة بدقة في سيناريوهات واقعية غنية بالسياق حيث تظهر النماذج الحالية مجالاً كبيراً للتحسين.

Peiqin Lin, Chenyang Lyu, Wenjiang Luo, Haotian Ye, Md Mehrab Hossain, Chunlan Ma, Shaoxiong Ji, Younes Samih, Bo Zeng (…)2026-04-22
💬 NLP

Beyond Semantic Similarity: A Component-Wise Evaluation Framework for Medical Question Answering Systems with Health Equity Implications

تقدم هذه الورقة البحثية VB-Score، وهو إطار تقييم قائم على المكونات يكشف عن إخفاقات حادة في الأداء وتفاوتات كبيرة في العدالة الصحية في النماذج اللغوية الكبيرة الطبية الحالية، مما يثبت أن التشابه الدلالي وحده غير كافٍ لضمان الدقة والسلامة الطبية.

Abu Noman Md Sakib, Md. Main Oddin Chisty, Zijie Zhang2026-04-22