💬 NLP

EpiCurveBench: Evaluating VLMs on Epidemic Curve Digitization

تقدم هذه الورقة EpiCurveBench، وهو معيار مرجعي يتكون من 1,000 صورة لمنحنيات وبائية من العالم الحقيقي، وEpiCurveSimilarity (ECS)، وهو مقياس تقييم مبتكر يأخذ في الاعتبار البنية الزمنية والإزاحات المحلية، لإثبات أن نماذج الرؤية واللغة الحالية تعاني في رقمنة المنحنيات الوبائية وأن ECS يوفر تقييماً أكثر تمييزاً وذات صلة وبائية من مقاييس القيم المفتاحية الموجودة حالياً.

Thomas Berkane, Maimuna S. Majumder2026-05-27
💬 NLP

GraphReview: Scientific Paper Evaluation via LLM-Based Graph Message Passing

يُعد GraphReview إطار عمل جديداً للنماذج اللغوية الكبيرة القائم على الرسوم البيانية، والذي يعزز تقييم الأوراق العلمية من خلال نمذجة الجودة الجوهرية والعلاقات المتبادلة بين الأوراق عبر تمرير الرسائل على رسم بياني دلالي، محققاً تحسينات ملحوظة في دقة اتخاذ القرار، والترتيب، وتوليد المراجعات مقارنة بالنماذج المرجعية الحالية.

Pujun Zheng, Wanying Ren, Jiacheng Yao, Guoxiu He, Star X. Zhao2026-05-27
💬 NLP

Temporal Simultaneity Predicts Annotation Quality in Sentiment Corpora

تقدم هذه الورقة مجموعة بيانات لمشاعر لغة التسوانا وتثبت أن التزامن الزمني —الفجوة الزمنية بين عمليات التصنيف— هو المتنبئ الرئيسي لاتفاق المقيّمين، مع تحقيق اتساق شبه مثالي عندما يتم تعيين الملصقات في غضون دقيقة واحدة مقارنة بانحراف كبير عبر فترات أطول، مع قياس أداء النماذج متعددة اللغات التي تحقق أداءً قويًا بعد الضبط الدقيق.

Idris Abdulmumin, Mokgadi Penelope Matloga, Tadesse Destaw Belay, Botshelo Kondowe, Letlhogonolo Mohleleng, Hareaipha Nk (…)2026-05-27
💬 NLP

ENPMR-Bench: Benchmarking Proactive Memory Retrieval for Emotional Support Agents

تقدم هذه الورقة البحثية ENPMR-Bench، وهو معيار مرجعي يتكون من أكثر من 1,800 حوار مستند إلى هرم ماسلو للاحتياجات لتقييم استرجاع الذاكرة الاستباقي المدرك للاحتياجات العاطفية، مما يكشف أن نماذج الاسترجاع الحالية تعاني بشكل كبير في استنتاج الاحتياجات العاطفية الكامنة واسترجاع الذكريات الداعمة بشكل استباقي للتفاعل التعاطفي.

Xing Fu, Yulin Hu, Mengtong Ji, Haozhen Li, Yixin Sun, Weixiang Zhao, Yanyan Zhao, Bing Qin2026-05-27
🤖 AI

Gumbel Machine: Counterfactual Student Writing Generation via Gumbel Noise Steering

تقدم الورقة البحثية "آلة غامبل" (Gumbel Machine)، وهي إطار عمل معياري يستخدم خوارزمية فك تشفير جديدة تعتمد على التحكم بـ β\beta-Hindsight مع ضوضاء غامبل (Gumbel noise) لتوليد كتابات طلابية مضادة (counterfactual) متسقة مع المعايير، توازن بفعالية بين تحسين الجودة والتشابه مع العمل الأصلي.

Hunter McNichols, Alexander Scarlatos, Mihai Dascalu, Danielle McNamara, Andrew Lan2026-05-27
💬 NLP

Pair-In, Pair-Out: Latent Multi-Token Prediction for Efficient LLMs

تقترح الورقة البحثية إطار عمل "الزوج الداخل، الزوج الخارج" (PIPO)، وهو إطار عمل موحد يجمع بين ضغط المدخلات الكامن مع التنبؤ بمخرجات متعددة الرموز وآلية قبول خفيفة الوزن قائمة على الثقة، وذلك لتحقيق تسريع كبير في زمن الاستجابة وتحسين أداء الاستنتاج في النماذج اللغوية الكبيرة دون عبء عملية التحقق المنفصلة.

Wenhui Tan, Minghao Li, Xiaoqian Ma, Siqi Fan, Xiusheng Huang, Liujie Zhang, Ruihua Song, Weihang Chen2026-05-27
💬 NLP

Lost in Sampling: Assessing Lexical Reachability in LLMs via the Word Coverage Score (WCS)

تقدم هذه الورقة "درجة تغطية الكلمات" (WCS)، وهي مقياس يوضح أن مرشحات أخذ عينات فك التشفيد القياسية في النماذج اللغوية الكبيرة تعمل بشكل منهجي على استبعاد المفردات البشرية منخفضة التكرار والمناسبة سياقياً، مما يجعلها تعمل كآليات رقابة غير مقصودة تقمع التنوع المعجمي وتجعل النصوص المولدة متجانسة.

Samer Awad, Javier Conde, Carlos Arriaga, Tairan Fu, Javier Coronado-Blázquez, Pedro Reviriego2026-05-27
💬 NLP

It's Not Always Sycophancy: Measuring LLM Conformity as a Function of Epistemic Uncertainty

تقدم هذه الورقة إطار عمل MUSE، الذي يوضح أن امتثال النماذج اللغوية الكبيرة (LLMs) لاعتراض المستخدم لا ينبع من التملق فحسب، بل أيضاً من عدم اليقين المعرفي، حيث يزداد كلا العاملين بناءً على الخبرة المتصورة للمستخدم ومدى معقولية مقترحاته.

Kevin H. Guo, Chao Yan, Avinash Baidya, Katherine Brown, Xiang Gao, Juming Xiong, Zhijun Yin, Bradley A. Malin2026-05-27
💬 NLP

Separating Semantic Competition from Context Length in RAG Reading

تقدم هذه الورقة بروتوكول تحكم متوافق لإثبات أن إخفاقات قارئ استرجاع المعزز بالاسترجاع (RAG) تنبع من التنافس الدلالي بين الفقرات المسترجعة وليس مجرد زيادة طول السياق، مما يظهر أن استبدال المنافسين الصعاب بفقرات أقل صلة يحسن بشكل كبير مقاييس الأداء مثل التطابق التام، وتضمين الإجابة، ودرجات F1.

Vyzantinos Repantis, Ameya Gawde, Harshvardhan Singh, Rohit Alekar, Cien Zhang, Svetlana Karslioglu, Akash Vishwakarma2026-05-27
💬 NLP

Probing Cultural Awareness in LLMs: A Case Study of Cross-Culture Aesthetic Stylistics

تقدم هذه الورقة البحثية معيار C4STYLI لتقييم الأساليب الجمالية عبر الثقافات لنماذج اللغات الكبيرة في سياقي هونج كونج والصين البر الرئيسي، كاشفةً أنه بينما تُظهر النماذج قدرات متفاوتة في التعرف والتوليد، فإن تعرُّفها غالبًا ما يعتمد على إشارات لغوية سطحية بدلاً من البنى الأسلوبية العميقة، مما يشير إلى حساسية ثقافية حقيقية محدودة.

Jiashuo Wang, Fenggang Yu, Jian Wang, Chak Tou Leong, Xiaoyu Shen, Chunpu Xu, Jiawen Duan, Wenjie Li, Johan F. Hoorn2026-05-27