💬 NLP

Tracing the Arrow of Time: Diagnosing Temporal Information Flow in Video-LLMs

تشخص هذه الورقة ضعف قدرات الاستدلال الزمني في النماذج اللغوية الكبيرة للفيديو (Video-LLMs) من خلال تحديد الاختناقات في كل من تصميمات المشفرات البصرية وجهاز الإسقاط (projector)، مما أدى إلى بنية جديدة تحقق أداءً يقارب المثالية في مهمة "سهم الزمن" (Arrow-of-Time) وتحسن بشكل كبير معايير الاستدلال الزمني الأوسع.

Peitao Han, Fei Cheng, Lis K. Pereira, Qianying Liu, Shigeru Kitazawa2026-05-11
💬 NLP

Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States

تقدم هذه الورقة POISE، وهي طريقة للتعلم التعزيزي تستفيد من مسبار خفيف الوزن يتم تدريبه على الحالات الداخلية لنموذج السياسة لتقدير خطوط الأساس للقيمة بتكلفة ضئيلة، مما يحقق تحسيناً مستقراً وفعالاً للسياسة دون العبء الحسابي للمنتقدات المنفصلة أو عمليات التدحرج المتعددة.

Yunho Choi, Jongwon Lim, Woojin Ahn, Minjae Oh, Jeonghoon Shim, Yohan Jo2026-05-11
💬 NLP

Intent-Driven Semantic ID Generation for Grounded Conversational News Recommendation

تقترح هذه الورقة إطار عمل لتوليد المعرفات الدلالية (Semantic ID) القائم على النوايا ضمن نموذج "التوليد ثم المطابقة" (Generate-then-Match)، وذلك باستخدام تدريب ثنائي المراحل واستدلال مزدوج الإشارات المدرك للملف الشخصي للتغلب على اختناقات الاسترجاع في توصية الأخبار الحوارية، محققةً انعدام الهلوسة وأداءً يتفوق على النماذج المرجعية القائمة على GPT-4 بتكلفة أقل بكثير.

Hongyang Su, Beibei Kong, Lei Cheng, Chengxiang Zhuo, Zang Li, Chenyun Yu2026-05-11
💬 NLP

Is She Even Relevant? When BERT Ignores Explicit Gender Cues

تكشف هذه الورقة أن نموذج BERT الهولندي الذي تم تدريبه من الصفر يطور تحيزات جندرية قوية ومستمرة تميل نحو التذكور وتتجاوز الإشارات السياقية الصريحة، مما يثبت أن تمثيلاته المتعلمة غير ديناميكية بما يكفي لترميز المعلومات الجندرية غير النمطية بشكل صحيح رغم ما تتميز به اللغة من علامات جندرية صرفة.

Jonas Klein, Chiara Manna, Eva Vanmassenhove2026-05-11
💬 NLP

Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents

تقدم هذه الورقة PhoneSafety، وهو معيار مرجعي لـ 700 لحظة من لحظات السلامة الحرجة في العالم الحقيقي تميز بين السلامة الحقيقية ومجرد العجز في وكلاء استخدام الهاتف، مما يكشف أن القدرات العامة الأقوى لا تضمن اتخاذ قرارات أكثر أماناً وأن النتائج غير الضارة غالباً ما تخفي عدم القدرة على الفعل بدلاً من السلامة الحقيقية.

Zhengyang Tang, Yi Zhang, Chenxin Li, Xin Lai, Pengyuan Lyu, Yiduo Guo, Weinong Wang, Junyi Li, Yang Ding, Huawen Shen (…)2026-05-11
💬 NLP

Post-training makes large language models less human-like

تقدم الورقة البحثية مجموعة بيانات Psych-201 لتوضيح أن عمليات ما بعد التدريب، التي تعمل على تحسين النماذج اللغوية الكبيرة من أجل المنفعة، تؤدي باستمرار إلى تدهور قدرتها على محاكاة السلوك البشري بدقة، وهي مشكلة تستمر وتتفاقم في الأجيال الأحدث من النماذج ولا يمكن حلها عبر تقنيات استحضار الشخصية.

Marcel Binz, Elif Akata, Abdullah Almaatouq, Mohammed Alsobay, Oleksii Ariasov, Franziska Brändle, David Broska, Jason W (…)2026-05-11
💬 NLP

MAVEN: Multi-Agent Verification-Elaboration Network with In-Step Epistemic Auditing

يُعد MAVEN إطار عمل مستوحى من نظام السبورة (blackboard) ومتعدد الوكلاء، يعمل على تعزيز جودة استدلال النماذج اللغوية الكبيرة والثقة المعرفية عبر فك الارتباط بين الأدوار في حلقة (المشكك-الباحث-القاضي) التنافسية مع التدقيق أثناء الخطوات، متفوقاً بذلك على النماذج أحادية البنية والنماذج القائمة على الإجماع عبر مختلف المعايير والنماذج الأساسية.

Yinsheng Yao, Jiehao Tang, Zhaozhen Yang, Dawei Cheng2026-05-11
💬 NLP

Quality-Conditioned Agreement in Automated Short Answer Scoring: Mid-Range Degradation and the Impact of Task-Specific Adaptation

تكشف هذه الدراسة أنه في حين تؤدي نماذج التصحيح الآلي للإجابات القصيرة أداءً جيداً في الاستجابات الصحيحة أو الخاطئة بوضوح، إلا أنها تظهر تدهوراً كبيراً في الاتفاق مع الخبراء البشريين في الإجابات متوسطة المدى أو الصحيحة جزئياً، وهو قصور يكون في أقصى درجاته في النماذج اللغوية الكبيرة ذات التعلم من أمثلة قليلة ويتحسن مع زيادة التكيف الخاص بالمهمة.

Abigail Victoria Gurin Schleifer, Moriah Ariely, Beata Beigman Klebanov, Asaf Salman, Giora Alexandron2026-05-11
📊 statistics

Reliable Chain-of-Thought via Prefix Consistency

تقدم هذه الورقة البحثية "اتساق البادئة" (prefix consistency)، وهو إشارة موثوقية في وقت الاختبار تعمل على تحسين كفاءة استدلال "سلسلة الأفكار" (Chain-of-Thought) من خلال وزن الإجابات المرشحة بناءً على قابليتها لإعادة الإنتاج بعد الاقتطاع وإعادة التوليد، محققةً دقة التصويت بالأغلبية القياسية بعدد أقل بكثير من الرموز المولدة دون الحاجة إلى الوصول إلى احتمالات السجل (log-probabilities) أو مطالبات التقييم الذاتي.

Naoto Iwase, Yuki Ichihara, Mohammad Atif Quamar, Junpei Komiyama2026-05-11
💬 NLP

TRACE: Tourism Recommendation with Accountable Citation Evidence

تقدم الورقة البحثية TRACE، وهي مجموعة بيانات وإطار تقييم شامل لأنظمة التوصية الحوارية في مجال السياحة، والتي تعالج الفجوة الحرجة في الموثوقية من خلال التقييم المشترك لدقة التوصية، والأدلة الاستشهادية القابلة للتحقق من المراجعات، والتعافي التكيفي من رفض المستخدم عبر 10,000 حوار متعدد الأدوار.

Zixu Zhao, Sijin Wang, Yu Hou, Yuanyuan Xu, Yufan Sheng, Xike Xie, Wenjie Zhang, Won-Yong Shin, Xin Cao2026-05-11