💬 NLP

Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance

تقدم هذه الورقة البحثية "التفكير مع المعايير" (Think-with-Rubrics)، وهو نموذج جديد يحول المعايير من مقيمات خارجية إلى توجيه استدلالي داخلي عبر جعل النماذج اللغوية الكبيرة تولد المعايير جنباً إلى جنب مع الاستجابات أثناء التدريب، مما يؤدي إلى تحسينات مستمرة في الأداء مقارنة بالنماذج المرجعية القائمة على المكافأة.

Jiachen Yu, Zhihao Xu, Junjie Wang, Yujiu Yang2026-05-11
💬 NLP

The Moltbook Files: A Harmless Slopocalypse or Humanity's Last Experiment

تقدم هذه الورقة "ملفات مولتبوك" (Moltbook Files)، وهي مجموعة بيانات تضم 232 ألف منشور و2.2 مليون تعليق من منصة شبيهة بـ "ريديت" (Reddit) مأهولة بوكلاء ذكاء اصطناعي، مما يكشف عن مخاطر خصوصية جسيمة مثل كشف مفاتيح واجهة برمجة التطبيقات (API keys) وانخفاض في صدقية النماذج عند الضبط الدقيق، ومع ذلك تصنف الحدث في النهاية على أنه "كارثة هراء غير ضارة" (harmless slopocalypse) مع التحذير من مخاطر ذيل مستمرة مثل تلوث البيانات وعدم الاتساق الناشئ.

William Brach, Federico Torrielli, Stine Lyngsø Beltoft, Annemette Brok Pirchert, Peter Schneider-Kamp, Lukas Galke Poec (…)2026-05-11
💬 NLP

InterLV-Search: Benchmarking Interleaved Multimodal Agentic Search

تقدم هذه الورقة البحثية InterLV-Search، وهو معيار شامل وإطار تقييم للبحث الوكيل متعدد الوسائط المتداخل الذي يسلط الضوء على أوجه القصور الحالية الكبيرة في قدرة الأنظمة على دمج الأدلة النصية والبصرية ديناميكيًا عبر سيناريوهات البحث النشط، والبحث الموجه غير المتصل بالإنترنت، والبحث في الويب المفتوح.

Bohan Hou, Jiuning Gu, Jiayan Guo, Ronghao Dang, Sicong Leng, Xin Li, Xuemeng Song, Jianfei Yang2026-05-11
💬 NLP

Why do Large Language Models Fail in Low-resource Translation? Unraveling the Token Dynamics of Large Language Models for Machine Translation

تتقصى هذه الورقة البحثية سبب معاناة النماذج اللغوية الكبيرة في الترجمة منخفضة الموارد عبر تحليل أنماط الفشل عبر 22 زوجاً لغوياً وتقديم مقياس معدل تنشيط الرموز (TAR)، والذي يكشف أن انخفاض استغلال الرموز الخاصة باللغة يرتبط ارتباطاً وثيقاً بجودة الترجمة الضعيفة، لا سيما في الأزواج غير المتمحورة حول اللغة الإنجليزية.

Shenbin Qian, Yves Scherrer2026-05-11
💬 NLP

Tracing the Arrow of Time: Diagnosing Temporal Information Flow in Video-LLMs

تشخص هذه الورقة ضعف قدرات الاستدلال الزمني في النماذج اللغوية الكبيرة للفيديو (Video-LLMs) من خلال تحديد الاختناقات في كل من تصميمات المشفرات البصرية وجهاز الإسقاط (projector)، مما أدى إلى بنية جديدة تحقق أداءً يقارب المثالية في مهمة "سهم الزمن" (Arrow-of-Time) وتحسن بشكل كبير معايير الاستدلال الزمني الأوسع.

Peitao Han, Fei Cheng, Lis K. Pereira, Qianying Liu, Shigeru Kitazawa2026-05-11
💬 NLP

Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States

تقدم هذه الورقة POISE، وهي طريقة للتعلم التعزيزي تستفيد من مسبار خفيف الوزن يتم تدريبه على الحالات الداخلية لنموذج السياسة لتقدير خطوط الأساس للقيمة بتكلفة ضئيلة، مما يحقق تحسيناً مستقراً وفعالاً للسياسة دون العبء الحسابي للمنتقدات المنفصلة أو عمليات التدحرج المتعددة.

Yunho Choi, Jongwon Lim, Woojin Ahn, Minjae Oh, Jeonghoon Shim, Yohan Jo2026-05-11
💬 NLP

Intent-Driven Semantic ID Generation for Grounded Conversational News Recommendation

تقترح هذه الورقة إطار عمل لتوليد المعرفات الدلالية (Semantic ID) القائم على النوايا ضمن نموذج "التوليد ثم المطابقة" (Generate-then-Match)، وذلك باستخدام تدريب ثنائي المراحل واستدلال مزدوج الإشارات المدرك للملف الشخصي للتغلب على اختناقات الاسترجاع في توصية الأخبار الحوارية، محققةً انعدام الهلوسة وأداءً يتفوق على النماذج المرجعية القائمة على GPT-4 بتكلفة أقل بكثير.

Hongyang Su, Beibei Kong, Lei Cheng, Chengxiang Zhuo, Zang Li, Chenyun Yu2026-05-11
💬 NLP

Is She Even Relevant? When BERT Ignores Explicit Gender Cues

تكشف هذه الورقة أن نموذج BERT الهولندي الذي تم تدريبه من الصفر يطور تحيزات جندرية قوية ومستمرة تميل نحو التذكور وتتجاوز الإشارات السياقية الصريحة، مما يثبت أن تمثيلاته المتعلمة غير ديناميكية بما يكفي لترميز المعلومات الجندرية غير النمطية بشكل صحيح رغم ما تتميز به اللغة من علامات جندرية صرفة.

Jonas Klein, Chiara Manna, Eva Vanmassenhove2026-05-11
💬 NLP

Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents

تقدم هذه الورقة PhoneSafety، وهو معيار مرجعي لـ 700 لحظة من لحظات السلامة الحرجة في العالم الحقيقي تميز بين السلامة الحقيقية ومجرد العجز في وكلاء استخدام الهاتف، مما يكشف أن القدرات العامة الأقوى لا تضمن اتخاذ قرارات أكثر أماناً وأن النتائج غير الضارة غالباً ما تخفي عدم القدرة على الفعل بدلاً من السلامة الحقيقية.

Zhengyang Tang, Yi Zhang, Chenxin Li, Xin Lai, Pengyuan Lyu, Yiduo Guo, Weinong Wang, Junyi Li, Yang Ding, Huawen Shen (…)2026-05-11
💬 NLP

Post-training makes large language models less human-like

تقدم الورقة البحثية مجموعة بيانات Psych-201 لتوضيح أن عمليات ما بعد التدريب، التي تعمل على تحسين النماذج اللغوية الكبيرة من أجل المنفعة، تؤدي باستمرار إلى تدهور قدرتها على محاكاة السلوك البشري بدقة، وهي مشكلة تستمر وتتفاقم في الأجيال الأحدث من النماذج ولا يمكن حلها عبر تقنيات استحضار الشخصية.

Marcel Binz, Elif Akata, Abdullah Almaatouq, Mohammed Alsobay, Oleksii Ariasov, Franziska Brändle, David Broska, Jason W (…)2026-05-11