💻 computer science

DirectorBench: Diagnosing Long-Form Video Generation with Personalized Multi-Agent Evaluation

يقدم DirectorBench معياراً تشخيصياً متعدد الوكلاء مخصصاً يقيم توليد الفيديو طويل المدى عبر خمسة أبعاد وعدة ملفات تعريف للمستخدمين لتحديد إخفاقات سير العمل بدقة والمواءمة بشكل وثيق مع التقدير البشري مقارنة بطرق التقييم الإجمالية التقليدية.

Jiamin Chen, Qianben Chen, Jiawen Zhang, Yidi Wu, Yuchen Li, Xiaokun Zhang, Wangchunshu Zhou, Chen Ma2026-05-29
💻 computer science

SEAL: Can Saturated Benchmarks Be Revived by LLM-as-a-Meta-Judge?

تقدم الورقة البحثية SEAL، وهو بروتوكول تقييم ذاتي التحسين يستخدم نموذج لغوي كبير كـ "حكم ميتا" (LLM-as-a-Meta-Judge) مع آلية الاستبعاد المعتمدة على البذور وقوائم التحقق التكيفية لإحياء المعايوهات المرجعية المشبعة عبر استخراج إشارات التصنيف الكامنة بدقة أعلى وزمن انتقال أقل بكثير من عملية الحكم الثنائي الكاملة.

Jiamin Chen, Yidi Wu, Qiexiang Wang, Qianben Chen, Yuchen Li, Yansen Zhang, Xiaokun Zhang, Wangchunshu Zhou, Chen Ma2026-05-29
💻 computer science

Dial HEALTHDIAL for Advice: A Multilingual and Multi-Parallel Spoken Dialogue Dataset for Knowledge-Grounded Information Seeking

تقدم هذه الورقة HEALTHDIAL، وهي مجموعة بيانات حوارية صوتية ضخمة متعددة اللغات والمتوازيات تضم 6,000 محادثة بحث عن المعلومات مستندة إلى معايير منظمة الصحة العالمية باللغات العربية والصينية والإنجليزية والإسبانية، صُممت لدعم تطوير وتقييم أنظمة التوليد المعزز بالاسترجاع مع تسليط الضوء على تفاوتات الأداء الحالية عبر اللغات.

Songbo Hu, Yinhong Liu, Ej Zhou, Evgeniia Razumovskaia, Xiaobin Wang, Alexander Fraser, Ivan Vulić, Anna Korhonen2026-05-29
💻 computer science

CCS: Clinical Consensus Selection for Radiology Report Generation

تقترح هذه الورقة البحثية "اختيار الإجماع السريري" (CCS)، وهو إطار عمل للاستدلال في وقت التشغيل غير مرتبط بفك التشفيد، يعمل على تحسين توليد تقارير الأشعة من خلال أخذ عينات لعدة مرشحين واختيار المرشح الذي يحقق أعلى إجماع سريري، مستفيداً من مقياس فائدة جديد مرتبط بالصورة ليتفوق على فك التشفيد القياسي أحادي المسار ونماذج "الأفضل من N" العامة.

Xi Zhang, Yingshu Li, Zaiqiao Meng, Jake Lever, Edmond S. L. Ho2026-05-29
🤖 AI

Do Proactive Agents Really Need an LLM to Decide When to Wake and What to Anchor?

تقترح هذه الورقة استبدال الممارسة غير الفعالة المتمثلة في تحويل أحداث نشاط المستخدم المهيكلة إلى نصوص لاتخاذ القرار القائم على النماذج اللغوية الكبيرة، بنموذج تعلم رسوم بيانية زمنية خفيف الوزن يعمل على الجهاز ويعالج تحديثات الرسوم البيانية مباشرةً لتفعيل وكلاء استباقيين، مما يحقق دقة أعلى بكثير، وسرعات استدلال أسرع، وبصمة ذاكرة أصغر.

Xiaoze Liu, Ruowang Zhang, Amir H. Abdi, Michel Galley, Zhikai Chen, Siheng Xiong, Xiaoqian Wang, Jing Gao2026-05-29
🤖 machine learning

Token-Level Generalization in LoRA Adapter Backdoors: Attack Characterization and Behavioral Detection

تُثبت هذه الورقة أن مُلحقات "LoRA" يمكن استهدافها بفعالية عبر "أبواب خلفية" من خلال تسميم البيانات لإنشاء هجمات تعميم على مستوى الرمز (token) تتجنب الكشف الهيكلي، بينما تقترح طرق كشف قوية على مستوى السلوك والأوزان لتحديد هذه الملحقات المخترقة في سلاسل التوريد.

Travis Lelle2026-05-29
🤖 AI

Do Language Models Track Entities Across State Changes?

تكشف هذه الورقة أن النماذج اللغوية الكبيرة تخفق في تتبع حالات الكيانات بشكل تراكمي عبر العمليات المتتالية، حيث تعتمد بدلاً من ذلك على استراتيجية غير تسلسلية تجمع المعلومات عند رمز الاستعلام وتستخدم آلية كبت عالمية هشة لعمليات الإزالة، مما يؤدي إلى أنماط فشل يمكن التنبؤ بها والتي يمكن التخفيف من حدتها جزئياً من خلال التدخل الميكانيكي.

Zilu Tang, Qiao Zhao, Gabriel Franco, Derry Wijaya, Aaron Mueller, Sebastian Schuster, Najoung Kim2026-05-29
💻 computer science

CommunityFact: A Dynamic, Multilingual, Multi-domain Benchmark for Misinformation Detection in the Wild

تقدم الورقة البحثية CommunityFact، وهو معيار مرجعي ديناميكي، متعدد اللغات، ومتعدد المجالات للكشف عن المعلومات المضللة يقيم النماذج اللغوية الكبيرة في بيئات واقعية، كاشفةً أنه بينما يحسن الوصول إلى الويب الأداء بشكل كبير، فإن النماذج الحالية تظهر سياسات اختيار مصادر غير متوافقة مقارنة بالمقيمين البشريين، وتسلط الضوء على "ملاحظات المجتمع" (Community Notes) كإشارة تدريب محتملة لأنظمة التحقق المستقبلية.

Sahajpreet Singh, Insyirah Mujtahid, Min-Yen Kan, Kokil Jaidka2026-05-29
💻 computer science

Knowing What to Solve Before How: Preplan Empowered LLM Mathematical Reasoning

تقترح الورقة البحثية إطار عمل PPC (التخطيط المسبق-التخطيط-سلسلة الأفكار)، وهو إطار عمل مبتكر يقدم مرحلة "تخطيط مسبق" صريحة لتوضيح أنواع المشكلات والأدوات قبل عملية التخطيط، مما يعزز بشكل كبير أداء النماذج اللغوية الكبيرة في الاستدلال الرياضي عبر معايير متعددة دون إضافة عبء على وقت الاستنتاج.

Shaojie Wang, Liang Zhang2026-05-29
💻 computer science

VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents

تقدم هذه الورقة البحثية VideoFDB، وهو أول معيار مرجعي مُصمم لتقييم وكلاء المحادثة السمعية البصرية ثنائيي الاتجاه (full-duplex) من خلال تحليل التفاعلات الثنائية في العالم الحقيقي، كاشفةً أن الأنظمة الحالية تفشل في دمج الإشارات البصرية المتدفقة بفعالية من أجل التواصل غير اللفظي الطبيعي رغم قدرتها على التعامل مع الأسئلة البصرية الصريحة.

Amrita Mazumdar, Seonwook Park, Rajarshi Roy, Nikhil Srihari, Shengze Wang, Yuhao Zhou, Julia Wang, Koki Nagano, Shalini (…)2026-05-29