💻 computer science

MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues

تكشف هذه الورقة أن النماذج اللغوية الكبيرة متعددة الوسائط تمتلك قدرات كامنة في الربط الزمني ضمن انتباه مرحلة التعبئة المسبقة (prefill attention) لكنها تفشل في استغلالها أثناء التوليد، مما دفع إلى ابتكار إطار عمل للاستدلال بدون تدريب يستخلص إشارات الانتباه هذه لتقييد السياق البصري وتحسين أداء الربط الزمني للفيديو بشكل كبير.

Dazhao Du, Liao Duan, Jian Liu, Tao Han, Yujia Zhang, Eric Liu, Xi Chen, Song Guo2026-05-22
💻 computer science

ChronoMedicalWorld: A Medical World Model for Learning Patient Trajectories from Longitudinal Care Data

تقدم الورقة البحثية نموذج ChronoMedicalWorld (CMWM)، وهو نموذج عالم كامن مشروط بالأفعال يدمج التدخلات المهيكلة والتواصل عبر النصوص الحرة للتنبؤ بدقة بمسارات المرضى طويلة الأمد للأمراض المزمنة، مما يظهر أداءً متفوقاً على النماذج المرجعية GPT-5.5 في التنبؤ بتطور معدل الترشيح الكبيبي (eGFR) لمرضى الكلى المزمن.

Jiangyuan Wang, Xuyong Chen, Junwei He, Xu Xu, Shasha Xie, Fuman Han2026-05-22
💻 computer science

Video as Natural Augmentation: Towards Unified AI-Generated Image and Video Detection

تقترح الورقة البحثية VINA، وهو إطار عمل موحد للكشف عن المحتوى المُنشأ بواسطة الذكاء الاصطناعي يستفيد من إطارات الفيديو كتعزيزات طبيعية ويستخدم هدف تباين عبر الوسائط لسد فجوة الأداء بين كواشف الصور والفيديو، محققاً بذلك أحدث مستويات القوة والتعميم عبر مختلف المعايير المرجعية.

Zhengcen Li, Chenyang Jiang, Liangxu Su, Tong Shao, Shiyang Zhou, Ming Tao, Jingyong Su2026-05-22
💻 computer science

Interpreting and Enhancing Emotional Circuits in Large Vision-Language Models via Cross-Modal Information Flow

تقدم هذه الورقة إطار عمل للنسب السببي قائم على متجه التوجيه للكشف عن وتعزيز دوائر "التكيف-التجميع-التنفيذ" العاطفية في النماذج اللغوية البصرية الكبيرة، مما يكشف عن فصل وظيفي بين تجميع الإشارات البصرية وتوليد السرد يتيح تدخلات مستهدفة أثناء الاستدلال لتحسين الاستدلال العاطفي بشكل كبير وتقليل الهلوسة.

Chengsheng Zhang, Chenghao Sun, Zhining Xie, Xinmei Tian2026-05-22
💻 computer science

Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning

تقدم هذه الورقة البحثية "تحسين السياسة العلاقية المضادة للواقع" (CRPO)، وهو إطار عمل للتعلم التعزيزي ثنائي الفروع يستفيد من تحويلات الفيديو المضادة للواقع والمكافأة القائمة على العلاقات لتدريب نماذج اللغات الكبيرة المرئية (Video LLMs) على تطوير حساسية زمانية مكانية حقيقية مع تجنب الاعتماد على الاختصارات الثابتة.

Dazhao Du, Jian Liu, Jialong Qin, Tao Han, Bohai Gu, Fangqi Zhu, Yujia Zhang, Eric Liu, Xi Chen, Song Guo2026-05-22
💻 computer science

Ex-GraphRAG: Interpretable Evidence Routing for Graph-Augmented LLMs

تقدم الورقة البحثية Ex-GraphRAG، وهو إطار عمل GraphRAG قابل للتفسير يستبدل مشفرات الشبكات العصبية الرسومية (GNN) الغامضة بشبكة عصبية مضافة رسومية متعددة المتغيرات (M-GNAN) لتوفير عزو دقيق لمساهمات العقد، مما يكشف عن عدم تطابق دلالي-بنيوي حرج حيث تهيمن العقد غير المتصلة بنيوياً على مخرجات النموذج رغم كونها مترابطة عبر وسطاء منخفضي العزو.

Yoav Kor Sade, Arvindh Arun, Rishi Puri, Steffen Staab, Maya Bechler-Speicher2026-05-22
💻 computer science

From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents

تقدم الورقة البحثية طريقة "الرقع إلى المسارات" (Patches-to-Trajectories - P2T)، وهي منهجية تستفيد من الرقع المرجعية كمعلومات مميزة لاستخلاص معالم الحل الأمثل وتنسيق مسارات تدريب عالية الجودة وفعالة لوكلاء هندسة البرمجيات، مما يؤدي إلى تحسين فعالية الاستدلال وكفاءة الاستنتاج بشكل كبير مقارنة بالضبط الدقيق الخاضع للإشراف القياسي.

Murong Ma, Tianyu Chen, Yun Lin, Shuai Lu, Qinglin Zhu, Yeyun Gong, Zhiyong Huang, Peng Cheng, Yan Lu, Jin Song Dong2026-05-22
💬 NLP

Blind Spots in the Guard: How Domain-Camouflaged Injection Attacks Evade Detection in Multi-Agent LLM Systems

تكشف هذه الورقة أن كواشف الحقن في أنظمة النماذج اللغوية الكبيرة متعددة الوكلاء تعاني من "فجوة كشف التمويه"، حيث تفشل في تحديد الهجمات التي تحاكي المفردات الخاصة بمجال معين وهياكل السلطة، مما يتسبب في انخفاض معدلات الكشف بشكل حاد ويكشف عن ثغرة هيكلية حرجة في آليات السلامة.

Aaditya Pai2026-05-22✓ Author reviewed
💬 NLP

From TF-IDF to Transformers: A Comparative and Ensemble Approach to Sentiment Classification

تقيم هذه الورقة نماذج مختلفة من تعلم الآلة ومعالجة اللغات الطبيعية لتصنيف المشاعر على مجموعة بيانات IMDb، حيث وجدت أن نموذج RoBERTa يحقق أعلى دقة بنسبة 93.02% بينما يعزز نظام التصويت الناعم (soft voting) لجميع النماذج الأداء العام بشكل أكبر.

Dip Biswas Shanto, Mitali Yadav, Prajwal Panth, Suresh Chandra Satapathy2026-05-22
💻 computer science

AgroVG: A Large-Scale Multi-Source Benchmark for Agricultural Visual Grounding

تقدم هذه الورقة AgroVG، وهو معيار مرجعي واسع النطاق متعدد المصادر يضم أكثر من 10,000 زوج من (صورة-استعلام) عبر ست عائلات مستهدفة زراعية لتقييم التأسيس البصري كمهمة تنبؤ بمجموعة معممة، مما يكشف عن فجوات كبيرة في أداء النماذج الحالية في التعامل مع الأجسام الصغيرة، والمحجوبة، والمتغيرة العدد في السيناريوهات الزراعية.

Haocheng Li, Juepeng Zheng, Zenghao Yang, Kaiqi Du, Guilong Xiao, Gengmeng Pu, Haohuan Fu, Jianxi Huang2026-05-22