💬 NLP

Quantification and object perception in Multimodal Large Language Models and human linguistic cognition

تستقصي هذه الورقة البحثية كيفية ترميز النماذج اللغوية الكبيرة متعددة الوسائط لسمات التكميم الشبيهة بالبشر — وتحديداً مقاييس المكممات، والنموذجية، وتحيزات الأعداد التقريبية — كاشفةً أنه في حين تتفوق نماذج "التفكير" في تقدير العدد والمقياس، إلا أنها لا تزال تتباعد بشكل كبير عن الإدراك البشري في نطاقات الاستخدام والنموذجية عبر مختلف اللغات وأنواع النماذج.

Raquel Montero, Natalia Moskvina, Paolo Morosi, Tamara Serrano, Elena Pagliarini, Evelina Leivada2026-03-26
💬 NLP

Collaborative Causal Sensemaking: Closing the Complementarity Gap in Human-AI Decision Support

تقترح هذه الورقة "الإدراك السببي التعاوني" (CCS) كأجندة بحثية لسد فجوة التكامل بين الإنسان والذكاء الاصطناعي عبر تحويل تطوير الذكاء الاصطناعي من محركات للإجابات إلى شركاء يشاركون في استنباط البنى السببية، وإظهار أوجه عدم اليقين، وتكييف الأهداف جنباً إلى جنب مع الخبراء البشر في اتخاذ القرارات عالية المخاطر.

Raunak Jain2026-03-26
💬 NLP

ChartAttack: Testing the Vulnerability of LLMs to Malicious Prompting in Chart Generation

تقدم هذه الورقة البحثية "ChartAttack"، وهو إطار عمل يكشف عن الثغرات الأمنية في النماذج اللغوية الكبيرة متعددة الوسائط من خلال حقن عناصر تصميم مضللة في إنشاء الرسوم البيانية، وتقدم مجموعة بيانات "AttackViz" لتقييم هذه المخاطر وإثبات أن الضبط الدقيق يمكن أن يحسن بشكل كبير من متانة النموذج ضد مثل هذا التحفيز الخبيث.

Jesus-German Ortiz-Barajas, Jonathan Tonglet, Vivek Gupta, Iryna Gurevych2026-03-26
💬 NLP

From Sycophancy to Sensemaking: Premise Governance for Human-AI Decision Making

تقترح هذه الورقة تحويل عملية اتخاذ القرار بين الإنسان والذكاء الاصطناعي من توليد الإجابات المتملقة إلى إطار عمل "حوكمة المقدمات" المهيكل، والذي يستخدم حلقات تحكم قائمة على التباين وبوابات الالتزام لضمان تعاون موثوق وقابل للتدقيق في البيئات عالية المخاطر وغير اليقينية.

Raunak Jain2026-03-26
💬 NLP

Agent-Diff: Benchmarking LLM Agents on Enterprise API Tasks via Code Execution with State-Diff-Based Evaluation

تقدم الورقة البحثية Agent-Diff، وهو إطار عمل مرجعي مبتكر لتقييم النماذج اللغوية الكبيرة الوكيلة (agentic LLMs) في مهام واجهة برمجة التطبيقات (API) الواقعية للمؤسسات، وذلك عبر الجمع بين بيئات تجريبية (sandboxes) معزولة ومحتواة لواجهات برمجة التطبيقات وبين مقياس تقييم يعتمد على فرق الحالة (state-diff) لتقدير نجاح المهمة من خلال التغيرات في حالة البيئة بدلاً من مطابقة المسار.

Hubert M. Pysklo, Artem Zhuravel, Patrick D. Watson2026-03-26
💬 NLP

Team of Thoughts: Efficient Test-time Scaling of Agentic Systems through Orchestrated Tool Calling

تقدم الورقة البحثية "فريق الأفكار" (Team-of-Thoughts)، وهو إطار عمل متعدد الوكلاء غير متجانس يستفيد من معايرة المنسق والتقييم الذاتي للوكيل لاختيار نماذج متخصصة كأدوات بشكل ديناميكي، مما يتفوق بشكل كبير على الأنظمة المتجانسة الحالية في معايير الاستدلال الرياضي وتوليد الكود البرمجي.

Jeffrey T. H. Wong, Zixi Zhang, Junyi Liu, Yiren Zhao2026-03-26
💬 NLP

Beyond Masks: Efficient, Flexible Diffusion Language Models via Deletion-Insertion Processes

تقدم هذه الورقة نماذج لغوية تعتمد على انتشار الحذف والإدراج (DID)، والتي تستبدل نموذج إخفاء الرموز (token masking) بعمليات حذف وإدراج دقيقة لتحقيق كفاءة حوسبية فائقة، ودعم أصيل للأطوال المتغيرة، وقدرات تصحيح ذاتي جوهرية مقارنة بنماذج الانتشار اللغوية القائمة على الإخفاء.

Fangyu Ding, Ding Ding, Sijin Chen, Kaibo Wang, Peng Xu, Zijin Feng, Haoli Bai, Kai Han, Youliang Yan, Binhang Yuan, Jia (…)2026-03-26
💬 NLP

Internal Safety Collapse in Frontier Large Language Models

تحدد هذه الورقة البحثية "الانهيار الأمني الداخلي"، وهو نمط فشل حرج في النماذج اللغوية الكبيرة الرائدة حيث تجبر المهام المعقدة والمتخصصة في مجالات معينة النماذج دون قصد على توليد محتوى ضار، مما يكشف أن القدرات المتقدمة وجهود المحاذاة قد لا تقضي على المخاطر الأمنية الكامنة في البيئات المهنية عالية المخاطر.

Yutao Wu, Xiao Liu, Yifeng Gao, Xiang Zheng, Hanxun Huang, Yige Li, Cong Wang, Bo Li, Xingjun Ma, Yu-Gang Jiang2026-03-26
💬 NLP

Visuospatial Perspective Taking in Multimodal Language Models

تكشف هذه الورقة أن النماذج اللغوية متعددة الوسائط تظهر عجزاً كبيراً في المستوى الثاني من اتخاذ المنظور البصري المكاني، حيث تجد صعوبة في كبح وجهة نظرها الخاصة لتبني وجهة نظر الآخر، مما يسلط الضوء على قيود حرجة لنشرها في الإعدادات الاجتماعية والتعاونية.

Jonathan Prunty, Seraphina Zhang, Patrick Quinn, Jianxun Lian, Xing Xie, Lucy Cheke2026-03-26
💬 NLP

S-Path-RAG: Semantic-Aware Shortest-Path Retrieval Augmented Generation for Multi-Hop Knowledge Graph Question Answering

يُعد S-Path-RAG إطار عمل للتوليد المعزز بالاسترجاع والمدعوم دلالياً، وهو يعمل على تحسين الإجابة على أسئلة الرسوم البيانية للمعرفة متعددة القفزات من خلال الجمع بين استراتيجية تعداد المسارات الهجينة ودرجة تقييم قابلة للتفاضل وحلقة حوار سقراطية عصبية تكرارية لتحقيق دقة أعلى، وتغطية أفضل للأدلة، وكفاءة أكبر مقارنة بالنماذج المرجعية الحالية.

Rong Fu, Yemin Wang, Tianxiang Xu, Yongtai Liu, Weizhi Tang, Wangyu Wu, Xiaowen Ma, Simon Fong2026-03-26