💬 NLP

Scaling Natural-Language Graph-Based Test Time Compute for Automated Theorem Proving

تقدم الورقة البحثية KG-prover، وهو إطار عمل مبتكر يعزز النماذج اللغوية الكبيرة للأغراض العامة برسم بياني للمعرفة مستخرج من النصوص الرياضية لتعزيز إثبات النظريات آلياً، مما يظهر مكاسب أداء كبيرة عبر مجموعات بيانات متعددة دون الحاجة إلى ضبط دقيق إضافي.

Vincent Li, Tim Knappe, Yule Fu, Kevin Han, Kevin Zhu2026-05-26
💬 NLP

Lean Formalization of Generalization Error Bound by Rademacher Complexity and Dudley's Entropy Integral

تقدم هذه الورقة صياغة في لغة Lean 4 لحدود خطأ التعميم القائمة على تعقيد رادماخر وتكامل إنتروبي دودلي، والتي تتميز بمسار تم التحقق منه آلياً بدءاً من الأسس النظرية للقياس وصولاً إلى حدود الانحراف الموحد ذات الاحتمالية العالية وتطبيقاتها على المتنبئات الخطية.

Sho Sonoda, Kazumi Kasaura, Yuma Mizuno, Kei Tsukamoto, Naoto Onda2026-05-26
💬 NLP

Ineffectiveness for Search and Undecidability of PCSP Meta-Problems

تُثبت هذه الورقة أن تقريب الحلول من خوارزميات استرخاء PCSP القياسية (BLP وAIP وBLP+AIP) لإيجاد شهادات البحث هو بصعوبة أي مسألة من مسائل TFNP، وتُثبت أن تحديد ما إذا كانت قوالب PCSP المنتهية تستوفي هذه الخوارزميات أو شروطاً جبرية معينة من حيث القابلية للتتبع هو أمر غير قابل للتقرير.

Alberto Larrauri2026-05-26
💬 NLP

MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence

تقدم الورقة البحثية MMSI-Bench، وهو معيار مرجعي مليء بالتحديات يضم 1,000 سؤال حول الاستدلال المكاني متعدد الصور يكشف عن فجوة أداء كبيرة بين النماذج اللغوية الكبيرة متعددة الوسائط الحالية والبشر، مع توفير مسار تحليل أخطاء مؤتمت لتشخيص أوضاع فشل محددة وتوجيه الأبحاث المستقبلية.

Sihan Yang, Runsen Xu, Yiman Xie, Sizhe Yang, Mo Li, Jingli Lin, Chenming Zhu, Xiaochen Chen, Haodong Duan, Xiangyu Yue (…)2026-05-26
💬 NLP

Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks

تقدم هذه الورقة البحثية Agent-X، وهو معيار مرجعي واسع النطاق يضم 828 مهمة واقعية متعددة الوسائط عبر ست بيئات متنوعة وإطار تقييم دقيق على مستوى الخطوات لتقييم الاستدلال العميق في الوكلاء المتمحورين حول الرؤية، مما يكشف أن النماذج الرائدة الحالية تعاني لتحقيق نجاح كامل السلسلة في السيناريوهات المعقدة متعددة الخطوات.

Tajamul Ashraf, Amal Saqib, Hanan Ghani, Muhra AlMahri, Yuhao Li, Noor Ahsan, Umair Nawaz, Jean Lahoud, Hisham Cholakkal (…)2026-05-26
💬 NLP

From Multi-Agent Systems and the Semantic Web to Agentic AI: A Unified Narrative of the Web of Agents

تقدم هذه الورقة سردية موحدة لتطور "شبكة الوكلاء" من عام 1990 إلى عام 2026، محاججةً بأن "هجرة الجهد الدلالي" من تنسيق المنصات إلى توصيف البيانات وأخيرًا إلى تفسير النماذج تحدد ثلاثة أجيال متميزة، مع تقديم إطار مقارن، وتصنيفات للنظم، وتحليل للتقارب المؤسسي الأخير لتحديد التحديات المستمرة والتوجهات المستقبلية للذكاء الاصطناعي الوكيل.

Tatiana Petrova (SEDAN SnT, University of Luxembourg, Luxembourg, Luxembourg), Boris Bliznioukov (SEDAN SnT, University (…)2026-05-26
💬 NLP

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework

تقدم هذه الورقة ArxivRoll، وهو إطار تقييم ديناميكي مستوحى من تشفير لوحة المرة الواحدة (one-time pad)، يستخدم معياراً آلياً نصف سنوي يتم إنشاؤه من مقالات ArXiv الحديثة لقياس وتخفيف المبالغة في تقدير النماذج اللغوية الكبيرة (LLMs) الناتجة عن تلوث البيانات وتحيز التدريب.

Zi Liang, Liantong Yu, Shiyu Zhang, Qingqing Ye, Haibo Hu2026-05-26
💬 NLP

LiveMCP-101: Stress Testing and Diagnosing MCP-enabled Agents on Challenging Queries

تقدم هذه الورقة البحثية LiveMCP-101، وهو معيار يتكون من 101 استعلاماً من واقع العالم الحقيقي صُمم لاختبار قدرات الوكلاء الممكنين بواسطة بروتوكول MCP عبر إطار تقييم متوازي، مما يكشف أن حتى النماذج اللغوية الكبيرة الرائدة تواجه صعوبة في تنسيق الأدوات متعدد الخطوات والمعقدة، وتحدد سبعة أنماط فشل محددة لتوجيه التحسينات المستقبلية.

Ming Yin, Dinghan Shen, Silei Xu, Sixun Dong, Mian Zhang, Yebowen Hu, Shujian Liu, Jianbing Han, Simin Ma, Song Wang, Sa (…)2026-05-26
💬 NLP

Towards Inclusive Toxic Content Moderation: Addressing Vulnerabilities to Adversarial Attacks in Toxicity Classifiers Tackling LLM-generated Content

تقترح هذه الورقة استراتيجية دفاع استباقي مبتكرة لمصنفات السمية تستفيد من التفسير الآلي لتحديد وتثبيط مكونات الدوائر العصبية الضعيفة، مما يعزز المتانة ضد الهجمات العدائية ويعالج فجوات العدالة عبر المجموعات الديموغرافية المتنوعة في سياق المحتوى الذي تولده النماذج اللغوية الكبيرة.

Shaz Furniturewala, Arkaitz Zubiaga2026-05-26
💬 NLP

Agent Learning via Early Experience

تقدم هذه الورقة "الخبرة المبكرة"، وهي نموذج حيث تتعلم الوكلاء اللغوية من بيانات تفاعلها الخاصة دون إشارات مكافأة صريحة من خلال نمذجة العالم الضمنية والتأمل الذاتي، مما يظهر فعالية وقدرة أفضل على التعميم مع سد الفجوة بين الضبط الدقيق الخاضع للإشراف والتعلم المعزز.

Kai Zhang, Xiangchao Chen, Bo Liu, Tianci Xue, Zeyi Liao, Zhihan Liu, Xiyao Wang, Yuting Ning, Zhaorun Chen, Xiaohan Fu (…)2026-05-26