🤖 AI

GameXpert-Bench: How Far Are Coding Agents from Expert Game Development?

تقدم هذه الورقة GameXpert-Bench، وهي مجموعة اختبار شاملة تتكون من ثلاثة مسارات (GameGen وGameFix وGameOpt) تقيم وكلاء البرمجة عبر دورة حياة تطوير الألعاب الكاملة، كاشفةً عن أنه في حين يتفوق الوكلاء الحاليون في إنشاء الأسس القابلة للعب وتنفيذ المتطلبات الصريحة، إلا أنهم يواجهون صعوبة في اكتشاف العيوب، والتحقق من سلوك وقت التشغيل، والحفاظ على الوظائف أثناء التحسين التكراري.

Kun Chen, Haorong Hong, Peizhong Gao, Jianfeng Lin, Tongxu Luo, Yuxuan Xie, Chenxu Liu, Jieling He, Zhongyuan Liu, Zeno (…)2026-08-25
💬 NLP

PUMA: A Polish Benchmark for Culturally Grounded Multimodal Understanding

تقدم هذه الورقة PUMA، وهو معيار مرجعي جديد يتكون من 900 مهمة صُمم لتقييم قدرات نماذج الذكاء الاصطناعي متعددة الوسائط في السياق الثقافي واللغوي البولندي، مما يكشف عن فجوات أداء كبيرة في فهم الصوت والمستندات رغم النتائج القوية في الإجابة على الأسئلة البصرية.

Sławomir Dadas, Michał Perełkiewicz, Rafał Poświata, Małgorzata Grębowiec, Bartłomiej Jaworski, Izabela Woźniakowska2026-08-25
💬 NLP

SkillBloat: Token Amplification Attacks via Skill Injection in LLM Coding Agents

تقدم هذه الورقة البحثية SkillBloat، وهو إطار عمل ثنائي المراحل يستغل قنوات حقن المهارات الموثوقة في وكلاء البرمجة القائمين على النماذج اللغوية الكبيرة لتحقيق تضخيم كبير في الرموز (5.4x–10.1x)، مما يكشف عن تهديد متميز يتمثل في إساءة استخدام الموارد الاقتصادية، وهو تهديد متعامد مع الهجمات الأمنية التقليدية.

Yuanjin Zheng, Jingbang Chen2026-08-25
💬 NLP

Spine-Branch Coordination for Multi-agent Computer Use

تقترح الورقة البحثية "تنسيق العمود الفقري والأفرع" (Spine-Branch Coordination)، وهو إطار عمل متعدد الوكلاء يقوم بتفكيك مهام استخدام الحاسوب إلى "عمود فقري" مستمر و"أفرع" متوازية لتجنب الاستحالة الفيزيائية لدمج حالات الأجهزة الافتراضية، مما يحسن معدلات النجاح بشكل كبير ويقلل التكاليف في المهام طويلة المدى.

Mian Zhang, Manasi Sharma, Sheng Zhang, Minglai Yang, Kejian Shi, Ying Liu, Zhiyu Zoey Chen, Daniel Yue Zhang2026-08-25
💬 NLP

W-RAG: Source-Aware Retrieval for Enterprise Document Generation from Heterogeneous Knowledge Bases

تقدم هذه الورقة W-RAG، وهو إطار عمل للاسترجاع مدرك للمصدر يعالج قيود التصنيف العالمي في قواعد المعرفة المؤسسية غير المتجانسة من خلال توظيف الاسترجاع الموجه بالأنطولوجيا والوزن على مستوى المصدر لتحسين تغطية المستندات وجودة التوليد.

Hridya Dhulipala, Rajesh Ombase, Michael Wang, Tien N. Nguyen2026-08-25
🤖 machine learning

TANGO: Token-Aggregated Nonlinear Gating Operators for Natural and Formal Language Modeling

تقدم هذه الورقة البحثية TANGO، وهي بنية نموذج لغوي مبتكرة تستبدل الطبقات الفرعية القياسية لنموذج Transformer بتحديث متبقٍ بوابي عبر الرموز (cross-token gated residual update) لتحقيق أداء فائق في مجموعات البيانات الرياضية والتعليمية، إلى جانب متغيرها ذي التعقيد الخطي WANGO الذي يتفوق على النماذج الحالية ذات الوقت الخطي.

Joshua Nunley2026-08-25
💬 NLP

RAG Collapse: LLM Responses Collapse When Retrieved Documents Are Self-Authored

تُثبت هذه الورقة أن النماذج اللغوية الكبيرة (LLMs) تعاني من "انهيار استرجاع المعزز بالاسترجاع" (RAG collapse)، وهي ظاهرة تتدهور فيها استجاباتها وتفقد تنوعها عندما تسترجع وتعتمد على محتواها الذي تم إنشاؤه سابقاً، حيث تُظهر التجارب أن 79.6% من عمليات المحاكاة هذه تنتهي بالانهيار بسبب انحياز مفرط في الاستشهاد الذاتي.

Gregory Druck, Ethan Smith2026-08-25
💬 NLP

LLM assisted writing deserves empirical evaluation

تجادل هذه الورقة بأن الكتابة بمساعدة النماذج اللغوية الكبيرة يجب أن تُقيّم بناءً على الجودة العلمية والمسؤولية بدلاً من التعامل معها كمسألة كشف، مستشهدة بتحليل لأكثر من 69,000 ورقة بحثية في مجال المعلوماتية الصحية تربط استخدام الأدوات بتقديم أكثر تركيزاً، واستشهادات أوسع، وتأليفاً موزّعاً عالمياً.

Xuan Zhong Feng, Yi Lin, Yiye Zhang, Chunhua Weng, Yifan Peng2026-08-25
💬 NLP

SSE-Bio: A Structured Self-Evolving Agent with Agentic Retrieval Policy for Multi-Hop Biomedical Reasoning

تقدم الورقة البحثية SSE-Bio، وهو وكيل ذاتي التطور مهيكل يستخدم سياسة وسيطة قابلة للتدريب وتحريراً دقيقاً للقوالب لتحسين قرارات الاسترجاع وتعزيز الاستدلال البيولوجي الطبي متعدد الخطوات، متفوقاً بذلك على النماذج المرجعية الحالية في الاختبارات المعيارية الرئيسية.

Zhaohan Meng, Zaiqiao Meng, Siwei Liu, Hao Xu, Ke Yuan, Iadh Ounis2026-08-25
🤖 AI

Measuring Stability and Failure Behavior in Language Models Under Structured Perturbations

تقدم هذه الورقة إطاراً متدرجاً لاختبار الإجهاد متعدد العائلات يكشف كيف تتباين استقرارية الاستنتاج ونقاط الفشل في النماذج اللغوية عبر أنواع محددة من الاضطرابات ومستويات شدتها، مما يكشف عن نقاط ضعف حرجة في التعامل مع التعليمات المتضاربة والمقدمات المستحيلة التي تغفلها مقاييس الدقة القياسية.

Samira Golsefid2026-08-25