💬 NLP

SNARE: Adaptive Scenario Synthesis for Eliciting Overeager Behavior in Coding Agents

تقدم هذه الورقة SNARE، وهو مسار تكيفي يعمل على تخليق سيناريوهات حميدة للكشف عن أن ما يقرب من 20% من عمليات وكلاء البرمجة تظهر سلوكًا "متحمسًا للغاية" (القيام بإجراءات غير مصرح بها رغم نجاح المهمة)، وهي ثغرة ناتجة عن أطر عمل الوكلاء أكثر من النماذج الأساسية وتغفل عنها المقاييس الحالية إلى حد كبير.

Yubin Qu, Yi Liu, Gelei Deng, Yanjun Zhang, Yuekang Li, Ying Zhang, Leo Yu Zhang2026-05-28
🤖 AI

Do Clinical Models Change Treatment Decisions?

تقدم هذه الورقة ClinPivot، وهو معيار مرجعي يوضح أن الأداء القوي في الأسئلة والأجوبة الطبية لا يضمن قدرة النموذج على تكييف قرارات العلاج بشكل صحيح مع سياقات المرضى المتغيرة، بينما يُظهر أن الإشراف القائم على هيكلة القرار وإعادة التشغيل خفيفة الوزن يمكن أن يحسنا من اتخاذ القرارات الحساسة للمتغيرات ومن قدرات المساعد العامة.

Dongkyu Cho, Miao Zhang, Rumi Chunara2026-05-28
🤖 AI

Data-Efficient On-Policy Distillation for Automatic Speech Recognition

تُثبت هذه الورقة أن التقطير داخل السياسة الموجه من قبل المعلم يُمكّن نموذج التعرف التلقائي على الكلام (ASR) مدمج بـ 0.6 مليار معلمة، والمدرب على 100 ألف ساعة فقط من الكلام، من التفوق بشكل كبير على الضبط الدقيق الخاضع للإشراف ومضاهاة النماذج المرجعية الأكبر حجمًا تقريبًا، مما يقلل من متطلبات البيانات للتعرف التلقائي على الكلام التنافسي.

Yu Lin, Yiming Wang, Runyuan Cai, Xiaodong Zeng2026-05-28
🤖 AI

DeltaMCP: Incremental Regeneration via Spec-Aware Transformation for MCP servers

تُعد DeltaMCP أداة مدركة للمواصفات تتيح التوليد التدريجي لخوادم MCP ذات المستوى المؤسسي عبر تحديث المكونات المتأثرة فقط عند تغير مواصفات OpenAPI، مما يقلل من العبء التطويري ويحسن قابلية الصيانة مقارنة بطرق التوليد الكامل.

Aditya Pujara, Xiaogang Zhu, Hsiang-Ting Chen2026-05-28
🤖 AI

OR-Space: A Full-Lifecycle Workspace Benchmark for Industrial Optimization Agents

تقدم الورقة البحثية OR-Space، وهو معيار مساحة عمل كاملة دورة الحياة مصمم لتقييم وكلاء التحسين الصناعي في مهام واقعية متعددة المراحل تتضمن بناء النماذج، والمراجعة، والتفسير المرتكز ضمن بيئات مستمرة ومتعددة المصنوعات، متجاوزاً بذلك تقييمات صياغة المشكلات التقليدية ذات الخطوة الواحدة.

Chenyu Zhou, Xinyun Lu, Jiangyue Zhao, Jianghao Lin, Dongdong Ge, Yinyu Ye2026-05-28
🤖 AI

Look on Demand: A Cognitive Scheduling Framework for Visual Evidence Acquisition in Multimodal Reasoning

تقدم هذه الورقة البحثية إطار عمل CSMR، وهو إطار استدلال متعدد الوسائط يعزز الدقة من خلال توظيف آلية جدولة معرفية حيث يقرر نموذج لغوي ديناميكيًا متى يستدعي وحدة إدراك بصري مستقلة للحصول على أدلة ذات صلة بالمهمة، مما يتغلب على قيود التحويل الثابت والهيمنة اللغوية في النهج الحالية.

Yang Zhang, Xiaoshuai Sun, Rui Zhao, Wujin Sun, Yidong Chen, Jiayi Ji, Qian Chen, Rongrong Ji2026-05-28
🤖 AI

Performance and Explainability Requirements of Evolutionary Algorithms in Real-World Physics-Informed Optimization

تتناول هذه الورقة الفجوة بين الحوسبة التطورية والتحسين القائم على الفيزياء في العالم الحقيقي من خلال تفصيل خمس مشكلات خاصة بمجالات محددة، وتحديد متطلبات الخبراء فيما يتعلق بالأداء والقابلية للتفسير لبناء الثقة، واقتراح تقنيات موجودة ولكن غير مستغلة بما يكفي لسد هذه الفجوة.

Helena Stegherr, Michael Heider, Nils Meyer, Tobias Thummerer, Thomas Wendler, Pierre Aublin, Ennio Idrobo-Àvila, Lars M (…)2026-05-28
💬 NLP

BenGER: Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law

تقدم الورقة البحثية BenGER، وهي مجموعة بيانات مرجعية شاملة لتقييم النماذج اللغوية الكبيرة في الاستدلال القانوني القائم على التضمين في القانون الألماني، مظهرةً أن النماذج الرائدة المغلقة تتصدر الأداء بينما يتفوق الإنشاء المشترك بين الإنسان والذكاء الاصطناي بشكل كبير على العمل البشري غير المدعوم، وكل ذلك تم التحقق منه من خلال إطار عمل قوي يعتمد على النموذج اللغوي الكبير كحَكَم.

Sebastian Nagl, Ann-Kristin Mayrhofer, Martin Heidebach, Aleyna Koçak, Anne Zettelmeier, Elly Breu, Angelina Greiner, So (…)2026-05-28
🤖 AI

Agentic Active Omni-Modal Perception for Multi-Hop Audio-Visual Reasoning

تقدم هذه الورقة MOV-Bench، وهو معيار للتحليل والاستنتاج السمعي البصري متعدد الخطوات، وتقترح AOP-Agent، وهو إطار عمل وكيل كفء يعزز قدرات الاستنتاج لنماذج Omni-LLM مفتوحة المصدر من خلال الإدراك النشط لجميع الأنماط دون الحاجة إلى تدريب إضافي.

Ke Xu, Yuhao Wang, Ziyang Cheng, Hongcheng Liu, Yanfeng Wang, Yu Wang2026-05-28
🤖 AI

Plant, Persist, Trigger: Sleeper Attack on Large Language Model Agents

تقدم هذه الورقة "هجوم النائم" (Sleeper Attack)، وهو تهديد أمني جديد يتمثل في حقن محتوى عدائي في البيئة الخارجية لوكيل النماذج اللغوية الكبيرة (LLM agent) يستمر عبر التفاعلات في حالته (مثل الذاكرة أو السياق) لتحفيز سلوكيات ضارة لاحقًا عبر استعلامات حميدة، مما يثبت أن الوكلاء الحاليين يظلون عرضة للخطر حتى عندما يبدون آمنين تحت اختبار التفاعل الواحد.

Yongxiang Li, Moxin Li, Zhixin Ma, Fengbin Zhu, Dongrui Liu, Wenjie Wang, Fuli Feng2026-05-28