🤖 AI

DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows

تقدم هذه الورقة البحثية DecisionBench، وهو ركيزة معيارية شاملة لتقييم التفويض الناشئ في تدفقات العمل الوكيلية طويلة الأمد عبر نماذج ومهام متنوعة، كاشفةً أنه بينما تظل جودة المهام مستقرة عبر ظروف الوعي المختلفة، إلا أن هناك إمكانات غير مستغلة كبيرة لتحسين دقة التوجيه وأداء التنسيق العام.

Yuxuan Gao, Megan Wang, Yi Ling Yu, Zijian Carl Ma, Ao Qu2026-05-20
🤖 AI

POLAR-Bench: A Diagnostic Benchmark for Privacy-Utility Trade-offs in LLM Agents

تقدم الورقة البحثية POLAR-Bench، وهو معيار تشخيصي يقيم مدى التزام وكلاء النماذج اللغوية الكبيرة (LLM agents) بسياسات الخصوصية المحددة من قبل المستخدم ضد الاستقصاء العدائي، كاشفةً أنه في حين تحمي النماذج الرائدة البيانات الخاصة بفعالية، فإن النماذج الأصغر ذات الأوزان المفتوحة والمستخدمة عادةً للاستنتاج على الأجهزة تعاني من تسرب كبير للخصوصية.

Qiaoyuan Zheng, Yiqu Yang, Qi Gao, Imanol Schlag2026-05-20
🤖 AI

Learning to Hand Off: Provably Convergent Workflow Learning under Interface Constraints

تقدم هذه الورقة البحثية خوارزمية IC-QQ، وهي خوارزمية تعلم QQ لامركزية لتدفقات العمل متعددة الوكلاء التي تعمل تحت قيود الواجهة، وتضع أول ضمان تقارب للعينات المحدودة لتعلم QQ العصبي في هذا السياق من خلال تفكيك الخطأ إلى مكونات التقريب الدالي، والتمثيل، ووقت الخلط، مع التحقق تجريبياً من قدرتها على مطابقة أداء الأوراكل المركزي دون الوصول إلى المسارات المشتركة.

Jiayu Li, Enpei Zhang, Dawei Zhou, Elynn Chen, Yujun Yan2026-05-20
🤖 machine learning

Flash PD-SSM: Memory-Optimized Structured Sparse State-Space Models

تقدم الورقة البحثية Flash PD-SSM، وهو نموذج فضاء حالة متناثر مهيكل ومحسن للذاكرة، يختار ديناميكيًا من مجموعة من المصفوفات المتناثرة القابلة للتدريب لتحقيق القدرة التعبيرية العالية للنماذج غير المهيكلة مع الحفاظ على الكفاءة الحسابية المطلوبة للتدريب واسع النطاق والأداء المتميز في المتواليات الطويلة.

Aleksandar Terzić, Francesco Carzaniga, Nicolas Menet, Yannick Biehl, Michael Hersche, Thomas Hofmann, Abbas Rahimi2026-05-20
🤖 AI

How Far Are We From True Auto-Research?

تقدم هذه الورقة البحثية "ResearchArena"، وهو إطار عمل لتقييم وكلاء البحث المستقلين، وتجد أنه في حين يمكنهم إنتاج مسودات أبحاث تبدو تنافسية تحت المراجعة السطحية، إلا أنهم يفشلون في النهاية في إنتاج أبحاث رفيعة المستوى بسبب مشكلات جسيمة في الدقة التجريبية، بما في ذلك النتائج المفبركة وعدم التطابق بين الخطط والتنفيذ.

Zhengxin Zhang, Ning Wang, Sainyam Galhotra, Claire Cardie2026-05-20
🤖 AI

Going PLACES: Participatory Localized Red Teaming for Text-to-Image Safety in the Global South

تقدم هذه الورقة مبادرة PLACES، وهي مبادرة للفريق الأحمر التشاركي تعالج التحيزات المتمحورة حول الغرب في سلامة تحويل النص إلى صورة من خلال التعاون مع مجتمعات في دول الجنوب العالمي لإنشاء مجموعة بيانات متنوعة تضم أكثر من 26,000 مثال من حالات الفشل الموضعية، مما يكشف عن أضرار ثقافية فريدة ويدعو إلى أطر سلامة تراعي السياق.

Charvi Rastogi, Mukul Bhutani, Minsuk Kahng, Shamsuddeen Hassan Muhammad, Evgeniia Razumovskaia, Priyanka Suresh, Ibrahi (…)2026-05-20
🤖 AI

Hallucination as Exploit: Evidence-Carrying Multimodal Agents

تقدم هذه الورقة البحثية "الوكلاء متعددون الوسائط حاملو الأدلة" (ECA)، وهي بنية آمنة تمنع إخفاقات التفويض الناجمة عن الهلوسة من خلال اشتراط التحقق من استدعاءات الأدوات مقابل شهادات أدلة خارجية محددة النوع، بدلاً من الاعتماد على الادعاءات الإدراكية غير المتحقق منها للنموذج.

Guijia Zhang, Hao Zheng, Harry Yang2026-05-20
🔢 mathematics

Aerial Inspection Behaviors via RL-based Quadrotor Control for Under-canopy Forest Environments

تقدم هذه الورقة نظام طائرة كوادروتور (رباعية المراوح) ذاتية القيادة لفحص الغابات تحت المظلة الشجرية، يجمع بين متحكم منخفض المستوى يعتمد على التعلم التعزيزي العميق لتتبع وضعية الرؤية بدقة، وبين حزمة ملاحة عالية المستوى تستخدم مخططي TSP وRRT* لضمان تنفيذ مهام آمنة وطويلة المدى.

Fausto Mauricio Lagos Suarez, Akshit Saradagi, Vidya Sumathy, Viswa Narayanan Sankaranarayanan, George Nikolakopoulos2026-05-20
🤖 AI

Not all uncertainty is alike: volatility, stochasticity, and exploration

تُثبت هذه الورقة أن مصادر عدم اليقين البيئي المتميزة — وتحديداً التقلب والعشوائية — تدفع الاستكشاف الأمثل في اتجاهات متعاكسة، مما أدى إلى تطوير خوارزمية CAUSE التي تستفيد من هذا التباين للتفوق على الاستراتيجيات القياسية وتقدم رؤى جديدة حول استدلال الضجيج المرضي في الحالات النفسية.

Payam Piray2026-05-20
🤖 AI

SimGym: A Framework for A/B Test Simulation in E-Commerce with Traffic-Grounded VLM Agents

إنّ SimGym هو إطار عمل يستفيد من وكلاء نماذج الرؤية واللغة المرتكزة على حركة المرور والذين يعملون في متصفح حي لمحاكاة اختبارات A/B للتجارة الإلكترونية بسرعة ودقة، محققاً توافقاً اتجاهياً بنسبة 77% مع النتائج الواقعية مع تقليل دورات التجارب من أسابيع إلى أقل من ساعة دون تعريض المستخدمين الفعليين لمتغيرات غير مثبتة.

Han Li, Vibhor Malik, Zahra Zanjani Foumani, Alberto Castelo, Shuang Xie, Ailin Fan, Keat Yang Koay, Yuanzheng Zhu, Meys (…)2026-05-20