🤖 AI

Governing AI-Assisted Security Operations: A Design Science Framework for Operational Decision Support

تقترح هذه الدراسة إطار عمل لعلوم التصميم لحوكمة العمليات الأمنية المدعومة بالذكاء الاصطناعي في البيئات عالية المخاطر، باستخدام أثر وسيط للاستعلام يعتمد على لغة KQL لفصل التخطيط القائم على الذكاء الاصطناعي عن التنفيذ وضمان المساءلة والخصوصية وقابلية التدقيق قبل توسيع نطاق الأتمتة.

Elyson A. De La Cruz, Rishikesh Sahay, Md Rasel Al Mamun2026-05-12
🤖 AI

SmartEval: A Benchmark for Evaluating LLM-Generated Smart Contracts from Natural Language Specifications

تقدم هذه الورقة SmartEval، وهو معيار شامل يتميز بمتن يضم 9,000 عقد Solidity من إنشاء النماذج اللغوية الكبيرة، ومعيار تقييم خماسي الأبعاد، ومسار عمل تم التحقق من صحته يكشف عن أنماط فشل مميزة بينما يوضح أن العقود التي أنشأتها النماذج اللغوية الكبيرة يمكن أن تتفوق على التنفيذات الحقيقية في الالتزام الوظيفي.

Abhinav Goel, Agostino Capponi, Alfio Gliozzo, Chaitya Shah2026-05-12
🤖 AI

Adaptive DNN Partitioning and Offloading in Heterogeneous Edge-Cloud Continuum

تقترح هذه الورقة وتتحقق من صحة إطار عمل لتقسيم وتفريغ الشبكات العصبية العميقة (DNN) بشكل تكيفي عبر متصل حافة-سحابة غير متجانس يتكيف ديناميكياً مع ظروف وقت التشغيل، مما يظهر انخفاضات كبيرة في استهلاك الطاقة وزمن الاستجابة مقارنة بالنماذج المرجعية الثابتة على منصة اختبار فيزيائية.

Akuen Akoi Deng, Eimantas Butkus, Alfreds Lapkovskis, Praveen Kumar Donta2026-05-12
🤖 AI

Workspace Optimization: How to Train Your Agent

تقدم هذه الورقة البحثية "تحسين مساحة العمل"، وهو نموذج تدريبي يعمل على تطوير الركيزة الخارجية المهيكلة للوكيل بدلاً من أوزانه، وتثبت فعاليته من خلال DreamTeam، وهو نظام متعدد الوكلاء يحقق نتيجة قياسية جديدة تبلغ 38.4% على معيار ARC-AGI-3 مع استخدام عدد أقل من الإجراءات.

Elad Sarafian, Gal Kaplun, Ron Banner, Daniel Soudry, Boris Ginsburg2026-05-12
🤖 AI

RDEx-CASK: Cauchy Mutation, Archive, and Stagnation Kick for RDEx-CSOP

تقدم الورقة البحثية RDEx-CASK، وهي نسخة محسنة من خوارزمية RDEx-CSOP تدمج طفرة كوشي المبتورة، وأرشيفًا بأسلوب JADE مقتصرًا على الحلول الممكنة، وآلية تجاوز محلي مستحثة بالركود لتحسين جودة الوعي بالحلول الممكنة والأداء للوصول إلى الهدف في مسائل CEC ذات القيود.

Dikshant, Dikshit Chauhan, Chen Hao, Anupam Trivedi, Harikumar Kandath, Senthilnath Jayavelu2026-05-12
🤖 AI

MedMeta: A Benchmark for LLMs in Synthesizing Meta-Analysis Conclusion from Medical Studies

تقدم الورقة البحثية MedMeta، وهو معيار جديد لتقييم قدرة النماذج اللغوية الكبيرة على توليف استنتاجات التحليل التلوي الطبي من ملخصات الدراسات، كاشفةً أن التوليد المعزز بالاسترجاع يتفوق بشكل كبير على النهج المعتمد على المعلمات فقط، بينما يكشف في الوقت ذاته عن ثغرات حرجة في التعامل مع الأدلة المنفية والقيمة المحدودة للضبط الدقيق المتخصص في المجال لهذه المهمة.

Huy Hoang Ha, Benoit Favre, Francois Portet2026-05-12
🤖 AI

Absurd World: A Simple Yet Powerful Method to Absurdify the Real-world for Probing LLM Reasoning Capabilities

تقدم هذه الورقة "العالم العبثي" (Absurd World)، وهو إطار عمل للمقارنة المرجعية يعمل على تحويل السيناريوهات الواقعية بشكل منهجي إلى سياقات عبثية لكنها متماسكة منطقيًا، وذلك لتقييم ما إذا كانت النماذج اللغوية الكبيرة تمتلك قدرات استدلال منطقي قوية ومستقلة عن الأنماط الواقعية المحفوظة.

Ryan Albright, Golam Md Muktadir, Zarif Ikram, S M Jubaer, Mehrab Hossain, Dianbo Liu2026-05-12
🤖 AI

DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents

تقدم الورقة البحثية DeepTumorVQA، وهو معيار مرجعي ثلاثي الأبعاد للأشعة المقطعية (CT) هرمي البنية يقوم بتفكيك تشخيص الأورام إلى أربع مراحل تدريجية لتقييم نماذج الرؤية واللغة الطبية والوكلاء المعززين بالأدوات، كاشفةً أن القياس الكمي يمثل عقبة رئيسية يمكن التخفيف من حدتها من خلال دمج الأدوات والإشراف خطوة بخطوة.

Yixiong Chen, Wenjie Xiao, Pedro R. A. S. Bassi, Boyan Wang, Liang He, Xinze Zhou, Sezgin Er, Ibrahim Ethem Hamamci, Zon (…)2026-05-12
🤖 AI

MonitoringBench: Semi-Automated Red-Teaming for Agent Monitoring

تقدم هذه الورقة MonitoringBench، وهو معيار اختبار للفريق الأحمر شبه مؤتمت يتكون من 2,644 مسار هجوم متنوع يكشف عن نقاط ضعف كبيرة في مراقبي الوكلاء الذكيين الحاليين، مما يظهر أن طرق التقييم الحالية غالباً ما تبالغ في تقدير الأداء عبر الفشل في اكتشاف هجمات الإقناع المتطورة وإعادة معايرة درجات الاشتباه.

Monika Jotautaitė, Maria Angelica Martinez, Ollie Matthews, Tyler Tracy2026-05-12
🤖 AI

Unpredictability dissociates from structured control in language agents

تُثبت هذه الورقة أنه في الوكلاء اللغويين، لا يمكن لعدم اليقين العشوائي أن يحل محل آليات التحكم الهيكلية التي تربط الأسباب والذاكرة والحالة الذاتية باختيار الفعل، حيث تؤدي الآفات المستهدفة لهذه المكونات الهيكلية باستمرار إلى تدهور الأداء، بينما تفشل المتغيرات ذات العشوائية العالية في محاكاة الاقتران الهيكلي بين حقل الفعل والمكونات المذكورة عبر اختبارات معيارية واسعة النطاق.

Jia Xiao2026-05-12