💬 NLP

Prompt Injection Detection is Regime-Dependent: A Deployment-Aware Evaluation with Interpretable Structural Signals

تقدم هذه الورقة تقييماً مدركاً لبيئة النشر يوضح أن أداء كشف حقن الأوامر (prompt injection) يعتمد بشكل كبير على النظام الحاكم وحساس تجاه اختيار العتبة، مما يكشف أنه في حين توفر النماذج القائمة على المحولات (transformer-based models) أقوى النتائج الإجمالية، فإن الإشارات الهيكلية القابلة للتفسير توفر مكاسب ثابتة في سيناريوهات تشغيلية محددة وتسلط الضوء على الفجوة الحرجة بين مقاييس الترتيب والفعالية في العالم الحقيقي.

Akindoyin Akinrele, Shreyank N Gowda2026-05-27
🤖 AI

Lessons from Penetration Tests on Large-Scale Agent Systems

تقدم هذه الورقة نتائج اختبارات الاختراق لعام ٢٠٢٥ على أنظمة الوكلاء الاصطناعيين المملوكة، والتي تكشف أنه على الرغم من معايير التطوير الأكثر صرامة، إلا أنها لا تزال تظهر ثغرات أمنية متكررة مشابهة لتلك الموجودة في الوكلاء مفتوحي المصدر بسبب طبيعتها المعقدة، وغير المحدودة، وذاتية التعديل.

Kevin Eykholt, Dhilung Kirat, Xiaokui Shu, Jiyong Jang, Frederico Araujo, Ian Molloy2026-05-27
💻 computer science

Landseer: Exploring the Machine Learning Defense Landscape

تقدم هذه الورقة "لاندسير" (Landseer)، وهو إطار عمل معياري مصمم لدمج وتقييم تكوين دفاعات تعلم الآلة بشكل منهجي، مما يكشف عن فجوات حرجة في قابلية التكرار ويقدم رؤى حول تحديات نشر تدابير أمنية متعددة في آن واحد.

Ayushi Sharma, Rosemary Agbozo, Santiago Torres-Arias, Zahra Ghodsi2026-05-27
💻 computer science

Detecting Vulnerabilities in Encrypted Software Code while Ensuring Code Privacy

تقدم هذه الورقة CoCoA، وهي أداة مبتكرة تجمع بين التحليل الساكن والتشفير المتماثل القابل للبحث لتمكين اكتشاف الثغرات البرمجية في الكود المصدري المشفر مع الحفاظ على خصوصية الكود، محققةً دقة بنسبة 93% مع عبء أداء قدره 42.7% فقط مقارنة بالنماذج المرجعية غير السرية.

Jorge Martins, David Dantas, Rafael Ramires, Bernardo Ferreira, Ibéria Medeiros2026-05-26
💻 computer science

zkFuzz: Foundation and Framework for Effective Fuzzing of Zero-Knowledge Circuits

تقدم هذه الورقة البحثية zkFuzz، وهو إطار عمل جديد للفحص القائم على الطفرات (mutation-based fuzzing) يستند إلى اختبار اتساق تتبع القيود (TCCT) النظري، والذي يكتشف بفعالية ثغرات القيود الناقصة والقيود الزائدة في دوائر المعرفة الصفرية من خلال التغلب على قيود أدوات التحليل الاستاتيكي والتحليل الرسمي الحالية.

Hideaki Takahashi, Jihwan Kim, Suman Jana, Junfeng Yang2026-05-26
🤖 AI

MultiPhishGuard: An Explainable and Adaptive Multi-Agent LLM System for Phishing Email Detection

يُعد MultiPhishGuard إطار عمل للنماذج اللغوية الكبيرة متعدد الوكلاء، وهو قابل للتفسير والتكيف، يستخدم وكلاء متخصصين بتنسيق ذي أوزان ديناميكية وتدريب تنافسي لتحقيق أداء فائق في كشف رسائل البريد الإلكتروني الاحتيالية، حيث يصل إلى دقة بنسبة 97.89% مع تقديم تفسيرات قابلة للقراءة البشرية.

Yinuo Xue, Eric Spero, Meng Wai Woo, Wei Gao, Giovanni Russello2026-05-26
🤖 AI

SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models

تقدم هذه الورقة أول تحليل شامل لعمليات كسر الحماية (jailbreak) لعائلة نماذج DeepSeek مقارنة بنماذج GPT-3.5 وGPT-4، كاشفةً أنه في حين يُظهر DeepSeek صموداً جزئياً ضد الهجمات القائمة على التحسين، إلا أنه يظل أكثر عرضة للمدخلات العدائية القائمة على الأوامر النصية (prompts) مقارنة بـ GPT-4، مما يسلط الضوء على مقايضة حرجة بين كفاءة النموذج وتعميم محاذاة السلامة.

Xiaodong Wu, Xiangman Li, Qi Li, Lingshuang Liu, Jianbing Ni2026-05-26
💬 NLP

From Multi-Agent Systems and the Semantic Web to Agentic AI: A Unified Narrative of the Web of Agents

تقدم هذه الورقة سردية موحدة لتطور "شبكة الوكلاء" من عام 1990 إلى عام 2026، محاججةً بأن "هجرة الجهد الدلالي" من تنسيق المنصات إلى توصيف البيانات وأخيرًا إلى تفسير النماذج تحدد ثلاثة أجيال متميزة، مع تقديم إطار مقارن، وتصنيفات للنظم، وتحليل للتقارب المؤسسي الأخير لتحديد التحديات المستمرة والتوجهات المستقبلية للذكاء الاصطناعي الوكيل.

Tatiana Petrova (SEDAN SnT, University of Luxembourg, Luxembourg, Luxembourg), Boris Bliznioukov (SEDAN SnT, University (…)2026-05-26
💬 NLP

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework

تقدم هذه الورقة ArxivRoll، وهو إطار تقييم ديناميكي مستوحى من تشفير لوحة المرة الواحدة (one-time pad)، يستخدم معياراً آلياً نصف سنوي يتم إنشاؤه من مقالات ArXiv الحديثة لقياس وتخفيف المبالغة في تقدير النماذج اللغوية الكبيرة (LLMs) الناتجة عن تلوث البيانات وتحيز التدريب.

Zi Liang, Liantong Yu, Shiyu Zhang, Qingqing Ye, Haibo Hu2026-05-26