🤖 AI

Class-Aware Adaptive Differential Privacy in Deep Learning for Sensor-Based Fall Detection

تقترح هذه الورقة إطار عمل للخصوصية التفاضلية التكيفية المدركة للفئات (CA-ADP) متكاملاً مع بنية (3D CNN-BiLSTM) التي تضبط مستويات الضجيج ديناميكياً بناءً على تكوين الفئات في الدفعة الصغيرة (mini-batch) لتحقيق ضمانات خصوصية رسمية مع تحسين أداء اكتشاف السقوط بشكل كبير عبر مجموعات بيانات مرجعية متعددة مقارنة بطرق الضجيج الموحد التقليدية.

Joydeb Kumar Sana2026-05-06
🤖 AI

CyberAId: AI-Driven Cybersecurity for Financial Service Providers

تقدم هذه الورقة الموقفية منصة CyberAId، وهي منصة هجينة متعددة الوكلاء مصممة لتعزيز الأمن السيبراني المالي من خلال دمج وكلاء فرعيين متخصصين يعتمدون على النماذج اللغوية الكبيرة (LLMs) مع بيانات التتبع التقليدية لأنظمة إدارة الأحداث والمعلومات الأمنية (SIEM) للتغلب على اختناقات الاستنتاج، وضمان الامتثال التنظيمي، وتمكين الدفاع الجماعي المحافظ على الخصوصية عبر المؤسسات المالية.

George Fatouros, Georgios Makridis, John Soldatos, Dimosthenis Kyriazis, Pedro Malo, George Kousiouris, Giannis Ledakis (…)2026-05-06
💬 NLP

RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs

تقدم هذه الورقة RefusalGuard، وهو إطار عمل للضبط الدقيق يحافظ على الهندسة ويخفف من تدهور السلامة في النماذج اللغوية من خلال تقييد التحديثات في فضاء التمثيل الخفي لمنع تشويه البنى ذات الصلة بالسلامة مع الحفاظ على أداء المهام.

Sadia Asif, Mohammad Mohammadi Amiri2026-05-06
🤖 AI

Trojan Hippo: Weaponizing Agent Memory for Data Exfiltration

تقدم هذه الورقة "Trojan Hippo"، وهو هجوم ذاكرة مستمر يستغل الحمولات الخاملة في وكلاء النماذج اللغوية الكبيرة (LLM agents) لتسريب البيانات الحساسة عند استجابة محفزات معينة، وتقترح إطار تقييم ديناميكي يوضح أنه بينما يمكن للدفاعات الحالية أن تخفف من هذه الهجمات بشكل كبير، إلا أنها غالباً ما تسبب تكاليف فادحة في المنفعة، مما يسلط الض الضوء على المقايضة الحرجة بين الأمن والمنفعة في نشر أنظمة الذاكرة الآمنة.

Debeshee Das, Julien Piet, Darya Kaviani, Luca Beurer-Kellner, Florian Tramèr, David Wagner2026-05-06
🤖 AI

When Alignment Isn't Enough: Response-Path Attacks on LLM Agents

تقدم هذه الورقة هجوم التلاعب بالترحيل (RTA)، وهو تهديد جديد يوضح أن أجهزة الترحيل الخارجية الخبيثة في بنيات الوكلاء من نوع "أحضر مفتاحك الخاص" (BYOK) يمكنها تجاوز محاذاة النماذج اللغوية الكبيرة عن طريق التلاعب بالاستجابات بعد توليدها، محققةً معدلات نجاح عالية للهجوم تعجز الدفاعات الحالية عن تخفيف حدتها بشكل كامل.

Mingyu Luo, Zihan Zhang, Zesen Liu, Yuchong Xie, Zhixiang Zhang, Dung Hiu Hilton Yeung, Wai Ip Lai, Ping Chen, Ming Wen (…)2026-05-06
🤖 AI

On the Privacy of LLMs: An Ablation Study

تقدم هذه الورقة نموذج تهديد موحداً لإجراء دراسة استئصال مهيكلة حول هجمات الخصوصية ضد النماذج اللغوية الكبيرة، كاشفةً أنه في حين تُظهر هجمات العضوية والباب الخلفي موثوقية عالية، فإن استنتاج السمات واستخراج البيانات يظلان تحدياً كبيراً ومع ذلك يشكلان مخاطر جسيمة، مما يسلط الضوء في النهاية على أن ثغرات الخصوصية تعتمد بشكل كبير على السياق وتدفعها خيارات تصميم النظام المحددة.

Karima Makhlouf, Lamiaa Basyoni, Syed Khaderi, Gabriel Marquez, Peter Sotomango, Mahmoud Awawdah, Sami Zhioua2026-05-06
🤖 AI

Privacy Preserving Machine Learning Workflow: from Anonymization to Personalized Differential Privacy Budgets in Federated Learning

تقترح هذه الورقة سير عمل شامل للتعلم الاتحادي الحافظ للخصوصية للبيانات الجدولية الحساسة، يدمج بين إخفاء الهوية، وكشف انحراف العميل للتخفيف من حدة التسمم، ومنهجية مبتكرة لتخصيص ميزانيات الخصوصية التفاضلية بناءً على مخاطر إعادة تحديد الهوية، مما يظهر أداءً فائقاً للنموذج مقارنة بنهج الميزانية الثابتة على السجلات الطبية.

Judith Sáinz-Pardo Díaz, Álvaro López García2026-05-06
💬 NLP

ContextualJailbreak: Evolutionary Red-Teaming via Simulated Conversational Priming

تقدم الورقة البحثية ContextualJailbreak، وهو إطار عمل تطوري لاختبار الاختراق (red-teaming) يستخدم عوامل طفرة مبتكرة وتصنيفًا متدرجًا للضرر لتحسين التمهيد الحواري متعدد الأدوار، محققًا معدلات نجاح شبه مثالية في كسر الحماية على نماذج مفتوحة متنوعة، ومظهرًا قابلية نقل كبيرة إلى النماذج المغلقة الرائدة مع الكشف عن تباينات صارخة في متانة المحاذاة عبر مختلف المزودين.

Mario Rodríguez Béjar, Francisco J. Cortés-Delgado, S. Braghin, Jose L. Hernández-Ramos2026-05-06
💬 NLP

FunFuzz: An LLM-Powered Evolutionary Fuzzing Framework

يُعد FunFuzz إطار عمل للتفتيش التطوري متعدد الجزر يستفيد من النماذج اللغوية الكبيرة مع مطالبات تكيفية موجهة بالتغذية الراجعة وهجرة دورية للمرشحين للتغلب على حساسية المطالبات وتباين أخذ العينات، مما يحقق تغطية فائقة للمترجمات ويكتشف مدخلات فريدة أكثر تسبب الفشل مقارنة بالنهج السابقة القائمة على النماذج اللغوية الكبيرة.

Mario Rodríguez Béjar, B. Romera-Paredes, Jose L. Hernández-Ramos2026-05-06
💻 computer science

Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses

تقدم هذه الدراسة مراجعة شاملة للسلامة في الذكاء الاصطناዊ المجسد من خلال تقديم تصنيف موحد متعدد المستويات يفحص الهجمات والدفاعات عبر مسار الوكيل بأكمله، وتوليف الرؤى من أكثر من 400 ورقة بحثية لتحديد التحديات الحرجة وتقديم خارطة طريق لبناء أنظمة واقعية آمنة وقوية وموثوقة.

Xiao Li, Xiang Zheng, Yifeng Gao, Xinyu Xia, Yixu Wang, Xin Wang, Ye Sun, Yunhan Zhao, Ming Wen, Jiayu Li, Xun Gong, Yi (…)2026-05-06