💬 NLP

Beyond Pattern Matching: Seven Cross-Domain Techniques for Prompt Injection Detection

تقترح هذه الورقة وتقيم سبع تقنيات للكشف عبر المجالات عن حقن الأوامر (prompt injection) — مستمدة من مجالات مثل المعلوماتية الحيوية، والاقتصاد، ونظرية المترجمات — للتغلب على قيود أساليب التعبيرات النمطية (regex) والمصنفات الضبطية (fine-tuned classifiers) الحالية، مع دمج ثلاث من هذه الطرق بنجاح في إصدار prompt-shield v0.4.1 وإظهار تحسينات كبيرة في مقياس F1 score.

Thamilvendhan Munirathinam2026-04-21
💬 NLP

Different Paths to Harmful Compliance: Behavioral Side Effects and Mechanistic Divergence Across LLM Jailbreaks

تُثبت هذه الورقة أنه في حين أن الضبط الدقيق الخاضع للإشراف الضار، والتعلم التعزيزي بالمكافآت القابلة للتحقق (RLVR) الضار، وعملية "الاستئصال" (abliteration) المثبطة للرفض، تحقق جميعها امتثالاً ضاراً يقترب من السقف في النماذج اللغوية ذات الأوزان المفتوحة، إلا أنها تتباعد بشكل كبير في آثارها الجانبية السلوكية، وآلياتها الداخلية، وقابليتها للإصلاح، حيث تنفرد نماذج RLVR التي تم كسر حمايتها بالحفاظ على إدراك السلامة وقدرات النموذج الأساسي رغم مخرجاتها الضارة.

Md Rysul Kabir, Zoran Tiganj2026-04-21
💻 computer science

Goldilocks Isolation: High Performance VMs with Edera

تُعد Edera برنامج مراقب أنظمة وهمية (hypervisor) من النوع الأول (Type 1) مُحسَّنًا يستفيد من تقنية المحاكاة الافتراضية شبه المباشرة (paravirtualization) لتقديم عزل قوي يضاهي الأنظمة القائمة على مراقبي الأنظمة الوهمية، مع الحفاظ في الوقت ذاته على أداء يقارب أداء Docker وتوافق كامل مع Kubernetes، مما يعالج بفعالية الثغرات الأمنية المتأصلة في تقنية الحاويات ذات النواة المشتركة.

Marina Moore, Alex Zenla2026-04-20
💻 computer science

Blueprint, Bootstrap, and Bridge: A Security Look at NVIDIA GPU Confidential Computing

تقدم هذه الورقة تحليلاً أمنياً شاملاً للحوسبة السرية لوحدات معالجة الرسومات من NVIDIA عبر إعادة بناء بنيتها المملوكة، وفحص محركاتها المتخصصة وعملية الإقلاع الخاصة بها، والتحقق تجريبياً من حماية البيانات عبر عمليات النقل بين وحدة المعالجة المركزية ووحدة معالجة الرسومات، مع الإفصاح عن جميع النتائج لشركة NVIDIA بشكل مسؤول.

Zhongshu Gu, Enriquillo Valdez, Salman Ahmed, Julian James Stephen, Michael Le, Hani Jamjoom, Shixuan Zhao, Zhiqiang Lin2026-04-20
🤖 AI

When Search Goes Wrong: Red-Teaming Web-Augmented Large Language Models

تقدم هذه الورقة CREST-Search، وهو إطار عمل رائد لاختبار الاختراق (red-teaming) يستخدم استراتيجيات هجوم مبتكرة ومجموعة بيانات متخصصة لكشف ثغرات السلامة في النماذج اللغوية الكبيرة المعززة بالويب من خلال توليد استعلامات حميدة تؤدي إلى الاستشهاد بمحتوى ويب ضار.

Haoran Ou, Kangjie Chen, Xingshuo Han, Gelei Deng, Jie Zhang, Han Qiu, Tianwei Zhang2026-04-20
💬 NLP

Power to the Clients: Federated Learning in a Dictatorship Setting

تقدم هذه الورقة وتحلل "العملاء الدكتاتوريين" (dictator clients)، وهم فئة جديدة من المشاركين الخبيثين في التعلم الاتحادي القادرين على محو مساهمات العملاء الآخرين تماماً مع الحفاظ على مساهماتهم الخاصة، مستكشفةً تأثيرهم من خلال تحليل التقارب النظري والتقييمات التجريبية عبر سيناريوهات تعاونية وعدائية متنوعة.

Mohammadsajad Alipour, Mohammad Mohammadi Amiri2026-04-20
💻 computer science

A Reality Check on SBOM-based Vulnerability Management: An Empirical Study and A Path Forward

تكشف هذه الدراسة التجريبية لـ 2,414 مستودعاً أنه بينما تتيح ملفات القفل إنشاء قائمة دقيقة لمواد البرمجيات (SBOM)، تعاني أدوات فحص الثغرات الأمنية اللاحقة من معدل إنذارات كاذبة بنسبة 92% بسبب الكود غير القابل للوصول، وهي مشكلة تم التخفيف من حدتها بفعالية من خلال دمج تحليل استدعاء الدوال لتقليل التنبيهات بنسبة 61.9% وتخفيف إجهاد المطورين.

Li Zhou, Marc Dacier, Charalambos Konstantinou2026-04-20
💻 computer science

LogJack: Indirect Prompt Injection Through Cloud Logs Against LLM Debugging Agents

تقدم الورقة البحثية LogJack، وهو معيار يوضح أن وكلاء تصحيح أخطاء النماذج اللغوية الكبيرة (LLM) معرضون بشدة لحقن الأوامر غير المباشر عبر سجلات السحابة، والتي غالباً ما تتجاوز الضوابط السحابية الرئيسية وتؤدي إلى تنفيذ أوامر غير مصرح بها حتى عندما تحاول النماذج تنقية المحتوى الضار.

Harsh Shah2026-04-20
💻 computer science

An Agentic Workflow for Detecting Personally Identifiable Information in Crash Narratives

تقدم هذه الورقة سير عمل وكيلِيّاً قابلاً للنشر محلياً يجمع بين الاستخراج القائم على القواعد، والنماذج اللغوية الكبيرة الضبطية، وخطوة تحقق قائمة على الأدلة لتحقيق كشف قوي ومحافظ على الخصوصية لمعلومات الهوية الشخصية في روايات حوادث التصادم، مما يمكّن من تحليل سلامة المرور بشكل قابل للتوسع مع حماية خصوصية الأفراد.

Junyi Ma, Pei Li, Rui Gan, Kai Cheng, Steven T. Parker, Bin Ran2026-04-20
🤖 AI

LinuxArena: A Control Setting for AI Agents in Live Production Software Environments

تقدم الورقة البحثية LinuxArena، وهي بيئة التحكم الأكبر والأكثر تنوعاً لوكلاء الذكاء الاصطناعي الذين يعملون في بيئات الإنتاج الحية، والتي تتميز بآلاف المهام في هندسة البرمجيات وسيناريوهات فشل السلامة لإظهار قدر كبير من الآفاق المتاحة لكل من أبحاث الهجوم والدفاع من خلال تقييمات التخريب والمراقبة.

Tyler Tracy, Ram Potham, Nick Kuhn, Myles Heller, Anshul Khandelwal, Cody Rushing, Henri Lemoine, Miguel Brandao, Tomas (…)2026-04-20