💬 NLP

Tuning for TraceTarnish: Techniques, Trends, and Testing Tangible Traits

تقيم هذه الورقة هجوم التنميط الأسلوبي العدائي "TraceTarnish" من خلال تحديد السمات اللغوية الرئيسية — وتحديداً ترددات الكلمات الوظيفية والكلمات المحتوية ونسبة النوع إلى الرمز — التي تعمل كدلالات على الاختراق للكشف عن تعمية التأليف، وكعناصر أساسية لتعزيز فعالية الهجوم.

Robert Dilworth2026-04-24
💻 computer science

Focus on What Matters: Fisher-Guided Adaptive Multimodal Fusion for Vulnerability Detection

تقترح الورقة البحثية إطار عمل TaCCS-DFA، وهو إطار عمل مبتكر يعالج أوجه القصور في الدمج متعدد الوسائط الساذج في اكتشاف الثغرات الأمنية باستخدام معلومات فيشر لتوجيه استراتيجية دمج تكيفية مشروطة بالمهمة تدمج الإشارات المتكاملة بشكل انتقائي، مما يحقق مكاسب كبيرة في الأداء مع حد أدنى من زمن التأخير الإضافي.

Yun Bian, Yi Chen, HaiQuan Wang, ShiHao Li, Zhe Cui2026-04-24
💻 computer science

How Generative AI Empowers Attackers and Defenders Across the Trust & Safety Landscape

من خلال دراسة نوعية شملت 43 خبيراً في مجال الثقة والأمان، تكشف هذه الورقة أن الذكاء الاصطناعي التوليدي يخفض في الوقت ذاته الحواجز أمام المهاجمين لإنشاء محتوى ضار على نطاق واسع، بينما يوفر للمدافعين أدوات قوية للكشف والتحقيق والتخفيف، مما يقدم في نهاية المطاف إطاراً استراتيجياً للتنقل عبر هذا التأثير ذي الحدين على السلامة عبر الإنترنت.

Patrick Gage Kelley, Steven Rousso-Schindler, Renee Shelby, Kurt Thomas, Allison Woodruff2026-04-24
💬 NLP

Intent Laundering: AI Safety Datasets Are Not What They Seem

تكشف هذه الورقة أن مجموعات بيانات سلامة الذكاء الاصطناعي المستخدمة على نطاق واسع معيبة لأنها تعتمد على "إشارات تحفيزية" صريحة بدلاً من السلوك العدائي الواقعي، مما يثبت أنه عند إزالة هذه الإشارات عبر تقنية تسمى "غسيل النوايا"، تفشل حتى النماذج رفيعة المستوى في منع المخرجات الضارة.

Shahriar Golchin, Marc Wetter2026-04-24
💻 computer science

CRED-1: An Open Multi-Signal Domain Credibility Dataset for Automated Pre-Bunking of Online Misinformation

تقدم هذه الورقة البحثية CRED-1، وهي مجموعة بيانات مفتوحة المصدر وقابلة لإعادة الإنتاج تضم 2,672 نطاقاً مُعززة بدرجات مصداقية متعددة الإشارات، صُممت لتمكين التوعية الاستباقية (pre-bunking) للحفاظ على الخصوصية من جانب العميل ضد المعلومات المضللة عبر الإنترنت من خلال إضافات المتصفح على الأجهزة.

Alexander Loth, Martin Kappes, Marc-Oliver Pahl2026-04-24
💻 computer science

Omission Constraints Decay While Commission Constraints Persist in Long-Context LLM Agents

تحدد هذه الورقة وتُحدد كمياً ظاهرة "تباعد الأمان والاستدعاء" (Security-Recall Divergence)، وهي ظاهرة تفشل فيها وكلاء النماذج اللغوية الكبيرة بشكل متزايد في الالتزام بالقيود الأمنية القائمة على الحظر (السهو/الإغفال) مع زيادة طول المحادثة، بينما تحافظ في الوقت ذاته على الالتزام الصارم بالقيود القائمة على المتطلبات (الامتثال/التنفيذ)، وهو نمط فشل يظل غير مرئي للمراقبة القياسية ولكن يمكن التخفيف من حدته عن طريق إعادة حقن القيود قبل الوصول إلى "عمق الدور الآمن" الخاص بالنموذج.

Yeran Gamage2026-04-24
💻 computer science

SDNGuardStack: An Explainable Ensemble Learning Framework for High-Accuracy Intrusion Detection in Software-Defined Networks

تقدم هذه الورقة SDNGuardStack، وهو إطار عمل للتعلم التجميعي القابل للتفسير تم تدريبه على مجموعة بيانات InSDN، والذي يحقق دقة بنسبة 99.98% في اكتشاف اختراقات الشبكات المعرفة برمجياً (SDN) مع استخدام تقنية SHAP لتوفير رؤى شفافة وقابلة للتنفيذ لمحللي الأمن.

Ashikuzzaman, Md. Saifuzzaman Abhi, Mahabubur Rahman, Md. Manjur Ahmed, Md. Mehedi Hasan, Md. Ahsan Arif2026-04-24
🤖 machine learning

Differentially Private Model Merging

تقترح هذه الورقة تقنيات معالجة لاحقة، وتحديداً الاختيار العشوائي والتركيب الخطي، لتوليد نماذج تستوفي متطلبات الخصوصية التفاضلية التعسفية من مجموعة من النماذج المدربة مسبقاً دون تدريب إضافي، مع إثبات تفوق التركيب الخطي نظرياً والتحقق من صحة النهج عبر مجموعات بيانات متنوعة.

Qichuan Yin, Manzil Zaheer, Tian Li2026-04-24
💬 NLP

Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models

تقدم هذه الورقة البحثية "هجوم اختطاف الوظائف" (FHA) المبتكر الذي يتلاعب بقوة بالنماذج الذكية للذكاء الاصطناعي الوكيل لدفعها نحو تنفيذ وظائف يختارها المهاجم بغض النظر عن دلالات السياق، محققاً معدلات نجاح عالية عبر نماذج متنوعة ومبرهناً على الحاجة الماسة لتعزيز الضوابط الأمنية في أنظمة استدعاء الوظائف.

Yannis Belkhiter, Giulio Zizzo, Sergio Maffeis, Seshu Tirupathi, John D. Kelleher2026-04-24