💬 NLP

Logit-Gap Steering: A Forward-Pass Diagnostic for Alignment Robustness

تقدم هذه الورقة "فجوة لوجيت الرفض-التأكيد" كتشخيص للمرور الأمامي لقياس هوامش أمان المحاذاة، وتوضح أن "توجيه فجوة اللوجيت" يمكنه اكتشاف لواحق داخل النطاق ذات تعقيد منخفض وقابلة للنقل تتجاوز الدفاعات الحالية بكفاءة، مما يكشف أن متانة المحاذاة غالباً ما تعتمد على هوامش تشغيلية ضيقة.

Tung-Ling Li, Hongliang Liu2026-05-06
💻 computer science

On Digital Twins in Defence: Overview and Applications

تقدم هذه الورقة مراجعة شاملة لتطبيقات التوأم الرقمي في النمذجة والمحاكاة الدفاعية، حيث تقدم إطاراً موحداً وتصنيفاً لحالات الاستخدام مع تحديد التحديات الرئيسية واتجاهات البحث المستقبلية بناءً على آراء أصحاب المصلحة.

Marco Giberna, Holger Voos, Paulo Tavares, João Nunes, Tobias Sorg, Andrea Masini, Jose Luis Sanchez-Lopez2026-05-06
🤖 AI

False Friends in the Shell: Unveiling the Emoticon Semantic Confusion in Large Language Models

تحدد هذه الورقة البحثية وتقيم بشكل منهجي "الارتباك الدلالي للرموز التعبيرية"، وهو ثغرة أمنية منتشرة في النماذج اللغوية الكبيرة حيث يتم تفسير الرموز التعبيرية القائمة على رموز ASCII بشكل خاطئ للتسبب في إخفاقات صامتة وإجراءات تدميرية، مما يكشف أن استراتيجيات التخفيف الحالية غير فعالة إلى حد كبير.

Weipeng Jiang, Xiaoyu Zhang, Juan Zhai, Shiqing Ma, Chao Shen, Yang Liu2026-05-06
🤖 machine learning

Uncovering and Understanding FPR Manipulation Attack in Industrial IoT Networks

تكشف هذه الورقة عن هجوم جديد للتلاعب بمعدل الإنذارات الكاذبة (FPA) يستهدف شبكات إنترنت الأشياء الصناعية، والذي يستغل المعرفة ببروتوكول MQTT لتغيير الحزم السليمة بشكل منهجي لتُصنف خطأً على أنها خبيثة، مما يظهر معدلات نجاح عالية وتأخيرات تشغيلية كبيرة في مراكز عمليات الأمن مع اقتراح التدريب الخصمي كاستراتيجية للتخفيف من حدة الهجوم.

Mohammad Shamim Ahsan, Peng Liu2026-05-06
💻 computer science

Do Multimodal RAG Systems Leak Data? A Comprehensive Evaluation of Membership Inference and Image Caption Retrieval Attacks

تقدم هذه الورقة دراسة تجريبية تثبت أن أنظمة التوليد المعزز بالاسترجاع متعدد الوسائط (mRAG) عرضة لهجمات استنتاج العضوية واسترجاع وصف الصور، مما يكشف عن مخاطر خصوصية كبيرة في ربط مجموعات البيانات الخاصة بهذه المسارات.

Ali Al-Lawati, Suhang Wang2026-05-06
🤖 machine learning

DARTH-PUM: A Hybrid Processing-Using-Memory Architecture

تقترح الورقة البحثية DARTH-PUM، وهي بنية هجينة تدمج تقنيات المعالجة باستخدام الذاكرة (PUM) التناظرية والرقمية مع دوائر طرفية محسنة ودعم برمجِي لتمكين الحوسبة داخل الذاكرة الشاملة والموفرة للطاقة لتطبيقات متنوعة مثل التشفير والتعلم العميق.

Ryan Wong, Ben Feinberg, Saugata Ghose2026-05-06
🤖 AI

E-MIA: Exam-Style Black-Box Membership Inference Attacks against RAG Systems

تقترح هذه الورقة البحثية هجوم E-MIA، وهو هجوم استدلال العضوية خفي في بيئة الصندوق الأسود ضد أنظمة التوليد المعزز بالاسترجاع (RAG)، والذي يقوم بتحويل التفاصيل القابلة للتحقق من المستندات المرشحة إلى استعلام بأسلوب امتحاني لاستنتاج عضوية المستند بشكل موثوق بناءً على درجات الاستجابة المجمعة، متجاوزاً بذلك قيود الطرق الحالية التي تعتمد على إشارات ناعمة غير مستقرة أو استقصاءات تأكيدية لافتة للنظر.

Zelin Guan, Shengda Zhuo, Zeyan Li, Jinchun He, Wangjie Qiu, Zhiming Zheng, Shuqiang Huang2026-05-06
🤖 AI

Certified Purity for Cognitive Workflow Executors: From Static Analysis to Cryptographic Attestation

تقدم هذه الورقة بنية نقاء معتمدة تعزز حوكمة سير العمل المعرفي من خلال استبدال الاصطلاحات وقت التشغيل بحدود هيكلية عبر تجميع "ويب أسيمبلي" (WebAssembly) مقيد، وشهادات نقاء تشفيرية، وإثبات عن بُعد، مما يثبت رياضياً القضاء على التجاوزات العدائية مع الحفاظ على عبء تشغيلي ضئيل.

Alan L. McCann2026-05-06
💬 NLP

LLM Ghostbusters: Surgical Hallucination Suppression via Adaptive Unlearning

تقدم هذه المساهمة "التعلم غير المتكيف" (Adaptive Unlearning - AU)، وهو إطار عمل لما بعد النشر يعمل على كبح الهلوسات في النماذج اللغوية الكبيرة جراحياً — لا سيما في توليد الأكواد البرمجية، حيث تُمكّن هجمات "الاستيلاء عبر الحشو" (Slopsquatting) — من خلال هدف هجين على مستوى الرموز (token-level) وحلقة اكتشاف تكيفية، مما يقلل معدل الهلوسة بنسبة 81% دون الحاجة إلى تعليق بشري أو إعادة تدريب كاملة للنموذج.

Joseph Spracklen, Pedram Aghazadeh, Farinaz Koushanfar, Murtuza Jadliwala2026-05-06
🤖 AI

VisInject: Disruption != Injection -- A Dual-Dimension Evaluation of Universal Adversarial Attacks on Vision-Language Models

تجادل هذه الورقة بأن معدلات النجاح العالية المُبلغ عنها للهجمات العدائية الشاملة على نماذج الرؤية واللغة تخلط بين الاضطراب العام للمخرجات وبين حقن الأوامر الدقيق، وهو ما يكشف من خلال تقييم جديد ثنائي الأبعاد أنه بينما تؤدي الاضطرابات غير المحسوسة في كثير من الأحيان إلى إرباك مخرجات النموذج، إلا أنها نادراً ما تحقق حقناً فعلياً، حيث وصلت 0.756% فقط من الحالات المختبرة إلى أي مستوى من مستويات الحقن غير "العدم" (none).

Pang Liu, Yingjie Lao2026-05-06