🤖 AI

BioRefusalAudit: Auditing Biosecurity Refusal Depth Using General and Domain-Fine-Tuned Sparse Autoencoders

تقدم هذه الورقة إطار عمل لتدقيق الأمن الحيوي باستخدام المشفّرات التلقائية المتناثرة (sparse autoencoders) لتكشف أن النماذج اللغوية تُظهر سلوكيات رفض غير متسقة وغالباً ما تكون سطحية مدفوعة بعوامل قانونية وثقافية بدلاً من الكشف الحقيقي عن المخاطر، مع إثبات أن تحليل مستوى التنشيط الداخلي يمكن أن يكشف عن أوضاع الفشل غير المرئية للتقييمات السلوكية القياسية.

Caleb DeLeeuw2026-05-29
🤖 machine learning

Token-Level Generalization in LoRA Adapter Backdoors: Attack Characterization and Behavioral Detection

تُثبت هذه الورقة أن مُلحقات "LoRA" يمكن استهدافها بفعالية عبر "أبواب خلفية" من خلال تسميم البيانات لإنشاء هجمات تعميم على مستوى الرمز (token) تتجنب الكشف الهيكلي، بينما تقترح طرق كشف قوية على مستوى السلوك والأوزان لتحديد هذه الملحقات المخترقة في سلاسل التوريد.

Travis Lelle2026-05-29
💻 computer science

LightPHE: Integrating Partially Homomorphic Encryption into Python with Extensive Cloud Environment Evaluations

تقدم هذه الورقة LightPHE، وهو إطار عمل بلغة بايثون خفيف الوزن وقابل للتوسع للتشفير المتماثل جزئياً، ويتحقق من أدائه المتفوق وقابليته للتوسع عبر بيئات سحابية متنوعة من خلال اختبارات قياسية شاملة على Google Colab وMicrosoft Azure.

Sefik Ilkin Serengil, Alper Ozpinar2026-05-28
🤖 machine learning

MM-PoisonRAG: Disrupting Multimodal RAG with Local and Global Poisoning Attacks

تقدم الورقة البحثية إطار عمل MM-PoisonRAG، الذي يوضح أن أنظمة التوليد المعزز بالاسترجاع متعددة الوسائط معرضة بشدة لكل من هجمات التسميم الموضعي المستهدف والتسميم العالمي الواسع، والتي يمكن أن تؤدي إلى تدهور دقة النموذج وتجاوز الدفاعات الحالية بشكل خطير.

Hyeonjeong Ha, Qiusi Zhan, Jeonghwan Kim, Dimitrios Bralios, Saikrishna Sanniboina, Nanyun Peng, Kai-Wei Chang, Daniel K (…)2026-05-28
⚡ electrical engineering

An Adversarial-Driven Experimental Study on Deep Learning for RF Fingerprinting

تكشف هذه الورقة عن ثغرات أمنية حرجة في أنظمة بصمة التردد الراديوي القائمة على التعلم العميق، حيث تُثبت من خلال تجارب واقعية مكثفة أن الانزياحات في النطاق تسبب أخطاءً مستمرة في التصنيف يمكن استغلالها كأبواب خلفية، وأن التدريب على الإشارات الخام يدمج بصمات الأجهزة مع الميزات البيئية، مما يخلق نواقل هجوم لا يمكن معالجتها بطرق ما بعد المعالجة.

Xinyu Cao, Bimal Adhikari, Shangqing Zhao, Jingxian Wu, Yanjun Pan2026-05-28
💬 NLP

AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens

تقدم هذه الورقة البحثية AdvJudge-Zero، وهي طريقة تثبت أن الأحكام الثنائية لنموذج "النموذج اللغوي الكبير كحكم" (LLM-as-a-Judge) يمكن قلبها بنسب نجاح عالية باستخدام رموز قصيرة ومنخفضة الارتباك (low-perplexity) يتم أخذ عينات منها من توزيع الحكم نفسه، وتقترح آلية دفاع قائمة على تقنية LoRA تخفف بفعالية من هذه الهجمات العدائية وتمنع انهيار المكافأة في تدريب التعلم المعزز من التغذية الراجعة البشرية (RLHF).

Tung-Ling Li, Yuhao Wu, Hongliang Liu2026-05-28
🤖 AI

Grimlock: Guarding High-Agency Systems with eBPF and Attested Channels

إنّ "جروملوك" (Grimlock) هو نظام حماية للوكلاء (Agent Guard) يعمل على تأمين سير عمل الوكلاء ذوي القدرة العالية (high-agency agentic workflows) في بيئات السحب المتعددة عبر الاستفيد من اعتراض حركة مرور eBPF وتوثيق TLS 1.3 لفرض اتصالات شفافة، قابلة للتدقيق، وذات امتيازات أدنى بين الصناديق الرملية (sandboxes) دون الحاجة إلى إجراء تعديلات على كود التنسيق الذي صاغه المستخدم.

Qiancheng Wu, Wenhui Zhang, Gan Fang, Sheng Mao, Biao Gao, David Levitsky, Shawna Murphy Butterworth, Rob Cameron2026-05-28
💬 NLP

Grounded Cache Routing for Retrieval-Augmented Generation: When Is It Safe to Reuse an Answer?

تقترح هذه الورقة GroundedCache، وهي آلية توجيه مثبتة بالأدلة تضمن إعادة الاستخدام الآمن للإجابات المخزنة مؤقتاً في التوليد المعزز بالاسترجاع من خلال فرض أربع بوابات سلامة متزامنة، مما يؤدي إلى القضاء على معدلات تقديم الإجابات غير الآمنة عبر أعباء عمل متنوعة مع الحفاظ على زمن انتقال قريب من الخط المرجعي.

Syed Huma Shah (Duke University)2026-05-28
💻 computer science

Analyzing Linear Layers in Related-Differential Cryptanalysis

تتقصى هذه الورقة بشكل منهجي وجود بنيات التفاضل المرتبطة في الطبقات الخطية لشفيرات تشبه AES، حيث تثبت أن مثل هذه الثغرات لا مفر منها لجميع المصفوفات غير الـ MDS، وجميع مصفوفات الـ MDS المتماثلة ذات الرتب الفردية، ومعظم المصفوفات الدائرية، مع تقديم توصيف كامل لمصفوفات الـ MDS من النوع 3×33 \times 3 فوق الحقل F2m\mathbb{F}_{2^m}.

Yogesh Kumar, Akshay Ankush Yadav, Susanta Samanta2026-05-28
🤖 AI

On the Origin of Synthetic Information by Means of Steganographic Inheritance

تقترح هذه الورقة آلية وراثة إخفائية تدمج سمات نسب قابلة للتتبع بشكل غير مرئي داخل المعلومات الاصطناعية التي يولدها الذكاء الاصطناعي، مما يتيح إعادة بناء تاريخها التطوري وأصولها رغم التعديلات الهيكلية أو الدلالية.

Ching-Chun Chang, Isao Echizen2026-05-28