🤖 machine learning

Safety Training Modulates Harmful Misalignment Under On-Policy RL, But Direction Depends on Environment Design

تُظهر هذه الورقة أن تأثير تدريب السلامة القائم على السياسة (on-policy) على عدم المواءمة الضارة في النماذج اللغوية الكبيرة يعتمد بشكل كبير على السياق، حيث يمكن لحجم النموذج أن يعمل إما كدرع سلامة أو يُمكّن من استغلال أكبر اعتماداً على ميزات تصميم بيئة محددة مثل تأطير الأدوار وإشارات قابلية التلاعب بالأنظمة، بينما تكشف أيضاً أن معايير السلامة القياسية غالباً ما تفشل في التنبؤ بهذه السلوكيات الناجمة عن التعلم التعزيزي.

Leon Eshuijs, Shihan Wang, Antske Fokkens2026-04-15
🤖 machine learning

Evaluating Differential Privacy Against Membership Inference in Federated Learning: Insights from the NIST Genomics Red Team Challenge

تثبت هذه الورقة تجريبياً أن هجوماً جديداً لاستنتاج العضوية قائماً على التراكم (stacking)، والذي يجمع بين عدة مُقدِّرات الصندوق الأسود، ينجح في اختراق نماذج التعلم الاتحادي بفعالية حتى في ظل إعدادات الخصوصية التفاضلية العالية (ϵ=10\epsilon=10)، ويتفوق بشكل كبير على النماذج المرجعية التقليدية في سيناريوهات الخصوصية المنخفضة (ϵ=200\epsilon=200) حيث تفشل هجمات الإشارة الواحدة.

Gustavo de Carvalho Bertoli2026-04-15
💻 computer science

EXTree: Towards Supporting Explainability in Attribute-based Access Control

تقدم هذه الورقة EXTree، وهو إطار عمل قائم على الأشجار يعمل على تحسين سياسات التحكم في الوصول القائم على السمات (ABAC) لضمان كفاءة التقييم وتوفير تفسيرات متمحورة حول الإنسان لطلبات الوصول المرفوضة في آن واحد.

Shanampudi Pranaya Chowdary, Shamik Sural2026-04-15
🤖 AI

Parallax: Why AI Agents That Think Must Never Act

تجادل هذه الورقة بأن السلامة القائمة على التلقين غير كافية للوكلاء المستقلين للذكاء الاصطناعي، وتقدم "بارالاكس" (Parallax)، وهو إطار معماري يفرض الفصل الإدراكي التنفيذي والتحقق متعدد المستويات لتحقيق تخفيف للهجمات يقترب من المثالية حتى عندما يكون نظام الاستدلال مخترقاً بالكامل.

Joel Fokou2026-04-15
🤖 machine learning

Lightweight Strategy for XOR PUFs as Security Primitives for Resource-constrained IoT device

تقترح هذه الورقة استراتيجية خفيفة الوزن تعمل على تحسين معايير بنية "XOR Arbiter PUF" وطرق استخدامها لتحقيق أمن قوي ضد هجمات تعلم الآلة، مع الحفاظ على انخفاض التكاليف العتادية واستهلاك الطاقة لأجهزة إنترنت الأشياء محدودة الموارد.

Gaoxiang Li, Khalid T. Mursi, Yu Zhuang2026-04-14
💻 computer science

A Survey on the Applications of Zero-Knowledge Proofs

تقدم هذه الدراسة المسحية نظرة عامة تقنية شاملة وتحليلاً عملياً لبروتوكولات إثبات المعرفة الصفرية، مع تركيز خاص على تقنيات zkSNARKs، وذلك من خلال تصنيف تطبيقاتها المتنوعة عبر مجالات البلوكشين والمجالات غير المرتبطة بالبلوكشين، وتقييم مقايضات الأداء الرئيسية، ومراجعة البنية التحتية الداعمة واتجاهات البحث المستقبلية.

Ryan Lavin, Xuekai Liu, Hardhik Mohanty, Logan Norman, Giovanni Zaarour, Bhaskar Krishnamachari2026-04-14
🤖 machine learning

Designing Short-Stage CDC-XPUFs: Balancing Reliability, Cost, and Security in IoT Devices

تقترح هذه الورقة تصميماً محسناً وخفيف الوزن لـ "دالة التحدي التفاضلي للمكونات لـ XOR-PUF" (CDC-XPUF) مع استراتيجية اختيار مسبق توازن بفعالية بين الموثوقية والتكلفة والأمن لمقاومة هجمات تعلم الآلة والهجمات القائمة على الموثوقية في أجهزة إنترنت الأشياء ذات الموارد المحدودة.

Gaoxiang Li, Yu Zhuang2026-04-14
💬 NLP

Defending against Backdoor Attacks via Module Switching

تقترح هذه الورقة البحثية "دفاع تبديل الوحدات" (MSD)، وهي استراتيجية جديدة لما بعد التدريب تعمل على تعطيل هجمات الأبواب الخلفية عبر دمج وحدات النموذج بشكل انتقائي باستخدام خوارزمية تطورية، مما يظهر متانة فائقة وقدرة أعلى على الحفاظ على الفائدة مقارنة بمتوسط الأوزان، لا سيما في سيناريوهات النماذج المحدودة أو الأبواب الخلفية المتواطئة.

Weijun Li, Ansh Arora, Xuanli He, Mark Dras, Qiongkai Xu2026-04-14
🤖 machine learning

Property-Preserving Hashing for 1\ell_1-Distance Predicates: Applications to Countering Adversarial Input Attacks

تقدم هذه الورقة أول بناء لتجزئة الحفاظ على الخصائص لمتطلبات مسافة 1\ell_1، مما يوفر طريقة فعالة للغاية وقوية للكشف عن الصور المتشابهة إدراكياً تحت الهجمات العدائية من خلال إجبار المهاجمين على إدخال ضجيج كبير يؤدي إلى تدهور جودة الصورة للتهرب من الكشف.

Hassan Asghar, Chenhan Zhang, Dali Kaafar2026-04-14