💻 computer science

Position: No Retroactive Cure for Infringement during Training

تجادل هذه الورقة بأن استراتيجيات التخفيف اللاحقة مثل "إلغاء تعلم الآلة" لا يمكنها معالجة المسؤولية عن انتهاك حقوق الطبع والنشر في الذكاء الاصطناعي التوليدي بأثر رجعي، لأن المسؤولية القانونية تعتمد على عملية الاستحواذ والتدريب غير المصرح بها بدلاً من المخرجات النهائية، مما يستوجب التحول نحو الامتثال القابل للتحقق المسبق.

Satoru Utsunomiya, Masaru Isonuma, Junichiro Mori, Ichiro Sakata2026-04-22
💻 computer science

Owner-Harm: A Missing Threat Model for AI Agent Safety

تقدم هذه الورقة البحثية "إلحاق الضرر بالمالك" (Owner-Harm)، وهو نموذج تهديد رسمي يعالج الفجوة الأمنية الحرجة المتمثلة في إلحاق وكلاء الذكاء الاصطناعي الضرر بجهات النشر الخاصة بهم، حيث تُظهر أن الدفاعات الحالية تفشل في التعميم عبر مفردات الأدوات المختلفة، وتقترح إطار عمل "التعميم الدفاعي الرمزي-الدلالي" (SSDG) للكشف عن هذه المخاطر والتخفيف من حدتها بفعالية.

Dongcheng Zhang, Yiqing Jiang2026-04-22
💻 computer science

Evaluating Answer Leakage Robustness of LLM Tutors against Adversarial Student Attacks

تتقصى هذه الورقة مدى عرضة المعلمين القائمين على النماذج اللغوية الكبيرة لهجمات الطلاب العدائية المصممة لاستخراج الإجابات، وتُقدم عميلاً عدائياً مضبوطاً بدقة كمعيار قياسي لتقييم المتانة، وتقترح استراتيجيات دفاعية فعالة للتخفيف من تسريب الإجابات.

Jin Zhao, Marta Knežević, Tanja Käser2026-04-22
💻 computer science

From Finite Enumeration to Universal Proof: Ring-Theoretic Foundations for PQC Hardware Masking Verification

تقدم هذه الورقة أول برهان عالمي تم التحقق منه آلياً في لغة Lean 4، والذي يثبت أن استقلال القيمة يستلزم توزيعات هامشية متطابقة لعمليات القناع الحسابي عبر جميع المقاسات q>0q > 0، مما يستبدل التحقق القائم على SMT للمجالات المحدودة بأساس نظري حلقي للأجهزة المخصصة للتشفير لما بعد الكوانتوم.

Ray Iskander, Khaled Kirah2026-04-22
💻 computer science

Towards Optimal Agentic Architectures for Offensive Security Tasks

تُقيّم هذه الورقة تجريبياً مختلف توبولوجيات التنسيق متعدد الوكلاء لمهام الأمن الهجومي عبر ٢٠ هدفاً تفاعلياً، كاشفةً أنه في حين يمكن للتنسيق الأوسع نطاقاً أن يحسن التغطية، فإن البنية المثلى تعتمد على جبهة تكلفة-جودة غير رتيبة حيث تفوق أهمية القدرة على الملاحظة والمجال بشكل كبير تعقيد البنية المعمارية.

Isaac David, Arthur Gervais2026-04-22
🤖 machine learning

Towards Understanding the Robustness of Sparse Autoencoders

تُثبت هذه الورقة أن دمج المشفّرات التلقائية المتفرقة (Sparse Autoencoders) المُدربة مسبقاً في مسارات المتبقيات (residual streams) لنماذج المحولات (transformer) أثناء وقت الاستنتاج يعزز بشكل كبير من متانة النماذج اللغوية الكبيرة ضد هجمات كسر الحماية (jailbreak attacks) بنوعيها، "الصندوق الأبيض" و"الصندوق الأسود"، وذلك عبر إعادة تشكيل هندسة الأمثلة (optimization geometry)، محققةً انخفاضاً يصل إلى 5 أضعاف في معدلات نجاح الهجمات مع الكشف عن علاقة رتيبة بين التفرق (sparsity) وفعالية الدفاع.

Ahson Saiyed, Sabrina Sadiekh, Chirag Agarwal2026-04-22
🤖 AI

ARES: Adaptive Red-Teaming and End-to-End Repair of Policy-Reward System

يُعد ARES إطار عمل مبتكر يعالج الثغرات النظامية في النماذج اللغوية الكبيرة المحاذية لتعلم التعزيز من التغذية الراجعة البشرية (RLHF) عبر توظيف "مُوجّه سلامة" لتوليد مطالبات عدائية مزدوجة الاستهداف تكشف عن الإخفاقات المتزامنة في كل من نموذج السياسة ونموذج المكافأة، يتبع ذلك عملية إصلاح مكونة من مرحلتين لتعزيز متانة السلامة الشاملة دون المساس بقدرات النموذج.

Jiacheng Liang, Yao Ma, Tharindu Kumarage, Satyapriya Krishna, Rahul Gupta, Kai-Wei Chang, Aram Galstyan, Charith Peris2026-04-22
🤖 machine learning

Mechanistic Anomaly Detection via Functional Attribution

تقدم هذه الورقة إطاراً للكشف عن الشذوذ الميكانيكي غير المرتبط بنمط معين، يعيد صياغة المشكلة كعزو وظيفي باستخدام دوال التأثير لتحديد الآليات الداخلية الشاذة، محققاً أداءً هو الأفضل في فئته في اكتشاف الأبواب الخلفية، والأمثلة العدائية، وعينات التوزيع الخارج عن النطاق عبر نماذج الرؤية واللغة.

Hugo Lyons Keenan, Christopher Leckie, Sarah Erfani2026-04-22
💻 computer science

Security Is Relative: Training-Free Vulnerability Detection via Multi-Agent Behavioral Contract Synthesis

تقدم الورقة البحثية Phoenix، وهو إطار عمل متعدد الوكلاء لا يتطلب تدريباً يتغلب على قيود التصنيف العالمي للثغرات الأمنية عبر تخليق عقود سلوكية خاصة بالمشروع عبر مواصفات Gherkin، محققاً بذلك دقة كشف هي الأفضل في مجالها، ومثبتاً أن الأمن هو خاصية نسبية تُحدد من خلال السياق وليس بناءً على بناء لغوي مطلق.

Yongchao Wang, Zhiqiu Huang2026-04-22
🤖 AI

Refute-or-Promote: An Adversarial Stage-Gated Multi-Agent Review Methodology for High-Precision LLM-Assisted Defect Discovery

تقدم هذه الورقة البحثية إطار عمل "Refute-or-Promote" (التفنيد أو الترويج)، وهو إطار عمل تنافسي متعدد الوكلاء يستخدم صيد السياق الطبقي، والنقد عبر النماذج، والتحقق التجريبي الإلزامي لتصفية النتائج الإيجابية الكاذبة في اكتشاف العيوب بمساعدة النماذج اللغوية الكبيرة، محققاً دقة عالية وتأثيراً واقعياً يشمل العديد من ثغرات CVE وقبولات معيارية عبر المكتبات الأمنية والمترجمات.

Abhinav Agarwal2026-04-22