🤖 AI

Decaf: Improving Neural Decompilation with Automatic Feedback and Search

تقدم الورقة البحثية نظام Decaf، الذي يستفيد من التغذية الراجعة للمترجم والبحث لتحسين الصحة الدلالية لمخرجات إلغاء التجميع العصبية بشكل كبير، مما يرفع معدل النجاح في مجموعة Real -O2 من 26.0% إلى 83.9% دون المساس بالتشابه مع الكود المصدري الأصلي.

Alexander Shypula, Osbert Bastani, Edward Schwartz2026-05-13
🤖 machine learning

FERMI: Exploiting Relations for Membership Inference Against Tabular Diffusion Models

تقدم الورقة البحثية FERMI، وهو هجوم استدلال عضوية مبتكر يستفيد من المعلومات المساعدة ذات الصلة المتاحة أثناء التدريب لتعزيز تقييم مخاطر الخصوصية بشكل كبير لنماذج الانتشار الجدولية في بيئات الجداول المتعددة، متفوقاً على النماذج المرجعية الحالية للجداول الفردية بنسبة تصل إلى 53% في معدلات الإيجابية الحقيقية.

Abtin Mahyar, Masoumeh Shafieinejad, Yuhan Liu, Xi He2026-05-13
🤖 AI

Every Bit, Everywhere, All at Once: A Binomial Multibit LLM Watermark

تقدم هذه الورقة البحثية مخططاً جديداً لعلامة مائية ثنائية الحدين متعددة البتات للنماذج اللغوية الكبيرة (LLM) تقوم بتشفير كل بت من الحمولة عند كل موضع للرمز باستخدام مشفر ذي حالة لتحديد أولوية البتات غير المشفرة بشكل ديناميكي، مما يحقق دقة ومتانة فائقتين مقارنة بالنماذج المرجعية الحالية مع اقتراح مقياس أكثر عملية لتسجيل الثقة لكل بت من أجل التقييم.

Thibaud Gloaguen, Robin Staab, Mark Vero, Martin Vechev2026-05-13
🤖 AI

Cochise: A Reference Harness for Autonomous Penetration Testing

تقدم هذه الورقة Cochise، وهو إطار مرجعي بلغة بايثون يتكون من 597 سطرًا فقط، يطبق بنية "المخطط-المنفذ" (Planner-Executor) المنفصلة لاختبار الاختراق المستقل، مما يمكّن الباحثين من تقييم الوكلاء الموجهين بالنماذج اللغوية الكبيرة (LLMs) ضد بيئة اختبار "لعبة النشاط في الدليل النشط" (GOAD)، مع توفير أدوات مفتوحة المصدر لإعادة التشغيل، والتحليل، ومشاركة بيانات المسار.

Andreas Happe, Jürgen Cito2026-05-13
🤖 machine learning

Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation

تقدم هذه الورقة إطار عمل "التحفيز العدائي المشروط بالشخصية" (PCAP)، وهو إطار عمل لاختبار الاختراق (red-teaming) يستفيد من شخصيات مهاجمين متنوعة لاكتشاف عمليات كسر الحماية القابلة للنقل وتوليد مجموعات بيانات غنية بالبيانات الوصفية، مما يتيح محاذاة مؤتمتة فعالة ويحسن متانة النموذج بشكل كبير من خلال الضبط الدقيق المستهدف.

Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed, Douglas Leith2026-05-13
⚡ electrical engineering

Behavioral Integrity Verification for AI Agent Skills

تقدم هذه الورقة إطار عمل للتحقق من النزاهة السلوكية (BIV)، والذي يجمع بين تحليل الكود الحتمي والاستخراج بمساعدة النماذج اللغوية الكبيرة للكشف عن التباينات بين القدرات المعلنة والقدرات الفعلية لمهارات الوكيل الذكي، مظهرةً أنه في حين أن معظم الانحرافات تنبع من إهمال المطورين لا من سوء النية، إلا أن النظام يحدد التهديدات الخبيثة بفعالية ويتفوق على المقاييس المرجعية الحالية في الاختبارات المعيارية واسعة النطاق.

Yuhao Wu, Tung-Ling Li, Hongliang Liu2026-05-13
🤖 AI

IPI-proxy: An Intercepting Proxy for Red-Teaming Web-Browsing AI Agents Against Indirect Prompt Injection

تقدم الورقة البحثية IPI-proxy، وهي مجموعة أدوات مفتوحة المصدر تستخدم وكيل اعتراض (intercepting proxy) لإعادة كتابة استجابات HTTP ديناميكيًا من نطاقات مدرجة في القائمة البيضاء باستخدام مكتبة متنوعة من حمولات حقن الأوامر غير المباشرة (indirect prompt injection)، مما يتيح إجراء اختبارات اختراق واقعية وقابلة للتكرار لوكلاء الذكاء الاصطناعي المتصفحين للويب في بيئات شبيهة ببيئات الإنتاج دون الاعتماد على صفحات وهمية.

Chia-Pei (Janet), Chen, Kentaroh Toyoda, Anita Lai, Alex Leung2026-05-13
🤖 AI

Proteus: A Self-Evolving Red Team for Agent Skill Ecosystems

تقدم الورقة البحثية "بروتيوس" (Proteus)، وهو إطار عمل للفريق الأحمر ذاتي التطور يثبت أن أنظمة فحص المهارات الحالية تستهين بشكل كبير بالمخاطر الأمنية من خلال الكشف عن كيفية قيام المهاجمين المتكيفين والقائمين على التغذية الراجعة بتجاوز عمليات التدقيق بشكل تكراري لإنشاء متغيرات مهارات قاتلة للوكلاء.

Zhaojiacheng Zhou2026-05-13
💻 computer science

A microservices-based endpoint monitoring platform with predictive NLP models for real-time security and hate-speech risk alerting

تقترح هذه الورقة منصة قائمة على الخدمات المصغرة وقابلة للتوسع، تدمج القياس عن بُعد لنقاط النهاية مع نماذج معالجة اللغات الطبيعية التنبؤية لتوفير تنبيهات موحدة وفورية لتسريب البيانات، والسلوك المريب، وخطاب الكراهية.

Darlan Noetzold, Anubis Graciela De Moraes Rossetto, Juan Francisco De Paz Santana, Valderi Reis Quietinho Leithard2026-05-13
💬 NLP

SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces

تقدم هذه الورقة البحثية SkillSafetyBench، وهو معيار مرجعي يوضح أن المهارات القابلة لإعادة الاستخدام والقطع البرمجية المحلية يمكن أن تؤدي إلى سلوكيات غير آمنة للوكيل حتى من طلبات المستخدمين الحميدة، مما يكشف أن سلامة الوكيل تعتمد بشكل حاسم على كيفية تفسير النماذج للمهارات وثقتها في سياقات سير العمل بدلاً من مجرد الاعتماد على التوافق على مستوى النموذج.

Chang Jin, An Wang, Zeming Wei, Kai Wang, Biaojie Zeng, Qiaosheng Zhang, Chao Yang, Jingjing Qu, Xia Hu, Xingcheng Xu2026-05-13