🤖 machine learning

Agent-ToM: Learning to Monitor Autonomous LLM Agents via Theory-of-Mind Reasoning

تقدم الورقة البحثية Agent-ToM، وهو إطار عمل للتعلم من أجل المراقبة يستفيد من استدلال نظرية العقل ومسار (الاستنتاج-التحقق-التنقيح) للكشف عن السلوكيات الخبيثة المستترة في الوكلاء المستقلين القائمين على النماذج اللغوية الكبيرة عبر استنتاج المعتقدات والنوايا الخفية، متفوقاً بذلك على النماذج المرجعية الحالية المتطورة في مجال المراقبة.

Nesreen K. Ahmed, Nima Nafisi2026-05-26
💻 computer science

Safety-Oriented Routing Analysis of Mixtral MoE Under Benign and Harmful Prompts

تحلل هذه الورقة سلوك التوجيه لنموذج Mixtral 8x7B-Instruct تحت تأثير المطالبات الحميدة والضارة، كاشفةً أن تنشيط الخبراء المرتبط بالسلامة هو تنشيط دقيق، ومعتمد على العمق، وموزع بدلاً من أن يهيمن عليه مجموعة ثابتة من الخبراء، مع إثبات أن التدخلات القائمة على التدرج أكثر فعالية من تلك القائمة على التنشيط في تقليل الاستجابات الضارة.

Md Nurul Absar Siddiky2026-05-26
💻 computer science

Five Queries Are Enough: Query-Efficient and Surrogate-Free Membership Inference Attacks on RAG via Entailment

تقدم هذه الورقة البحثية MEntA، وهو هجوم استدلال عضوية كفء في الاستعلام وخالٍ من النماذج البديلة، يستفيد من الاستلزام باللغة الطبيعية للكشف عن وجود وثائق حساسة في أنظمة التوليد المعزز بالاسترجاع بدقة عالية باستخدام خمس استعلامات فقط، متفوقاً بشكل كبير على الأساليب الحالية مع التهرب من الدفاعات الراهنة.

Nguyen Linh Bao Nguyen, Wanlun Ma, Viet Vo, Alsharif Abuadbba, Minghong Fang, Jun Zhang, Yang Xiang2026-05-26
💻 computer science

Poisoning the Watchtower: Prompt Injection Attacks Against LLM-Augmented Security Operations Through Adversarial Log Content

تحدد هذه الورقة وتقيم هجمات "حقن الأوامر عبر السجلات" (log-substrate prompt injection)، حيث يقوم المهاجمون بدمج تعليمات خبيثة داخل حقول السجلات التي يسيطر عليها المهاجم لتقويض العمليات الأمنية القائمة على النماذج اللغوية الكبيرة، كاشفةً أنه بينما تقلل الدفاعات من المخاطر، إلا أنها تفشل في القضاء على التهديد، لا سيما في مهام اختطاف الشخصية والتلخيص.

Rohan Pandey, Archit Bhujang2026-05-26
💻 computer science

Steering Beyond the Support: Adversarial Training on Unsupervised Jailbroken Activation Simulation

تقترح هذه الورقة إطار عمل للدفاع ضد كسر الحماية بنمط "الصفر محاولة" (zero-shot) يستخدم اكتشاف الاتجاه الكامن غير الخاضع للإشراف لمحاكاة تنشيطات تنافسية متنوعة، وتدريب مجال توجيه مستحث محتملاً لتوجيه عمليات كسر الحماية غير المرئية بفعالية نحو الرفض مع الحفاظ على المنفعة الحميدة.

Luoyu Chen, Weiqi Wang, Zhiyi Tian, Chenhan Zhang, Feng Wu, Jianhuan Huang, Ahmed Asiri, Shui Yu2026-05-26
💻 computer science

AI-Driven Adaptive Adversaries and the Erosion of Cryptographic Trust in Public Key Systems

تتقصى هذه الورقة كيف تعمل الخصوم التكيفية المدفوعة بالذكاء الاصطناعي على تقويض تشفير المفتاح العام من خلال استغلال الملاحظات القابلة للرصد على مستوى التنفيذ، مما يكشف عن عدم تطابق حرج بين نماذج الأمن التقليدية التي تركز على الخوارزميات وبين واقع الهجمات التشغيلية الحديثة.

Petar Radanliev2026-05-26
💻 computer science

Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling

تقترح هذه الورقة "التحكم الإهليلجي" (Ellipsoid Control)، وهو دفاع ضد كسر الحماية يعتمد على القائمة البيضاء، يستخدم شكلاً إهليلجياً متباين الخواص (anisotropic ellipsoid) مُلائماً من بيانات حميدة وفيرة لتقييد خوارزمية "الاشتقاق المتدرج الموجه" (projected gradient descent) في وقت الاختبار، مما يستحث الرفض عند المدخلات الضارة مع الحفاظ على فائدة النموذج في المهام الحميدة دون الاعتماد على إشراف القائمة السوداء غير المكتمل.

Luoyu Chen, Weiqi Wang, Zhiyi Tian, Feng Wu, Ahmed Asiri, Shui Yu2026-05-26
💻 computer science

Demystifying the Mythos or Disrupting Bugonomics? From Zero-Day Asymmetry to Defender Remediation Throughput

تجادل هذه الورقة بأن التأثير الرئيسي للنماذج اللغوية الكبيرة على الأمن السيبراني لا يقتصر مجرد زيادة في اكتشافات الثغرات الصفرية، بل يتمثل في تحول جوهري في "اقتصاديات الثغرات" (bugonomics) حيث ينتقل عنق الزجاجة من إيجاد الثغرات إلى قدرة المدافع على التحقق من التقارير الناتجة وتصنيفها ومعالجتها، والتي ستشهد طفرة في الحجم وانخفاضاً في التكلفة.

Alfredo Pesoli, Herman Errico, Lorenzo Cavallaro2026-05-26
💻 computer science

CALIBURN: A Regime-Sensitivity Study of Operationally Calibrated Streaming Intrusion Detection

تقدم هذه الورقة CALIBURN، وهو خط معالجة لكشف التسلل عبر التدفق ومعاير تشغيلياً يتيح تهيئة التنبيه قبل النشر عبر قيود التكلفة والميزانية، مُظهراً أداءً فائقاً في أنظمة الهجمات النادرة مع توفير رؤى بالغة الأهمية حول حساسية أساليب التدفق عبر مستويات متفاوتة من انتشار الهجمات.

Michel A. Youssef2026-05-26
🤖 AI

Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection

يعزز Reflect-Guard مصنفات سلامة النماذج اللغوية الكبيرة مثل Llama Guard ضد هجمات كسر الحماية العدائية من خلال توظيف الضبط الدقيق الموفر للمعلمات لغرس قدرات التأمل المنطقي الذاتي، مما يحسن دقة الكشف بشكل كبير ويقلل معدلات نجاح الهجمات في الاختبارات المعيارية الصعبة.

Lixing Lin, Juli You, Yue Li, Luyun Lin, Yiqing Wang, Zhen Zhang, Moxuan Zheng2026-05-26