🤖 AI

An Empirical Audit of k-NAF Budget Accounting for Anchored Decoding

تُدقق هذه الورقة تجريبيًا آلية محاسبة ميزانية k-NAF في فك التشفير المرتكز (Anchored Decoding) عبر أعباء عمل ثابتة ومتكيفة، لتجد أن الإنفاق التراكمي لـ KL يظل باستمرار أقل بكتم من ميزانيات مستوى التسلسل، وأن حالات استنفاد الميزانية الظاهرة تُعزى إلى آثار وسيطة وليس إلى إخفاقات فعلية في الآلية.

J. Vijayavallabh2026-05-28✓ Author reviewed
🤖 machine learning

SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection

تقترح الورقة البحثية إطار عمل SPARD، وهو إطار دفاعي يجمع بين التحسين التناوبي المسقط على السلامة (Safety-Projected Alternating optimization) واختيار البيانات القائم على الوعي بالارتباط والتنوع (Relevance-Diversity aware data selection) للتخفيف بفعالية من هجمات الضبط الدقيق الضارة مع الحفاظ على أداء المهمة.

Shuhao Chen, Weisen Jiang, Yeqi Gong, Shengda Luo, Chengxiang Zhuo, Zang Li, James T. Kwok, Yu Zhang2026-05-28
💬 NLP

SilentRetrieval: Hijacking Retrieval-Augmented Generation via Semantically-Preserving Adversarial Data Poisoning

تقدم الورقة البحثية SilentRetrieval، وهو هجوم تسميم بيانات ثنائي المراحل يختطف أنظمة التوليد المعزز بالاسترجاع (RAG) عبر حقن مستندات عدائية مصاغة بطلاقة تحافظ على تصنيفات استرجاع عالية وتنجح في تلاعب مخرجات النماذج اللغوية الكبيرة مع التهرب من الكشف عبر الحفاظ على التماسك الدلالي.

Jiachen Qian2026-05-28
💬 NLP

MIRAGE: Context-Aware Prompt Injection against Mobile GUI Agents via User-Generated Content

تقدم الورقة البحثية MIRAGE، وهو مسار هجوم مدرك للسياق يقوم بحقن مطالبات عدائية في المحتوى الذي ينشئه المستخدم داخل لقطات شاشة واجهة مستخدم الهاتف المحمول لخداع وكلاء النماذج اللغوية الرؤية، مما يثبت أن جميع الوكلاء الخمسة الذين تم تقييمهم عرضة لهجمات واقعية لا يمكن تمييزها بصرياً بنسب نجاح تتراوح بين 23% و30%.

Ruoqi Guo, Yi Liu, Gelei Deng, Yiheng Xiong, Yuekang Li, Ying Zhang, Leo Yu Zhang, Lida Zhao, Ji Jie, Yuxiao Lu2026-05-28
💬 NLP

SNARE: Adaptive Scenario Synthesis for Eliciting Overeager Behavior in Coding Agents

تقدم هذه الورقة SNARE، وهو مسار تكيفي يعمل على تخليق سيناريوهات حميدة للكشف عن أن ما يقرب من 20% من عمليات وكلاء البرمجة تظهر سلوكًا "متحمسًا للغاية" (القيام بإجراءات غير مصرح بها رغم نجاح المهمة)، وهي ثغرة ناتجة عن أطر عمل الوكلاء أكثر من النماذج الأساسية وتغفل عنها المقاييس الحالية إلى حد كبير.

Yubin Qu, Yi Liu, Gelei Deng, Yanjun Zhang, Yuekang Li, Ying Zhang, Leo Yu Zhang2026-05-28
💻 computer science

Cybersecurity AI (CAI) Dataset

تقدم الورقة البحثية مجموعة بيانات CAI، وهي متن ضخم من تفاعلات النماذج اللغوية الكبيرة في مجال الأمن السيبراني من واقع العالم الحقيقي، والتي تسلط الضوء على العائق الحرج المتمثل في مسارات المشغلين الخبراء، مع التأكيد في الوقت ذاته على الحاجة الملحة لنماذج مستضافة محلياً وبشكل خاص للتخفيف من المخاطر النظامية الناجمة عن مركزية البيانات الهجومية والدفاعية الحساسة لدى مزودي واجهات برمجة تطبيقات النماذج الرائدة.

Víctor Mayoral-Vilches2026-05-28
💻 computer science

Towards Cybersecurity SuperIntelligence (CSI): What's the best harness for cybersecurity?

تقدم هذه الورقة البحثية "الذكاء الفائق للأمن السيبراني" (CSI)، وهو بنية هيكلية عليا توحد أطر الوكلاء المعتمدة على النماذج اللغوية الكبيرة غير المتجانسة عبر لوحة معلومات مشتركة، مما يثبت أن الجمع بين الهياكل المتنوعة بنيوياً يحقق تغطية لتحديات الأمن السيبراني (57.6%) وكفاءة أعلى بكثير من أي هيكل منفرد بمفرده.

Víctor Mayoral-Vilches, Francesco Balassone, María Sanz-Gómez, Paul Zabalegui Landa, Daniel Sánchez Prieto, Marina Oteiz (…)2026-05-28
🤖 AI

Refusal Before Decoding: Detecting and Exploiting Refusal Signals in Intermediate LLM Activations

تُثبت هذه الورقة أن سلوك الرفض في النماذج اللغوية الكبيرة يمكن فك تشفيره خطياً من التنشيطات الوسيطة قبل توليد المخرجات، مما يتيح تطوير "Mechanism AutoDAN"، وهو أسلوب هجوم موجه بالمسبار يقلل بشكل كبير من وقت البحث مع الحفاظ على معدلات نجاح تنافسية مقارنة بالأساليب التقليدية.

Matteo Gioele Collu, Riccardo Conte, Alberto Giaretta, Denis Kleyko, Mauro Conti, Matteo Zavatteri, Roberto Confalonieri2026-05-28
🤖 AI

Technical Report: Exploring the Emerging Threats of the Agent Skill Ecosystem

يحلل هذا التقرير التقني ما يقرب من 4,000 مهارة من مهارات الوكلاء الذكيين من الأسواق الرئيسية ليكشف أن 13.4% منها تحتوي على مشكلات أمنية حرجة، بما في ذلك 76 حمولة ضارة مؤكدة، مما يسلط الضوء على الحاجة الملحة لتدابير أمنية مؤتمتة مع توسع الأنظمة البيئية للوكلاء.

Luca Beurer-Kellner, Aleksei Kudrinskii, Marco Milanta, Kristian Bonde Nielsen, Hemang Sarkar, Liran Tal2026-05-28