🤖 AI

Quantitative Certification of Agentic Tool Selection

تقدم هذه الورقة البحثية LLMCert-T، وهو إطار عمل إحصائي يوفر حدوداً عليا عالية الثقة لسلامة اختيار الأدوات من قبل وكلاء النماذج اللغوية الكبيرة (LLM agents) في ظل توزيعات أدوات واقعية متأثرة بأطراف ثالثة، مما يكشف أن الوكلاء الحاليين أكثر هشاشة بشكل ملحوظ في البيئات المفتوحة مما توحي به المعايير القياسية.

Jehyeok Yeon, Isha Chaudhary, Gagandeep Singh2026-05-14
🔢 mathematics

Local Information-Theoretic Security via Euclidean Geometry

تقترح هذه الورقة إطاراً لنظرية المعلومات الإقليدية يحول التحسين غير المحدب للاتصالات الآمنة عبر قنوات التنصت إلى برنامج تربيعي قابل للمعالجة، مما يتيح اشتقاق صيغة تحليلية للسعة السرية المحلية ومعاملات انكماش سرية محلية جديدة تتميز بالقيم الذاتية المعممة.

Emmanouil M. Athanasakos, Nicholas Kalouptsidis, Hariprasad Manjunath2026-05-14
💬 NLP

Sockpuppetting: Jailbreaking LLMs by Combining Prefilling with Optimization

تعمل هذه الورقة على تعزيز كسر حماية النماذج اللغوية الكبيرة (LLM jailbreaking) من خلال إثبات أن تجميع متغيرات "الاستكمال المسبق" (prefill) البسيطة يعزز معدلات نجاح الهجوم بشكل كبير، وتقديم تقنية "الدمية الرديفة" (sockpuppetting)، وهي طريقة هجينة مبتكرة تعمل على تحسين اللاحقات العدائية ضمن كتلة رسالة المساعد لتحقيق أداء فائق ومستقل عن نوع المطالبة.

Asen Dotsinski, Panagiotis Eustratiadis2026-05-14✓ Author reviewed
🤖 machine learning

ZKBoost: Zero-Knowledge Verifiable Training for XGBoost

تقدم هذه الورقة البحثية ZKBoost، وهو أول بروتوكول لإثبات التدريب باستخدام المعرفة الصفرية لـ XGBoost يُمكّن مالكي النماذج من التحقق تشفيرياً من صحة التدريب على مجموعات البيانات الملتزم بها دون الكشف عن البيانات أو المعلمات، مع التغلب على الثغرات الأمنية السابقة وتحقيق الكفاءة من خلال تنفيذ متخصص للنقطة الثابتة وتجسيد قائم على VOLE.

Nikolas Melissaris, Antigoni Polychroniadou, Akira Takahashi, Chenkai Weng, Jiayi Xu2026-05-14
💻 computer science

Tracking Conversations: Measuring Content and Identity Exposure on AI Chatbots

تقيس هذه الورقة البحثية بشكل منهجي تتبع الويب في 20 من روبوتات الدردشة الآلية الشهيرة للذكاء الاصطناعي، وتكشف أن غالبية هذه الروبوتات تشارك محتوى المستخدم الحساس ومعلومات الهوية مع خدمات التحليلات والإعلانات وإعادة تشغيل الجلسات التابعة لجهات خارجية، حتى في أوضاع الدردشة الخاصة.

Muhammad Jazlan, Ethan Wang, Yash Vekaria, Zubair Shafiq2026-05-14
💻 computer science

BackFlush: Knowledge-Free Backdoor Detection and Elimination with Watermark Preservation in Large Language Models

تقدم هذه الورقة BackFlush، وهو إطار عمل موحد يكتشف ويلغي بفعالية الأبواب الخلفية غير المعروفة في النماذج اللغوية الكبيرة مع الحفاظ على العلامات المائية المشروعة وفائدة النموذج، محققاً معدلات نجاح هجوم تقترب من الصفر ودقة نظيفة عالية دون الحاجة إلى معرفة مسبقة بالمحفزات أو النماذج المرجعية.

Jagadeesh Rachapudi, Ritali Vatsi, Pranav Singh, Praful Hambarde, Amit Shukla2026-05-14
💻 computer science

Ghost in the Context: Measuring Policy-Carriage Failures in Decision-Time Assembly

تحدد هذه الورقة وتُحدد كمياً حالات "فشل حمل السياسة" في وكلاء النماذج اللغوية الناتجة عن تجميع السياق في وقت اتخاذ القرار (مثل التقطيع والتلخيص) الذي يؤدي دون قصد إلى إسقاط الحالة الحاملة للتوجيهات، وتقيم طبقة تحكم تسمى SafeContext تعمل على التخفيف جزئياً من هذه المخاطر عبر تثبيت الحالة الحرجة وحقن التذكيرات، رغم أن فعاليتها تظل محدودة ومشروطة بالسياسة.

Igor Santos-Grueiro2026-05-14
💻 computer science

Persona-Conditioned Adversarial Prompting (PCAP): Multi-Identity Red-Teaming for Enhanced Adversarial Prompt Discovery

تقدم الورقة البحثية "التحفيز التنافسي المشروط بالشخصية" (PCAP)، وهو إطار عمل جديد لاختبار الاختراق يستفيد من شخصيات المهاجم وبطاقات الاستراتيجية لتعزيز اكتشاف عمليات كسر الحماية المتنوعة والقابلة للنقل بشكل كبير، مما يزيد بشكل جوهري من معدلات نجاح الهجوم ويعالج أوجه القصور في خطوط الأنابيب الآلية الحالية في التقاط التكتيكات العدائية المعتمدة على الهوية ومتعددة الجولات.

Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed, Douglas Leith2026-05-14
🤖 AI

Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack

تقدم الورقة البحثية BenchJack، وهو نظام آلي للاختبار الهجومي (red-teaming) يقوم بمراجعة معايير قياس الوكلاء الذكيين بشكل منهجي لتحديد ومعالجة ثغرات "تحايل المكافأة" (reward-hacking)، مما يثبت أن العديد من المعايير الشائعة سهلة الاستغلال ويمكن تحصينها بشكل كبير من خلال عملية هجومية تكرارية.

Hao Wang, Hanchen Li, Qiuyang Mang, Alvin Cheung, Koushik Sen, Dawn Song2026-05-14