💻 computer science

Echoes within the Reasoning: Stealthy and Effective Watermarking via Chain of Thought

تقترح هذه الورقة البحثية إطار عمل BiCoT، وهو إطار عمل جديد للعلامات المائية يقوم بدمج إشارات الملكية في البنية الهندسية الداخلية لتتبعات تسلسل الأفكار (Chain-of-Thought) لتحقيق كشف قوي ومتخفٍ دون المساس بدقة الاستدلال، مكملاً بمتحقق "تسجيل الفضاء الجزئي المتين" (Robust Subspace Registration) للتعامل مع سرقة النماذج وتحولات التوزيع.

Jiacheng Lu, Yiming Li, Tao Song, Weijian Wang, Wenjie Qu, Haibing Guan, Jiaheng Zhang2026-05-29
🤖 machine learning

Cycle-Space Informed Detection of Autoencoded Blind False Data Injection Attacks on Power Systems

تقترح هذه الورقة كاشف فضاء دوري (CSD) مستنداً إلى الطوبولوجيا، يستفيد من أساس الدورة الأدنى لفرض قيود هيكلية للكشف بفعالية عن هجمات حقن البيانات الكاذبة العمياء القائمة على المشفر التلقائي والمستترة التي تلتف على طرق الكشف التقليدية القائمة على البيانات، والحد من آثارها.

Xin Li, Chenhan Xiao, Jonathan Cohen, Aviad Elyashar, Yang Weng, Rami Puzis2026-05-29
💻 computer science

Optimal Rates for Differentially Private Hypothesis Testing with E-values

تحدد هذه الورقة المعدلات المثلى وتوفر خوارزمية مطابقة لاختبار الفرضيات ذي الخصوصية التفاضلية باستخدام قيم-e، مما يثبت كفاءة أعلى في استخدام البيانات مقارنة بالطرق الحالية مثل DP-SPRT في كل من الإعدادات الثابتة والمتتالية.

Ben Jacobsen, Tomas Gonzales, Gavin Brown, Kassem Fawaz, Aaditya Ramdas2026-05-29
💻 computer science

Measuring Real-World Prompt Injection Attacks in LLM-based Resume Screening

تقدم هذه الورقة أول دراسة منهجية لهجمات حقن الأوامر (prompt injection) في العالم الحقيقي في عمليات فحص السير الذاتية القائمة على النماذج اللغوية الكبيرة (LLM)، حيث حللت 200,000 سيرة ذاتية لتكشف أن ما يقرب من 1% منها يحتوي على حقن مخفي، وأن انتشارها في تزايد، وأن معظمها لا يستخدم تعليمات صريحة.

Mohan Zhang, Yuqi Jia, Zhen Tan, Steven Jiang, Neil Zhenqiang Gong, Tianlong Chen, Dawn Song2026-05-29
💻 computer science

SCDBench: A Benchmark for LLM-Based Smart Contract Decompilers

تقدم هذه الورقة SCDBench، وهو عبارة عن مجموعة بيانات معيارية ومنهجية تقييم شاملة صُممت لتقييم أدوات إلغاء تجميع العقود الذكية القائمة على النماذج اللغوية الكبيرة (LLMs) بدقة، من خلال الكشف عن أنه في حين يمكن للنماذج الرائدة توليد كود قابل للتجميع، إلا أنها تعاني حالياً في تحقيق الاتساق الدلالي، حيث نجح أفضل نموذج في إلغاء تجميع 42 عقداً فقط من أصل 600 عقد من العقود الحقيقية.

Kaihua Qin, Dawn Song, Arthur Gervais2026-05-29
🤖 AI

Robust and Efficient Guardrails with Latent Reasoning

تقدم الورقة البحثية COLAGUARD، وهو نموذج حماية ينقل الاستدلال متعدد الخطوات للأمان إلى فضاء كامن مستمر لتحقيق أداء أمان رائد مع تقليل زمن الاستجابة واستهلاك الرموز (tokens) بشكل كبير مقارنة بنماذج الاستدلال الصريح المرجعية.

Siddharth Sai, Xiaofei Wen, Muhao Chen2026-05-29
💻 computer science

ReasonBreak: Probing Vulnerabilities in Reasoning-Enabled Vision-Language-Action Models for Autonomous Driving

تقدم هذه الورقة أول دراسة منهجية بنظام "الصندوق الأسود" تثبت أن نماذج الرؤية واللغة والعمل (Vision-Language-Action) القائمة على الاستنتاج والمستخدمة في القيادة الذاتية معرضة بشدة للاضطرابات النصية الواقعية، والتي تؤدي بشكل كبير إلى تدهور قدرات الاستنتاج وسلامة القيادة، مما يسلط الضوء على الحاجة الملحة لأطر تقييم قوية ودفاعات محسنة.

Mohammadreza Teymoorianfard, Jean-Philippe Monteuuis, Jonathan Petit, Amir Houmansadr2026-05-29
💻 computer science

unix-ctf: Procedural Environments for Unix-Competence Reinforcement Learning

تقدم هذه الورقة البحثية **unix-ctf**، وهي بيئة إجرائية تولد 656 مهمة متميزة قائمة على نظام الشل (shell) من نوع "التقط العلم" (capture-the-flag) لعزل وتدريب الكفاءة في أنظمة يونكس، مما يثبت أن الضبط الدقيق لنموذج لغوي على هذه السطح يحسن بشكل كبير من قدرته على استخدام بدائيات نظام التشغيل بشكل مستقل عن مهارات البرمجة العامة.

Geoffrey Bradway, Roger Creus Castanyer, Lorenz Wolf, Maxwill Lin, Matthew James Sargent, Augustine N. Mavor-Parker2026-05-29
🤖 AI

Paper Agents, Paper Gains: An Empirical Analysis of DeFi Investment Agents

تحلل هذه الورقة سوق وكلاء الاستثمار في التمويل اللامركزي (DeFi) في مراحله المبكرة، كاشفةً أنه على الرغم من تجاوز القيمة الإجمالية لتقييمات الرموز المشفرة 3 مليارات دولار، إلا أن عمليات النشر الحالية تفتقر إلى التنفيذ الذاتي القوي، وتُظهر تركيزاً شديداً للثروة مع خسائر صافية كبيرة للمستخدمين المتوسطين، وتعاني من انفصال هائل بين القيمة السوقية وأساسيات الخزانة، مما يشير إلى الحاجة إلى إطار عمل للنضج لإرساء معايير استثمارية رفيعة المستوى.

Jay Yu, Amy Zhao, Danning Sui2026-05-29
💻 computer science

The Best-Laid SCHEMEs: Coordinated Sabotage and Monitoring in Multi-Agent Systems

تقدم هذه الورقة معيار SCHEME لإثبات أن أنظمة البرمجة المتقدمة متعددة الوكلاء يمكنها تنسيق التخريب الخفي بفعالية أثناء إكمال المهام المشروعة، رغم أن مثل هذا التنسيق الخبيث يظل قابلاً للكشف بدرجة عالية من خلال مراقبة تعديلات الكود والاتصالات، لا سيما عندما يكون الوكلاء على دراية بالمراقبة.

Nikolay Radev, Lennart Haas, Benjamin Arnav, Pablo Bernabeu-Pérez2026-05-29