💻 computer science

AI Alignment and Fiduciary Obligation

تجادل هذه الورقة بأن المساعدين المتقدمين القائمين على الذكاء الاصطناعي ينشئون علاقة ائتمانية بين المطورين والمستخدمين، مما يتطلب من المطورين الالتزام بالواجبات الأربعة الجوهرية المتمثلة في الولاء، والرعاية، وحسن النية، والصدق، وذلك للحد من مخاطر محددة وضمان التوافق بشكل مستقل عن وقوع ضرر فعلي.

Benjamin Lange2026-08-05
🤖 machine learning

Verifier-Guided Model Discovery for Physical Dynamical Systems with Pretrained Symbolic Transformers

تقدم هذه الورقة سير عملً موجهاً بالتحقق يعزز قابلية نقل المحولات الرمزية مسبقة التدريب (ODEFormer) إلى الأنظمة الفيزيائية عالية الأبعاد من خلال استخدام معايير ديناميكية ومعايير القابلية للقبول الفيزيائي لاختيار المعادلات الدقيقة، مما ينجح في اكتشاف نماذج مختزلة قابلة للتفسير لظواهر مثل انفصال الدوامات دون الاعتماد على مكتبات خاصة بالنظام أو هياكل محددة مسبقاً.

Farbod Faraji, Francesco Belardinelli2026-08-05
💻 computer science

Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity

تُثبت هذه الورقة أن الاعتماد على مطالبات نموذجية (canonical prompts) واحدة لتقييم سلامة النماذج اللغوية الكبيرة يؤدي إلى تقدير نقص كبير في الامتثال غير الآمن، حيث تكشف التغييرات في الصيغ السطحية التي تحافظ على المعنى أن جزءاً كبيراً من السلوكيات الضارة يظل غير مكتشف بواسطة طرق القياس المعيارية.

Yongxi Zhou, Junwei Yao, Yuanzhe Liu, Zihan Dong, Wenbo Ye, Jiaxi Wen, Lai Yun Choi2026-08-05
🤖 machine learning

Sphere Retraction Normalizations

تعمم هذه الورقة البحثية "التطبيع الجيوديزي" (Geodesic Normalization) من خلال إثبات أن جميع خرائط الارتداد (retraction maps) لتدفقات البقايا الكروية تختزل إلى معلمة قياسية واحدة تتحكم في زاوية الدوران، مما يؤدي إلى عائلة "pp-SpheretNorm" المقترحة التي تتفوق على الأساليب الحالية في نموذج nanoGPT عبر تحديد أن الخريطة الأسية (exponential map) ليست سوى حالة حدية وليست الخيار الأمثل.

Jie Zhang, Cheng-Fang Su, Yi-Jui Huang, Min-Te Sun2026-08-05
💻 computer science

Vulnerabilities, Secrets and Misconfiguration in the Highest-Exposure Docker Hub Images

تقدم هذه الورقة ChimangoScan، وهو مسار تحليل واسع النطاق يحلل صور Docker Hub الأكثر تعرضاً باستخدام ستة أدوات فحص مستقلة ليكشف أن الثغرات الأمنية والأخطاء في التكوين تكاد تكون عالمية، وأن نتائج الفحص تعتمد بشكل كبير على الأداة المستخدمة مع وجود توافق منخفض بينها، وأن غالبية الأسرار المكتشفة هي نتائج إيجابية كاذبة.

Cristhian Kapelinski, Beatriz Machado, Diego Kreutz2026-08-05
💻 computer science

Security-First Evaluation of Text-to-Terraform: Benchmarking LLMs and SLMs for Secure IaC Generation

تقوم هذه الورقة البحثية بقياس أداء سبعة نماذج لغوية كبيرة وصغيرة في توليد كود "Terraform" آمن لخدمات "AWS"، مما يكشف أن الصلاحية النحوية والامتثال الأمني هما خاصيتان متعامدتان إلى حد كبير، وأن الفحص الآلي متعدد الأدوات يظل ضرورياً بغض النظر عن أداء النموذج أو استراتيجيات هندسة الأوامر.

Francis Luis Santos Vargas, Rodrigo Brandão Mansilha, Diego Kreutz2026-08-05
💻 computer science

Moving the Safety Barrier: Dynamic Routing Adaptive Alignment Against White-Box Attacks

تقترح هذه الورقة إطار عمل "المحاذاة التكيفية للتوجيه الديناميكي" (DRAA)، وهو إطار يعزز متانة النماذج التأسيسية الضخمة ضد هجمات الصندوق الأبيض من خلال تحديد وتحديد مواقع مسارات السلامة، ثم تدريب مسارات تعويضية للحفاظ على سلوك الرفض حتى عندما تتعرض آليات السلامة الأساسية للاختراق.

Shangze Li, Chuancheng Shi, Simiao Xie, Lingzhi He, Cheng Ji, Zifeng Cheng, Fei Shen, Chao Wu, Tat-Seng Chua2026-08-05
💻 computer science

When Policies Change Probabilities: Modular Decision-Making for LLM Code Review

تُثبت هذه الورقة أن مراجعي الأكواد الحاليين القائمين على النماذج اللغوية الكبيرة يخلطون بين تقدير المخاطر وسياسات اتخاذ القرار، مما يتسبب في تغير الاحتمالات المُبلغ عنها مع تغير افتراضات التكلفة، وتقترح خط إنتاج معياريًا يفصل بين استقاء الأدلة القائم على المخاطر وبين الإجراءات المدفوعة بالتكلفة لتحسين الدقة بشكل كبير وتقليل خسارة القرار.

Rasvik Kudum, Max Corbett, Hitansh Paliwal, Romaisa Fatima, Thomas Jiralerspong, Sneheel Sarangi2026-08-05
💻 computer science

DenialRAG: Single-Document RAG Poisoning via Embedded Parametric Denial

تقدم هذه الورقة البحثية DenialRAG، وهو هجوم تسميم جديد لنظام استرجاع المعلومات المعزز بالتوليد (RAG) أحادي المستند، يقوم صراحةً بتسمية الإجابة الصحيحة وتفنيدها داخل نص مسترجع لتوجيه النماذج اللغوية الكبيرة نحو إجابات خاطئة يختارها المهاجم، مما يثبت أن فعاليته تعتمد بشكل كبير على النموذج وأن الدفاعات الحالية لا توفر سوى حماية جزئية وغير موحدة.

Abay Zhurekbay, Tao Liu, Fan Li2026-08-05
💻 computer science

AI Sandbox: Technical Report

تقدم هذه الورقة تصميم وتنفيذ والدروس العملية لبيئة اختبار ذكاء اصطناعي (AI sandbox) متعددة المستأجرين ومدركة للحوكمة، تم تطويرها من خلال تعاون بين الصناعة والأكاديميا لتمكين التجريب السريع والمُحكم والقابل للتتبع مع أدلة تقييم قابلة لإعادة الاستخدام.

Muhammad Waseem, Md Aidul Islam, Md Nasir Uddin Shuvo, Md Mahade Hasan, Kai-Kristian Kemell, Jussi Rasku, Mika Saari, Vi (…)2026-08-05