💻 computer science

DecodingTrust-Agent Platform (DTap): A Controllable and Interactive Red-Teaming Platform for AI Agents

本文介绍了 DTap,这是首个用于 AI 智能体(AI agents)的可控且交互式的红队测试平台,它包含一个自主红队测试智能体(DTap-Red)和一个大规模基准测试集(DTap-Bench),旨在系统地评估并揭示 14 个真实世界领域的安全漏洞。

Bo Li, Zhaorun Chen, Xun Liu, Haibo Tong, Chengquan Guo, Yuzhou Nie, Jiawei Zhang, Mintong Kang, Chejian Xu, Qichang Liu (…)2026-07-03
💻 computer science

Operationalizing Trustworthy AI: A Scalable Framework for Granular Error Analysis and Bias Mitigation in Healthcare Models

本文提出了一个通过利用误差分析决策树和新颖的方法论创新来揭示隐藏的子群失败并减轻偏差,从而将抽象的公平性原则转化为可验证的工程目标,以确保符合欧盟《人工智能法案》等法规,从而在医疗保健领域实现可扩展的可信人工智能运营化框架。

Andrea Corvaglia, Marco Montagna, Davide Vignale, Anna Palmisano, Francesco Pisu, Alberto Colombo, Marta Liberotti, Clar (…)2026-07-03
💻 computer science

Deployable AI for IoT/IIoT Security: A Systematic Review of Labeling, Transfer, Resource, and Explainability Constraints

这项针对 154 项研究(2021–2025 年)的系统综述表明,尽管用于 IoT/IIoT 安全的 AI 研究高度集中在入侵检测方面,但由于标签匮乏和资源限制,当前的研究缺乏操作有效性,因此有必要转向标准化、具备漂移感知能力且可解释的部署协议。

Anass Rharif, Ziad Charafi, Mounia Zaydi, Sofia Belkhala, Yassine Maleh2026-07-03