← 最新论文
🤖 machine learning

Evaluating Frontier AI Agents as Autonomous Clinical Security Auditors

本文介绍了一项基于 METR 任务标准的开放评估任务,该任务测试前沿 AI 智能体是否能够通过实施攻击、计算安全评分并生成报告,自主进行结构化的临床 AI 安全审计,并证明了像 Claude Sonnet 4.6 和 GPT-4.1 这样的模型可以在多个数据集和架构上获得满分。

原作者: Michael O. Eniolade

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Michael O. Eniolade

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机正在学习成为医生的世界,它们正在帮助诊断疾病并决定治疗方案。这些“人工智能医生”极其聪明,但它们有一个秘密弱点:它们可能会被欺骗。就像人类可能会被巧妙的视错觉所迷惑一样,人工智能也会被其接收到的数据中微小到几乎不可见的改变所困扰。如果黑客知道如何进行这些微小的改变,他们就能欺骗人工智能,让它在患者实际患病时判定为健康,或者反之亦然。这被称为“对抗性攻击”(adversarial attack),这是一个巨大的问题,因为如果我们没能在让人工智能帮助真实患者之前发现这些诡计,人们可能会受到伤害。

为了阻止这种情况,我们需要“安全审计员”——即那些试图故意破坏人工智能以测试其强度的专家。但问题在于,担任安全审计员非常困难。这需要深厚的数学技能、特殊的计算机程序以及大量的时间。大多数医院团队并不具备能够胜任此工作的专家,而且用于此类工作的工具往往缺失或过于复杂。因此,一个大问题是:一种新型的超级智能计算机程序,即所谓的“人工智能智能体”(AI agent),能否独自完成这项艰巨的工作?这些智能体就像数字实习生,它们可以阅读指令、编写自己的计算机代码、运行测试并撰写报告,而不需要人类在每一步都手把手地指导。

这篇论文对这个想法进行了测试。研究人员为世界上最先进的三种人工智能智能体设计了一场具有挑战性的“考试”。考试要求它们扮演临床人工智能模型的自主安全审计员。这些智能体被赋予了一个医疗预测模型(例如预测乳腺癌或重症监护病房死亡率的模型)、一个患者记录数据集,以及一份关于如何执行四种不同类型安全攻击的书面指令集。这些智能体必须从头开始编写自己的代码来执行这些攻击、处理数据,并在一个受限的数字容器内,在40个“回合”(或步骤)的严格时间限制内,按照特定的格式撰写最终的安全报告。

结果呈现出惊人的成功与有趣的失败交织的局面。三种人工智能智能体中的两种——Claude Sonnet 4.6 和 GPT-4.1——通过了考试。它们完美地完成了考试的每一个版本,每次尝试都编写了正确的代码并生成了准确的安全报告。它们完成得非常高效,使用的“Token”(人工智能处理的文本单位)相对较少。然而,第三种智能体 GPT-4o 则遇到了困难。它仅在约 61% 的尝试中取得了成功。当它失败时,并不是因为它不懂数学,而是因为它在过程中迷失了方向。有时它在保存最终报告之前就停止了工作,有时它在计算最终得分时犯了简单的数学错误,有时它提交了一个空文件。这项研究表明,虽然顶尖的人工智能智能体现在已经能够自主进行复杂的多步安全审计,但它们并不都是同样可靠的。成功与失败的区别往往在于“纪律性”——即保持专注、追踪进度并在不分心或不犯粗心错误的情况下完成工作的能力。这意味着,对于想要使用人工智能来检查自身医疗人工智能的医院来说,选择合适的“数字审计员”与选择医疗模型本身同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →