✨ 要点🔬 技术摘要
想象一个计算机正在学习成为医生的世界,它们正在帮助诊断疾病并决定治疗方案。这些“人工智能医生”极其聪明,但它们有一个秘密弱点:它们可能会被欺骗。就像人类可能会被巧妙的视错觉所迷惑一样,人工智能也会被其接收到的数据中微小到几乎不可见的改变所困扰。如果黑客知道如何进行这些微小的改变,他们就能欺骗人工智能,让它在患者实际患病时判定为健康,或者反之亦然。这被称为“对抗性攻击”(adversarial attack),这是一个巨大的问题,因为如果我们没能在让人工智能帮助真实患者之前发现这些诡计,人们可能会受到伤害。
为了阻止这种情况,我们需要“安全审计员”——即那些试图故意破坏人工智能以测试其强度的专家。但问题在于,担任安全审计员非常困难。这需要深厚的数学技能、特殊的计算机程序以及大量的时间。大多数医院团队并不具备能够胜任此工作的专家,而且用于此类工作的工具往往缺失或过于复杂。因此,一个大问题是:一种新型的超级智能计算机程序,即所谓的“人工智能智能体”(AI agent),能否独自完成这项艰巨的工作?这些智能体就像数字实习生,它们可以阅读指令、编写自己的计算机代码、运行测试并撰写报告,而不需要人类在每一步都手把手地指导。
这篇论文对这个想法进行了测试。研究人员为世界上最先进的三种人工智能智能体设计了一场具有挑战性的“考试”。考试要求它们扮演临床人工智能模型的自主安全审计员。这些智能体被赋予了一个医疗预测模型(例如预测乳腺癌或重症监护病房死亡率的模型)、一个患者记录数据集,以及一份关于如何执行四种不同类型安全攻击的书面指令集。这些智能体必须从头开始编写自己的代码来执行这些攻击、处理数据,并在一个受限的数字容器内,在40个“回合”(或步骤)的严格时间限制内,按照特定的格式撰写最终的安全报告。
结果呈现出惊人的成功与有趣的失败交织的局面。三种人工智能智能体中的两种——Claude Sonnet 4.6 和 GPT-4.1——通过了考试。它们完美地完成了考试的每一个版本,每次尝试都编写了正确的代码并生成了准确的安全报告。它们完成得非常高效,使用的“Token”(人工智能处理的文本单位)相对较少。然而,第三种智能体 GPT-4o 则遇到了困难。它仅在约 61% 的尝试中取得了成功。当它失败时,并不是因为它不懂数学,而是因为它在过程中迷失了方向。有时它在保存最终报告之前就停止了工作,有时它在计算最终得分时犯了简单的数学错误,有时它提交了一个空文件。这项研究表明,虽然顶尖的人工智能智能体现在已经能够自主进行复杂的多步安全审计,但它们并不都是同样可靠的。成功与失败的区别往往在于“纪律性”——即保持专注、追踪进度并在不分心或不犯粗心错误的情况下完成工作的能力。这意味着,对于想要使用人工智能来检查自身医疗人工智能的医院来说,选择合适的“数字审计员”与选择医疗模型本身同样重要。
技术摘要:评估作为自主临床安全审计师的前沿 AI 智能体
问题陈述 临床 AI 模型越来越多地被部署在高度敏感的环境中(例如:死亡率预测、放射学筛查),但尚未经过正式的对抗性测试。虽然这些模型在留存测试集上表现良好,但它们仍易受到刻意设计的微小输入扰动的影响,从而导致患者伤害。目前的安全性审计存在结构性瓶颈:它需要统计学专业知识、自定义软件实现(例如:基于梯度的攻击、影子模型、校准指标)以及大量的时间。大多数临床部署团队缺乏这些资源,导致评估过程呈现出随机性、不完整或过度依赖供应商的情况。本文提出,具备多步推理和工具使用能力的前沿 AI 智能体,可以通过实现结构化的安全评估规范,在无需人工干预的情况下,自主弥补这一差距。
方法论 作者构建了一个基于 METR Task Standard v0.3.0 的开放评估任务,旨在测试前沿 AI 智能体是否能够自主执行**安全态势评分(SPS)**评估。
任务环境: 智能体在一个 Docker 容器内运行,该容器可以访问一个预训练的临床模型、一个患者数据集以及一份书面的审计规范。智能体没有脚手架代码;它必须根据指令中提供的伪代码实现所有逻辑。
SPS 框架: 智能体必须实现四个不同的对抗组件,并将它们聚合为一个加权得分:
FGSM 鲁棒性 (s f g s m s_{fgsm} s f g s m ): 使用代理逻辑回归实现快速梯度符号法(Fast Gradient Sign Method),以近似非微分目标模型的梯度。
成员推理抗性 (s m i s_{mi} s mi ): 在重叠的数据子集上训练四个影子模型,以构建攻击分类器,并针对目标模型进行测试。
预期校准误差 (s e c e s_{ece} s ece ): 对预测概率进行分箱处理,并计算准确度与置信度之间的加权平均绝对偏差。
边界攻击抗性 (s b a s_{ba} s ba ): 通过从测试点向相反类别迭代移动,来测量决策边界的接近程度。
约束条件: 智能体必须通过 bash 工具接口将结构化的 JSON 报告写入 submission.txt,并在 40 轮对话限制内完成。
实验设计:
数据集: 使用了两个临床数据集:威斯康星州诊断乳腺癌(WDBC)数据集和 MIMIC-IV(ICU 死亡率)数据集。
模型: 三种模型架构,防御强度递增(逻辑回归基准、带有 Platt 缩放的随机森林、带有对抗训练的 XGBoost)。
智能体: 评估了三种前沿模型:Claude Sonnet 4.6 、GPT-4.1 和 GPT-4o 。
协议: 每个模型针对每个变体执行三次独立运行(共 6 个变体),总计 54 次评估。
核心贡献
开放评估任务: 本文发布了一个符合 METR 标准的临床 AI 安全审计任务,包括 SPS 规范、自动化评分基础设施以及 WDBC 变体的公开资产。
实证比较: 进行了一项试点评估,对比了三种前沿模型在任务完成率、Token 效率和数值精度方面的表现。
失效模式分类学: 对 GPT-4o 观察到的三种不同失效模式进行了特征化描述:在文件写入前的早期会话终止、加权聚合中的算术错误以及提交文件为空。
结果
任务完成情况: Claude Sonnet 4.6 和 GPT-4.1 实现了 100% 的任务完成率 (各 18/18 次运行),并获得了完美的评估员得分。它们在多次运行中产生了数值完全一致的结果(GPT-4.1 因影子模型训练种子的随机性存在轻微差异)。
GPT-4o 表现: GPT-4o 的完成率为 61% (11/18 次运行)。其余 7 次失败的表现为未提交有效结果或因聚合错误导致得分不全。
效率与成本:
Token 使用量: GPT-4o 每轮消耗的输入 Token 大约是 Claude Sonnet 4.6 的 5 倍 (169K 对比 34K)。
API 成本: 在 18 次运行中,GPT-4.1 的成本约为 \8,Claude Sonnet 4.6 约为 \ 12,而 GPT-4o 约为 $27。
轮数(Turns): Claude 平均 4.7 轮;GPT-4.1 平均 10.4 轮;GPT-4o 平均 16.9 轮,部分运行达到了 40 轮的上限。
失效分析: GPT-4o 的失败归因于“智能体执行纪律”问题,而非缺乏推理能力。具体失效包括:
在写入最终 JSON 文件前终止了会话(5 例)。
在最终加权聚合步骤中使用了手动算术计算而非程序化计算(1 例)。
创建了空提交文件(1 例)。
意义与主张 本文声称,只要任务定义明确,前沿 AI 智能体就能够自主实现结构化、多步骤的临床安全评估,且具有高保真度。结果表明,模型选择是从业者构建智能体安全流水线时的主要架构决策 ;Claude Sonnet 4.6/GPT-4.1 的完美表现与 GPT-4o 39% 的失败率之间的差距,足以影响部署的可靠性。
作者强调,这是一个试点评估 (n = 18 n=18 n = 18 每模型),旨在识别模式而非提供精确的点估计。他们明确指出,SPS 框架的权重和阈值取自一篇配套的预印本(Eniolade, 2026),尚未经过独立的同行评审。研究结论认为,虽然该技术是可行的,但智能体的“执行纪律”——特别是追踪进度以及避免上下文膨胀或过早终止的能力——是多步技术任务中的关键差异化因素。本文并不声称这些智能体可以完全取代人类统计学家,而是强调它们可以自动化地实现那些目前对许多临床团队而言难以触及的严谨评估协议。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。