← 最新论文
💻 computer science

TOAIAF: A Runtime AI Assurance Control Plane for Trustworthy On-Device Agentic AI in Consumer Intelligence Ecosystems

本文介绍了 TOAIAF,这是一个具有三阶段决策程序和七个治理组件的运行时 AI 保障控制平面,它在检测设备端智能体 AI 的安全违规、提示词注入和隐私风险方面显著优于基准系统,同时透明地报告了实验局限性,并将其框架映射至主要的国际 AI 安全标准。

原作者: Rakesh Kumar Agrawal, Wasim Mohammed Amin Tambe, Nihar Karra

发布于 2026-09-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Rakesh Kumar Agrawal, Wasim Mohammed Amin Tambe, Nihar Karra

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:你家中的设备、你的手表以及你的汽车不再仅仅等待指令,而是能够代表你主动思考、规划并行动。这就是正在兴起的“代理式”(agentic)人工智能的现实。不同于仅仅回答问题或播放歌曲的传统软件,这些新系统会观察周围环境,推断你的目标,然后执行一系列步骤来实现它们。它们可能会在无需你按下任何按钮的情况下,决定调低恒温器温度、解锁门锁或订购杂货。虽然这种转变带来了极大的便利,但也引入了一个深刻的新挑战:如何确保一个进行独立决策的机器不会犯下危险的错误?问题的核心不仅在于软件是否存在漏洞,更在于代理本身可能误解了目标、被陌生人的信息所欺骗,或者采取了某种一旦发生便无法撤销的行为。

研究人员 Rakesh Kumar Agrawal、Wasim Mohammed Amin Tambe 和 Nihar Karra 针对这一问题提出了一个名为 TOAIAF 的解决方案。你可以将其想象成一个生活在设备内部的专属安全官,在代理做出每一个决策之前对其进行监视。他们的工作聚焦于代理决定做某事与实际执行该动作之间的那短短一瞬。在这个短暂的窗口期内,系统会根据一套严格的规则和信任评分来检查提议的操作。研究人员构建了一个用于此类检查的完整框架,该框架包含七个不同的组件,它们协同工作以评估可靠性、安全性、隐私性以及是否需要咨询人类。他们使用一个包含一百种不同场景的计算机模拟实验测试了这个系统,场景范围涵盖了从智能家居调节灯光到可穿戴设备监测健康数据等各种情况。其目标是观察这个新的安全层是否能在不阻碍正常操作的前提下拦截错误行为。

该系统的核心是一个三步决策过程,它就像是为代理考虑的每一个动作设置的过滤器。首先,系统执行一项硬性检查,查看代理是否拥有执行该任务的权限。如果代理试图使用未经授权的工具或访问数据,系统会立即阻止它。这是一个简单但至关重要的守门员。第二步是安全闸门,它负责寻找特定的危险,例如可能违反隐私或破坏安全规则的行为。至关重要的一点是,这个闸门是非补偿性的,这意味着无论在其他领域表现得多么“行为良好”,都无法弥补单一的安全违规。如果隐私泄露的风险过高,该动作就会被拦截,无论该代理平时表现得多么可靠。第三步是基于六个不同因素计算最终的信任得分,这些因素包括代理与用户实际目标的契合程度,以及人类介入的有效性。如果风险较低,则允许执行;如果风险中等,系统可能会发出警告或请求批准;如果风险较高,则完全停止该动作。

为了测试这种方法是否奏效,研究人员创建了一个包含一百个场景的合成基准测试。这些并非涉及真实人类或设备的现实世界测试,而是旨在模拟现实风险的精心构建的模拟实验。其中包括四十个无害场景,以确保系统不会干扰正常生活;以及六十个风险场景,涵盖了六种特定的失效模式:不安全行为、隐私泄露、目标偏离、通过提示词注入进行的欺骗、工具误用以及人类监督不足。他们将新系统与另外两种方法进行了对比:一种是完全没有安全检查的系统,另一种是仅拦截包含特定“不良”关键词的简单系统。结果显示出明显的差异。新系统成功标记了几乎所有的危险场景,拦截了 100% 的不安全政策违规、提示词注入和工具误用案例。它还拦截了超过 92% 的隐私风险和目标偏差。相比之下,简单的关键词系统在目标偏差和隐私风险方面完全失败,几乎错过了所有这类问题,因为这些不良行为往往使用了礼貌的语言。最重要的是,新系统在无害场景中实现了零失误,从未拦截过安全的动作。

然而,研究人员对他们的研究证明了什么以及未证明什么保持了透明度。虽然该系统在模拟中表现完美,但研究揭示了系统中不同部分协作时存在的一些局限性。当他们尝试移除安全闸门以观察其是否真正必要时发现,在这一特定测试集中,其他部分已经捕捉到了相同的错误,这使得很难衡量该闸门的独特价值。同样,他们发现一个旨在衡量人类如何监督代理的新指标实际上在某些情况下降低了系统的敏感性,这表明数学模型仍需进一步微调。或许最显著的是,他们在原型设计中发现了一个设计缺陷:系统目前允许在标记警告的情况下继续执行动作,这对于像解锁门锁这类物理动作来说可能是危险的。这意味着,尽管决策逻辑是合理的,但最终的实现方案需要针对不可逆转的行为制定更严格的规则。

这项研究还将他们的框架映射到了现有的全球人工智能安全标准中,展示了其技术组件如何与《欧盟人工智能法案》及美国国家标准与技术研究院(NIST)的指南相一致。这种联系表明,该系统不仅仅是一个理论构想,而是一个可以帮助制造商满足可信人工智能法律要求的实用工具。研究人员强调,他们的工作只是一个起点。由于结果源自模拟,下一步涉及使用真实的 AI 模型在实际硬件(如智能扬声器和可穿戴设备)上测试该系统。他们计划使用成熟的安全基准测试,以观察该系统如何处理现实世界的复杂性。目前,这项工作提供了一个清晰的蓝图,指导如何构建一个监视自主代理的安全层,确保它们始终是高效的仆人,而非难以预测的主人。它提供了一种方法,既能保留智能设备带来的承诺,又能防范因缺乏监管而产生的现实风险。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →