← 最新论文
🤖 AI

Autonomous Action Runtime Management(AARM):A System Specification for Securing AI-Driven Actions at Runtime

本文提出了“自主动作运行时管理”(AARM)开放规范,旨在通过在动作执行前进行拦截、上下文评估与策略强制,为从被动助手转向自主代理的AI系统建立一套模型无关且标准统一的运行时安全防御机制。

原作者: Herman Errico

发布于 2026-02-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Herman Errico

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

1. 背景:从“只会说话的助理”到“会干活的管家”

以前的 AI(比如早期的 ChatGPT)像是一个**“只会动嘴的军师”**。你问它问题,它给你写文章、出主意。如果它说错了,顶多是让你觉得它“胡说八道”,不会造成实际损失。

但现在的 AI 正在变成**“全能管家”**。它不仅能说话,还能直接操作你的电脑、发邮件、转账、甚至修改公司的数据库。

  • 风险在于: 如果这个管家被坏人“洗脑”了(比如通过一种叫“提示词注入”的手段),他可能会在你不经意间,把你的银行卡密码发给骗子,或者把公司的机密文件全部删掉。

2. 核心问题:传统的保安“太迟钝”了

目前的网络安全手段就像是**“事后查监控”或者“看门卫查证件”**:

  • 查证件(传统权限控制): 门卫只看管家有没有钥匙。管家拿着钥匙去开保险箱,门卫觉得“你有钥匙,可以进”,但他不知道管家这次去开保险箱,是不是因为主人真的吩咐了,还是被坏人骗了。
  • 查监控(事后审计): 等你发现钱丢了,再去翻监控,那时候损失已经造成了,根本无法挽回。

AI 的动作太快了,而且具有“组合性”: 管家先查了一下你的账单(合法),接着又发了一封邮件(合法),但如果这两件事连在一起看——“查完账单立刻把内容发给陌生人”——这就是犯罪!


3. AARM 是什么?——“智能实时监察官”

AARM 提出的方案不是在事后查监控,而是在管家**“伸手去拿钥匙”的那一瞬间**,拦住他,进行一次**“深度灵魂拷问”**。

我们可以把 AARM 想象成一个**“带有记忆的智能拦截器”**,它在做决策时会看三样东西:

  1. 硬性红线(Forbidden): 就像保险箱上有个物理锁,规定“绝对禁止任何人尝试拆解保险箱”。不管管家怎么辩解,只要想拆,直接拒绝。
  2. 看上下文(Context): 这是 AARM 的灵魂。它不只看管家现在要做什么,还要看**“他刚才干了什么”以及“主人最初到底让他干什么”**。
    • 例子: 如果主人说“帮我整理一下账单”,管家查完账单后想“发邮件给外部地址”。AARM 会想:“主人让你整理,没让你发给外人啊!”于是立刻拦截。
  3. 遇到模糊情况先“暂停”(Defer): 如果管家要做一件大事(比如转账),但 AARM 觉得现在的证据不足以判断他是好人还是坏人,它不会直接说“行”或“不行”,而是会**“按下暂停键”**,然后弹窗问主人:“主人,管家现在想转账,您确定吗?”

4. AARM 的四个“决策模式”

为了应对不同的情况,AARM 给管家准备了四种待遇:

  • 🚫 绝对禁止 (Deny): “你这事儿违法,别想了!”
  • 🛑 逻辑不对,拒绝 (Context-Dependent Deny): “你拿钥匙没问题,但你刚才查了隐私,现在又要发邮件,这不对劲,不行!”
  • ✅ 确认意图,允许 (Context-Dependent Allow): “这事儿看起来有点危险(比如删数据),但我想了一下,主人确实刚才说过要清理垃圾,那好吧,准了!”
  • ⏳ 拿不准,等等看 (Defer): “这事儿有点悬,我先按住不放,等主人亲自确认一下再说。”

5. 总结:给 AI 时代装上“刹车”和“大脑”

这篇论文的核心思想是:我们不能信任 AI 的“大脑”(模型本身),因为大脑可能会被洗脑;我们必须在 AI 的“手”(执行动作的边界)上装一个极其聪明的“刹车系统”。

这个刹车系统不仅能识别动作,还能**“读懂意图”**,确保 AI 无论变得多么强大、动作多么迅速,始终都在主人的掌控之中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →