← 最新论文
💻 computer science

Delegation-Aware Runtime Contracts for Open LLM Multi-Agent Systems: Constraint Preservation, Capability Revocation, and State Recovery

本文引入了委托感知运行时合约(Delegation-Aware Runtime Contracts, DARC),这是一个将大语言模型多智能体系统中的权限转移视为一种可由机器检查的过程的正式框架,旨在通过确定性的运行时中介来强制执行约束保持、能力撤销和状态恢复,从而解决将委托仅视为自然语言所带来的安全风险。

原作者: Vinay Bamil

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Vinay Bamil

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:你不仅仅是在和一个聪明的机器人交谈,而是在与一整个协作的机器人团队共事。在这个世界里,一个“经理”机器人可能会说:“嘿,你去帮我找一台新笔记本电脑的最佳价格。”然后这个机器人可能会对第三个机器人说:“你去检查一下那些网站。”这被称为多智能体系统(multi-agent system)。这就像一场数字接力赛,而接力棒就是一个任务。但棘手之处在于:当第一个机器人把任务交给第二个机器人时,它通常只是用普通的英语低声传达指令。如果第一个机器人说:“不要超过 500 美元,”第二个机器人听到的可能只是“找一台笔记本电脑”,从而完全忘记了价格限制。这是因为计算机擅长遵循规则,但在传递对话时并不擅长记住“细节条款”。科学家们担心,如果我们任由这些机器人团队在没有更好规则的情况下横冲直撞,它们可能会在无意中花光我们的钱、泄露我们的秘密,或者做出一些我们从未要求它们做的事情。

本文介绍了一种处理这种机器人移交任务的新方法,称为 DARC(委托感知运行时合约)。你可以把它想象成给机器人一个特殊的、坚不可摧的背包,而不是仅仅传递一个耳语。每当一个机器人向另一个机器人移交任务时,它不仅仅是说“去吧”;它还会递交给对方一个数字合约,装在这个背包里。这份合约详细列出了新机器人被允许做什么、不能做什么、可以花多少钱以及任务何时到期。论文表明,如果你使用这些合约,你就可以在数学上证明新机器人的权力不会突然超过原有的机器人,它也不会忘记预算限制。作者构建了一个能够自动检查这些背包的系统。他们发现,如果不使用这些合约,规则在任务传递过程中往往会消失;但如果使用了它们,规则就会被牢牢锁住。不过,论文谨慎地指出,虽然“数学部分”(如金额限制和时间限制)是完全安全的,但涉及理解人类语言含义的部分(如“要有礼貌”)仍然比较复杂,仍需进一步测试。

问题所在:机器人团队的“传声筒游戏”

想象一下你在和一群朋友玩“传声筒”游戏。你把一个秘密低声传给第一个人,那个人又传给下一个人,以此类推。到了最后一个人那里,秘密通常已经变样了。也许“不要吃蛋糕”变成了“吃掉蛋糕!”

在 AI 世界中,当一个大语言模型(LLM)智能体团队协作时,情况正是如此。一个智能体(老板)给另一个智能体(工人)分配任务。老板可能会说:“找一个供应商,但不要花费超过 1,000 美元,也不要向任何人展示我们的员工名单。”工人听到了这些,并将任务传递给第三个智能体(网页冲浪者)。但由于这条信息只是纯文本,第三个智能体可能只听到了“找一个供应商”。预算限制和隐私规则就这样凭空消失了!

这是危险的。如果一个机器人团队正在管理公司的预算或处理私密数据,丢失这些规则意味着机器人可能会在无意中挥霍数百万美元或泄露机密。问题不在于机器人“不好”;而在于它们交流的方式将重要的安全规则视为可选的建议,而非硬性法律。

解决方案:不可拆解的背包 (DARC)

由 Vinay Bamil 领导的作者提出了一个名为 DARC 的解决方案。与其仅仅传递一条文本消息,每次智能体进行委托时,都必须移交一份委托合约

把这份合约想象成一个随任务一起移动的特殊、坚不可摧的背包。在这个背包里,有清晰的、机器可读的标签,上面写着:

  • 你能做什么:(例如,“你可以查看价格,但你不能购买任何东西。”)
  • 你不能做什么:(例如,“你不能查看员工记录。”)
  • 预算:(例如,“你总共有 500 美元的剩余可用额度。”)
  • 有效期:(例如,“此任务仅在 1 小时内有效。”)
  • 历史记录:(例如,“此任务来自智能体 A,而 A 是从老板那里获得的。”)

DARC 的魔力在于它将这些规则视为数学,而不仅仅是文字。当一个机器人试图向新机器人移交任务时,“协调员”(安全卫士)会检查背包。如果新机器人试图获取一个原本不存在的权限,或者试图增加它原本不具备的权力,卫士就会说:“不行!”并阻止这次移交。

它如何运作:安全卫士与背包

该系统通过三个主要阶段运行,就像机场的安全检查站一样:

  1. 移交(协调员): 当智能体 A 想要把任务交给智能体 B 时,协调员会检查背包。它确保智能体 B 没有要求比智能体 A 更多的权力。如果智能体 A 有 500 美元的预算,智能体 B 不能获得 600 美元的预算。如果智能体 A 有一条关于“禁止查看员工数据”的规则,智能体 B 也必须遵守该规则。背包是在任务传递之前构建好的,因此不可能忘记规则。
  2. 行动(网关): 当智能体 B 尝试实际执行某项操作(如购买笔记本电脑或读取文件)时,网关会再次检查背包。它会询问:“你有权执行此操作吗?你的预算还够吗?你试图读取的数据是被允许的吗?”如果答案是否定的,该操作会被立即拦截。
  3. 清理(事件控制器): 如果一个机器人被黑客攻击或失控了怎么办?系统可以“撤销”背包。如果老板说“停止智能体 B!”,系统不仅会停止智能体 B,还会追踪背包的历史记录。它会找到智能体 B 传递任务的所有机器人,并同时停止它们。它还会隔离这些机器人所接触的任何数据,确保“感染”不会扩散。

作者的发现(以及未发现的部分)

作者构建了一个该系统的原型,并进行了严格测试。以下是他们的发现:

  • 数学是有效的: 他们证明了如果你使用这些合约,规则就无法被意外丢弃。如果预算设定为 500 美元,那么无论任务传递多少次,它始终保持为 500 美元(或更少)。他们发现,如果没有这个系统,规则在经过几次移交后往往会消失。
  • “遗漏”漏洞: 在测试期间,他们发现了一个隐蔽的漏洞。他们意识到,如果父级机器人忘记写下特定的限制(比如预算数值),子级机器人可能会认为自己拥有无限的资金。他们通过制定一条新规则修复了这个问题:如果缺少限制,系统必须假设最严格的限制(例如 0 元)以确保安全。这是构建安全 AI 的一个重要教训。
  • “意义”问题: 该系统在检查数字、日期和明确规则方面非常完美。但它并不擅长理解人类语言的细微差别。例如,如果规则说“要有礼貌”,系统无法通过数学证明一个机器人是否表现得有礼貌。作者承认,对于这些“基于意义”的规则,他们的系统只是一个“尽力而为”的监控器,而非完美的保证。他们坦诚地表示:他们可以证明数学是有效的,但目前还无法证明“礼貌”是有效的。
  • 测试过程: 他们进行了一项试点研究,以观察自动化评判员识别这些错误的能力。然而,该评判员尚未通过其严格的一致性测试。因此,他们并不声称已经解决了“礼貌”问题,只是展示了他们的系统可以追踪这些问题,并且还需要更多的测试。

为什么这很重要

这篇论文是两个世界之间的桥梁:一个是旧世界中严格的计算机安全(规则是硬性的且不可破坏的),另一个是新世界中灵活的 AI 团队(机器人通过自然语言交谈)。

作者表明,如果我们想要 AI 机器人是安全的,我们就不能只是让它们自由地交谈。我们需要给它们一个随任务移动的“合约”。这确保了即使机器人说话很活跃、很有创意,它们也无法打破我们为它们设定的规则。

虽然该系统还不完美(特别是在理解复杂的语义方面),但它提供了一个坚实的基础。它证明了我们可以构建既强大又安全的 AI 团队,通过将每一次移交都视为严肃且经过检查的合约,而不是黑暗中的一次耳语,从而保护我们的资金和秘密。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →