← 最新论文
🤖 AI

Language-Based Agent Control

本文介绍了基于语言的代理控制(LBAC),这是一种编程模型,它通过要求代理生成经过静态验证的良类型程序,确保代理应用遵守用户指定的安全策略,从而在保留计算表达力的同时,统一了开发者编写的脚手架与代理生成的行为之间的安全保证。

原作者: Timothy Zhou, Loris D'Antoni, Nadia Polikarpova

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Timothy Zhou, Loris D'Antoni, Nadia Polikarpova

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位才华横溢但不可预测的助手(一个 AI 智能体)来为你工作,比如整理你的研究论文。你希望他们既富有创造力又聪明,但同时也需要确保他们不会(意外地或恶意地)删除你的文件、窃取你的机密,或编造虚假数据。

目前,大多数系统迫使你必须在安全自由之间做出选择:

  • “玩具箱”方法(受限工具): 你给助手一个装有预先批准工具的微小盒子。他们不能走出这个盒子。这非常安全,但他们无法做任何聪明或复杂的事情。如果他们需要排序一个列表,就必须请求你逐个处理。
  • “开放式厨房”方法(代码解释器): 你让助手完全进入厨房。他们可以随心所欲地烹饪!但如果他们感到困惑或被欺骗,可能会烧毁房子或给你端上毒药。

本文介绍了一种名为基于语言的智能体控制(LBAC)的新方法。这就像给助手一个魔法厨房,其中物理定律(宇宙的规则)是用他们必须使用的语言写成的。

核心理念:“魔法语言”

与其仅仅给助手一份“可做与不可做”的清单,程序员将整个系统构建在一个特殊的、严格的语言内部(类似于一种超严格的编程语言 Haskell)。

在这种魔法语言中,类型(数据的标签)充当了安全警卫。

  • 如果一段数据被标记为“受信任”,意味着它来自安全来源(如经过验证的数据库)。
  • 如果一段数据被标记为“不受信任”,则它来自互联网或用户。
  • 该语言有一条规则:你不能将“不受信任”的原料混入“受信任”的菜肴中。

实际运作方式

让我们回到文本中的研究论文示例。你要求智能体:“找到最早关于差分隐私的论文,并将其添加到我的参考文献中。”

  1. 旧方法(代码解释器): 智能体编写一个程序。它可能决定编造一个虚假的论文标题,将其写入你的文件,然后说:“给你!”系统只检查代码是否运行,而不检查内容是否真实。
  2. 旧方法(受限工具): 你只给智能体一个“获取并保存”按钮。他们无法自行对结果进行排序或筛选。他们只能等待你告诉他们选择哪一个。
  3. LBAC 方法(TYPEGUARD):
    • 智能体用魔法语言编写程序。
    • 为了获取论文,他们必须使用一个特殊函数,该函数仅返回带有“受信任”标签的结果。
    • 为了写入你的文件,该函数要求输入必须带有“受信任”标签。
    • 魔法检查: 在允许智能体的程序运行之前,“类型检查器”(一位严格的图书管理员)会查看代码。
      • 如果智能体试图将没有“受信任”标签的虚假论文写入文件,图书管理员会说:“错误!此代码不符合规则。请重试。”
      • 智能体收到错误信息,意识到自己的错误,并重新编写代码,先从数据库中获取真实的论文。
    • 一旦代码通过检查,它便会运行。

为何这至关重要

该论文声称,这种方法解决了“安全与自由”的问题:

  • 自由: 智能体仍然可以编写复杂的程序、排序列表和进行数学运算。他们不会被限制在一个微小的工具盒中。
  • 安全: 由于智能体必须编写符合语言严格规则的代码,他们在物理上无法执行违反规则的操作(如泄露机密数据或写入虚假文件)。如果代码未通过“类型检查”,它将永远不会运行。

“嵌套”智能体技巧

该论文还表明,即使智能体雇佣“子智能体”协助,这种方法依然有效。

  • 想象主智能体要求子智能体查看一封可疑的电子邮件。
  • 子智能体阅读该邮件(这是“脏”的或不受信任的)。
  • 由于魔法语言的规则,子智能体自动被置于“隔离区”。他们可以阅读邮件,但除非将那些“脏”数据包裹在主智能体被允许打开的特殊容器中,否则不能将其传递给主智能体的工具。
  • 这是通过语言规则自动发生的,而非依赖独立的安全系统。

总结

该论文认为,我们不应在 AI 智能体周围建造围墙,而应将 AI 的世界构建在一个严格的、基于规则的语言内部。在这个世界中,安全不是额外添加的独立层级,而是内置于智能体思考和编写代码的机制本质之中。如果智能体试图违反规则,语言本身就会说“不”,并在行动发生之前将其阻止。

作者通过三种场景测试了这一点:

  1. 数据溯源: 确保只有真实的、源自数据库的论文才会被添加到参考文献中。
  2. 文件系统沙箱: 确保智能体只能接触特定文件夹中的文件(类似于“能力”令牌)。
  3. 信息流: 确保机密数据永远不会意外泄露到公共互联网。

在所有情况下,该系统都保持了智能体的聪明和灵活,同时保证它无法违反规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →