← 最新论文
🤖 AI

Provably Auditable and Safe LLM Agents from Human-Authored Ontologies

本文介绍了 Agentic Redux,一种基于类型化 λ 演算和人工编写本体论的可证明正确且可审计的 LLM 智能体架构,并展示了其在医疗计费合规性和安全漏洞披露方面的应用。

原作者: Aaron Sterling

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Aaron Sterling

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在运营一项非常重要、高风险的任务,比如医院的计费部门,或者寻找软件漏洞的安全团队。你雇佣了一支由超级智能 AI 助手(大语言模型)组成的团队来提供帮助。但问题在于,这些 AI 非常聪明却又难以捉摸。它们有时会“产生幻觉”(凭空捏造),彼此之间并不总是一致,而且如果任由它们发挥,它们可能会在无意中破坏你为它们构建的世界规则。

这篇论文介绍了一种组织这些 AI 助手的新方法,称为 Agentic Redux。请记住,这不仅仅是一种新的 AI,而是一种全新的管理结构,它能够保证安全性,并为做出的每一个决策创建一份完美的、不可更改的记录。

以下是其工作原理,通过简单的概念进行拆解:

1. 问题所在:“写偏斜”(Write Skew)灾难

想象一下,爱丽丝(Alice)和鲍勃(Bob)正在共同管理一个 10 万美元的预算。

  • 爱丽丝看到还剩 45,000 美元,于是决定花掉这笔钱。
  • 鲍勃看到还剩 60,000 美元,于是决定花掉这笔钱。
  • 他们在不知道对方在做什么的情况下同时采取行动。
  • 结果: 系统支出了 105,000 美元。预算超支了。

在计算机科学中,这被称为“写偏斜”(Write Skew)。在现实世界中,当 AI 代理在没有看到全局图景的情况下独立行动时,就会发生这种情况。目前的解决方案通常只是询问 AI:“这样做可以吗?”并寄希望于它回答“可以”。如果 AI 今天状态不佳,它可能会在应该说“不”的时候说“可以”,而损失已经造成。

2. 解决方案:“智能容器”(Agentic Redux)

作者提出了一种受流行的软件设计概念 Redux 启发的结构。想象一家这样的公司:

  • 工人(子代理/Sub-agents): 这些是 AI 助手。它们只能看到世界的微小片段(它们的“局部状态”)。它们可以思考、计算并提出行动建议,但它们无法直接改变世界。它们就像是“哑组件”。
  • 经理(元代理/Meta-agent): 这是一个中央决策者,它能看到整个全局状态(整个预算、所有规则、所有历史记录)。
  • 流程:
    1. 一名工人提出一项行动建议(例如,“花费 45,000 美元”)。
    2. 该建议提交给经理。
    3. 经理根据一系列不变式(Invariants)(不可逾越的规则,如“总支出不能超过 100,000 美元”)对提议进行检查。
    4. 如果符合规则,经理批准变更;否则,经理拒绝。
    5. 经理更新世界状态,并告诉工人新的现实情况是什么。

神奇之处在于: 论文通过数学证明(使用一种名为“类型化 Lambda 演算”的逻辑分支)表明,只要经理遵循规则,无论工人们提出的建议多么疯狂或带有幻觉,系统都不可能破坏规则。这种架构本身就是一个安全网。

3. “黑匣子”账本(线性可审计性)

每当经理做出决策时,他们都会在特殊的笔记本上记录下来。

  • 如果说“是”: 他们会写下新的状态以及证明规则已被遵守的证据。
  • 如果说“否”: 他们会写下提议的内容、拒绝的原因以及哪条规则会被违反。
  • 规则: 这个笔记本是**仅限追加(Append-only)**的。你可以添加新页面,但永远不能撕掉或擦除旧页面。

这创建了一个“线性审计追踪”。如果审计员稍后介入,他们可以查看这个笔记本,并以完美的时间顺序了解每一个决策是如何做出的。他们可以验证系统从未违反过规则。

4. 如何构建这些系统:“本体优先设计”

你不能将这种架构随意套用到任何问题上。你需要先深入理解问题。作者建议使用一种名为**本体优先代理设计(Ontology-First Agent Design)**的方法:

  1. 绘制领域地图: 人类专家使用标准的制图工具(称为基本形式本体,Basic Formal Ontology)来绘制问题的精确地图(例如:“什么是患者?什么是药物测试?规则是什么?”)。
  2. 分配角色: 要求 AI 查看这张地图,并建议需要完成哪些“职责”(Roles)。
  3. 组建团队: AI 将这些职责转化为用于工人(子代理)和经理(元代理)的代码。

论文在两个现实世界的问题上测试了这一点:

  • 医疗计费: 确保保险理赔符合关于药物测试的复杂政府规定。
  • 安全漏洞: 管理发现和披露软件漏洞的过程,而不引起恐慌或违反法律。

在这两个案例中,系统都成功防止了如果代理独立行动时会发生的“写偏斜”错误。

5. 人类安全阀(顾问队列)

如果规则过于复杂导致经理无法决策,或者情况需要人类的判断,该怎么办?
系统设有顾问队列(Counselor Queue)。如果经理陷入困境,或者遇到规则要求“询问人类”的情况,提议会被暂停并进入人类专家的排队序列。

  • 人类审查情况并做出决定。
  • 至关重要的是,即使是人类,也必须将他们的决定记录在同一个不可更改的笔记本中,并解释其选择。
  • 论文证明,只要人类遵循既定格式,即使引入了人类参与,系统依然保持着可审计性和安全性。

总结

这篇论文并不声称让 AI 变得更聪明。相反,它声称通过将 AI 置于一个有着极其严格经理的“笼子”里,使 AI 更安全、更值得信赖

  • AI 负责思考和提议。
  • 架构(经理)负责检查和执行。
  • 账本永久记录一切。

其结果是一个你可以通过数学证明“坏事”(如超支或违反法规)绝不会因意外而发生的系统;并且如果人类必须介入,他们的决策也会以完全透明的方式被记录下来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →