← 最新论文
💻 computer science

ARCHER: Agentic Rule and Compliance Harness for Executable Regulations

本文介绍了 ARCHER,一种确定性的多智能体程序合成框架,它能从监管文件中生成可审计的验证代码,以实现可扩展、透明且高准确度的建筑合规性检查,并证明了自托管开源权重模型的性能可以媲美前沿 API,且成本仅为后者的极小部分。

原作者: Chiraag Singh Anand, Xue Wen Tan, Lionel Teo, Eric Tan

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Chiraag Singh Anand, Xue Wen Tan, Lionel Teo, Eric Tan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人遵循一套非常严格的盖房规则。问题不在于机器人很懒,而在于规则手册是用人类语言编写的,充满了像“确保走廊足够宽”这样模糊的措辞,而机器人只理解数学和几何。在建筑领域,这些规则被称为“建筑规范”,而蓝图则是被称为 BIM(建筑信息模型)的数字 3D 模型。几十年来,检查设计是否符合规则一直是一个巨大且昂贵的难题,通常需要大量的专家通过人工扫描数以千行的代码和几何图形。这就像是在试图通过用放大镜阅读每一页,来在一座拥有百万本书籍的图书馆中寻找一个错别字。

最近,科学家们开始使用“AI 智能体”(AI agents)——即能够思考、规划和编写代码的智能计算机程序——来提供帮助。但问题在于:如果你只是要求一个聪明的 AI “写一个规则检查器”,它往往会感到困惑,编造不存在的规则,或者编写会导致崩溃的代码。这就像是要求一位才华横溢但混乱的厨师在没有食谱的情况下烤蛋糕;他们可能会做出美味的蛋糕,也可能烧毁整个厨房。研究人员提出的核心问题是:我们如何组织这些 AI 智能体,使它们不仅仅是在靠猜,而是真正构建出可靠、可用的工具,让我们能够信任它们?新加坡资讯通信媒体发展局(IMDA)的一个团队决定解决这个谜题。

ARCHER:AI 建筑师团队

这篇论文介绍了一个名为 ARCHER(用于可执行法规的智能体规则与合规性框架)的新系统。请不要把 ARCHER 仅仅看作一个单一的超级大脑,而要把它看作一个高度组织的施工队,其中的每个成员都有特定的职责,并且遵循严格、不可逾越的时间表。

过去,研究人员尝试通过给单个 AI 模型一个巨大的提示词(prompt)并寄希望于好结果来实现这一目标。作者称之为“盲目”(Blind)方法。这就像是把一道复杂的数学题交给一个学生,然后对他说:“自己搞定它”,而不允许他检查自己的作业。论文发现,这种方法是不可靠的。即使是最聪明的 AI 模型也经常无法得到正确答案,因为它们无法在为时已晚之前发现自己的错误。

ARCHER 通过使用具有确定性编排(deterministic orchestration)的多智能体系统改变了游戏规则。让我们用一个类比来拆解一下:

想象一下,你正试图根据一份模糊的说明书搭建一座完美的乐高城堡。

  1. 规划者(The Planner): 首先,一个“规划者”智能体会阅读说明书,并绘制出一份如何搭建城堡的逐步草图。它还不会碰积木,只是制定计划。
  2. 生成者(The Generator): 接下来,一个“生成者”智能体会遵循那份草图,开始将乐高积木拼在一起,编写实际的计算机代码。
  3. 评估者(The Evaluator): 然后,一个严格的“评估者”智能体会检查这座城堡。它会对照原始规则测量每一面墙并清点每一块积木。如果墙太短了,评估者不会只说“错了”,它会精准地指向那面短墙并说:“修复这块特定的积木。”
  4. 循环(The Loop): 随后,生成者会修复错误并再次尝试。这个循环会重复执行最多 30 次。如果评估者意识到不仅是“积木”错了,连“计划”本身也是错的,它会将工作发回给规划者,让其重新绘制草图。

这种“计划-生成-评估”的循环是其成功的秘诀。论文表明,通过强制 AI 反复检查自己的工作并修复特定错误,它可以将像“停车位必须 2.4 米宽”这样模糊的规则,转化为一个完美的、可运行的计算机程序,从而瞬间检查数千个 3D 模型。

他们的发现:结构的威力

研究人员使用一个新的包含十条真实世界建筑规则和 3D 模型的数据集测试了这个系统。他们将他们的“ARCHER”团队与另外六种使用 AI 的方式进行了对比,这些方式涵盖了从一个困惑的单体机器人到一群互相争吵的机器人团队。

以下是核心结论,以直观的数字呈现:

  • 结构胜过纯粹的智能: 最令人惊讶的发现是,一个组织良好的“较弱”AI 模型团队的表现优于一个独自工作的“超强”AI 模型。当 AI 被允许只进行一次猜测时(“盲目”法),其平均正确率仅为 47%。但当团队使用 ARCHER 循环时,准确率平均跃升至 85%。这比基础方法提升了 82%
  • “编排者”至关重要: 团队测试了运行该团队的两种方式。一种方式是让 AI 决定谁与谁交谈(类似于一场混乱的会议);另一种方式是使用固定不变的日程表(类似于军事演习)。他们发现,固定日程的方法(ARCHER)更加可靠。对于某些模型,它比混乱的版本提高了高达 24.5 个百分点的准确率。
  • 便宜并不总是意味着更省钱: 团队测试了四种不同的 AI 模型,从昂贵的、顶级的“前沿”模型(运行成本很高)到可以在你自己的电脑上运行的廉价、自托管模型。
    • 昂贵的模型表现出色,但论文发现,运行在 ARCHER 系统上的廉价自托管模型可以达到昂贵模型 97.8% 的准确率。
    • 更棒的是,这种廉 cheaper 的设置成本仅为前者的四分之一
    • 这表明,机构不需要为了获得出色的结果而斥巨资购买最昂贵的 AI;他们只需要一个正确的系统(ARCHer)来引导那些较便宜的 AI。

为什么这很重要

论文指出,建筑合规性检查长期以来一直停留在“手动”时代。现有的工具通常被锁定在昂贵的、专有的软件中,无人能见其内部逻辑也无法修复。如果规则存在歧义,软件就会失效,你必须寻求人工介入。

ARCHER 提供了一种新的途径:透明、灵活且可扩展。 由于该系统编写的是标准的 Python 代码(一种通用的编程语言),人类实际上可以阅读 AI 编写的代码,从而了解它是如何判定一栋建筑是安全还是不安全的。如果 AI 犯了错,人类可以查看代码,理解其逻辑并进行修正。

作者谨慎地指出,这并不是解决所有问题的万灵药。有些建筑规则对于计算机来说过于复杂,无法进行完美的测量(例如,判断一个形状奇特的楼梯是否“安全”需要人类的直觉)。对于这些情况,系统旨在将其标记为“人工检查”(MANUAL_CHECK)以供人类核实。但对于成千上万的标准规则——比如“门是否足够宽?”或“停车位尺寸是否正确?”——ARCHER 表明我们现在可以通过高精度、低成本的方式实现自动化处理。

简而言之,这篇论文证明了,如果你给 AI 一个严格的工作描述、一个专家团队以及一个检查作业的循环,它就能将混乱、模糊的建筑规则转化为清晰、可运行的代码。它将 AI 的“黑箱”转变为一个透明、可审计的工具,有朝一日能让建筑变得更安全、更快速、更便宜。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →