← 最新论文
🤖 AI

Fantastic Scientific Agents and How to Build Them: AgentBuild for Rietveld Refinement

本文介绍了 AgentBuild,这是一个赋能科学家通过版本控制的契约(评分标准、课程大纲和知识库)来构建基于大语言模型的智能体以保留人类判断力的框架,并通过在 X 射线衍射数据 Rietveld 精修中的成功应用得到了验证,在该应用中,系统将工作流限制识别为契约失败而非模型错误。

原作者: Woong Shin, Craig A. Bridges, Marshall T. McDonnell, Rafael Ferreira da Silva

发布于 2026-06-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Woong Shin, Craig A. Bridges, Marshall T. McDonnell, Rafael Ferreira da Silva

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位大师级厨师(科学家),想要教一位非常有天赋但有点手忙脚乱的新晋副厨(AI智能体)如何烹饪一道特定的、复杂的菜肴(科学分析)。

在过去,如果你想让这位副厨去烹饪,你可能会尝试重写他的大脑(微调),或者只是对他大声吼叫指令直到他做对为止(提示词即用)。但本文认为这是一个坏主意。如果你重写了他的大脑,你会丢失你自己的食谱。如果你只是对他大声吼叫,他可能只在一次时做得对,但下次你更换食材时就会失败。

相反,作者提出了一种构建这些 AI 厨师的新方法,叫做 AgentBuild。以下是它的工作原理,使用简单的类比:

1. “合同”(科学家的工作)

科学家不是编写代码,而是编写一份合同。这份合同包含三个部分:

  • 评分标准(评分表): 一份关于完美菜肴长什么样的严格清单。它不仅仅是说“味道好”;它会规定“酱汁的粘稠度必须恰好为 5 度”、“不能有焦洋葱”,并且“摆盘必须与照片一致”。
  • 课程表(练习菜单): 一份练习菜肴的列表,从简单的(烧开水)到复杂的(4 小时慢炖)。
  • 知识库(参考图书馆): 科学家自己信任的食谱和菜谱。AI 可以阅读这些书籍来学习如何烹饪,但科学家会妥善保管原始书籍。

2. “构建器”(AI 构建过程)

论文引入了一个名为 AgentBuild 的系统,它就像一条工厂装配线。

  • 评委: 一个 AI 充当严厉的美食评论家。它根据“评分标准”品尝新副厨做的每一道菜,并进行评分。
  • 元优化器(Meta-Optimizer): 这是“修复者”。如果副厨烧焦了酱汁,修复者会查看评论家的笔记,并重写副厨的指令(其“系统提示词”和代码)以尝试再次烹饪。
  • 边界: 至关重要的一点是,修复者被允许修改的仅限于给副厨的指令。他们不允许触碰科学家的原始食谱(知识库)或评分表(评分标准)。这确保了科学家的判断始终是“老板”,并且不会迷失在 AI 的黑盒之中。

3. “菜肴”(结果)

目标不仅仅是做出顿好饭,而是构建一个可部署的智能体

  • 把最终结果想象成一个“打包好的”厨师。一旦该智能体通过了所有练习菜肴的“评分表”,它就会被打包封装。
  • 这个封装包拥有一个持久化接口。这意味着如果底层的“大脑”(AI 模型)在明年发生了变化(比如从 iPhone 14 升级到 iPhone 15),你不需要重新教这个厨师。你只需要用新的大脑再次运行 AgentBuild 过程,旧的“评分表”和“练习菜单”会自动调优新的厨师。科学家的合同是持久的资产;AI 仅仅是不断变化的工具。

现实世界的测试:“X 射线食谱”

为了证明这套方法有效,作者尝试构建一个能进行**Rietveld 精修(Rietveld Refinement)**的 AI。

  • 这是什么? 想象你有一张模糊的晶体结构照片(X 射线数据)。你需要将一个 3D 模型拟合到这张照片上,从而确定这个晶体是由什么组成的。这就像是通过观察物体的影子来猜测隐藏物体的形状。
  • 挑战: 计算机擅长数学,但它们经常会忽略视觉上的错误。计算机可能会说“数学上是吻合的!”,但照片看起来显然不对劲(对人类而言)。
  • 实验: 他们使用 AgentBuild 系统来教 AI 如何观察这些“影子”(X 射线图谱)并调整模型。
    • 他们从简单、清晰的照片(低噪声)开始。
    • 他们转向更难、更模糊的照片(高噪声)。
    • 最后,他们尝试了一个“4 小时扫描”(最难、最详细的照片)。

结果:
该系统成功构建了一个能够完美处理简单和中等照片的 AI 智能体。当遇到最难的“4 小时扫描”时,AI 确实可以产生一个数学上吻合的结果(看起来像真实的晶体),但它违反了“工作流合同”。它试图同时做太多事情,破坏了科学家设定的特定流程规则。

核心启示:
这篇论文表明,你可以构建一个既具有可解释性(你知道它遵循哪些规则)又具有持久性(当 AI 技术发生变化时依然有效)的科学 AI。科学家仍然是规则的制定者,而 AI 只是将这些规则编译成工作工具的机器。在 4 小时扫描处的“失败”并不是 AI 智能水平的失败,而是一个清晰的信号,表明科学家的规则(合同)需要针对该特定难度级别进行调整。

简而言之:不要让 AI 编写规则。让科学家编写规则,然后让 AI 根据这些规则构建出那台机器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →