← 最新论文
💬 NLP

CRAFT: Learn the Schema, Execute the Plan

CRAFT 是一个用于企业级编程智能体的两阶段后训练框架,它通过学习基于模式(schema)的规划与执行行为,无需在提示时进行详尽的模式注入,从而在显著降低 Token 开销的同时,大幅提升分析性能、一致性与效率。

原作者: Aakash Kolekar, Sahika Genc, Shahriar Shariat, Bunyamin Sisman, Tibor Mezi, Barbara Poblete, Shree Vandana Kachroo, Calvin Chi, Parth Parmar, Ari Singer, Prayaas Jain, Cindy Barker, Benoit Dumoulin

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Aakash Kolekar, Sahika Genc, Shahriar Shariat, Bunyamin Sisman, Tibor Mezi, Barbara Poblete, Shree Vandana Kachroo, Calvin Chi, Parth Parmar, Ari Singer, Prayaas Jain, Cindy Barker, Benoit Dumoulin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:你可以通过与一个超级聪明的机器人助手交谈,只需使用普通的英语,就能让它进行复杂的数学计算、分析海量数据或编写计算机程序。这就是“编码智能体”(coding agents)的梦想。但问题在于:为了完成工作,这个机器人需要了解它所处理的数据库的秘密规则。这就像一位厨师试图烹饪一道美食。如果厨师不知道储藏室里有哪些食材,也不知道炉灶如何工作,他们就无法烹饪。在过去,为了帮助机器人,工程师们会将一本包含所有规则、表名和列定义的、厚重且落满灰尘的百科全书,在每次机器人提问时都强行塞进机器人的大脑里。这就像是强迫厨师在切第一个洋葱之前,必须先读完整本百科全书。

现在,想象一下,如果厨师不再需要每次都阅读百科全书,而是可以在几次练习后就“记住”厨房的布局。这就是这篇论文要解决的核心问题:我们能否教会这些 AI 助手一次性学会这些规则,从而不需要每次都被提醒它们?研究人员想要看看,他们是否可以训练 AI 去“内化”模式(schema,即数据的地图)以及它需要使用的工具,从而使它变得更快、更聪明,并且在对话变得漫长而复杂时不易产生困惑。


论文:CRAFT —— 先学会地图,再跑完比赛

这篇论文介绍了一个名为 CRAFT 的新系统(其名称代表了“学习的两个阶段配方”)。作者团队来自亚马逊,他们希望构建一种能够帮助广告专家分析营销活动数据,而无需让他们沉溺于技术细节的 AI。他们发现,旧的方法——即将无穷无尽的文档“填充”到 AI 的提示词中——就像是背着一包砖头跑马拉松。这不仅减慢了速度,还让 AI 容易出错。

因此,他们尝试了一种不同的方法:学习模式,执行计划。

第一阶段:“剥离模式”的教室

首先,他们在一个特殊的教室里教授 AI,在这个教室里,“百科全书”被拿走了。他们给了 AI 数千个解决问题的案例,但隐藏了原始的数据库规则(DDL)输入。AI 不是通过阅读规则来学习,而是必须学习如何思考和规划的“模式”。

这就像是通过展示步骤和逻辑来教学生解数学题,但不允许他们看公式表。他们必须记住“思考的方式”。研究人员称之为 PLAN 有监督微调(SFT)。这就像是 AI 正在学习如何构建计划和编写代码的“肌肉记忆”,而不需要每次都依赖那张“作弊纸”。

第二阶段:“强化学习”健身房

一旦 AI 具备了基础的肌肉记忆,他们就会把它放入一个 强化学习(RL) 健身房。在这里,AI 实际上会尝试运行代码并使用工具。如果它犯了错误——比如调用了错误的工具或编写了导致崩溃的代码——它会得到一个“负分”。如果成功了,它会得到一个“正分”。

研究人员使用了一种特殊的评分系统,该系统不仅关心代码是否能运行,还关心代码是否“好”、计划是否与代码匹配,以及当情况出错时 AI 是否能够恢复。这就像是一位教练观察一名跑步者,不仅看他是否跑完全程,还要检查他的姿势、速度以及他在踉跄时如何应对。这个阶段被称为 Execution-Shaped GRPO,它教会了 AI 即使在用户提出后续问题或在中途改变规则时,也能保持可靠和一致。

结果:更快、更聪明、更简洁

结果非常令人印象深刻。当他们测试 CRAFT 与旧的“砖头背包”法时:

  • 速度: 新系统将 AI 需要阅读的文本量(token)减少了约 9 倍。这对 AI 的大脑来说是一次巨大的“减重”。
  • 聪明程度: 整体“智能体得分”(衡量其完成任务能力的指标)提升了 9.6 个百分点
  • 一致性: AI 变得更加一致,提升了 4.1 个百分点,这意味着即使你两次询问同一个问题,它也能给出同样好的答案。
  • 减少困惑: 它将 AI “搜索”正确工具的次数减少了高达 5 倍

研究人员还发现,AI 在处理多轮对话方面变得更出色了。如果用户说,“显示销售额”,然后紧接着说,“现在只筛选红色衬衫”,CRAFT AI 会记住上下文并保持对话连贯,而旧系统则经常会迷失方向。

它不是什么(以及需要注意什么)

值得注意的是,这篇论文并没有声称它能做到所有事情。作者明确指出,该系统是为**稳定的已知模式(schemas)**设计的。如果数据库突然发明了一种全新的数据类型或一种 AI 从未见过的全新工具,CRAFT 可能会陷入困境。这就像一位完美熟悉厨房的厨师,却不知道如何使用一个从未见过的奇怪新奇小工具。在这种情况下,你可能仍然需要查阅规则(检索)或重新训练这位“厨师”。

此外,论文也承认,虽然 AI 在遵循计划方面表现出色,但它尚未完全针对计算机内存使用量或服务器运行成本进行优化。那是未来升级的工作。

总结

CRAFT 表明,与其不断地把信息塞到 AI 面前,不如教会它规则,然后信任它去执行计划。通过结合“无作弊纸”的训练阶段和“实践并接受纠正”的阶段,他们构建了一个更轻量、更快且更可靠的智能体。这是朝着让 AI 助手感觉不再像是阅读手册的机器人,而更像是深谙业务逻辑的专家同事,迈出了重要的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →