CRAFT: Learn the Schema, Execute the Plan
CRAFT 是一个用于企业级编程智能体的两阶段后训练框架,它通过学习基于模式(schema)的规划与执行行为,无需在提示时进行详尽的模式注入,从而在显著降低 Token 开销的同时,大幅提升分析性能、一致性与效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一个世界:你可以通过与一个超级聪明的机器人助手交谈,只需使用普通的英语,就能让它进行复杂的数学计算、分析海量数据或编写计算机程序。这就是“编码智能体”(coding agents)的梦想。但问题在于:为了完成工作,这个机器人需要了解它所处理的数据库的秘密规则。这就像一位厨师试图烹饪一道美食。如果厨师不知道储藏室里有哪些食材,也不知道炉灶如何工作,他们就无法烹饪。在过去,为了帮助机器人,工程师们会将一本包含所有规则、表名和列定义的、厚重且落满灰尘的百科全书,在每次机器人提问时都强行塞进机器人的大脑里。这就像是强迫厨师在切第一个洋葱之前,必须先读完整本百科全书。
现在,想象一下,如果厨师不再需要每次都阅读百科全书,而是可以在几次练习后就“记住”厨房的布局。这就是这篇论文要解决的核心问题:我们能否教会这些 AI 助手一次性学会这些规则,从而不需要每次都被提醒它们?研究人员想要看看,他们是否可以训练 AI 去“内化”模式(schema,即数据的地图)以及它需要使用的工具,从而使它变得更快、更聪明,并且在对话变得漫长而复杂时不易产生困惑。
论文:CRAFT —— 先学会地图,再跑完比赛
这篇论文介绍了一个名为 CRAFT 的新系统(其名称代表了“学习的两个阶段配方”)。作者团队来自亚马逊,他们希望构建一种能够帮助广告专家分析营销活动数据,而无需让他们沉溺于技术细节的 AI。他们发现,旧的方法——即将无穷无尽的文档“填充”到 AI 的提示词中——就像是背着一包砖头跑马拉松。这不仅减慢了速度,还让 AI 容易出错。
因此,他们尝试了一种不同的方法:学习模式,执行计划。
第一阶段:“剥离模式”的教室
首先,他们在一个特殊的教室里教授 AI,在这个教室里,“百科全书”被拿走了。他们给了 AI 数千个解决问题的案例,但隐藏了原始的数据库规则(DDL)输入。AI 不是通过阅读规则来学习,而是必须学习如何思考和规划的“模式”。
这就像是通过展示步骤和逻辑来教学生解数学题,但不允许他们看公式表。他们必须记住“思考的方式”。研究人员称之为 PLAN 有监督微调(SFT)。这就像是 AI 正在学习如何构建计划和编写代码的“肌肉记忆”,而不需要每次都依赖那张“作弊纸”。
第二阶段:“强化学习”健身房
一旦 AI 具备了基础的肌肉记忆,他们就会把它放入一个 强化学习(RL) 健身房。在这里,AI 实际上会尝试运行代码并使用工具。如果它犯了错误——比如调用了错误的工具或编写了导致崩溃的代码——它会得到一个“负分”。如果成功了,它会得到一个“正分”。
研究人员使用了一种特殊的评分系统,该系统不仅关心代码是否能运行,还关心代码是否“好”、计划是否与代码匹配,以及当情况出错时 AI 是否能够恢复。这就像是一位教练观察一名跑步者,不仅看他是否跑完全程,还要检查他的姿势、速度以及他在踉跄时如何应对。这个阶段被称为 Execution-Shaped GRPO,它教会了 AI 即使在用户提出后续问题或在中途改变规则时,也能保持可靠和一致。
结果:更快、更聪明、更简洁
结果非常令人印象深刻。当他们测试 CRAFT 与旧的“砖头背包”法时:
- 速度: 新系统将 AI 需要阅读的文本量(token)减少了约 9 倍。这对 AI 的大脑来说是一次巨大的“减重”。
- 聪明程度: 整体“智能体得分”(衡量其完成任务能力的指标)提升了 9.6 个百分点。
- 一致性: AI 变得更加一致,提升了 4.1 个百分点,这意味着即使你两次询问同一个问题,它也能给出同样好的答案。
- 减少困惑: 它将 AI “搜索”正确工具的次数减少了高达 5 倍。
研究人员还发现,AI 在处理多轮对话方面变得更出色了。如果用户说,“显示销售额”,然后紧接着说,“现在只筛选红色衬衫”,CRAFT AI 会记住上下文并保持对话连贯,而旧系统则经常会迷失方向。
它不是什么(以及需要注意什么)
值得注意的是,这篇论文并没有声称它能做到所有事情。作者明确指出,该系统是为**稳定的已知模式(schemas)**设计的。如果数据库突然发明了一种全新的数据类型或一种 AI 从未见过的全新工具,CRAFT 可能会陷入困境。这就像一位完美熟悉厨房的厨师,却不知道如何使用一个从未见过的奇怪新奇小工具。在这种情况下,你可能仍然需要查阅规则(检索)或重新训练这位“厨师”。
此外,论文也承认,虽然 AI 在遵循计划方面表现出色,但它尚未完全针对计算机内存使用量或服务器运行成本进行优化。那是未来升级的工作。
总结
CRAFT 表明,与其不断地把信息塞到 AI 面前,不如教会它规则,然后信任它去执行计划。通过结合“无作弊纸”的训练阶段和“实践并接受纠正”的阶段,他们构建了一个更轻量、更快且更可靠的智能体。这是朝着让 AI 助手感觉不再像是阅读手册的机器人,而更像是深谙业务逻辑的专家同事,迈出了重要的一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。