TIER: Trajectory-Invariant Execution Rewards for Multi-Step Tool Composition
本文提出了 TIER,这是一种利用函数模式和运行时执行来为多步工具使用提供稠密且轨迹不变的监督的奖励框架,使大语言模型能够在现有基于轨迹的方法失效的复杂组合任务中实现高准确率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教导一位非常聪明但缺乏经验的机器人助手,如何通过使用一套数字工具(例如查询天气、查找航班时间或预订餐厅)来解决复杂问题。
问题在于,当你让机器人执行简单任务(如“查询天气”)时,它学得很快。但当你让它执行一连串任务(如“查找我的航班、确认降落地点、查询该地天气,然后寻找一家餐厅”)时,机器人往往会感到困惑并失败。
本文介绍了一种名为TIER的新教学方法来解决这一问题。以下是其工作原理的简明解释:
问题所在:“正确答案”陷阱
目前,教导这些机器人主要有两种方式,但两者都存在缺陷:
- “通过/不通过”方法(基于结果): 只有当机器人给出最终正确答案时,你才给予奖励。如果它在五步流程的第二步出错,它就得不到任何分数。这就像一名学生参加数学考试,前四步都算错了,却猜对了最终数字,结果得了 A;但如果最终数字错了,哪怕前四步完全正确,也会得 F。机器人永远无法知道自己哪里出错了。
- “模仿者”方法(轨迹监督): 你向机器人展示一条特定的、预先写好的“完美路径”来解决问题。如果机器人严格遵循这条路径,就能得分;如果它找到了另一种同样有效的解决方案,反而会受罚。这就像一位老师只认可学生完全按照老师的方式绘制地图,即使学生发现了一条更快的路线也不予认可。随着任务变得复杂,有效路径越来越多,机器人受罚的频率也越高,最终停止学习。
解决方案:TIER(“智能检查员”)
作者提出了TIER,它充当一名智能、自动化的检查员,在机器人执行的每一步都进行检查,而无需依赖预先写好的“完美路径”作为对比。
TIER 不再询问“你是否复制了老师的路径?”或“你是否得到了最终答案?”,而是针对机器人尝试使用的每一个工具,提出四个具体问题:
- 格式检查: “你是否用正确的语言(语法)编写了请求?”(例如:你是否使用了正确的括号和逗号?)
- 模式检查: “你是否请求了正确的工具并提供了正确的信息?”(例如:当你需要时,是否请求了“航班”工具,并提供了航班号?)
- 执行检查: “该工具是否实际运行成功?”(例如:计算机是否成功运行了代码而未崩溃?)
- 答案检查: “你是否解决了原始问题?”
TIER 的魔力:
如果机器人找到了不同的有效解决方案(例如,在查找航班之前先查询天气,而不是之后),只要步骤有效且最终答案正确,TIER 仍会给予满分。它不在乎顺序,只在乎逻辑是否成立。
类比:建造房屋
想象一下你在建造一座房子。
- 旧方法 1(通过/不通过): 只有当房子完工时才支付建筑工人报酬。如果因为地基不牢导致屋顶坍塌,你就不支付任何费用。建筑工人不知道为什么失败了。
- 旧方法 2(模仿者): 你给建筑工人一张蓝图,并说:“只能完全按照这个建造。”如果工人决定把车库建在左边而不是右边(这其实没问题),你就拒绝付款。
- TIER 方法: 你有一名检查员,检查每一个阶段。
- “地基是否水平?”(格式)
- “你是否使用了正确的墙体材料?”(模式)
- “墙体是否稳固?”(执行)
- “房子是否宜居?”(答案)
- 如果建筑工人把车库建在左边,检查员会说:“干得漂亮,这是一座有效的房子!”并支付报酬。
结果
研究人员在一个名为DepthBench的新基准测试中测试了这种方法,该测试衡量机器人处理从 1 步到 6 步递增复杂任务的能力。
- 旧方法: 机器人在 1 步任务中表现极佳,但一旦任务达到 4 或 5 步,就彻底失败。其准确率降至接近零。
- TIER: 使用 TIER 的机器人在最难的 6 步任务中仍保持了90% 以上的准确率。由于在每一步都能获得有益的反馈,而不仅仅是在最后,它们学会了可靠地将工具串联起来。
为何这很重要
这种方法意味着我们不需要人类为每一种可能的解决方案编写成千上万个“完美”示例。系统可以根据工具本身的规则,自动检查机器人是否正确执行了操作。这使得教导 AI 智能体处理需要多步骤的复杂现实世界工作变得容易得多。
该论文得出结论:为了让 AI 擅长复杂的多步推理,我们需要这种详细的、逐步的反馈机制,奖励有效的解决方案,而不仅仅是特定的解决方案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。