← 最新论文
🤖 AI

Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows

本文提出了一项概念验证,证明了带有可验证奖励的强化学习(RLVR)能显著提高小语言模型在合成 Atlassian(Jira 和 Confluence)环境中执行复杂、多步工具调用的能力,在无需依赖实时 API 或人工反馈的情况下,在大多数场景中实现了近乎完美的成功率。

原作者: Karthikeya Aditya Vissa, Sankalp Mane, Ananya Mantravadi, Harshit Rajgarhia, Abhishek Mukherji

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Karthikeya Aditya Vissa, Sankalp Mane, Ananya Mantravadi, Harshit Rajgarhia, Abhishek Mukherji

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明、博学多才的图书管理员(AI),他非常擅长预测句子中的下一个词。如果你问:“天空是……”,他会自信地说“蓝色的”。但如果你要求他真正去执行一项复杂的办公系统任务——比如“创建一个新的项目工单并将其链接到特定页面”——他往往会出错。他可能知道该说什么词,但在处理细节时会出错,比如在错误的框里填入了错误的 ID 编号,或者忘记先检查该框是否存在。

这篇论文是关于如何教会这位图书管理员如何真正地“做”工作,而不只是“谈论”工作,它使用了一种特定的训练方法,称为 RLVR(具有可验证奖励的强化学习)。

以下是他们实验的日常化解读:

1. 问题所在:“自动驾驶仪” vs. “飞行员”

大语言模型(LLMs)的训练目标是成为能够预测下一个词的“自动驾驶仪”。它们非常擅长写故事或邮件。但在企业办公环境中(具体是指使用 Jira 和 Confluence 等 Atlassian 工具),成功的关键不在于写出优美的句子,而在于以正确的顺序、使用正确的数据,精准地按下正确的按钮。

  • 旧方法: 你要求 AI “创建一个子任务”。AI 可能会说:“好的,我会创建一个子任务”,但它可能会忘记分配给某人,或者使用了错误的项代码。它看起来表达很流利,但任务失败了。
  • 目标: 作者希望看看能否训练 AI 不再仅仅是“猜测下一个词”,而是开始“像飞行员一样行动”,在飞行前先检查仪表。

2. 解决方案:一个“电子游戏”训练场

与其让 AI 在真实的、活生生的公司服务器上进行练习(这既危险又缓慢),作者构建了一个这些 Jira 和 Confluence 系统系统的完美数字孪生体(即视频游戏版本)。

  • 模拟器: 这个“游戏”看起来和用起来都和真实软件一模一样,但是安全的。如果 AI 犯了错,也不会造成任何破坏。
  • 裁判(奖励系统): 这是核心秘诀。通常,你需要人类来给 AI 的工作打分。在这里,他们构建了一个严格的、自动化的裁判。
    • 如果 AI 在正确的框里填入了正确的数据?加分。
    • 如果 AI 在尝试编辑页面之前先检查了页面是否存在?额外加分。
    • 如果 AI 尝试使用一个不存在的工具,或者忘记了必要的步骤?扣分。
    • 至关重要的一点是: 裁判不需要人类去盯着屏幕看。它只需检查数学逻辑和代码。

3. 训练过程:试错法

他们拿了两个版本的 AI(一个较小的 1.7B 模型和一个较大的 4B 模型),让他们在这个模拟器中进行了数千次的练习。

  • AI 尝试完成一项任务(例如“创建一个页面”)。
  • 它失败了,得到了裁判的低分,然后再次尝试。
  • 它慢慢学会了:“哦,当我先检查父页面时,我得到了分数。当我忘记项目代码时,我丢了分。”
  • 这就是强化学习:AI 通过对良好行为获得奖励和对不良行为受到惩罚来学习。

4. 结果:从“还可以”到“完美”

他们在进行这项训练前后,针对五种不同的办公任务测试了 AI。

  • 训练前: AI 在处理简单任务时表现尚可,但在处理复杂任务时表现糟糕。例如,在创建一个新的 Confluence 页面时,未经训练的 AI 只能拿到大约 35% 的分数。它总是犯一些代价高昂的小错误。
  • 训练后: 经过训练的 AI 变得近乎完美。在同一个创建页面的任务中,它的得分跃升到了 100%
  • 重大胜利: 这种训练在处理最难的任务(即那些规则和数据字段最多的任务)时最为有效。AI 学会了这类系统所要求的严格的“先检查、后执行”模式。

5. 局限性(不足之处)

作者非常诚实地说明了目前这还不能做什么:

  • 它并非万能魔法: 他们必须为这些特定的任务手工编写“裁判规则”。你不能直接将它接入世界上任何一种软件,除非你先为它构建一个新的裁判。这就像有一个教练,他非常擅长教足球,但还没学会篮球。
  • 有一个任务太简单了: 对于一个特定的任务(更改工单状态),AI 在训练前就已经达到了完美水平,因此训练并没有带来额外的价值。

核心结论

这篇论文证明了你可以通过将一个标准的 AI 置于安全的模拟办公环境中,并使用一个严格的自动化裁判来教会它如何遵循复杂的规则。这把 AI 从一个“话多但细节出错”的聊天机器人,转变成了一个“可靠的员工”,能够完美地完成工作。然而,这需要为你想要使用的每一种特定类型的软件都构建一个定制的“训练健身房”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →