← 最新论文
💬 NLP

Orchard: An Open-Source Agentic Modeling Framework

本文介绍了 Orchard,这是一个开源框架,包含一个轻量级环境层(Orchard Env)和专门的训练配方,能够在编码、图形用户界面和个人助手领域实现可扩展的高性能智能体建模,并在开源模型中取得最先进的成果。

原作者: Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandrio Sordoni, Xingdi Yuan, Yelong Shen, Pengcheng He, Tong Zhang, Zhou Yu, Jianfeng Gao

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandrio Sordoni, Xingdi Yuan, Yelong Shen, Pengcheng He, Tong Zhang, Zhou Yu, Jianfeng Gao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和生动的类比对"Orchard"论文的解释。

核心理念:为 AI 构建一个通用的“游乐场”

想象一下,你想教机器人完成复杂的工作,比如修复损坏的电脑程序、浏览网页购买杂货,或者管理你的电子邮件。为了学习,机器人需要一个安全、隔离的“沙盒”(就像视频游戏关卡)进行练习,让它可以尝试各种操作、犯错并观察结果,而不会破坏现实世界。

长期以来,构建这些沙盒就像为每一个玩具定制一个专属游乐场。如果你想测试一个编程机器人,就得建一个游乐场;如果你想测试一个购物机器人,就必须从零开始建造一个完全不同的游乐场。这使得研究变得缓慢、昂贵且难以共享。

Orchard 是一个新的开源框架,它通过构建一个通用的、高质量的游乐场来解决这个问题,该游乐场适用于任何类型的机器人智能体。研究人员将其称为"Orchard 环境(Orchard Env)”。

把 Orchard 想象成 AI 研究人员的万能电源排插和工具腰带。以前,每换一个设备就要重新安装一个新的电源插座;现在,他们建造了一个能兼容所有设备的智能插座。这使得研究人员可以专注于教导 AI 如何思考,而无需担心沙盒的底层架构问题。


三道“食谱”(他们构建了什么)

利用这个通用游乐场,团队“烹饪”出了三道不同的“食谱”,用于在三个特定领域训练 AI 智能体。他们不仅建造了厨房,还展示了如何制作三道截然不同且美味的菜肴。

1. Orchard-SWE:“初级开发者”智能体

  • 任务:修复软件代码中的错误。
  • 挑战:编程很难。有时 AI 会卡住,或者在过程中犯错。大多数训练方法只关注“完美”的解决方案,而丢弃了失败的尝试。
  • Orchard 的秘诀:他们使用了一种称为**“信用分配(Credit-Assignment)”**的技术。想象一个学生数学考试不及格,老师没有直接把试卷扔掉,而是看着试卷说:“前三步你做对了!这很好。”Orchard 对 AI 也是如此。它保存失败尝试中的“好部分”,并教导 AI 识别这些成功的步骤。
  • 结果:他们训练出了一个模型,在修复代码方面与更大、更昂贵的模型一样出色,但它是从成功和“差点成功”的混合尝试中学习到的。

2. Orchard-GUI:“浏览器导航员”智能体

  • 任务:点击网页、填写表单和查找产品(比如在亚马逊上找狗窝)。
  • 挑战:网站是视觉化的。AI 必须“看到”截图并找出点击哪里。这就像只通过展示道路照片来教人开车。
  • Orchard 的秘诀:他们训练了一个小型、高效的模型(仅 40 亿参数,这对 AI 来说非常小),结合了练习运行和一个“裁判”(另一个 AI)对结果进行评分。他们不需要数百万个示例;他们使用了一组精心策划的约 2600 个任务。
  • 结果:这个小型模型成为了有史以来最强大的开源浏览器智能体。它的表现与谷歌和 OpenAI 等公司的庞大、昂贵系统相当(有时甚至更好),证明了如果你拥有正确的训练方法,就不需要巨大的“大脑”。

3. Orchard-Claw:“个人助理”智能体

  • 任务:管理日常任务,如整理邮件、查看日历和整理文件。
  • 挑战:这些任务发生在不同的“工具”中(邮件应用、日历应用)。通常,在一个工具上训练的 AI 在切换到另一个工具时会感到困惑。
  • Orchard 的秘诀:他们同时使用**两个不同的“控制面板”(harnesses)*来训练 AI。这就像同时教司机开手动挡和自动挡汽车。这迫使 AI 学习驾驶的概念*,而不仅仅是某辆车的特定踏板。
  • 结果:AI 变得非常灵活。当他们在最后将其切换到更高级的控制面板时,它没有崩溃;相反,它的工作表现甚至更好了,这表明它真正学会了技能,而不仅仅是记住了按钮。

为什么这很重要:“薄层”革命

这篇论文认为,AI 研究中最大的瓶颈不是“大脑”(模型),而是“腿”(环境)。

  • 以前:研究人员为每辆车定制引擎。如果你想测试新引擎,就必须建造整辆新车。
  • 现在(Orchard):Orchard 是一个通用底盘。你可以将任何引擎(AI 模型)放入其中,它就能运行。
    • 便宜:因为它运行在标准的云技术上,成本比现有的商业服务低约10 倍
    • 快速:它可以同时运行数千次练习会话而不会崩溃。
    • 可复用:为编程机器人收集的数据可以重新用于训练购物机器人。

总结

Orchard 论文指出:“停止重复造轮子。”

通过创建一个干净、开放且廉价的、适用于所有人的“游乐场”,他们展示了开源 AI 可以与最大的科技巨头竞争。他们证明了,凭借正确的基础设施和聪明的训练食谱(如从错误中学习以及在多种工具上进行训练),小型开源模型可以像庞大、封闭的系统一样解决复杂的现实世界问题。

他们向公众发布了所有代码、数据和食谱,希望通过让“游乐场”对所有人开放,来加速整个 AI 研究领域的发展。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →