Orchard: An Open-Source Agentic Modeling Framework
本文介绍了 Orchard,这是一个开源框架,包含一个轻量级环境层(Orchard Env)和专门的训练配方,能够在编码、图形用户界面和个人助手领域实现可扩展的高性能智能体建模,并在开源模型中取得最先进的成果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗易懂的语言和生动的类比对"Orchard"论文的解释。
核心理念:为 AI 构建一个通用的“游乐场”
想象一下,你想教机器人完成复杂的工作,比如修复损坏的电脑程序、浏览网页购买杂货,或者管理你的电子邮件。为了学习,机器人需要一个安全、隔离的“沙盒”(就像视频游戏关卡)进行练习,让它可以尝试各种操作、犯错并观察结果,而不会破坏现实世界。
长期以来,构建这些沙盒就像为每一个玩具定制一个专属游乐场。如果你想测试一个编程机器人,就得建一个游乐场;如果你想测试一个购物机器人,就必须从零开始建造一个完全不同的游乐场。这使得研究变得缓慢、昂贵且难以共享。
Orchard 是一个新的开源框架,它通过构建一个通用的、高质量的游乐场来解决这个问题,该游乐场适用于任何类型的机器人智能体。研究人员将其称为"Orchard 环境(Orchard Env)”。
把 Orchard 想象成 AI 研究人员的万能电源排插和工具腰带。以前,每换一个设备就要重新安装一个新的电源插座;现在,他们建造了一个能兼容所有设备的智能插座。这使得研究人员可以专注于教导 AI 如何思考,而无需担心沙盒的底层架构问题。
三道“食谱”(他们构建了什么)
利用这个通用游乐场,团队“烹饪”出了三道不同的“食谱”,用于在三个特定领域训练 AI 智能体。他们不仅建造了厨房,还展示了如何制作三道截然不同且美味的菜肴。
1. Orchard-SWE:“初级开发者”智能体
- 任务:修复软件代码中的错误。
- 挑战:编程很难。有时 AI 会卡住,或者在过程中犯错。大多数训练方法只关注“完美”的解决方案,而丢弃了失败的尝试。
- Orchard 的秘诀:他们使用了一种称为**“信用分配(Credit-Assignment)”**的技术。想象一个学生数学考试不及格,老师没有直接把试卷扔掉,而是看着试卷说:“前三步你做对了!这很好。”Orchard 对 AI 也是如此。它保存失败尝试中的“好部分”,并教导 AI 识别这些成功的步骤。
- 结果:他们训练出了一个模型,在修复代码方面与更大、更昂贵的模型一样出色,但它是从成功和“差点成功”的混合尝试中学习到的。
2. Orchard-GUI:“浏览器导航员”智能体
- 任务:点击网页、填写表单和查找产品(比如在亚马逊上找狗窝)。
- 挑战:网站是视觉化的。AI 必须“看到”截图并找出点击哪里。这就像只通过展示道路照片来教人开车。
- Orchard 的秘诀:他们训练了一个小型、高效的模型(仅 40 亿参数,这对 AI 来说非常小),结合了练习运行和一个“裁判”(另一个 AI)对结果进行评分。他们不需要数百万个示例;他们使用了一组精心策划的约 2600 个任务。
- 结果:这个小型模型成为了有史以来最强大的开源浏览器智能体。它的表现与谷歌和 OpenAI 等公司的庞大、昂贵系统相当(有时甚至更好),证明了如果你拥有正确的训练方法,就不需要巨大的“大脑”。
3. Orchard-Claw:“个人助理”智能体
- 任务:管理日常任务,如整理邮件、查看日历和整理文件。
- 挑战:这些任务发生在不同的“工具”中(邮件应用、日历应用)。通常,在一个工具上训练的 AI 在切换到另一个工具时会感到困惑。
- Orchard 的秘诀:他们同时使用**两个不同的“控制面板”(harnesses)*来训练 AI。这就像同时教司机开手动挡和自动挡汽车。这迫使 AI 学习驾驶的概念*,而不仅仅是某辆车的特定踏板。
- 结果:AI 变得非常灵活。当他们在最后将其切换到更高级的控制面板时,它没有崩溃;相反,它的工作表现甚至更好了,这表明它真正学会了技能,而不仅仅是记住了按钮。
为什么这很重要:“薄层”革命
这篇论文认为,AI 研究中最大的瓶颈不是“大脑”(模型),而是“腿”(环境)。
- 以前:研究人员为每辆车定制引擎。如果你想测试新引擎,就必须建造整辆新车。
- 现在(Orchard):Orchard 是一个通用底盘。你可以将任何引擎(AI 模型)放入其中,它就能运行。
- 便宜:因为它运行在标准的云技术上,成本比现有的商业服务低约10 倍。
- 快速:它可以同时运行数千次练习会话而不会崩溃。
- 可复用:为编程机器人收集的数据可以重新用于训练购物机器人。
总结
Orchard 论文指出:“停止重复造轮子。”
通过创建一个干净、开放且廉价的、适用于所有人的“游乐场”,他们展示了开源 AI 可以与最大的科技巨头竞争。他们证明了,凭借正确的基础设施和聪明的训练食谱(如从错误中学习以及在多种工具上进行训练),小型开源模型可以像庞大、封闭的系统一样解决复杂的现实世界问题。
他们向公众发布了所有代码、数据和食谱,希望通过让“游乐场”对所有人开放,来加速整个 AI 研究领域的发展。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。