← 最新论文
💬 NLP

Synthetic Computers at Scale for Long-Horizon Productivity Simulation

本文介绍了“大规模合成计算机”,这是一种生成具有丰富人工制品的真实用户特定数字环境的方法,用于运行长视野生产力模拟,通过经验学习显著提升智能体性能,并为未来智能体强化学习提供可扩展的基础。

原作者: Tao Ge, Baolin Peng, Hao Cheng, Jianfeng Gao

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Tao Ge, Baolin Peng, Hao Cheng, Jianfeng Gao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想教一个机器人如何成为一名出色的办公室职员。你可以给它展示几个示例,比如某人如何撰写电子邮件或填写电子表格。但真正的办公室工作不仅仅是打字;它涉及在杂乱无章的数字桌面上导航、记住上周做过的事情、在三年前创建的文件夹中找到正确的文件,以及与发送简短邮件的老板和反复无常的客户进行协调。

论文《大规模合成计算机》提出了一种方法,可以在无需真实人类隐私数据的情况下,教会 AI 智能体这些复杂技能。以下是他们是如何做到的,简单解释如下:

1. 构建“数字幽灵”(合成计算机)

研究人员没有使用真实个人的计算机(其数据是私密的,且以不可预测的方式杂乱无章),而是从头开始构建了1,000 台假计算机

  • 人物设定:首先,他们为每台计算机创建了一个“角色”。其中一个可能是“玛格丽特”,一位住在丹佛的高级财务顾问,热爱 Excel 但讨厌杂乱。另一个可能是一位图形设计师,总是保留同一文件的 50 个版本。
  • 数字桌面:他们利用 AI 为每个角色构建了逼真的文件夹结构。这不仅仅是一个空的硬盘;里面填满了“幽灵文件”——假的电子表格、旧的演示文稿和草稿,看起来完全像是一个真实人类经过多年工作所创建的内容。
  • 结果:他们创建了 1,000 个独特的数字世界,每个世界都有其自己的历史、习惯以及杂乱(但有组织)的文件系统。

2. “一个月”的模拟

一旦假计算机准备就绪,他们便运行了一次大规模模拟。

  • 设置:一个 AI“经理”查看假计算机,并分配了一个月的工作量。对于财务顾问玛格丽特来说,这意味着更新投资模型、为客户撰写报告以及为董事会会议做准备。
  • 工作者:第二个 AI“工作者”被放置在那台假计算机中。它的任务是扮演玛格丽特。它必须:
    • 翻找文件夹以找到正确的数据。
    • 打开旧的电子表格,查看去年完成的工作。
    • 向“假同事”(也是 AI)发送邮件,寻求反馈或澄清截止日期。
    • 修正错误并修订文档。
  • 规模:这并非一项快速任务。每次模拟让 AI 花费了超过 8 小时的实时计算时间,并涉及2,000 多个步骤(回合),才能完成单个月的工作。

3. 从“幽灵”经验中学习

这篇论文最重要的部分在于模拟之后发生的事情。

  • 复盘:研究人员不仅查看了 AI 生成的最终报告,还审视了整个历程。他们分析了 AI 是如何迷失方向的、如何从错误中恢复的、如何与同事沟通的,以及在何处犯了错。
  • “技能卡”:他们将这些教训转化为“技能卡”。例如,他们发现财务智能体经常混淆百分比和基点。于是他们制定了一条具体的规则(一种技能)来防止此类错误。
  • 测试:他们将这些“技能卡”交给一个新的 AI 智能体,并要求它在一台新的假计算机上完成同样的工作。
    • 结果:拥有“技能卡”的 AI 得分显著提高(高出约 7%),比没有技能卡的 AI 表现更好。它犯的错误更少,处理复杂工作流程的能力也更强。

4. 为什么这很重要(“为什么”)

该论文认为,要让 AI 在现实世界中真正有用,我们不能只给它简单的任务。我们需要在复杂、长期的环境中训练它,让它学会记住上下文并处理杂乱的文档。

  • 类比:这就像飞行训练。你不仅仅教飞行员如何操纵飞机;你会将他们放入模拟器中,面对恶劣天气、引擎故障以及一位发出混乱指令的副驾驶。
  • 主张:通过创建数百万台这样的“数字幽灵”计算机,我们可以生成无限的训练数据。这使得 AI 能够在安全、虚假的世界中练习,从而学会如何成为一名高效的职员,而无需在接触真实世界之前就已经犯错。

总结

研究人员构建了1,000 台假计算机,里面填充了假文件假人。他们让 AI 智能体在这些计算机中生活了一个模拟月,从事复杂的工作。通过研究智能体在此过程中成功或失败的方式,他们创造了教训(技能),使 AI 在执行现实世界办公室工作时变得更加聪明。

他们 essentially 在说:“要教会 AI 成为一名优秀的员工,不要只给它一次考试。为它建立一个假办公室,让它在那里工作一个月,然后教它所学到的东西。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →