← 最新论文
🤖 machine learning

Scaling Automatic Research Agents via World Models

本文介绍了世界模型强化学习(World Model RL, WMRL),该框架通过学习到的世界模型取代了高昂的环境执行成本,并利用在线去偏和逆方差去噪来克服扩展瓶颈,从而加速训练,并使较小的智能体能够在自动研究和具身任务中显著超越规模大得多的基准模型。

原作者: Xiyuan Yang, Sheikh Sarwar, Jingru Cheng, Zhan Shi, Duanshun Li, Huiyuan Chen, Haiyang Zhang, Chenlei Guo, Jingrui He, Zhenyu Liao

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiyuan Yang, Sheikh Sarwar, Jingru Cheng, Zhan Shi, Duanshun Li, Huiyuan Chen, Haiyang Zhang, Chenlei Guo, Jingrui He, Zhenyu Liao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机不仅能聊天或写诗,而且实际上能进行科学研究的世界。它们可以观察一个问题,构思出一个解决方案,建立一个数字实验,运行它,并观察结果如何。这就是“自动研究”(Automatic Research)这一令人兴奋的前沿领域,在这里,AI智能体扮演着微小而不知疲倦的科学家角色。为了让这些智能体真正胜任工作,研究人员使用了一种名为“强化学习”(Reinforcement Learning, RL)的技术。把强化学习想象成训练一只狗:智能体尝试做一件事,如果做得好,就会得到一个“奖励”(即“零食”),并学会再次这样做。但问题在于:在现实世界的科学领域,获取那个“零食”是非常昂贵的。这就像要求一只狗在每次学习新把戏时,都要在真实的体育场里跑一次马拉松。建造体育场需要时间,跑赛道需要时间,而且消耗的能量也极其昂贵。

这篇论文解决了一个在训练这些AI科学家时遇到的特定难题:运行实验的成本问题。研究人员发现,虽然AI可以非常快速地构思出数千个想法(因为计算机可以同时处理许多想法),但在真实的数字实验室中实际运行这些想法却是缓慢且昂贵的。这就像有一个厨师,他可以在一分钟内写出一百万个食谱,但每当他想尝试其中一个时,都必须租下一个全新的厨房,购买新鲜食材,并等待一个小时让烤箱预热。如果你想把这个厨师培养成大师,你可负担不起烹饪一百万顿饭的费用。问题变成了:我们如何在不烧掉一百万美元买食材的情况下,训练这位厨师?

来自伊利诺伊大学和亚马逊团队的作者们提出了一种聪明的解决方案,称为“世界模型强化学习”(World Model RL, WMRL)。他们不是让AI在真实的厨房里烹饪每一顿饭,而是教它使用一个“模拟厨房”——一个关于食物味道的快速、数字化的猜测。这个模拟厨房是即时且廉价的。然而,存在一个风险:模拟可能会出错。它可能会认为烤焦的蛋糕味道美味,或者认为生的饼干是完美的。如果AI只听从模拟,它可能会养成坏习惯。

为了解决这个问题,团队增加了两个特殊的“安全网”。首先,他们使用了一种名为“在线去偏差”(Online Debiasing)的技术。想象一下有一个品尝员,偶尔会根据真实烹饪出的蛋糕来检查模拟的猜测。如果模拟一致认为烤焦的蛋糕很好吃,品尝员就会实时纠正模拟的分数,教会AI忽略这个特定的错误。其次,他们使用了“逆方差去噪”(Inverse-Variance Denoising)。这就像拥有一群评委。有些评委反应快但有点不稳定(模拟器),而另一些评委反应慢但非常准确(真实的厨房)。AI学会了在快速的评委表现不稳定时更多地倾听准确的评委,而在准确的评委保持安静时更多地倾听快速的评委。通过这种方式,AI既获得了模拟的速度,又获得了真实世界的准确性。

结果非常令人印象深刻。通过使用这种方法,研究人员能够比传统的在真实数字实验室中运行每一次实验的方法,将他们的AI智能体训练速度提高3到4倍。更棒的是,使用这种“模拟厨房”方法训练的AI智能体不仅学习得更快,而且实际上成为了更优秀的科学家。在测试中,一个规模较小(拥有40亿或90亿个“脑细胞”)且使用这种方法训练的AI模型,其表现优于许多规模更大(拥有480亿或1200亿个“脑细胞”)但未经过此类训练的预制AI模型。团队还展示了这种技巧不仅适用于编程和数据科学,也适用于教机器人如何在现实世界中移动它们的机械臂。

简而言之,这篇论文证明了你不需要为了训练一位天才AI科学家而烧掉一百万美元进行真实实验。通过使用一种智能的、具有自我纠错能力的模拟,你可以训练得更快,并让它们变得更聪明,将“昂贵烹饪”这一瓶颈转化为一种流畅、快速的学习体验。作者表明,虽然模拟并不完美,但只要有正确的修正,它们就可以成为下一代AI研究者的终极训练场。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →