← 最新论文
🤖 machine learning

Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning

Molt 是一个紧凑且原生支持 PyTorch 的开源框架,旨在通过实现无需牺牲性能的端到端算法修改,来简化智能体强化学习研究,同时在确保训练一致性和代码库清晰度的前提下,提供与最先进的基于 Megatron 的技术栈等效的统计性能。

原作者: Jian Hu, Huiying Li, Hao Zhang, Binfeng Xu, Yifan Zhang, Shaokun Zhang, Hemil Desai, Michael Demoret, Pavlo Molchanov, Jan Kautz, Yi Dong

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Jian Hu, Huiying Li, Hao Zhang, Binfeng Xu, Yifan Zhang, Shaokun Zhang, Hemil Desai, Michael Demoret, Pavlo Molchanov, Jan Kautz, Yi Dong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:计算机不再仅仅是回答问题,而是真正去进行冒险——解决谜题、编写代码,甚至通过玩游戏来学习如何变得更聪明。这就是**智能体强化学习(Agentic Reinforcement Learning)**令人兴奋的前沿领域。把它想象成训练一个电子游戏角色,不是通过给他们剧本,而是让他们去玩游戏,在犯错中学习,并从获得的奖励中汲取经验。其目标是构建能够独立思考、使用工具并处理复杂多步任务的 AI 智能体。

然而,构建这些智能体目前有点像是在赛车以每小时 200 英里的速度飞驰时试图修理它。研究人员用来训练这些智能体的软件工具规模庞大、极其复杂,且是为巨型工业化工厂而设计的。如果一名研究人员想要尝试一个新想法——比如改变智能体从错误中学习的方式——他们往往必须钻研层层混乱的代码,就像在解开一团巨大的乱麻。这使得实验过程变得缓慢且令人沮丧。一个大问题是:我们能否构建一个既足够强大、能适配顶级超级计算机,又足够简单、清晰,让一名研究人员能在一下午内理解并修改的训练系统?

这篇论文介绍了一个名为 Molt 的新训练框架,旨在解决这个难题。来自 NVIDIA 的作者团队认为,训练强大的 AI 并不需要一台庞大复杂的机器,你只需要一个更简洁、更易读的机器。他们将 Molt 构建为一个“原生 PyTorch(PyTorch-native)”框架,这意味着它使用最流行的 AI 编程工具所使用的同一种语言,将一切都保持在统一的体系内。

该论文的核心发现是 Molt 的效率极高。它的规模小到足以让一名人类研究人员(甚至是 AI 编程助手)能够阅读整个代码库,并从头到尾理解智能体是如何学习的。尽管 Molt 比其他系统更小、更简单,但作者对其性能进行了测量,发现其在统计学上与当今最先进、重型化的系统不相上下。在一场面对面的测试中,Molt 训练 AI 模型的速度与一个复杂的竞争对手一样快,证明了你不需要为了追求简单而牺牲速度。

论文明确反对“超大规模(hyperscale)”复杂度对于优秀研究是必要的这一观点。他们拒绝了“研究人员必须继承数千行混乱代码才能运行实验”的说法。相反,他们展示了通过保持代码的整洁并专注于核心算法,你可以取得同样的结果。他们还排除了“Token 漂移(token drift)”——即计算机生成了一个词,但在训练期间却计算了另一个版本——是可接受的这一观点;Molt 确保 AI 训练所用的 Token 与其生成的完全一致,从而防止隐藏的错误。

简而言之,Molt 是一个“精简”的训练循环,它让研究人员能够在不破坏系统的前提下快速推进。它采用了一种巧妙的设置:AI 生成答案,将其发送通过一个简单的队列,然后立即进行训练,同时对每一步都保持完美的记录。作者在了一个拥有 350 亿参数的大型模型上测量了这一点,甚至展示了它在 7000 亿参数模型上的运行情况,这表明这种简单的方法可以扩展到 AI 领域最大的挑战,而无需变得复杂。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →