✨ 要点🔬 技术摘要
想象一个这样的世界:计算机不再仅仅是回答问题,而是真正去进行冒险——解决谜题、编写代码,甚至通过玩游戏来学习如何变得更聪明。这就是**智能体强化学习(Agentic Reinforcement Learning)**令人兴奋的前沿领域。把它想象成训练一个电子游戏角色,不是通过给他们剧本,而是让他们去玩游戏,在犯错中学习,并从获得的奖励中汲取经验。其目标是构建能够独立思考、使用工具并处理复杂多步任务的 AI 智能体。
然而,构建这些智能体目前有点像是在赛车以每小时 200 英里的速度飞驰时试图修理它。研究人员用来训练这些智能体的软件工具规模庞大、极其复杂,且是为巨型工业化工厂而设计的。如果一名研究人员想要尝试一个新想法——比如改变智能体从错误中学习的方式——他们往往必须钻研层层混乱的代码,就像在解开一团巨大的乱麻。这使得实验过程变得缓慢且令人沮丧。一个大问题是:我们能否构建一个既足够强大、能适配顶级超级计算机,又足够简单、清晰,让一名研究人员能在一下午内理解并修改的训练系统?
这篇论文介绍了一个名为 Molt 的新训练框架,旨在解决这个难题。来自 NVIDIA 的作者团队认为,训练强大的 AI 并不需要一台庞大复杂的机器,你只需要一个更简洁、更易读的机器。他们将 Molt 构建为一个“原生 PyTorch(PyTorch-native)”框架,这意味着它使用最流行的 AI 编程工具所使用的同一种语言,将一切都保持在统一的体系内。
该论文的核心发现是 Molt 的效率极高。它的规模小到足以让一名人类研究人员(甚至是 AI 编程助手)能够阅读整个代码库,并从头到尾理解智能体是如何学习的。尽管 Molt 比其他系统更小、更简单,但作者对其性能进行了测量,发现其在统计学上与当今最先进、重型化的系统不相上下 。在一场面对面的测试中,Molt 训练 AI 模型的速度与一个复杂的竞争对手一样快,证明了你不需要为了追求简单而牺牲速度。
论文明确反对“超大规模(hyperscale)”复杂度对于优秀研究是必要的这一观点。他们拒绝了“研究人员必须继承数千行混乱代码才能运行实验”的说法。相反,他们展示了通过保持代码的整洁并专注于核心算法,你可以取得同样的结果。他们还排除了“Token 漂移(token drift)”——即计算机生成了一个词,但在训练期间却计算了另一个版本——是可接受的这一观点;Molt 确保 AI 训练所用的 Token 与其生成的完全一致,从而防止隐藏的错误。
简而言之,Molt 是一个“精简”的训练循环,它让研究人员能够在不破坏系统的前提下快速推进。它采用了一种巧妙的设置:AI 生成答案,将其发送通过一个简单的队列,然后立即进行训练,同时对每一步都保持完美的记录。作者在了一个拥有 350 亿参数的大型模型上测量了这一点,甚至展示了它在 7000 亿参数模型上的运行情况,这表明这种简单的方法可以扩展到 AI 领域最大的挑战,而无需变得复杂。
技术摘要:Molt —— 一个用于智能体强化学习的可扩展 PyTorch 原生训练框架
1. 问题陈述
智能体强化学习(Agentic RL)研究的特点是不断的迭代:修改算法、估计器、流水线阶段和采样方案。在主流框架中,这些修改需要追踪跨越复杂层级的训练器、分布式后端和采样胶合代码的变化。这种“超大规模复杂度”往往被那些并不需要超大规模生产级堆栈特定专业化能力的研究人员所继承。因此,理解或修改框架的成本往往超过了表达研究假设本身的成本。
此外,智能体在线强化学习存在“隐性失效模式”。服务引擎和训练参与者在名义上评估相同的策略,但可能在分词(tokenization)、采样变换、多模态渲染、权重版本或混合专家(MoE)路由方面出现差异,且不会引发错误,从而导致偏差或被拒绝的梯度。现有的工具通常拥有上下文管理和控制流的所有权,而训练器则期望框架特定的环境,这与步长粒度的轨迹协议之间存在不匹配。
2. 方法论与系统设计
Molt 是一个精简、高性能、PyTorch 原生的框架,旨在最小化想法与可靠实验之间的距离,同时保留大型策略所需的性能。它的构建基于这样一个论点:复杂度是由于继承了超大规模工程化而产生的一种选择,而非实现强大 RL 基础设施的先决条件。
核心架构
该系统由三个组件和一个异步循环组成(图 1):
用户智能体(User Agents): 使用纯 Python 编写。
采样引擎(Rollout Engines): 后端通过请求路由器连接的 vLLM 实例。
策略参与者(Policy Actor): 基于 NVIDIA NeMo AutoModel 的单个 FSDP2 策略参与者。 这些组件通过实现流式池(streaming pool)和部分采样(partial rollout)的 Ray 异步队列进行通信。
设计原则
该框架遵循五个原则:
可读性: 代码库必须能够被人类和 AI 编程助手(如 Claude Code)在单次阅读中理解,禁止不必要的间接性。
最小化后端: Molt 仅支持一种训练后端(AutoModel)和一种推理引擎(vLLM),且均非分支(forked)版本。这确保了上游改进能立即应用,无需重新基准(rebasing)。
性能对等: 精简是以不牺牲吞吐量为前提的。Molt 旨在实现与最先进的基于 Megatron 堆栈统计学上的对等。
算法模块化: 组件与 RL 算法对象(智能体、采样、估计器、损失函数)一一对应,而非对应于基础设施层。
细节正确性: 生成过程与训练过程之间的数值保真度是一项首要保证。系统仅 在它生成的 Token 上进行训练,并针对异步使用场景进行了显式修正。
关键技术机制
以 Token 为核心的智能体边界: Molt 支持两种智能体形式:
环境(Env): 框架驱动循环,调用用户的 step() 函数。
对话智能体(ChatAgent): 用户通过标准的 OpenAI/Anthropic SDK 拥有循环控制权。Molt 启动一个回环对话服务器,捕获作为 Token ID 和对数概率(Log-probabilities)的流量(即 Token-In/Token-Out 或 TITO),消除了重分词(retokenization)带来的漂移。
流式池与部分采样: 持久化的提示词组池(prompt-group pool)保持样本处于飞行状态,将训练吞吐量与生成延迟解耦。权重更新不会丢弃正在进行的请求;相反,引擎会暂停,通过 NCCL 广播接收分片,并带着每 Token 的对数概率修正恢复请求。
精确 Token 传输: 提示词以 Token ID 进入,补全结果也以带有对数概率的 Token ID 返回。在整个回合(episode)过程中,文本绝不会经过分词器。
MoE 一致性: 为了防止采样与训练之间的 MoE 路由分歧,Molt 实现了“采样路由重放(rollout routing replay)”,即引擎返回每 Token 的专家选择,随后参与者在训练期间重放它们。
作为函数的估计器: 优势估计器(如 REINFORCE++、GRPO、GAE)被实现为通过标志位(flags)选择的纯函数,避免了复杂的继承体系。
3. 核心贡献
本文做出了四个主要贡献:
原则性的框架设计: 采用可读性优先的架构,具有单一入口点、单一智能体模块和局部化机制,其代码库规模显著小于生产级堆栈。
以 Token 为核心的智能体边界: 使使用标准 OpenAI/Anthropic SDK 训练智能体成为可能,通过回环服务器捕获精确的 Token 轨迹。
快速异步 PyTorch 路径: 通过持久化流式传输、直接 NCCL 权重同步、FSDP2 原生并行以及无需改变稠密模型编程模型的优化器卸载,支持多模态 MoE 训练。
开源实现与匹配评估: 提供了一个开源实现,并通过严格评估证明其吞吐量与在匹配协议下的最先进 Megatron 堆栈相当,并在从 4B 稠密模型到 700B MoE 的工作负载上得到了验证。
4. 评估结果
评估测试了“精简”设计是否会牺牲吞吐量。
代码足迹: Molt 的完整 RL 路径约为 8.6K 行 Python 代码 ,相比之下,verl 约为 62K 行,slime 约为 25K 行。
吞吐量对等: 在针对 Qwen3-30B-A3B 多模态 MoE 模型、使用 16 个 GPU(8 个训练 + 8 个采样)的头对头基准测试中,Molt 每个优化器步长耗时 119.4 ± 2.3 秒 ,在统计学上与 slime(Megatron-Core + SGLang)的 109.5 ± 10.3 秒 相当。该差异处于跨运行变异范围内。
引擎特性: 由于引擎是组合而非分支实现的,诸如投机采样(Speculative Decoding,将生成时间缩短 5 倍)和前缀缓存(Prefix Caching,0.05s 重预填充)等优化可以通过配置标志直接获得。
可扩展性: 同一个异步循环已成功在 700B MoE 模型上端到端运行,专家并行度为 256,证明了规模扩展仅是配置变更,而非设计迁移。
5. 意义与主张
论文声称,Molt 证明了 复杂度并非实现强大 RL 基础设施的代价 。通过优先考虑人类和 AI 的可读性,Molt 提供了一个“可黑客化”的研究界面,其中算法编辑(例如添加新的估计器)仅需修改单个函数和标志位,其效果能立即在日志中体现。
其重要性在于,Molt 以比 Megatron 堆栈小得多的代码库,实现了统计学上相当的吞吐量 。这使得研究人员可以追踪从智能体调用到策略损失的整个样本过程,而无需重建隐藏的注册表或后端特定的控制流。该框架是为 AI 编程助手参与其中的研究时代而设计的,确保整个算法流足够小,以便能够作为一个整体被阅读和推理。
论文明确指出,其目的不在于提出新的 RL 目标,而是专注于保持这些目标所假设的量值(对齐的 Token、行为对数概率、一致的路由)在单一数据路径中的显式性与正确性。未来的工作涉及利用 NVIDIA GB300 硬件将模型规模进一步推向 3 万亿参数,并依赖于端到端的收敛度量而非重新设计。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。