← 最新论文
🤖 AI

Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning

本文提出了一种统一的三阶段训练范式,通过首先注入潜在的预测能力,随后通过格式诱导监督对其进行结构化,最后通过前瞻条件强化学习来精炼其校准,从而将前瞻性规划内化于大语言模型智能体中,进而克服反应型智能体的局限性,并实现具备落地能力的长时程决策。

原作者: Xuan Zhang, Zhijian Zhou, Lingfeng Qiao, Yulei Qin, Ke Li, Xing Sun, Xiaoyu Tan, Chao Qu, Yuan Qi

发布于 2026-06-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuan Zhang, Zhijian Zhou, Lingfeng Qiao, Yulei Qin, Ke Li, Xing Sun, Xiaoyu Tan, Chao Qu, Yuan Qi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常聪明的机器人去解决复杂的谜题,比如在互联网上寻找特定的事实,或者解决一道棘手的数学题。

目前,大多数这类机器人工作的模式就像是一个反应式驾驶员。他们看到红灯亮了,就踩刹车;看到问题,就立即输入答案。他们很快,但并不真正“思考未来”。如果他们走错了路,往往要等到已经撞车了才会意识到。

这篇论文的研究人员希望教会这些机器人更像人类驾驶员。人类不仅仅是做出反应;我们会进行“心理模拟”。在我们转动方向盘之前,我们会问自己:“如果我在这里左转,会撞到那辆卡车吗?如果我直行,会不会遇上堵车?”我们在脑海中尝试不同的路径,然后再实际行动。

论文指出,目前的 AI 智能体缺乏这种“心理模拟”或内部世界模型。它们无法真正想象行为带来的未来后果。

问题: “假装成真”的陷阱

研究人员首先尝试了一个简单的修复方法:他们直接告诉 AI,“在回答之前,写下你认为接下来会发生什么的计划。”

他们发现了一个被称为**“格式-能力差距”(Format-Capability Gap)**的问题。

把它想象成教学生写电影剧本。如果你只是告诉他们,“写一个包含英雄、反派和转折的剧本”,他们可能会写出一个在纸面上看起来完美的剧本。但如果你要求他们实际“演”出这个场景,他们可能会踉跄出错,因为他们并不真正理解角色是如何移动或说话的。他们只是在模仿计划的“格式”,而并没有具备预测未来的实际“能力”。

在 AI 的案例中,它开始编写一些看起来很棒但充满胡言乱语(幻觉)的“计划”。它会说:“我会搜索 X,然后找到 Y”,但它实际上并不知道搜索 X 是否真的会导致 Y。它只是在瞎猜。

解决方案:三阶段训练营

为了解决这个问题,研究人员创建了一个特殊的三个步骤训练计划,旨在教会 AI 如何真正“思考未来”,并根据这些想法采取行动。他们称之为世界模型智能体训练(World Model Agentic Training)

第一阶段:“心理健身房”(世界模型智能体中期训练)

在 AI 学会如何谈论计划之前,它需要先学会如何“拥有”计划。

  • 类比: 想象飞行员在飞行模拟器中训练。他们不只是阅读手册;他们在虚拟飞机中度过了数千小时,观察在用力拉动操纵杆或飞入风暴时会发生什么。
  • 论文的做法: 他们向 AI 输入了大量“未来”已知的海量数据。他们强迫 AI 观察当前情况,并写下现实世界中接下来实际发生了什么,同时附带一个置信度分数(例如,“我有 85% 的把握这次搜索能找到答案”)。
  • 结果: AI 不再只是瞎猜,而是开始建立一种真实的、内在的因果理解。它学习了任务的“物理规律”。

第二阶段:“编剧”(格式诱导的有监督微调)

现在 AI 已经具备了预测未来的“能力”,它需要学习如何将其“展示”出来。

  • 类比: 飞行员现在知道如何飞行了,但他们需要学习如何以正确的格式提交飞行计划,以便空中交通管制能够理解他们。
  • 论文的做法: 他们教会了 AI 一个必须遵循的特定结构。在采取行动之前,它必须输出一个“世界模型块(World Model Block)”,说明:“这是我预测的路径,这些是我要寻找的关键词,以及我的置信水平是多少。”
  • 结果: AI 学会了清晰地将内部想法语言化,将它的“想象”与“行动”分离开来。

第三阶段:“带着秒表的教练”(前瞻条件强化学习)

最后,他们需要确保 AI 的预测是诚实且有用的。

  • 类比: 想象一位观察飞行员的教练。如果飞行员说:“我有 100% 的把握能在飓风中着陆”,但最后坠毁了,教练会给予惩罚。如果飞行员说:“我有 50% 的把握,但我会尝试”,并且安全着陆了,他会得到奖励。
  • 论文的做法: 他们使用了一个检查两件事的奖励系统:
    1. 落地性(Grounding): AI 预测的事情是否真的发生了?(如果它预测会找到某个特定姓名,它是否真的找到了?)
    2. 校准度(Calibration): AI 的置信度分数是否准确?(如果它说“90% 确定”但错了,它会受到惩罚;如果它说“50% 确定”但对了,它会获得奖励。)
  • 结果: AI 学会了在不确定时保持谦逊,在正确时保持自信。它不再进行荒唐的猜测。

结果:更聪明、更安全的智能体

研究人员在两类任务上测试了这种新的训练方法:

  1. 搜索: 寻找需要查找多个信息碎片才能回答的复杂问题。
  2. 数学: 解决困难的数学问题。

研究结果非常明确:

  • 使用这种三阶段方法训练的 AI 在解决这些问题时,明显优于使用标准方法训练的 AI。
  • 它特别擅长多步推理(需要许多步骤的任务)。它不会在过程的中途迷失方向。
  • 最重要的是,AI 的置信度分数变得值得信赖。当 AI 说“我有 90% 的信心”时,它通常是正确的。当它说“我只有 10% 的信心”时,它通常正处于挣扎状态或即将犯错。

总结

这篇论文表明,你不能仅仅告诉 AI “向前思考”就指望它奏效。你必须首先教会它如何模拟未来(第一阶段),然后教会它如何写下这些想法(第二阶段),最后训练它对自己的确定程度保持诚实(第三阶段)。通过这样做,他们创造了一个不仅会对世界做出反应,而且能像人类一样为之进行规划的 AI 智能体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →