← 最新论文
🤖 machine learning

PriorZero: Bridging Language Priors and World Models for Decision Making

PriorZero 是一个统一框架,它通过在蒙特卡洛树搜索的根节点处注入大语言模型指导以进行聚焦探索,从而弥合静态大语言模型先验与动态世界模型之间的鸿沟,并通过将世界模型训练与大语言模型适配解耦以实现稳定、细粒度的信用分配,从而显著提升长程任务中的决策效率与性能。

原作者: Junyu Xiong, Yuan Pu, Jia Tang, Yazhe Niu

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Junyu Xiong, Yuan Pu, Jia Tang, Yazhe Niu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一位非常聪明、博览群书的图书管理员(即大语言模型)如何玩一款复杂的文字冒险游戏,比如《Zork》或《侦探》。这位图书管理员对世界、故事和逻辑知之甚少,但他们从未真正玩过这款游戏。他们不知道具体的规则、隐藏的陷阱,也不知道游戏世界会对每一个动作做出何种反应。

论文PriorZero提出了一种新方法,教导这位图书管理员如何玩游戏,既不会让他们发疯,也不会让他们忘记已有的知识。

以下是问题与解决方案的分解,使用了简单的类比:

问题:“知”与“行”的鸿沟

作者发现,现有将图书管理员的知识与游戏游玩相结合的方法,主要在两个方面失败:

  1. “静态指南”问题:如果你只是让图书管理员根据他们的通用知识告诉你该做什么,他们可能会给出一个逻辑上合理的答案,但这在游戏中实际上是一个陷阱。他们知道门通常起什么作用,但不知道游戏中这扇特定的门通向无底深渊。他们对游戏的具体规则是“盲”的。
  2. “无尽试错”问题:如果你试图通过让图书管理员玩数千次游戏并在每次失败时纠正他们(这种方法称为“微调”)来教导他们,那将是一场灾难。游戏提供的奖励极少(例如找到宝箱),导致图书管理员感到困惑。他们可能会开始随机猜测,或者因为游戏的特定规则如此怪异而“遗忘”他们良好的通用知识。

解决方案:PriorZero

PriorZero 充当了图书管理员的通用智慧与专门的“游戏模拟器”(称为世界模型)之间的桥梁。它采用了两部分策略:

1. “根先验注入”(聪明的起点)

想象图书管理员和游戏模拟器正在使用一棵巨大的决策树(称为MCTS)共同规划下一步。

  • 旧方法:图书管理员试图猜测未来路径的每一个步骤。这既缓慢又经常出错,因为图书管理员不了解游戏的物理机制。
  • PriorZero 方法:图书管理员仅在第一步(树的根节点)提供建议。他们会说:“基于我的知识,向走似乎是个好主意。”
  • 模拟器的任务:一旦图书管理员建议“向北”,游戏模拟器便接管。它仅从该建议开始,模拟数千种可能的未来,以查看这是否真的通向宝藏或陷阱。图书管理员不干涉深层模拟;他们只是帮助将搜索指向正确的方向,以免模拟器浪费时间去寻找明显糟糕的路径。

类比:把图书管理员想象成一位导游,他了解城市的历史。他指引你前往“历史街区”(根节点)。一旦你到达那里,GPS(世界模型)便接管,计算穿过街道的确切、最快路线,避开导游不知道的拥堵路段。

2. “交替训练”(安全的课程)

这是他们教导图书管理员变得更好而不破坏其大脑的方法。

  • 阶段 A(模拟器学习):首先,游戏模拟器玩游戏并学习规则、奖励以及每个动作的后果。它变得非常擅长预测未来。
  • 阶段 B(图书管理员学习):一旦模拟器变得聪明,它就充当一位严格但公正的老师。它告诉图书管理员:“你建议了‘向北’,这就是它带来的确切奖励量。”因为模拟器已经完成了艰难的数学计算,反馈清晰且不令人困惑。图书管理员从这些具体的反馈中学习。
  • 循环:它们轮流进行。模拟器变得更聪明,然后教导图书管理员,接着图书管理员变得更聪明,这反过来帮助模拟器更好地探索,如此循环往复。

类比:想象一位国际象棋教练(模拟器),他已经下过数百万局棋。与其让一名学生(图书管理员)随机下棋并感到沮丧,不如让教练为学生模拟游戏。教练说:“如果你走这一步,你将在 5 步内获胜。”学生无需承受亲自下完整局游戏的压力,就能学会该步棋的价值

结果

作者在两种类型的游戏中测试了这种方法:

  1. 文字冒险游戏(Jericho):你需要输入命令来探索世界的游戏。
  2. 网格世界(BabyAI):你需要在网格中导航以寻找物体的游戏。

发生了什么?

  • PriorZero 的学习速度快于仅使用图书管理员或仅使用模拟器的方法。
  • 从长远来看,它达到了更高的分数(找到了更多宝藏)。
  • 它解决了“死循环”问题,即智能体在同一个房间里来回走动而陷入停滞。图书管理员的初始提示帮助模拟器打破了这些循环。

总结

PriorZero 是一种团队合作策略。它让大语言模型(图书管理员)做它最擅长的事:利用常识建议一个好的起点。它让世界模型(模拟器)做它最擅长的事:计算这些动作复杂的长期后果。通过保持它们既分离又连接,它们避免了强迫图书管理员成为游戏引擎,或强迫游戏引擎成为哲学家的错误。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →