← 最新论文
🤖 machine learning

Identifiable Token Correspondence for World Models

本文通过引入具有可识别令牌对应关系的结构化概率推理框架,解决了基于 Transformer 的世界模型中的时间不一致性问题,从而在具有挑战性的基准测试中显著提升了长视野视觉强化学习的性能。

原作者: Youngin Kim (Interdisciplinary Program in Artificial Intelligence, Seoul National University), Ray Sun (Department of Computer Science and Engineering, Seoul National University), Inho Kim (Department
发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Youngin Kim (Interdisciplinary Program in Artificial Intelligence, Seoul National University), Ray Sun (Department of Computer Science and Engineering, Seoul National University), Inho Kim (Department of Computer Science and Engineering, Seoul National University), Bumsoo Park (KRAFTON), Hyun Oh Song (Interdisciplinary Program in Artificial Intelligence, Seoul National University, Department of Computer Science and Engineering, Seoul National University)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人玩电子游戏,方法是让它“梦”到游戏,而不是每次都真正去玩。这就是研究人员所称的世界模型。机器人构建了一个游戏世界的心理模拟,这样它就可以在不浪费实际游戏的时间和精力的情况下练习策略。

最近,科学家们利用一种名为Transformer的强大人工智能(许多现代聊天机器人背后的技术就是这种)来构建这些心理模拟。然而,这些 Transformer 有一个有趣的缺陷:当它们“梦”到未来时,会对谁是谁感到困惑。

问题所在:“克隆”与“消失术”

想象一下,你正在观看一段猫穿过房间的视频。

  • 缺陷:标准的 Transformer 可能会看下一帧并想:“哦,这里有一只猫,那里也有一只猫!”它意外地复制了这只猫。或者,它可能会看下一帧并说:“等等,猫不见了”,尽管它只是躲到了椅子后面。它甚至可能把猫变成狗。
  • 原因:Transformer 将视频视为一串字母。它试图猜测下一个“字母”(或像素块),而没有真正理解第 10 帧中的猫与第 9 帧中的是同一只猫,只是位置略有不同。它试图每次都从头开始“发明”这只猫,从而导致错误。

解决方案:“移动拼图”(ITC)

本文的作者 Youngin Kim 及其同事提出了一种名为**可识别令牌对应(Identifiable Token Correspondence, ITC)**的新方法。

将电子游戏世界想象成一个巨大的拼图

  • 旧方法:每次拼图发生微小变化(猫移动)时,旧的人工智能就会扔掉整个拼图,并试图从头开始构建一个全新的拼图。有时它会把错误的拼块拼在一起,创造出重复的猫或丢失的拼块。
  • 新方法(ITC):新的人工智能意识到:“嘿,这个拼图的大部分并没有改变!地板还在,墙壁还在,那只猫还是同一只猫,只是向右移动了一格。”

人工智能不再猜测每一个拼块,而是使用一种称为**最优传输(Optimal Transport)**的数学工具(这就像一位超级聪明的物流规划师)。它针对下一帧的每个部分提出两个问题:

  1. 我可以直接从上一帧复制这个拼块吗?(例如:“这棵树没有移动,所以我直接复制昨天的树。”)
  2. 我需要发明一个新的拼块吗?(例如:“玩家刚刚打开了一扇新门,所以我需要生成一个新的门令牌。”)

工作原理的简单步骤

  1. 设置:人工智能将游戏屏幕分割成小方块(令牌)。
  2. 媒人:在人工智能预测下一帧之前,它会运行一个“媒合”算法。它会查看当前屏幕以及人工智能对下一屏幕的猜测
  3. 决策:算法决定:“下一帧中的这个方块与当前帧中的那个方块匹配。让我们直接复制它。”或者,“这个方块完全是新的;让我们生成它。”
  4. 结果:最终预测的帧是复制的拼块(保持连贯性)和新拼块(处理变化)的混合体。

结果:更出色的“梦想家”

研究人员在几个视频游戏基准测试中测试了这种方法,包括一款名为Craftax的复杂游戏(这是一款拥有许多移动部件的 2D 开放世界冒险游戏)。

  • 得分:旧的最佳方法得分约为67.4%。新的 ITC 方法得分为72.5%
  • 视觉效果:当他们查看人工智能创建的“梦境”(模拟)时,旧方法会出现猫凭空出现或消失的情况。而新方法则保持了猫的一致性。猫从一个位置平滑地移动到另一个位置,没有变成重复体,也没有消失。

为什么这很重要(根据论文所述)

论文声称,通过明确指示人工智能跟踪哪些“令牌”(图像片段)在时间上对应于同一个物体,人工智能就不再会制造“幻觉”(如克隆物体)。这使得人工智能的“想象力”更加可靠,从而能够在学习真实游戏中的策略时表现得更好。

简而言之:这篇论文教会人工智能停止尝试每秒重绘整个世界,而是开始学习移动那些已经存在的拼块。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →