← 最新论文
🤖 AI

RetroMotion: Retrocausal Motion Forecasting Models are Instructable

RetroMotion 是一种基于 Transformer 的运动预测模型,它利用逆因果信息流将复杂的多智能体预测分解为边缘分布和联合分布,在主要数据集上实现了最先进的性能,同时独特地支持场景自适应的指令遵循。

原作者: Royden Wagner, Omer Sahin Tas, Felix Hauser, Marlon Steiner, Dominik Strutz, Abhishek Vivekanandan, Jaime Villa, Yinzhe Shen, Carlos Fernandez, Christoph Stiller

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Royden Wagner, Omer Sahin Tas, Felix Hauser, Marlon Steiner, Dominik Strutz, Abhishek Vivekanandan, Jaime Villa, Yinzhe Shen, Carlos Fernandez, Christoph Stiller

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正站在一个繁忙的十字路口,观察着汽车、行人和骑行者穿梭往来。预测接下来几秒钟内每个人会去向何方,难度极大。如果你试图同时猜测每个人的确切路径,可能性的数量会呈爆炸式增长,就像试图拼凑一个拼图,而每一块拼图都可能有一百万种不同的形状。

论文《RetroMotion》提出了一种让计算机解决这一难题的新方法。以下是他们方法的拆解,辅以简单的类比:

1. 两步舞:独奏与合奏

作者没有试图一次性预测整个混乱的人群,而是将问题拆分为两部分:

  • 独奏(边缘预测): 首先,计算机观察每个人 individually。它会问:“如果这辆车独自行驶在路上,它会去哪里?”它为每个人制定一个“独奏计划”。
  • 合奏(联合预测): 接下来,计算机观察那些正在互动的人(例如一辆车在等待行人过马路)。它将这些“独奏计划”进行重新组合,看看它们如何相互契合。

魔术技巧(逆因果性):
通常,你是根据过去来预测未来。但这个模型使用了一个巧妙的技巧,称为“逆因果性”。这就像写故事。通常,你先写开头,再写中间,最后写结尾。但这个模型先写结尾(基于独奏计划),然后利用这个结尾来重写群体故事的开头。

  • 为什么要这样做? 这就像意识到:“哦,如果那辆车最终左转了,它一定在更早的时候就开始减速了。”通过知晓目的地,模型能更好地理解互动的起点。这使得最初的独奏猜测不必完美无缺,因为“合奏”步骤可以修正任何微小的错误。

2. “模糊”地图(不确定性)

在预测汽车将位于何处时,你不能只画一条细线。你需要展示一个可能性的“云团”,因为司机可能会突然转向或刹车。

  • 旧方法: 大多数模型假设这个云团是一个完美的圆形(正态分布)或特定的菱形(拉普拉斯分布)。
  • RetroMotion 方法: 作者说:“让我们不要强迫云团适应特定的形状。”相反,他们使用了一种灵活的形状,称为指数幂分布
  • 类比: 想象试图将一团烟雾塞进一个玻璃罐里。有些烟雾是圆的,有些是扁平的,有些是尖刺状的。这个模型不是强行将烟雾塞进圆罐,而是将罐子塑造成完美贴合烟雾的形状。他们发现,这些“烟雾云团”通常看起来有点像菱形(拉普拉斯分布),但混合了一点点圆润度,这使得它们更加准确。

3. 压缩技巧(DCT)

预测 8 秒的路径涉及数百个数据点。存储所有这些点既沉重又缓慢。

  • 类比: 想象你有一根长长的、蜿蜒的绳子。与其存储绳子每一英寸的确切位置,不如用几个简单的波(就像和弦)来描述它。
  • 该模型使用一种名为**离散余弦变换(DCT)**的数学工具,将路径压缩为几个“波”。这使得计算机运行更快,并忽略了那些无关紧要的微小噪声抖动,只关注平滑、真实的运动。

4. “可指令”特性(惊喜)

这篇论文最令人惊讶的部分是,该模型能够接受指令,尽管研究人员并没有明确地教它这样做。

  • 实验: 研究人员取模型对一辆车的预测,并手动修改路径的终点,使其表示“前往这个特定地点”(基于目标的指令)。
  • 结果: 模型并没有盲目地跟随新路径。它审视了新指令并说:“好的,如果这辆车需要去那里,它一定更早开始转向了”,然后调整了整个路径,使其符合交通规则和其他车辆的情况。
  • “左转”测试: 他们甚至试图强迫一辆车“左转”进入对向车道(这是违法的)。模型审视了指令,意识到这很危险,并说:“不,我不能那样做”,随后调整了车辆的路径,使其保持在自己的车道内。
  • 启示: 仅仅通过训练模型使其擅长预测交通,它意外地学会了如何听取指令并将其适应现实世界,而无需被明确教导如何服从命令。

总结

RetroMotion 是一个交通预测系统,它:

  1. 将大问题分解为小的独奏计划,然后将它们混合成群体计划。
  2. 使用“向后看”的技巧(利用终点来修正起点)使群体计划更智能。
  3. 使用灵活的“云团”来预测不确定性,而不是僵硬的形状。
  4. 压缩数据以快速运行。
  5. 令人惊讶的是,学会了听取人类指令并将其适应场景,而无需被明确教导如何服从命令。

作者在真实世界的驾驶数据(Waymo、Argoverse、V2X)上测试了该系统,发现其预测交通的能力优于以往的方法,并且能很好地处理复杂的交互。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →