← 最新论文
🤖 machine learning

Heteroscedastic Diffusion for Multi-Agent Trajectory Modeling

本文介绍了 U2Diffine,这是一种统一的扩散模型,能够同时执行多智能体轨迹补全与预测,并为生成的模式提供状态层面的异方差不确定性估计和误差概率排序,在四个体育数据集上均优于最先进的方法。

原作者: Guillem Capellera, Antonio Rubio, Luis Ferraz, Antonio Agudo

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Guillem Capellera, Antonio Rubio, Luis Ferraz, Antonio Agudo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在观看一场混乱的篮球比赛。球员们正在奔跑、传球并相互躲避。现在,想象你是一名教练,试图预测每个人在接下来几秒内的位置。或者,想象你是一名视频编辑,正在修复一段有故障的录像,其中摄像头短暂丢失了对某名球员的追踪,你需要“填补缺失的帧”,使视频重新变得流畅。

本文介绍了一种新的计算机大脑(一种人工智能模型),名为U2Diffine(及其更快的“表亲”U2Diff),旨在专门完成这一任务:同时预测和修复多个人(或物体)的运动轨迹。

以下是他们所做工作的分解,使用了简单的类比:

1. 问题:预测未来(以及过去)

大多数预测运动的人工智能模型就像算命先生,只根据过去来猜测未来。他们会说:“根据你之前的位置,你很可能会去这里。”

  • 缺陷:它们通常忽略“如果……会怎样”的情况。在真实的比赛中,球员可能会停下、转身或被阻挡。人工智能通常只给出一个“最佳猜测”路径,或者几个随机猜测,而不会告诉你它对那些猜测有多大的把握
  • 缺失的一环:如果人工智能不确定,它应该说:“我不确定,路径可能在这个大圆圈内的任何地方。”如果它很确定,它应该说:“我非常确定,路径就是这条细线。”本文将这种特性称为“不确定性”。

2. 解决方案:“感知不确定性”的扩散模型

作者构建了一个基于扩散模型的系统。将扩散想象成一位用粘土工作的雕塑家

  • 过程:想象你有一座完美的雕像(真实的运动路径)。人工智能首先将其变成一团噪音(随机静电)。然后,它学习如何一步步将这团噪音慢慢变回雕像。
  • 转折:通常,雕塑家只是试图让雕像看起来正确。作者教导他们的雕塑家在每一步都要在心里记下自己的手有多抖
    • 如果手在抖,人工智能会在路径周围画出一团巨大、模糊的云。
    • 如果手很稳,它就画出一条紧密、精确的线。
  • 结果:人工智能不仅给你一条路径,还给你一条路径加上一张“置信度图”,精确显示预测在哪里有风险,在哪里是安全的。

3. 两个版本:“精度型”与“速度型”

作者创建了该人工智能的两个版本,以适应不同的需求:

  • U2Diffine(精度型雕塑家):这个版本非常谨慎。它使用复杂的数学(称为“一阶泰勒近似”)来精确计算不确定性如何从噪音传播回现实世界。这就像一位测量每一毫米的大师级雕塑家。它是最准确的,但运行时间较长。
  • U2Diff(速度型):这个版本为了节省时间跳过了复杂的数学运算。它在不进行所有繁重计算的情况下,对不确定性做出聪明的猜测。它的速度比精度版本快约 4 倍,在预测路径方面几乎同样出色,尽管在“置信度图”的精确度上稍逊一筹。

4. “排名”助手(RankNN)

有时,人工智能会生成 20 种不同的可能未来(20 种不同的“如果……会怎样”场景)。你怎么知道哪一个最有可能发生?

  • 旧方法:你可能会直接挑选那个看起来最“平滑”的。
  • 新方法(RankNN):作者添加了一位特殊的“裁判”(一个神经网络),它查看所有 20 种场景,并为每一种分配一个**“出错可能性”的分数**。
  • 类比:想象一位体育分析师正在观看 20 个不同的比赛回放。这位分析师不是凭空猜测,而是观察球员的动作和预测的“抖动程度”,然后说:“场景 #3 有 90% 的几率是正确的,而场景 #15 可能是错的。”这有助于自动挑选出最佳预测。

5. 他们在哪里进行了测试?

他们并没有在医疗数据或自动驾驶汽车上测试这项技术(除非论文这么说,但并没有)。他们严格地在体育数据上进行了测试:

  • 篮球:追踪 10 名球员和一个球。
  • 美式橄榄球:追踪 22 名球员和一个球。
  • 足球(英式):追踪 22 名球员和一个球。

6. 重大胜利

论文声称,他们的方法在以下两个方面优于当前的最佳方法(State-of-the-Art):

  1. 准确性:它更准确地预测球员将要去的位置,特别是在尝试“修复”视频缺失部分(轨迹补全)时。
  2. 可靠性:它在知道自己不确定方面要出色得多。如果人工智能说“我不确定”,通常意味着情况实际上很混乱或难以预测。这使得该系统对于修复体育视频素材等现实世界应用更加值得信赖。

简而言之:他们为计算机构建了一种更聪明的方法,用于观看体育比赛、预测球员动作并修复损坏的视频录像,同时诚实地承认何时是在猜测,何时是确定的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →