想象你正在观看一场混乱的篮球比赛。球员们正在奔跑、传球并相互躲避。现在,想象你是一名教练,试图预测每个人在接下来几秒内的位置。或者,想象你是一名视频编辑,正在修复一段有故障的录像,其中摄像头短暂丢失了对某名球员的追踪,你需要“填补缺失的帧”,使视频重新变得流畅。
本文介绍了一种新的计算机大脑(一种人工智能模型),名为U2Diffine(及其更快的“表亲”U2Diff),旨在专门完成这一任务:同时预测和修复多个人(或物体)的运动轨迹。
以下是他们所做工作的分解,使用了简单的类比:
1. 问题:预测未来(以及过去)
大多数预测运动的人工智能模型就像算命先生,只根据过去来猜测未来。他们会说:“根据你之前的位置,你很可能会去这里。”
- 缺陷:它们通常忽略“如果……会怎样”的情况。在真实的比赛中,球员可能会停下、转身或被阻挡。人工智能通常只给出一个“最佳猜测”路径,或者几个随机猜测,而不会告诉你它对那些猜测有多大的把握。
- 缺失的一环:如果人工智能不确定,它应该说:“我不确定,路径可能在这个大圆圈内的任何地方。”如果它很确定,它应该说:“我非常确定,路径就是这条细线。”本文将这种特性称为“不确定性”。
2. 解决方案:“感知不确定性”的扩散模型
作者构建了一个基于扩散模型的系统。将扩散想象成一位用粘土工作的雕塑家。
- 过程:想象你有一座完美的雕像(真实的运动路径)。人工智能首先将其变成一团噪音(随机静电)。然后,它学习如何一步步将这团噪音慢慢变回雕像。
- 转折:通常,雕塑家只是试图让雕像看起来正确。作者教导他们的雕塑家在每一步都要在心里记下自己的手有多抖。
- 如果手在抖,人工智能会在路径周围画出一团巨大、模糊的云。
- 如果手很稳,它就画出一条紧密、精确的线。
- 结果:人工智能不仅给你一条路径,还给你一条路径加上一张“置信度图”,精确显示预测在哪里有风险,在哪里是安全的。
3. 两个版本:“精度型”与“速度型”
作者创建了该人工智能的两个版本,以适应不同的需求:
- U2Diffine(精度型雕塑家):这个版本非常谨慎。它使用复杂的数学(称为“一阶泰勒近似”)来精确计算不确定性如何从噪音传播回现实世界。这就像一位测量每一毫米的大师级雕塑家。它是最准确的,但运行时间较长。
- U2Diff(速度型):这个版本为了节省时间跳过了复杂的数学运算。它在不进行所有繁重计算的情况下,对不确定性做出聪明的猜测。它的速度比精度版本快约 4 倍,在预测路径方面几乎同样出色,尽管在“置信度图”的精确度上稍逊一筹。
4. “排名”助手(RankNN)
有时,人工智能会生成 20 种不同的可能未来(20 种不同的“如果……会怎样”场景)。你怎么知道哪一个最有可能发生?
- 旧方法:你可能会直接挑选那个看起来最“平滑”的。
- 新方法(RankNN):作者添加了一位特殊的“裁判”(一个神经网络),它查看所有 20 种场景,并为每一种分配一个**“出错可能性”的分数**。
- 类比:想象一位体育分析师正在观看 20 个不同的比赛回放。这位分析师不是凭空猜测,而是观察球员的动作和预测的“抖动程度”,然后说:“场景 #3 有 90% 的几率是正确的,而场景 #15 可能是错的。”这有助于自动挑选出最佳预测。
5. 他们在哪里进行了测试?
他们并没有在医疗数据或自动驾驶汽车上测试这项技术(除非论文这么说,但并没有)。他们严格地在体育数据上进行了测试:
- 篮球:追踪 10 名球员和一个球。
- 美式橄榄球:追踪 22 名球员和一个球。
- 足球(英式):追踪 22 名球员和一个球。
6. 重大胜利
论文声称,他们的方法在以下两个方面优于当前的最佳方法(State-of-the-Art):
- 准确性:它更准确地预测球员将要去的位置,特别是在尝试“修复”视频缺失部分(轨迹补全)时。
- 可靠性:它在知道自己不确定方面要出色得多。如果人工智能说“我不确定”,通常意味着情况实际上很混乱或难以预测。这使得该系统对于修复体育视频素材等现实世界应用更加值得信赖。
简而言之:他们为计算机构建了一种更聪明的方法,用于观看体育比赛、预测球员动作并修复损坏的视频录像,同时诚实地承认何时是在猜测,何时是确定的。
技术摘要:用于多智能体轨迹建模的异方差扩散模型
问题陈述
多智能体轨迹建模传统上侧重于预测未来状态,往往忽视了更广泛的任务,如轨迹补全(推断轨迹中缺失或未观测到的部分)。现有方法,包括基于 GAN、CVAE 和标准扩散概率模型(DDPM)的方法,通常仅预测智能体状态,而未提供逐状态(state-wise)的异方差不确定性度量。此外,流行的多模态采样方法缺乏对同一先验观测下每个生成场景的误差概率估计,使得在推理时难以对预测可靠性进行排序。目前仍存在一个关键缺口,即量化每个预测状态的可能性,并根据其与真实值的接近程度对多个生成模式进行排序的能力。
方法论
作者提出了U2Diffine,这是一种统一的扩散模型,旨在执行轨迹补全的同时,提供逐状态的异方差不确定性估计。该框架基于以下核心组件构建:
- 统一扩散框架:受 CSDI(基于条件的分数扩散插补)启发,该模型使用双向 MambaSSM 进行时间处理,并使用 Social Transformer 处理智能体交互,取代了传统的 Transformer 编码器,以便在不依赖固定位置编码的情况下更好地处理时间动态。
- 异方差不确定性估计:与预测单个噪声向量的标准去噪损失不同,U2Diffine 将反向噪声建模为双变量高斯分布。它在每个时间步为每个智能体学习平均噪声状态(ϵθμ)和一个 2×2 协方差矩阵(ϵθΣ)。这是通过在标准去噪损失中增加负对数似然(NLL)项来实现的,从而使模型能够捕捉数据依赖的(偶然性)不确定性,包括方向依赖性和旋转的不确定性椭圆。
- 反向高斯采样(U2Diffine):为了将潜在空间的不确定性传播到真实状态空间,作者推导了一种一阶泰勒近似方法。该方法在当前的均值周围线性化分数网络以计算雅可比矩阵(Js),这些矩阵用于在反向采样过程中更新协方差矩阵。这种方法提供了精确、稳健且一致的逐状态不确定性估计,而无需诉诸昂贵的蒙特卡洛采样。
- 加速基线(U2Diff):为了应对计算雅可比矩阵所需的梯度计算成本,作者提出了U2Diff。该变体假设梯度为零(Js=0),并使用更简单的单变量不确定性模型。为了缓解潜在的方差膨胀,它采用“方差延迟”策略,仅在中间去噪步骤后启动不确定性传播。这种方法将推理时间减少了约 4 倍,同时保持了具有竞争力的位移误差。
- 排序神经网络(RankNN):为了解决对多个生成模式进行排序的挑战,作者引入了一种后处理监督架构。RankNN 以生成的模式、其预测的均值和方差作为输入。它通过一个社会 - 时间块(Social-temporal Block)和一个多场景 Transformer 处理这些数据,输出每个模式的误差概率分数。该模型被训练以最大化这些预测分数与实际场景平均位移误差(SADE)之间的斯皮尔曼相关性。
主要贡献
- 统一框架:一种基于扩散的多智能体轨迹补全方法,在一个可适应可变智能体数量和时间步长的单一框架中集成了预测、插补和推断未观测智能体的功能。
- 逐状态不确定性:通过增加双变量负对数似然损失来增强扩散框架,从而实现对每个预测潜在状态的异方差不确定性估计。
- 解析不确定性传播:开发了用于反向高斯采样的一阶泰勒近似,将潜在不确定性传播到输出空间,以产生精确的逐状态估计。
- 误差概率估计:一种新颖的后处理监督架构(RankNN),为每个生成模式提供误差概率估计,显示出与真实误差的高度相关性。
- 效率:提出了 U2Diff,这是一种更快的变体,在采样过程中避免了梯度计算,提供了约 4 倍更快的推理速度,同时位移误差相当。
实验结果
该方法在四个具有挑战性的体育数据集上进行了评估:NBA、Basketball-U、Football-U和Soccer-U。
- 轨迹补全:U2Diffine 和 U2Diff 在所有三个补全数据集上均优于最先进的方法(包括 UniTraj)。值得注意的是,U2Diffine 在 Football-U 和 Soccer-U 数据集上的 minSADE20 分别实现了约 33% 和 44% 的提升。
- 轨迹预测:在 NBA 数据集上,该统一方法在场景级指标(minSADE20/minSFDE20)上实现了最先进的性能,尽管使用了简单的独立同分布(i.i.d.)采样策略,其表现仍优于 LED、MART 和 MoFlow 等领先方法,提升幅度超过 3%。
- 不确定性质量:模型实现了高准确率(AccRate),其中 U2Diffine 在 Football-U 和 Soccer-U 数据集上超过了 95%。双变量建模使得能够预测与空间数据分布良好对齐的旋转不确定性椭圆。
- 排序性能:RankNN 框架显著提高了预测不确定性与实际误差之间的相关性。虽然简单的不确定性指标(AvgUcty)显示出中等的相关性(斯皮尔曼 ρ≈0.3),但 RankNN 预测的误差概率实现了高相关性(ρ 范围从 0.58 到 0.79)。这使得能够有效对生成模式进行排序,与随机选择或基于方差的选择相比,显著降低了 Top-1 场景误差。
意义
该论文声称,这项工作通过解决多智能体设置中缺乏不确定性量化的关键问题,为轨迹补全和预测建立了新的基准。通过提供逐状态的异方差不确定性以及一种根据误差概率对生成模式进行排序的机制,该方法增强了在体育等复杂交互环境中生成轨迹的可靠性。作者强调,虽然 U2Diffine 通过严格的解析传播提供了更优越的似然估计,但 U2Diff 为推理延迟至关重要的应用提供了一种实用的高速替代方案。RankNN 的集成进一步弥合了生成多样性与实际效用之间的差距,允许用户从一组生成的模式中选择最可靠的预测。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。