← 最新论文
🤖 machine learning

Towards Reliable Zero-Shot Crowd Forecasting: Evaluating Time Series Foundation Models for Special Event Pedestrian Forecasting

本文评估了预训练时间序列基础模型在针对不频繁特殊事件进行零样本概率人群预测方面的有效性,证明了它们能够在无需大量局部重训练的情况下,提供可靠的点估计和不确定性量化。

原作者: Ziteng Li, Yanan Xin, Tina Comes, Serge Hoogendoorn

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziteng Li, Yanan Xin, Tina Comes, Serge Hoogendoorn

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图为一个每五年才举办一次的野餐预测天气。你不能只看去年的天气,因为去年并没有举办这个活动。你也无法等到活动当天才开始学习规律。这就是“零样本”(zero-shot)预测的棘手之处:在几乎没有任何历史数据可以研究的情况下,对未来做出聪明的猜测。通常情况下,计算机需要“吞食”海量的历史数据来学习如何预测交通流量或人群密度。但如果你的大脑里已经拥有了一个超级聪明的计算机大脑,它已经阅读了来自其他数百万个地方的时间与模式的“百科全书”,你只需要问它:“嘿,这里将会发生什么?”这就是“基础模型”(foundation models)的承诺。它们就像是已经完成了十亿个不同课题作业的“全能学生”,所以它们可以走进一个新的教室并立即开始教学,而不需要任何教科书。

现在,想象一下阿姆斯特丹一场规模宏大的航海节——SAIL盛会,它吸引了250万人。这座城市需要准确知道未来30分钟内人群会在哪里,以便开启额外的闸门、增派警力或为救护车清理通道。但由于这是一个罕见的活动,该市并没有多年的数据来训练一个定制的机器人。他们需要的是一种不仅仅是一个单一猜测(比如“会有500人”)的预测,而是一个带有安全网的可能范围(比如“人数将在400到600之间,但要小心,可能会激增到800人”)。这篇论文是一个现实世界的测试,旨在观察这些预训练的“全能学生”是否真的能够处理如此大规模、一次性的群体事件,而不会崩溃或给出危险的建议。

研究人员在两个最聪明的“时空旅行者”AI模型之间进行了一场比赛:TimesFMChronos-2。他们并没有用阿姆斯特丹的数据来训练这些模型;相反,他们直接将它们投入到SAIL 2025盛会的现场,以观察它们在“零样本”设置下的表现。这就像是把一份从未在特定厨房里做过的全新菜谱交给一位厨师,看看他在没有尝过食材的情况下能否做出美味的佳肴。

结果出人意料地清晰。Chronos-2 模型成为了全场的明星。它能够实现提前约30到45分钟的可靠“安全窗口”预测。在人群控制领域,拥有30分钟的预警时间就像拥有一种超能力;它给了管理者足够的时间在瓶颈变成灾难之前,实际地疏导人群或开启应急出口。Chronos-2 在“滚动”其预测方面表现得尤为出色,这意味着随着每90秒产生新数据,它能平滑地更新其预测,而不会感到困惑。

然而,论文也发现了一些有趣的特性。虽然 Chronos-2 是整体上的冠军,但 TimesFM 在安静、低人流量的时段(如深夜)以及人群数量非常小且稳定的区域表现得更好。这就像是 TimesFM 是一个冷静、稳重的图书管理员,擅长预测图书馆的安静时段;而 Chronos-2 则是一位充满活力的体育教练,在比赛变得混乱和快节奏时表现卓越。

论文发现的一个最关键的问题是这些模型如何处理“缺失数据”。想象一下,如果一个摄像头停止工作了一个小时,留下了一个人群统计的空白点。研究人员发现,Chronos-2 对这种缺失信息的反应是扩大其“安全网”。它不再自信地猜测一个具体的数字,而是说:“我不确定,所以可能性的范围现在变得非常大。”这是一种功能,而不是漏洞!在安全至上的情况下,模型说“我不确定,请小心”远比自信地给出一个错误答案要好。相比之下,TimesFM 没有像那样扩大其安全网,如果缺失的数据隐藏了突然的人流激增,这可能会带来更高的风险。

这项研究还考察了使用这些模型的“成本”。他们在没有高端显卡的情况下,仅用一台标准笔记本电脑运行了所有程序。好消息是,这两个模型都非常快速,预测一小时后的情况耗时不到半秒。这意味着它们可以轻松运行在普通的城市计算机上,以实时管理人群。它们使用的内存也是可控的,尽管 Chronos-2 在“唤醒”并开始思考时需要更多的动力。

最后,论文表明,对于管理像 SAIL 盛会这样罕见的大规模活动,Chronos-2 是更可靠的选择,尤其是当你需要应对突发变化和缺失数据时。它表明我们并不总是需要为每一个活动构建一个新的定制机器人;有时,我们只需要找到一个合适的、经过预训练的专家,让他们能够随时介入并胜任工作。研究人员还为这些模型引入了一套新的“成绩单”,其关注点不仅在于猜测有多接近,还在于预测随时间变化的稳定性,以及模型对其不确定性的表达是否诚实。这非常重要,因为在人群管理中,知道“何时不知道”与知道答案本身同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →