← 最新论文
🤖 machine learning

A Later Test Set Is Not a New Domain: Pretraining Familiarity Survives a Contamination-Free Hold-Out

本文表明,时间序列留出测试无法完全消除时间序列基础模型的性能优势,因为其成功主要源于预训练阶段对特定数据领域的熟悉程度而非通用的预测能力,因此必须进行领域级留出测试以进行公平评估。

原作者: Mahdi Naser Moghadasi (BrightMind AI), Faezeh Ghaderi (University of Texas at Arlington)

发布于 2026-09-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Mahdi Naser Moghadasi (BrightMind AI), Faezeh Ghaderi (University of Texas at Arlington)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数据科学领域,人们日益相信,一个单一的、庞大的计算机程序可以学会预测几乎任何重复模式的未来,从用电量到股票价格,而无需针对该特定模式进行专门教学。这些被称为“基础模型”的程序,是在海量的历史数据库上进行训练的,它们学习了时间移动的通用“形状”。其承诺在于,一旦训练完成,它们在观察一组新的数字并预测其后续走向时,将比通常需要为每个特定任务从头构建的传统方法表现得更好。然而,一个阴影一直笼罩着这些说法。由于衡量这些模型的测试依赖于旧的公开记录,人们无法判断一个模型是真的擅长预测未来,还是仅仅记住了过去。如果一个模型是在其构建之前就已经存在的数据上进行测试,它可能是在回忆训练期间见过的实事,而非展示出真正的预测能力。

为了解决这个谜题,研究人员构建了一种全新的测试方法,任何模型都不可能预先见过。他们收集了十三种不同的预测工具——既有古老简单的,也有新颖复杂的——并要求它们预测在最新模型发布之后才公布的数据。这些数据来自人类活动的五个不同领域:维基百科页面浏览量、每小时天气模式、每小时空气质量读数、丹麦电网的用电量以及货币之间的每日汇率。用于测试的每一次观测值都记录在2026年,而这个时间在模型训练完成时尚未到来。这确保了没有任何模型能够记住被要求预测的特定数值。其目标是观察这些强大的、预训练的巨头在面对真正新鲜的挑战时,是否仍能超越那些谦逊的、老式的工具。

结果揭示了一个比新闻标题所暗示的更为微妙的故事。预训练模型并非在所有领域都获胜。在每日汇率方面,从最先进的人工智能到最简单的猜测,所有测试的方法表现完全一致,且没有任何一种方法能击败一个假设“明天与今天相同”的基础预测。在每小时电力网数据方面,一种名为Theta的经典非机器学习方法占据了榜首,而那些华丽的预训练模型无法与它拉开差距。在这些案例中,新技术并未提供优势。然而,模型在其他领域表现出色。它们在维基百科页面浏览量数据上的表现显著更好,对流量激增的预测远比经典方法准确。这种差异是巨大的:在每周维基百科浏览量方面,表现最好的预训练模型所产生的误差比表现最好的经典方法小了28%。

研究人员随后询问,为什么模型在某些地方成功而在另一些地方失败。他们最初怀疑数据本身的性质是关键。他们想知道模型是否在处理极具噪声或具有难以察觉的复杂重复周期的数据时表现更好。他们测量了这些周期的强度和数据的随机程度,但这些因素并未解释这一模式。模型表现得更好并非仅仅因为数据杂乱或具有高度季节性。相反,答案在于模型自身的训练历史。模型表现最好的领域是维基百科页面浏览量。这正是其中一个领先模型(TimesFM)的创造者所描述的,构成其训练库主体的数据类型。该模型已经阅读了数百万计的维基百科流量模式,并在此过程中度过了数年时光。尽管它从未见过具体的2026年数值,但它已经如此深刻地理解了维基百科流量的通用行为,以至于它可以轻松预测该特定领域的未来。

这一发现表明,这些模型的优势与其说来自于预测任何事物的通用能力,不如说来自于对它们所受教导的特定数据类型的深度熟悉。当研究人员在相同的维基百科数据上将不同的预训练模型进行对比时,那些曾在维基百科数据上接受过训练的模型家族始终优于其他模型。在其他数据类型(如天气或空气质量)上,同样的优势便消失了。这些模型并非魔法;它们是专家,读过特定的书库,并能回忆起其中的故事,即便章节内容是全新的。

研究还揭示了这些模型在表达信心方面的一个隐藏缺陷。虽然预训练模型在点预测(point predictions)方面通常很准确,但它们系统性地过于自信。当它们提供一个可能的结果范围时,它们声称有80%的把握,但其实际预测仅在约70%的时间内涵盖了真实结果。相比之下,较旧的经典方法则更为谨慎,它们提供的范围通常更宽,从而能更频繁地捕捉到真实结果。对于使用这些预测来管理电网或供应链的人来说,这种过度自信可能是危险的,会导致储备量过小。研究人员指出,虽然预训练模型速度更快且通常更准确,但由于缺乏校准,它们并不总是进行关键决策时的安全工具。

最终,论文得出结论:仅仅将测试日期向前推进,并不足以证明一个模型真正具备泛化能力。如果一个模型在训练期间已经学习了特定领域的“风味”,那么它即使在未来日期的测试中通过,也可能只是在进行记忆。要真正衡量一个模型的泛化能力,未来的基准测试必须剔除整个领域(即那些不在训练数据中的领域),而不仅仅是未来的日期。对于从业者而言,教训是明确的:在选择模型之前,不仅要问哪个工具最强大,还要问你试图预测的数据是否看起来像该工具所受教导的数据。如果数据不同,模型的表象辉煌可能会消失,留下那些更简单、更谨慎的工具作为更可靠的选择。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →