← 最新论文
💻 computer science

Finite Evidence, Infinite Horizons: The Artificial Age Score as a Case Study in Longitudinal AI Measurement

本文认为,有限的纵向人工智能评估记录(以人工时代评分 [AAS] 为例)在缺乏明确规定的延续模型的情况下,无法确定无限时界的系统属性或收敛性,这一点已通过反例和压力测试得到了证实,这些测试表明,仅凭有限的观测只能得出基于模型的条件性推论,而非确定性结论。

原作者: Seyma Yaman Kayadibi

发布于 2026-09-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Seyma Yaman Kayadibi

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界中,研究人员不断尝试衡量这些系统如何随着时间的推移进行学习、记忆和表现。正如教师可能会通过追踪一名学生整个学期的成绩来预测其未来的成功一样,科学家们使用纵向评分(longitudinal scores)来监测人工智能系统在面对新问题、更新和变化环境时的表现。这些评分不仅仅是为了捕捉单一时刻的快照;它们旨在讲述一个关于系统旅程、稳定性以及随着时间流逝能否保持有效运作的故事。然而,这种方法中潜伏着一个根本性的挑战:我们拥有的永远只是关于目前已经发生之事的有限记录。我们拥有过去测试的历史,但我们并不拥有未来。关键问题在于,从有限数量的过去测试中观察到的模式,是否真的能告诉我们关于该系统在无限未来中将如何表现的任何确定性信息,或者我们是否仅仅是在过度解读一个短篇故事。

维多利亚大学的 Seyma Yaman Kayadibi 进行的一项新研究直接针对了这一问题,她以一种名为“人工年龄评分”(Artificial Age Score)的特定测量工具作为案例研究,以揭示我们在解释人工智能性能时存在的隐藏差距。该研究并非认为这些评分是无用的;相反,它证明了仅凭从有限观测历史中计算出的评分,本身并不能证明一个系统将能够持续存在、保持稳定或永远表现良好。研究表明,一个系统可能在连续二十次会话中表现得非常稳定,然后在紧接着的一次之后立即失效;或者它可能一直表现完美,而基于前二十次会话计算出的数学评分在这两种情况下看起来都是完全一样的。论文指出,任何关于人工智能系统无限未来的主张,都不是观测数据本身的推论,而是源于我们对其将如何持续运行所做的额外假设。

为了说明这一点,研究人员检查了一个涉及人工智能系统在七十四个周更版本中接受测试的真实数据集。他们比较了该系统的两个版本:一个在封闭环境中运行,另一个则可以搜索互联网获取答案。数据显示,拥有互联网访问权限的版本表现始终更好,导致较低的“负担”(burden)评分,这意味着更少的错误。研究人员详细分解了这种差异产生的原因,发现这种提升来自于在多项选择题和开放式文本生成方面的更好表现。然而,当他们试图使用简单的规则(例如,假设下一次评分将与上一次相同,或者将是过去四次的平均值)来预测这些系统的未来表现时,他们发现每一个预测规则都犯了错误。适用于其中一个版本的最佳规则并不适用于另一个版本,这证明了评分内部并不存在某种决定未来的单一、普遍的规律。

该研究还探讨了一个更深层的数学现实:对于任何有限的评分序列,都有可能想象出无数种能够完美契合该序列的不同未来。在一种未来中,系统可能永远在进步;在另一种未来中,系统可能立即失效;而在第三种未来中,系统可能在好坏表现之间波动。所有这些不同的未来都会产生与过去二十次会话完全相同的评分。研究人员证明,如果不添加关于系统随时间变化的额外规则,评分本身无法区分这些可能性。他们还研究了真实时间的流逝如何影响这些测量。如果你将每一次测试计为一个时间单位,你得到的关于系统总工作量的图像,可能与你按实际小时和天数进行测量得到的图像不同。论文表明,这些不同的时间测量方式会改变对系统承受了多少“暴露”或压力的解读,但无论哪种方法都无法预测接下来会发生什么。

最终,论文得出结论,我们在谈论人工智能的长期可靠性时必须更加谨慎。今天的稳定评分并不代表明天的稳定性保证。为了做出关于未来的主张,研究人员必须明确说明他们对系统的谱系、环境及其运行规则所做的假设。该研究提出了一种新的结果报告方式,清晰地将“实际观察到的内容”、“做出预测时所做的假设”以及“仍然未知的内容”区分开来。通过将未来视为一种条件性的可能性,而非从过去数据中推导出的数学确定性,这项研究为理解“人工年龄”的局限性提供了一个更诚实且更严谨的框架。其研究结果提醒我们,虽然我们可以精确地测量过去,但未来是一个独立的领域,需要一套属于它自己的规则和假设来进行导航。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →