在人工智能飞速发展的世界中,研究人员不断尝试衡量这些系统如何随着时间的推移进行学习、记忆和表现。正如教师可能会通过追踪一名学生整个学期的成绩来预测其未来的成功一样,科学家们使用纵向评分(longitudinal scores)来监测人工智能系统在面对新问题、更新和变化环境时的表现。这些评分不仅仅是为了捕捉单一时刻的快照;它们旨在讲述一个关于系统旅程、稳定性以及随着时间流逝能否保持有效运作的故事。然而,这种方法中潜伏着一个根本性的挑战:我们拥有的永远只是关于目前已经发生之事的有限记录。我们拥有过去测试的历史,但我们并不拥有未来。关键问题在于,从有限数量的过去测试中观察到的模式,是否真的能告诉我们关于该系统在无限未来中将如何表现的任何确定性信息,或者我们是否仅仅是在过度解读一个短篇故事。
维多利亚大学的 Seyma Yaman Kayadibi 进行的一项新研究直接针对了这一问题,她以一种名为“人工年龄评分”(Artificial Age Score)的特定测量工具作为案例研究,以揭示我们在解释人工智能性能时存在的隐藏差距。该研究并非认为这些评分是无用的;相反,它证明了仅凭从有限观测历史中计算出的评分,本身并不能证明一个系统将能够持续存在、保持稳定或永远表现良好。研究表明,一个系统可能在连续二十次会话中表现得非常稳定,然后在紧接着的一次之后立即失效;或者它可能一直表现完美,而基于前二十次会话计算出的数学评分在这两种情况下看起来都是完全一样的。论文指出,任何关于人工智能系统无限未来的主张,都不是观测数据本身的推论,而是源于我们对其将如何持续运行所做的额外假设。
为了说明这一点,研究人员检查了一个涉及人工智能系统在七十四个周更版本中接受测试的真实数据集。他们比较了该系统的两个版本:一个在封闭环境中运行,另一个则可以搜索互联网获取答案。数据显示,拥有互联网访问权限的版本表现始终更好,导致较低的“负担”(burden)评分,这意味着更少的错误。研究人员详细分解了这种差异产生的原因,发现这种提升来自于在多项选择题和开放式文本生成方面的更好表现。然而,当他们试图使用简单的规则(例如,假设下一次评分将与上一次相同,或者将是过去四次的平均值)来预测这些系统的未来表现时,他们发现每一个预测规则都犯了错误。适用于其中一个版本的最佳规则并不适用于另一个版本,这证明了评分内部并不存在某种决定未来的单一、普遍的规律。
该研究还探讨了一个更深层的数学现实:对于任何有限的评分序列,都有可能想象出无数种能够完美契合该序列的不同未来。在一种未来中,系统可能永远在进步;在另一种未来中,系统可能立即失效;而在第三种未来中,系统可能在好坏表现之间波动。所有这些不同的未来都会产生与过去二十次会话完全相同的评分。研究人员证明,如果不添加关于系统随时间变化的额外规则,评分本身无法区分这些可能性。他们还研究了真实时间的流逝如何影响这些测量。如果你将每一次测试计为一个时间单位,你得到的关于系统总工作量的图像,可能与你按实际小时和天数进行测量得到的图像不同。论文表明,这些不同的时间测量方式会改变对系统承受了多少“暴露”或压力的解读,但无论哪种方法都无法预测接下来会发生什么。
最终,论文得出结论,我们在谈论人工智能的长期可靠性时必须更加谨慎。今天的稳定评分并不代表明天的稳定性保证。为了做出关于未来的主张,研究人员必须明确说明他们对系统的谱系、环境及其运行规则所做的假设。该研究提出了一种新的结果报告方式,清晰地将“实际观察到的内容”、“做出预测时所做的假设”以及“仍然未知的内容”区分开来。通过将未来视为一种条件性的可能性,而非从过去数据中推导出的数学确定性,这项研究为理解“人工年龄”的局限性提供了一个更诚实且更严谨的框架。其研究结果提醒我们,虽然我们可以精确地测量过去,但未来是一个独立的领域,需要一套属于它自己的规则和假设来进行导航。
技术摘要:有限证据,无限地平线:以人工年龄分(Artificial Age Score)作为纵向 AI 测量的案例研究
1. 问题陈述
本文探讨了人工智能(AI)系统纵向评估中一个根本性的认识论差距:即将有限的观测证据与无限地平线的数学主张混为一谈。
虽然纵向评分(例如,追踪跨会话、更新或部署的性能)在科学上是有用的,但存在一种普遍倾向,即将有限的得分记录视为无限序列的开端。研究人员往往基于有限得分前缀的有界性或趋势,去推断未观测未来的属性——例如系统的持久性、状态收敛性或无限期的运行能力。
文中识别的核心难点在于“地平线差距”(horizon gap),它将三个截然不同的对象分隔开来:
- 证据地平线(The Evidential Horizon): 有限的、已登记的观测记录(EN)。
- 数学地平线(The Mathematical Horizon): 由延续模型定义的无限序列或随机过程。
- 目标地平线(The Target Horizon): 物理或计算系统本身,其谱系,以及其实际的未来可用性。
本文认为,有限的得分前缀并不能演绎地决定系统的收敛性、累积暴露量或持续存在性。如果没有明确的桥接假设,无限地平线的结论仅是基于模型的条件性推断,而非仅凭有限数据本身所能得出的结论。
二. 研究方法
本文采用了一种结合形式化数学证明与使用“人工年龄分”(Artificial Age Score, AAS)作为具体案例研究的经验压力测试的混合方法论。
2.1 形式化框架
作者使用 AAS(一种经过冗余调整的复合得分)建立了一个理论框架。该方法论包括:
- 观测纤维分析(Observation Fibre Analysis): 定义产生特定观测前缀的所有容许系统模型(M)的集合。本文证明,对于任何有限前缀,其“纤维”都包含具有不兼容渐近行为的模型(例如,收敛至零、发散或振荡)。
- 匹配前缀构造(Matched-Prefix Constructions): 构建显式的反例,其中不同的无限尾部(满足不同的极限属性)共享完全相同的有限前缀。这证明了仅凭不受限制的有限前缀计算出的任何统计量,都无法确定未观测尾部的类别。
- 三地平线账本(Three-Horizon Ledger): 开发一种报告结构,明确区分什么是观测到的、什么是假设的(桥接条件)、什么是推导出的,以及什么是不被确立的。
2.2 经验压力测试
为了使理论主张落地,本文对 RealTimeQA 公开存档(从 2022 年 6 月到 2023 年 12 月的 74 个发布批次)进行了二次分析。
- 数据: 两种配置的配对比较:“封闭式 GPT-3”与“带有 Google 自定义搜索(GCS)及检索回退功能的 GPT-3”。
- 指标映射: 将 AAS 应用于批次级的多项选择准确率和生成 F1 分数,权重相等且无估计冗余(R=0)。
- 执行的分析:
- 配对对比: 将两种配置之间 AAS 的平均差值分解为组成部分的惩罚项。
- 探索性冗余敏感性: 应用项目级共缺陷(Odef)的代理值,测试变化的冗余假设(R=λOdef)如何影响得分对比。
- 聚合偏移审计: 量化当不同组件的变化在求和为标量得分时如何相互抵消(使用“发布指数聚合偏移”指标,KN)。
- 滚动起点预测: 比较四种有限延续规则(持久性、移动平均、标量 AR(1) 和组件级 AR(1))的平均绝对误差(MAE),以证明没有单一规则是普遍优越的,且所有规则都保留了非零误差。
- 时长加权暴露: 使用物理时间间隔而非仅仅是循环计数来计算累积暴露量。
3. 核心贡献
3.1 理论贡献
- 地平线差距框架: 建立了对证据、数学和目标地平线的形式化区分,明确了从有限记录转向无限主张需要显式的桥接假设(如谱系规则、延续模型、非 Zeno 时长调度)。
- 匹配前缀欠定定理(Matched-Prefix Underdetermination Theorems): 证明了对于任何有限的 AAS 前缀,都存在代数上容许的无限延续,这些延续可能收敛至零、发散、振荡或终止,从而使得前缀不足以确定系统的渐近命运。
- 标量收敛 vs. 状态识别: 提出了一个命题,证明如果测量映射是非单射的(即不同的系统状态可以产生相同的得分),那么标量得分的收敛并不一定意味着状态的收敛。
3.2 经验贡献
- AAS 分解: 在 RealTimeQA 审计中,GCS 配置显示的平均 AAS 低于封闭配置(表现更好)(平均差值:$-0.738)。该差异被分解为来自多项选择准确率的-0.261贡献和来自生成F1的-0.477$ 贡献。
- 聚合偏移: 研究量化了封闭配置中约 14.5% 的总变动和 GCS 配置中约 11.8% 的总变动被相互抵消的情况。这凸显了标量聚合如何掩盖显著的内部波动。
- 预测局限性: 所有滚动起点预测均保留了非零误差。最好的预测规则取决于配置(对于封闭配置,标量 AR(1) 最好;对于 GCS,Mean-4 最好),这表明有限前缀并不能选择一个通用的延续法则。
- 冗余敏感性: 虽然在五种施加冗余度的水平下(λ∈[0,1]),性能对比的方向保持不变,但差异的幅度显著减弱(从 $-0.738降至-0.259$),这证明了冗余假设是关键的测量参数,而非观测事实。
4. 结果
- 有限前缀是欠定的: 一个包含 20 个零 AAS 得分的有限记录(来自一项已发表的双语研究)在数学上与多种无限未来相容:系统可以完美持续、立即失效、振荡或终止。得分前缀本身无法确立其中任何一种情况。
- 不存在通用预测规则: 在 RealTimeQA 压力测试中,没有单一的预测规则能在所有配置和地平线中最小化误差。这支持了以下观点:有限前缀可以约束但不能唯一选择一个未来模型。
- 测量映射依赖性: 性能差异的大小高度依赖于冗余系数(R)和组件权重的选择。本文展示了将重叠视为冗余是一种假设,而非推导出的事实。
- 物理时间 vs. 循环计数: 本文证明了计数循环(事件)与测量物理时间是不同的。如果没有非 Zeno 时长调度(即总时间 →∞),无限数量的循环并不意味着在无限的物理地平线上运行。
5. 意义与主张
本文谦逊地声称提供的是一个审计框架,而非一种新的预测理论或对 AAS 本身的验证。
- 澄清归纳法: 主要贡献在于使“地平线差距”显性化。文章认为,无限地平线的结论是基于模型的条件性推断,而非仅凭有界得分或有限观测本身。
- 重构纵向主张: 本文提出了一个用于纵向 AI 研究的“主张账本”(表 10)。该账本要求研究人员明确记录:
- 观测到的: 有限记录和终点状态。
- 假设的: 谱系规则、延续模型和物理时间调度。
- 推导出的: 记录加上假设后的数学后果。
- 未被确立的: 需要额外证据才能证明的关于因果机制、无限持久性或系统生存的说法。
- AAS 的角色: AAS 被用作一个“具体的测量映射”,用以说明投影中的普遍问题。本文并不声称推导出了 AAS 的新的单周期属性,也不验证其是否为通用构念。相反,本文利用 AAS 展示了一个静态得分如何被误解为动态生存模型。
- 科学作用: 本文将这些初等不可能结果(匹配前缀构造)定位为定位缺失前提的工具。文章认为,其科学价值不在于证明预测是不可能的,而在于确保任何投影所需的桥接假设是可见且可审计的。
总之,本文断言,纵向 AI 得分对于在声明的协议内进行监测和比较是有用的,但它们本身无法确立一个系统将持续存在、收敛或保持可比性的事实。任何此类主张都需要一个明确声明的延续模型以及关于谱系和物理时间的桥接假设。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。