← 最新论文
🤖 machine learning

The Moving Target: A Longitudinal Audit of Trustworthiness Drift Across Twelve Checkpoints of Open-Source Chat LLMs

本文通过对四条开源大语言模型发布线的纵向审计表明,可信度评分在连续的检查点之间存在显著漂移,从而论证了此类指标必须被视为过时的、特定于检查点的产物,而非无需重新测量即可沿用至今的静态属性。

原作者: Zhichao Fan, Yanhang Li, Zexin Zhuang, Xian Sun, Yingshuo Wang

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhichao Fan, Yanhang Li, Zexin Zhuang, Xian Sun, Yingshuo Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你购买了一辆来自信赖品牌(如“Mistral”或“Qwen”)的汽车。销售人员递给你一份手册(即“模型卡/Model Card”),上面写着:“这款车有 90% 的安全性且 95% 的诚实度”,这是基于他们去年进行的测试。

现在,想象六个月后,同一个品牌发布了该汽车的一个微调版本。虽然名字没变,但他们可能调整了引擎、更新了软件,甚至更换了轮胎。

这个研究提出的核心问题是: 你还能信任那份旧的手册吗?旧版本的“90% 安全性”评分是否会自动适用于新版本?

作者们说:不,绝对不行。

以下是他们利用简单类比得出的研究结果:

1. “移动目标”问题

研究人员观察了四个主要的开源 AI 系列(Yi、Qwen、Mistral 和 Gemma)。对于每个系列,他们检查了三个连续的版本(第一代、第二代和第三代)。

你可以把这些 AI 模型想象成厨房里的厨师

  • 第一代是厨师的第一份食谱。
  • 第二代是同一个厨师,但也许他们改变了香料配比、烹饪时间或使用的锅具类型。
  • 第三代又是那位厨师,但可能配备了新的助手或不同的烤箱。

尽管菜单上的厨师名字没变,但他们提供的食物确实发生了变化。研究发现,AI 的“可靠性”在这些版本之间会发生显著偏移。这就像如果一位厨师上个月的“95% 美味度”评分,仅仅因为稍微改动了食谱,就掉到了 85% 或跳到了 98% 一样。

2. “漂移”是真实且巨大的

团队测量了 AI 性能在不同版本之间“漂移”(移动)的程度。

  • 他们发现平均偏移量为 8.00 个百分点
  • 为了让你更有概念,他们将这种偏移量与 AI 仅仅是随机抛硬币的结果进行了对比。实际的偏移量比随机噪声大 3.6 倍

类比: 想象你正试图射中靶心。如果你每次投掷时,靶盘本身都在剧烈晃动(即使你站在同一个位置投掷),那么昨天的得分对今天的得分将毫无参考价值。这篇论文证明了“靶盘”(AI 的行为)的移动程度远超我们的想象。

3. “证书”已经过期

目前,公司通常会在模型卡上标注一个信任分数,并假设该分数在整个“发布系列”中都有效。

  • 论文结论: 信任分数不是像驾照那样永久有效的证书。它更像是一个天气预报
  • 如果你读到的是上周二的天气预报说“晴天”,那么这份报告对于决定今天穿什么衣服是毫无用处的。你需要一份针对“今天”情况的新报告

作者认为,每当发布一个新的 AI 版本时,旧的信任分数都应该被视为已过期。你不能在没有重新测试的情况下,将其直接沿用到新版本。

4. “纵向模型卡”解决方案

由于分数变化如此之大,作者提出了一种新的报告方式,称之为纵向模型卡(Longitudinal Model Card)

这就像是健身追踪器的日志,而不是一张单张的照片。

  • 旧方式: 一张你今天的照片,上面写着“我体重 150 磅”。(这无法告诉你自上周以来你是胖了还是瘦了)。
  • 新方式(纵向卡): 一份日志,上面写着:“1 月 1 日,我体重 150 磅;2 月 1 日,我体重 152 磅;变化为 +2 磅。”

这种新卡片将包含:

  • 特定的“快照”(检查点): 究竟测试的是哪个版本的 AI。
  • 日期: 测试发生的时间。
  • 漂移量: 与前一个版本相比,分数变化了多少。

5. 这并不意味着什么

论文非常谨慎地说明了它并未声称的内容:

  • 不是关于“更好”或“更坏”: AI 并不一定变得“更笨”或“更安全”。它只是发生了变化。有时分数上升,有时分数下降。重点在于它是不可预测的
  • 不是关于“闭源 AI”: 本研究仅针对任何人都可以下载的开源模型。它没有讨论那些来自大公司的秘密、闭源模型(比如你在网站上聊天的那些),因为那些模型更难进行测试。
  • 不是关于“神奇”的修复方法: 论文并没有提供一种阻止 AI 发生变化的方法。它只是在说:“别再假装它不会发生变化了。”

总结

如果你正在购买、监管或使用开源 AI,不要假设手册上的信任分数适用于新版本。 AI 是一个“移动的目标”。你必须对每一个新版本进行重新测试,才能知道你实际得到的是什么。旧的分数只是一个过时的产物,而不是一份保证。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →