← 最新论文
📊 statistics

Total Variation Distance Estimation in Autoregressive Models

本文提出了在样本、logit 以及噪声 logit 访问模型下,估计两个长度为 nn 的自回归分布之间全变差距离的高效算法,这些算法相比以往方法提供了显著改进,并展示了在量化现代大语言模型(LLM)推理引擎之间分布差异方面的实际效用。

原作者: Eric Price, Kevin Tian, Zhiyang Xun, Yusong Zhu

发布于 2026-07-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Eric Price, Kevin Tian, Zhiyang Xun, Yusong Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

AI 双生子之间的隐形差异

想象你有两对完全相同的双胞胎。他们在同一个家里长大,吃同样的食物,拥有相同的 DNA。如果你问他们一个问题,你期望他们给出完全相同的回答,字字相同。在人工智能领域,特别是大语言模型(LLM)的世界里,“DNA”就是模型的权重——即存储在文件中的数学大脑力量。但在现实世界中,事情并非如此简单。就像双胞胎可能会因为疲劳、饥饿或正在与朋友交谈而做出不同的反应一样,AI 模型也会根据它们运行的计算机硬件、同时回答问题的数量,甚至是软件代码中微小且隐形的故障,从而产生不同的结果。

为了衡量两个事物的差异程度,科学家经常使用一种叫做“全变差距离”(Total Variation Distance, TV)的工具。可以将它想象成一个“不匹配度量计”。如果你有两个装满弹珠的袋子,并从每个袋子里各取出一个,TV 距离会告诉你这两个弹珠颜色不同的最大概率。它是衡量“这两个东西有多可能产生分歧”的一个完美得分。这不同于其他试图测量模型“有多惊讶”的工具,因为如果模型对哪怕一个词产生了分歧,那些工具就会完全失效。研究人员提出的重大问题是:如果两家公司声称正在运行完全相同的 AI 模型,它们提供的确实是相同的体验,还是代码中隐藏着差异?

论文使命:捕捉机器中的幽灵

这篇题为《自回归模型中的全变差距离估计》的论文是一个关于寻找这些隐藏差异的侦探故事。来自德克萨斯大学奥斯汀分校的作者们意识到,虽然两个 AI 引擎在纸面上看起来是一样的,但由于“批处理”(同时回答许多问题)或“量化”(通过简化数字来节省空间)等原因,它们实际生成文本的方式可能会产生偏差。他们想要建立一种可靠的方法来测量两个 AI 引擎之间的全变差距离,以观察它们究竟有多少分歧。

作者发现,测量这种距离非常棘手,因为 AI 模型不仅仅是吐出答案,它们还会像连锁反应一样,一个词接一个词地构建答案。如果你只能看到最终答案(例如一个样本),那就好比试图通过只看电影的最后一幕来猜测整个剧情。为了解决这个问题,他们开发了三种不同的“超能力”或观察内部机制的方法,并发现你看到的越多,工作就越容易。

1. “样本”超能力(蒙眼猜测)
检查 AI 最基本的方法就是问它一个问题,然后看它说什么。这被称为“样本访问”(sample access)。作者发现,如果你只有这种视角,你需要询问 AI 极大量的次数才能获得良好的测量结果。具体来说,你需要的提问次数随故事长度的平方(n2n^2)以及词汇表“活跃”列表的大小(KK)而增长。这就像试图通过走一条路径来绘制一片巨大的森林;你必须多次行走,才能确定自己没有错过隐藏的林间空地。他们的方法改进了以往的尝试,使其速度更快,但仍然需要海量的查询。

2. “Logit”超能力(X 射线视觉)
许多 AI 系统还会显示它们的“Logit”,即模型在决定下一个词之前使用的原始数字。这就像是看到了 AI 的内部思维过程。作者表明,如果你可以接触到这些数字,这项工作会变得异常简单。你只需要与故事长度(nn)呈线性关系的查询次数。这是一个巨大的飞跃——就像从在森林中步行转变为乘坐直升机飞越森林。他们证明了这是最快的方法;你不可能做得比这更快。

3. “噪声 Logit”超能力(雾气弥漫的窗户)
这里变得非常有趣。在现实世界中,那些“Logit”数字并不总是完美的。有时计算机很忙,或者软件略有缺陷,返回的数字会变得有些模糊或带有“噪声”。作者意识到,如果你将这种噪声视为已知量(比如知道你的窗户有多模糊),你仍然可以获得很好的测量结果。他们创建了一种方法,能够平滑地融合“蒙眼”和“X 射线”两种方式。如果噪声低,你就表现得像拥有 X 射线视觉;如果噪声高,你就表现得更像是在蒙眼观察。这是最实用的工具,因为它即使在 AI 表现不完美时也能工作。

实战演练:现实世界的对决

为了证明他们的方法有效,作者并没有仅仅停留在实验室里。他们设置了一个现实世界的实验,对比了运行相同模型(Qwen3-0.6B)的两个流行 AI 引擎:vllmsglang。他们想看看这两个理应完全相同的引擎是否真的产生了相同的文本。

他们发现,这两个引擎确实存在分歧。对于一个 500 字的故事,它们之间的全变差距离约为 0.586。这个数字代表了两个引擎之间对于任何可能结果的概率最大差异。在实际应用中,这意味着如果你运行一个特定的测试来区分这两个引擎,最好的测试大约有 59% 的概率会成功。它衡量的是这两个引擎的可区分程度,而不是指由其中一个生成的随机句子与另一个不同的直接概率。

研究还揭示了它们产生分歧的原因。有时,一个引擎会选择一个另一个引擎认为不可能的词(“支持集不匹配”,support mismatch),导致距离激增。有时,它们选择了相同的词,但分配的概率略有不同。作者还注意到,系统的“噪声”会根据引擎的配置而变化。例如,如果你要求引擎同时回答 256 个问题,噪声就会增加,使测量结果变得模糊。但他们的新型“多层级”方法足够聪明,能够处理这种情况。通过多次询问同一个问题并平均结果,他们可以过滤掉噪声,找到真实的距离。

总结

论文得出结论,我们现在可以可靠地测量两个 AI 引擎之间的差异,即使它们运行在不同的硬件上或使用了不同的软件技巧。他们证明了,虽然如果你只看最终答案,这件事很难做,但如果你能窥探内部数字,它就会变得容易得多。最重要的是,他们展示了即使在这些数字带有噪声的情况下,通过使用新的统计技巧,我们仍然可以获得准确的图像。

这之所以重要,是因为随着 AI 变得越来越普遍,公司需要知道他们的“廉价版”模型是否真的与“昂贵版”模型相同,或者一个新的、更快的软件更新是否在秘密地改变 AI 的行为方式。作者们提供了一把尺子来衡量这些隐形的差异,确保当我们说两个 AI 是相同时,它们确实是相同的。他们的代码现在已向所有人开放,将这些复杂的数学转化为面向 AI 未来的实用工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →