LLM Evaluation as Tensor Completion: Low Rank Structure and Semiparametric Efficiency
本文为大语言模型评估中的低秩张量补全建立了一个半参数推断框架,推导了效率界限,并引入了一种得分白化方法,从而能够从噪声且稀疏的成对比较中实现渐近正态且具有不确定性量化的模型能力估计。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能飞速发展的世界中,一种新型的统计挑战已经出现。随着大型语言模型变得越来越强大,问题不再仅仅是如何构建它们,而是如何准确地了解它们的水平究竟有多高。为了回答这个问题,各大平台转向了一种模仿人类学习的方法:要求人们将两个回答进行并排对比,并投票选出更好的那一个。这一过程产生了海量的数据,但这些数据是杂乱无章的。有些模型被比较了数千次,而有些模型却很少被提及;有些问题被不断地询问,而有些问题则被忽视。其结果是一个看起来像是清晰排名,实则建立在不均衡、多噪且不完整信息基础上的排行榜。如果缺乏衡量这些排名中不确定性的方法,我们就很难知道一个模型的进步是真正的提升,还是仅仅由于数据的偶然性。
麻省理工学院(MIT)和普渡大学的研究人员通过将这些 AI 模型的评估视为一个“缺失碎片”的谜题来解决这一问题。他们意识到,一个模型的能力并非一个单一的数字,而是一个复杂的剖面,会根据任务、语言或用户而变化。为了理清这一点,他们将每个模型在每种可能场景下的表现想象成一个巨大的、多维的隐藏得分网格。由于我们无法要求人类在每种情况下都让每个模型与其它所有模型进行对比,因此这些得分中的大多数从未被直接观察到。相反,我们只能看到特定随机对决的结果。研究人员开发了一种新的数学框架来填补这些缺失的得分,不仅是通过猜测,而且是通过计算最可能的数值,同时严谨地衡量我们对这些猜测的信心程度。
他们的核心工作解决了以往方法所忽略的一个特定难点:数据的非均衡性。在一个完美的世界里,每一次对比都会提供同等的信息量,但在现实中,两个非常相似的模型之间的对决提供了大量有用的信息,而一个顶尖模型与一个弱势模型之间的对决则告诉我们的信息却微乎其微。此外,数据的收集方式往往偏向于热门模型或趋势话题。研究人员发现,标准的统计工具在这样的环境下会失效,因为它们假设数据是均匀分布的。他们发现,用于估计这些得分的数学机制在信息不对称时会变得不稳定,从而导致不可靠的排名和误导性的置信区间。
为了解决这个问题,该团队引入了一种被称为“得分白化”(score whitening)的技术。可以将其想象为调节收音机的音量,使得每一个电台——无论其信号是清晰还是充满杂音——都能对最终的声音做出同等的贡献。通过根据每次对比实际携带的信息量进行数学上的缩放,他们将混乱、不均衡的数据转化为了平衡的流。这使他们能够构建出一种新型的估计器,能够处理 AI 评估中的现实复杂性。他们证明了这种方法可以创建出既准确又高效的置信区间,这意味着在不牺牲可靠性的前提下,区间尽可能地紧凑。
他们的研究结果表明,通过考虑数据的低秩结构(即模型性能是由推理能力或编程技能等少数潜在因素驱动,而非随机噪声),实现跨不同任务和模型的“信息借用”是可能的。这种信息的借用在数据稀疏时至关重要。研究人员展示了他们的方法不仅适用于简单问题(如“模型 A 比模型 B 好多少?”),也适用于复杂的非线性问题(如“模型 A 在特定类别中获胜的概率是多少?”)。
在利用合成数据和来自热门平台 Arena 的真实数据进行的实验中,这种新方法证明了其价值。与那些将每个任务分开处理或忽略采样不均情况的现有方法相比,这种新估计器产生的排名具有显著更小的误差幅度。它成功地校准了其置信水平,这意味着当它声称有 95% 的概率是正确时,它确实在 95% 的情况下是正确的。这项研究证实,尽管来自人类偏好的数据本质上是多噪且存在偏差的,但通过科学的方法提取出关于模型性能的清晰且符合统计学原理的图景是可能的。这为开发者和用户提供了一种原则性的方法,让他们不仅能理解谁在获胜,还能理解我们对这场胜利的确定程度,从而将嘈杂的投票集合转化为衡量人工智能能力的可靠标准。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。