← 最新论文
💬 NLP

Dimensionality and Measurement Precision in HLE's Multiple-Choice Subset

本文通过心理测量分析证明,“人类最后的一场考试”(HLE)主要衡量的是单一的通用推理因子,而非不同的特定领域能力,且其测量精度不足以有效地区分前沿语言模型。

原作者: Mayank Sharma, Savira Nadela, Tyler Matteson

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Mayank Sharma, Savira Nadela, Tyler Matteson

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位试图弄清楚班上哪个学生最聪明的老师。你给他们布置了一份包含 428 道题目的巨型测试卷,内容涵盖了从古代历史到高等物理的一切。如果一个学生拿了高分,你可能会假设他们是全能的天才。但如果你想了解更多呢?如果你想知道他们是数学天才但诗歌水平极差,还是科学达人但写不出完整的句子呢?为了回答这个问题,你可能会观察他们在每个学科下的“子分数”。这正是我们今天评估人工智能(AI)的方式。我们使用被称为“基准测试”(benchmarks)的大规模测试来观察我们的 AI 模型有多聪明。但这里有一个棘手之处:仅仅因为一个测试有标注为“数学”和“化学”的部分,并不意味着 AI 真的拥有独立的“数学大脑”和“化学大脑”。也许它只有一个巨大的“推理大脑”,可以帮助它在所有领域都表现出色。这篇论文就像是一个面向测试设计者的侦探故事。它在追问:这些学科标签是真实的、截然不同的技能,还是仅仅是对一种单一、通用能力的华丽切分?更重要的是,这个测试是否真的擅长区分最顶尖的 AI 模型,还是说一旦题目变得非常难,它就会变得模糊不清?

所讨论的论文题为《HLE 多项选择子集的维度性与测量精度》(Dimensionality and Measurement Precision in HLE's Multiple-Choice Subset),深入研究了一个著名的全新 AI 测试——“人类最后的考试”(Humanity's Last Exam,简称 HLE)。来自斯坦福的研究团队对 29 个不同的 AI 模型进行了测试,让他们完成了这个包含 428 道难题的纯文本多项选择版本考试。他们不仅仅是统计正确答案的数量;他们还使用了一种特殊的数学方法,称为项目反应理论(Item Response Theory,简称 IRT)。你可以把这想象成一把超级精密的尺子,它不仅能测量高度,还能告诉你这把尺子在不同高度下的精准度。他们想观察两件事:第一,这个测试是否真的测量了八种不同的技能(如数学、生物、历史),还是其实只是在测量一种大的“通用推理”能力?第二,在这个“聪明程度量表”上,这个测试在哪个阶段最擅长进行区分?

结果给 AI 社区带来了一些现实的警示。研究团队发现,有压倒性的证据表明,H 解本质上是在测量一件事情:一种通用的推理能力。他们计算了一个名为 McDonald's ωh\omega_h 的统计量,结果达到了惊人的 0.998。为了让你理解,如果 1.0 代表“完美的单一技能”,那么这个测试几乎是完美的单维度的。我们在题目上贴上的标签——比如“数学”或“工程”——仅解释了模型回答差异中的 3.5%。这就像是你对一群人进行分类,试图按“跑步速度”和“游泳速度”来划分,结果却发现每个跑步快的人游泳也都很快,而“游泳”这个标签并没有提供任何“跑步”无法提供的额外信息。研究人员还发现,特定领域的能力估计值与总分几乎完全一致(相关系数 r0.81r \ge 0.81),这意味着子分数基本上是冗余的。

此外,论文还发现了一个关于测试在“何处”最准确的问题。该测试在区分普通 AI 模型和稍好一点的模型时表现出色。然而,对于最顶尖的模型,测试的“精度”会断崖式下跌。该测试在能力水平 θ=0.35\theta = -0.35 附近最为精确,但顶级的“前沿”模型处于 θ>0\theta > 0 的区间。在这一高能力区间,测试变得模糊了。这就像是一个温度计,它能很好地分辨冷天和温天,但当天气达到“沸腾”状态时,指针就卡住了,无法分辨出是 212°F 还是 250°F。有趣的是,“工程”部分是唯一一个在这些超强模型面前仍保持一定锐度的部分(它将 69.1% 的信息集中在 θ>0\theta > 0 处),但由于工程部分仅占整个测试的 4%,这不足以挽救大局。

那么,这意味着什么?作者们建议,我们不应将 HLE 上不同的学科得分视为 AI 拥有数学或化学等独立、分离技能的证据。相反,我们应该将其视为衡量通用推理能力的工具。更重要的是,随着 AI 模型变得越来越聪明,这个测试可能会失去区分最顶尖模型的能力,因为它在设计时没有包含足够多的“难题”来区分那些绝对的巨头。这篇论文并不是说这个测试没用,但它警告我们,我们需要谨慎对待子分数的过度解读,并且我们可能需要更难的新测试来跟上快速发展的步伐。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →