← 最新论文
💬 NLP

HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam

本文提出了 HLE-Verified,这是一个通过两阶段验证与修订流程(包括专家审查、模型交叉验证及严格修订)对 Humanity's Last Exam 基准进行系统性清洗和修正的版本,旨在消除原始数据中的噪声与错误,从而更准确地评估前沿大语言模型的真实能力。

原作者: Weiqi Zhai, Zhihai Wang, Jinghang Wang, Boyu Yang, Xiaogang Li, Xander Xu, Bohan Wang, Peng Wang, Xingzhe Wu, Anfeng Li, Qiyuan Feng, Yuhao Zhou, Shoulin Han, Wenjie Luo, Yiyuan Li, Yaxuan Wang, Ruixi
发布于 2026-03-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Weiqi Zhai, Zhihai Wang, Jinghang Wang, Boyu Yang, Xiaogang Li, Xander Xu, Bohan Wang, Peng Wang, Xingzhe Wu, Anfeng Li, Qiyuan Feng, Yuhao Zhou, Shoulin Han, Wenjie Luo, Yiyuan Li, Yaxuan Wang, Ruixian Luo, Guojie Lin, Peiyao Xiao, Chengliang Xu, Ben Wang, Zeyu Wang, Zichao Chen, Jianan Ye, Yijie Hu, Jialong Chen, Zongwen Shen, Yuliang Xu, An Yang, Bowen Yu, Dayiheng Liu, Junyang Lin, Hu Wei, Que Shen, Bing Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于“给最难考试做体检和修修补补”的故事。

想象一下,人类为了测试超级人工智能(AI)有多聪明,设计了一场名为"人类最后的考试"(HLE)的终极测验。这场考试涵盖了数学、科学、工程和人文学科,题目极其刁钻,旨在挑战 AI 的极限。

但是,最近大家发现,这场考试本身**“病得不轻”**。

1. 问题出在哪?(考试卷本身的毛病)

这就好比你参加了一场高难度的数学竞赛,但试卷上存在很多低级错误:

  • 题目没写清楚:有的题目像谜语,让人猜都猜不出题意。
  • 答案给错了:有的题目明明算出来是 5,标准答案却印成了 3。
  • 解题思路是乱的:有的参考答案逻辑不通,甚至自相矛盾。

如果在这种“烂试卷”上考试,AI 答对了题目却拿不到分(因为答案印错了),或者答错了题目反而被算对(因为题目有歧义)。这导致我们无法判断 AI 到底聪不聪明,只能看到它被“烂试卷”坑了多少。

2. 他们做了什么?(HLE-Verified 项目)

为了解决这个问题,阿里巴巴和通义千问团队搞出了一个新工程,叫 HLE-Verified(已验证版)。他们把原来的试卷当成病人,进行了一次彻底的“大手术”。

他们的工作流程就像是一个**“三级诊疗中心”**:

  • 第一阶段:全科体检(验证)
    他们把 2500 道题分成三部分:题目本身、最终答案、解题过程。

    • 请了人类专家(像老教授)和AI 助手一起检查。
    • 结果:有 668 道题 是完美的,直接保留,作为“金牌题库”。
  • 第二阶段:专科手术(修复)
    对于那些“有病但能治”的题目(比如答案印错了,或者题目少写了个条件),他们进行了**“微创手术”**。

    • 两个独立的专家团队分别提出修改方案,互相核对,确保不改变题目原本想考的能力,只是把错误修好。
    • 结果:有 1143 道题 被成功修复并重新认证,变成了“康复题库”。
  • 第三阶段:疑难杂症科(存疑)
    剩下的 689 道题 实在修不好,或者需要太专业的知识才能判断对错(比如涉及未解之谜或极度模糊的领域)。

    • 他们没有扔掉这些题,而是给它们贴上了“存疑”标签,注明“这里需要哪类专家来定夺”,留给未来的社区慢慢研究。

3. 效果怎么样?(AI 的成绩单变了)

当用这份“修好后的试卷”重新测试 8 个最顶尖的 AI 模型时,发生了惊人的变化:

  • 平均分大涨:AI 们的平均正确率提升了 7% 到 10%。这就像是一个学生,以前因为试卷印错答案只能考 60 分,试卷改对后,他其实能考 70 分。
  • 在“错题”上提升巨大:对于那些原本题目或答案有严重错误的题目,AI 的正确率直接飙升了 30% 到 40%!这说明之前的低分,很大程度上是因为试卷太烂,而不是 AI 太笨。
  • AI 更自信了:以前面对有歧义的烂题,AI 会犹豫不决(信心低);现在题目清晰了,AI 能更准确地判断自己是否答对了,它的“自信心”和“实际能力”更匹配了。

4. 核心启示

这篇论文告诉我们一个重要的道理:
如果尺子本身刻度不准,我们就没法量出物体的真实长度。

以前我们看 AI 排行榜,可能是在比“谁更会猜出题人的烂答案”;现在有了 HLE-Verified,我们终于有了一把精准的尺子,能真正测出 AI 到底有没有“真才实学”。

总结一下:
这就好比给一场世界级的奥林匹克竞赛,重新检查了所有的跑道、计时器和裁判规则。虽然比赛还是那个比赛,但现在的结果,才真正代表了运动员(AI)的实力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →