HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam
本文提出了 HLE-Verified,这是一个通过两阶段验证与修订流程(包括专家审查、模型交叉验证及严格修订)对 Humanity's Last Exam 基准进行系统性清洗和修正的版本,旨在消除原始数据中的噪声与错误,从而更准确地评估前沿大语言模型的真实能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文讲述了一个关于“给最难考试做体检和修修补补”的故事。
想象一下,人类为了测试超级人工智能(AI)有多聪明,设计了一场名为"人类最后的考试"(HLE)的终极测验。这场考试涵盖了数学、科学、工程和人文学科,题目极其刁钻,旨在挑战 AI 的极限。
但是,最近大家发现,这场考试本身**“病得不轻”**。
1. 问题出在哪?(考试卷本身的毛病)
这就好比你参加了一场高难度的数学竞赛,但试卷上存在很多低级错误:
- 题目没写清楚:有的题目像谜语,让人猜都猜不出题意。
- 答案给错了:有的题目明明算出来是 5,标准答案却印成了 3。
- 解题思路是乱的:有的参考答案逻辑不通,甚至自相矛盾。
如果在这种“烂试卷”上考试,AI 答对了题目却拿不到分(因为答案印错了),或者答错了题目反而被算对(因为题目有歧义)。这导致我们无法判断 AI 到底聪不聪明,只能看到它被“烂试卷”坑了多少。
2. 他们做了什么?(HLE-Verified 项目)
为了解决这个问题,阿里巴巴和通义千问团队搞出了一个新工程,叫 HLE-Verified(已验证版)。他们把原来的试卷当成病人,进行了一次彻底的“大手术”。
他们的工作流程就像是一个**“三级诊疗中心”**:
第一阶段:全科体检(验证)
他们把 2500 道题分成三部分:题目本身、最终答案、解题过程。- 请了人类专家(像老教授)和AI 助手一起检查。
- 结果:有 668 道题 是完美的,直接保留,作为“金牌题库”。
第二阶段:专科手术(修复)
对于那些“有病但能治”的题目(比如答案印错了,或者题目少写了个条件),他们进行了**“微创手术”**。- 两个独立的专家团队分别提出修改方案,互相核对,确保不改变题目原本想考的能力,只是把错误修好。
- 结果:有 1143 道题 被成功修复并重新认证,变成了“康复题库”。
第三阶段:疑难杂症科(存疑)
剩下的 689 道题 实在修不好,或者需要太专业的知识才能判断对错(比如涉及未解之谜或极度模糊的领域)。- 他们没有扔掉这些题,而是给它们贴上了“存疑”标签,注明“这里需要哪类专家来定夺”,留给未来的社区慢慢研究。
3. 效果怎么样?(AI 的成绩单变了)
当用这份“修好后的试卷”重新测试 8 个最顶尖的 AI 模型时,发生了惊人的变化:
- 平均分大涨:AI 们的平均正确率提升了 7% 到 10%。这就像是一个学生,以前因为试卷印错答案只能考 60 分,试卷改对后,他其实能考 70 分。
- 在“错题”上提升巨大:对于那些原本题目或答案有严重错误的题目,AI 的正确率直接飙升了 30% 到 40%!这说明之前的低分,很大程度上是因为试卷太烂,而不是 AI 太笨。
- AI 更自信了:以前面对有歧义的烂题,AI 会犹豫不决(信心低);现在题目清晰了,AI 能更准确地判断自己是否答对了,它的“自信心”和“实际能力”更匹配了。
4. 核心启示
这篇论文告诉我们一个重要的道理:
如果尺子本身刻度不准,我们就没法量出物体的真实长度。
以前我们看 AI 排行榜,可能是在比“谁更会猜出题人的烂答案”;现在有了 HLE-Verified,我们终于有了一把精准的尺子,能真正测出 AI 到底有没有“真才实学”。
总结一下:
这就好比给一场世界级的奥林匹克竞赛,重新检查了所有的跑道、计时器和裁判规则。虽然比赛还是那个比赛,但现在的结果,才真正代表了运动员(AI)的实力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。