← 最新の論文
💬 NLP

HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam

本論文は、評価ノイズを低減しモデル能力をより正確に測定できるよう、専門家の検証と構造化された修正プロセスを経て「Humanity's Last Exam」を再構築・検証した「HLE-Verified」を提案し、その有効性を示すものです。

原著者: Weiqi Zhai, Zhihai Wang, Jinghang Wang, Boyu Yang, Xiaogang Li, Xander Xu, Bohan Wang, Peng Wang, Xingzhe Wu, Anfeng Li, Qiyuan Feng, Yuhao Zhou, Shoulin Han, Wenjie Luo, Yiyuan Li, Yaxuan Wang, Ruixi
公開日 2026-03-02
📖 1 分で読めます☕ さくっと読める

原著者: Weiqi Zhai, Zhihai Wang, Jinghang Wang, Boyu Yang, Xiaogang Li, Xander Xu, Bohan Wang, Peng Wang, Xingzhe Wu, Anfeng Li, Qiyuan Feng, Yuhao Zhou, Shoulin Han, Wenjie Luo, Yiyuan Li, Yaxuan Wang, Ruixian Luo, Guojie Lin, Peiyao Xiao, Chengliang Xu, Ben Wang, Zeyu Wang, Zichao Chen, Jianan Ye, Yijie Hu, Jialong Chen, Zongwen Shen, Yuliang Xu, An Yang, Bowen Yu, Dayiheng Liu, Junyang Lin, Hu Wei, Que Shen, Bing Zhao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人類の最終試験(HLE)の「修正版」が完成しました!

~「壊れた試験問題」を直すことで、AI の本当の力がわかる~

この論文は、AI(人工知能)の能力を測るための「超難問テスト」である**「HLE(Humanity's Last Exam)」という試験について、ある重大な問題が発見され、それを「HLE-Verified(検証済み版)」**として作り直したというお話しです。

まるで、「世界一難しい数学のテスト」を作ったけれど、実は問題文にミスがあったり、答えが間違っていたりして、生徒(AI)の本当の力が測れていなかったという状況です。


1. なぜこの研究が必要だったの?(「壊れた試験」の問題点)

HLE というテストは、AI がどれくらい賢いかを測るための「黄金基準」として使われていました。しかし、コミュニティの人々がよくよく見てみると、**「試験問題自体にゴミ(ノイズ)」**が混じっていることがわかりました。

  • 問題文が曖昧: 「これってどういう意味?」と AI が混乱する問題。
  • 答えが間違っている: 正解なのに「不正解」として登録されている問題。
  • 解説がおかしい: 答えに至るまでの理屈が破綻している問題。

これらは、「生徒(AI)がバカだから間違えた」のではなく、「先生(試験作成者)が問題を作ったから間違えた」という状況です。
これでは、AI の本当の能力が測れません。まるで、
「足が不自由な状態で走れ」と言われて、足が不自由だから走れないと評価されるようなもの
です。

2. 彼らが何をしたのか?(「HLE-Verified」の登場)

そこで、アリババグループのチームは、この試験を**「徹底的に掃除して、直して、再検証する」**という大プロジェクトを行いました。

彼らのやり方は、まるで**「古びた図書館の全蔵書を整理する」**ようなものです。

ステップ 1:「本当に正しいか?」をチェック(金メダル選定)

まず、2,500 問ある問題の一つ一つを、**「専門家の目」「別の AI」**の両方でチェックしました。

  • 「問題文は完璧か?」
  • 「答えは合っているか?」
  • 「解説は論理的か?」

これで見事に問題なかった668 問は、そのまま「金メダル(Gold)」として残しました。

ステップ 2:「直せるものは直す」(リハビリ)

「問題はあるけど、直せば使える」ものについては、**「元のテストの意図(何を問いたいのか)」**を壊さないように、慎重に修正しました。

  • 問題文の曖昧さを消す。
  • 間違った答えを正解に直す。
  • 破綻した解説を論理的に書き直す。

これで1,143 問が「リハビリ済み(Revised)」として復活しました。

ステップ 3:「直せないものは記録する」(保留)

どうしても誰がやっても「正解がわからない」や「専門知識が不足している」問題は、無理に直さず、**「未確定(Uncertain)」**としてリストに残しました。これらは「将来、もっと詳しい人が来たら直してください」というメモ付きで公開されています。


3. 結果はどうだった?(AI の力が「爆発」した!)

この「修正済みテスト(HLE-Verified)」で、最新の AI 8 種類をテストしたところ、驚くべき結果が出ました。

  • 平均して 7〜10% 正解率がアップ!
    • 全体的に、AI の成績が良くなりました。
  • 「間違った問題」だった部分では、正解率が 30〜40% も跳ね上がった!
    • これは**「AI がバカだったのではなく、試験問題が悪かった」**ことを証明しています。
    • 例えるなら、**「間違った地図を渡されて道に迷っていた人が、正しい地図を渡されたら、一気に目的地に到着できた」**ようなものです。

また、AI の**「自信」**についても面白い発見がありました。

  • 間違った問題文だと、AI は**「自信がない(迷っている)」**という反応を示していました。
  • 問題を直すと、AI は**「自信を持って正解」**を出せるようになりました。
  • つまり、「AI の自信のなさ」は、AI の能力不足ではなく、試験の質の悪さを示すシグナルだったのです。

4. この研究のすごいところは?

この研究は、単に「点数を上げた」だけではありません。

  1. 「試験の質」を可視化した:
    以前は「AI が間違えた」という結果しか見えませんでしたが、今回は「問題文が壊れていた」「答えが間違っていた」という**「どこが壊れていたか」を細かく分類**しました。
  2. コミュニティへの貢献:
    直せなかった問題は「保留リスト」として公開し、世界中の人々が「これなら直せる!」と協力できるようにしました。
  3. 公平な評価:
    これからは、AI の能力を測る際、「試験問題自体のミス」で評価が歪むことがなくなります。

まとめ

この論文は、**「AI の能力を正しく測るためには、まず『試験そのもの』を完璧にしなければならない」**という重要なメッセージを伝えています。

HLE-Verifiedは、AI 開発者にとっての**「新しいものさし」**です。
これにより、私たちは「AI が本当にどれくらい賢くなったか」を、より公平で正確に、そして安心して評価できるようになったのです。

一言で言うと:
「AI のテストに『ゴースト(誤った問題)』が混じっていましたが、それを掃除して『クリーンなテスト』にしたら、AI の本当の凄さがわかったよ!」というお話です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →