← 最新の論文
🤖 AI

Agents' Last Exam

本論文は、現在のベンチマークにおける成功と、意味のあるGDPに関連した展開との間の溝を埋めることを目的として、13の産業クラスターにわたる長期的な経済的価値のある実世界のタスクにおいてAIエージェントを評価するために、250人以上の業界専門家と共に開発されたリビング・ベンチマークであるAgents' Last Exam (ALE) を紹介するものである。

原著者: Yiyou Sun, Xinyang Han, Weichen Zhang, Yuanbo Pang, Tianyu Wang, Yuhan Cao, Yixiao Huang, Chris Duroiu, Haoyun Zhang, Jeffrey Lin, Weishu Zhang, Tyler Zeng, Ying Yan, Bo Liu, Hanson Wen, Mingyang Xu
公開日 2026-06-05
📖 1 分で読めます☕ さくっと読める

原著者: Yiyou Sun, Xinyang Han, Weichen Zhang, Yuanbo Pang, Tianyu Wang, Yuhan Cao, Yixiao Huang, Chris Duroiu, Haoyun Zhang, Jeffrey Lin, Weishu Zhang, Tyler Zeng, Ying Yan, Bo Liu, Hanson Wen, Mingyang Xu, Xiaoyuan Liu, Zimeng Chen, Weiyan Shi, Amanda Dsouza, Vincent Sunn Chen, Patrick Bryant, Carl Boettiger, Yamini Rangan, Bradley Rothenberg, Kyle Steinfeld, Arvind Rao, Tapio Schneider, Georgios Yannakakis, Laure Zanna, Kaan Ozbay, Ida Sim, Tarek Zohdi, George Em Karniadakis, Jack Gallant, Teresa Head-gordon, Yushan Li, Wenxi Deng, Tao Sun, Huiqi Wang, Zhun Wang, Justin Xu, Chris Yuhao Liu, Yafei Cheng, Rongwang Hu, Aras Bacho, Shengcao Cao, Zengyi Qin, Yixiong Chen, Hengduan Fan, Hao Liu, Lin Zeng, Shashank Muralidhar Bharadwaj, Litian Gong, Yingxuan Yang, Maojia Song, Ruheng Wang, Zongzheng Zhang, Honglin Bao, Shuo Lu, Jianhong Tu, Zhonghua Wang, Zheng Zhang, Zijiao Chen, yanqiong Jiang, Zhendong Li, Bohan Lyu, Chang Ma, Peiran Xu, Benran Zhang, Shangding Gu, Haoyue Hua, Haoyang Li, Wanzhe Liao, Chengzhi Liu, Junbo Peng, Haoran Sun, Zechen Xu, Bo Chen, Jiayi Cheng, Yi Jiang, Keying Kuang, Yuan Li, Youbang Pan, Ziyan Rao, Alexander Schubert, Yifan Shen, Vincent Siu, Xiatao Sun, Kangqi Zhang, Xiaopan Zhang, Yuchen Zhu, Ishaan Singh Chandok, Lei Ding, Jingxuan Fan, Andrew Glover, Jiaming Hu, Yiran Hu, Wenbo Huang, Zixin Jiang, Haoran Jin, Lukas Kim, Ming Liu, Yang Liu, Alireza Rafiei, Xuhuan Shen, Kunyang Sun, Sophia Sun, Ting Sun, Eric Wang, Yixin Wang, Hanwen Xing, Sihan Xu, Yuzheng Xu, Zhongxing Xu, Zhiling Yan, Boqin Yuan, Ruiqi Zhang, Yifan Zhang, Zibo Zhao, Liana, Santanu Bosu Antu, Haoyue Bai, Carlo Bosio, Joseph Cavanagh, Patricia Cavazos-Rehg, Tianxing Chen, Xuewen Chen, Yipu Chen, Zhu Chenyu, Chen Dai, Stefano De Castro, Yunfu Deng, Kaustubh Dhole, Jiayuan Ding, Chenchen Du, Zhehang Du, Hao Fan, Run-ze Fan, Hengyu Fu, Shi Gu, Yifan Gu, Charlie Guo, Baihe Huang, Baixiang Huang, Rimika Jaiswal, Zhihan Jiang, Ran Jin, Erin Kasson, Xin Lan, Joseph Lee, Deren Lei, Chenyu Li, Daofeng Li, Haitao Li, Hongwei Li, Jingyan Li, Xiao Li, Yi Li, Yinsheng Li, Yuangang Li, Zhixu Li, Wenyu Liang, Longtai Liao, Kevin Qinghong Lin, AndyZeyi Liu, Che Liu, Jiaming Liu, Kaiyuan Liu, Xuan Liu, Pan Lu, Wenbo Lv, Yicheng Lv, Qiuyang Mang, Kyle Montgomery, Yuzhou Nie, Ruoxi Ning, Jorin Overwiening, Xu Pan, Layna Paraboschi, Core Francisco Park, Justin Purnomo, Swati Rajwal, Scott Rankin, Bixuan Ren, Yiren Rong, HaoYang Shang, Ventus Shaw, Fiona Shen, Jiawei Shen, Minqi Shi, Qiu Shi, Huaxiu Yao, Tianneng Shi, Jonah So, Vladislav Susoy, Hannah Szlyk, Haocheng Wang, Jialu Wang, Wei Wang, Xinyu Wang, Zehao Wang, Dowling Wong, Angela Wu, Dehao Wu, Fangyu Wu, Mengyuan "Millie" Wu, Yu Wu, Yuchen Wu, Yuhao Wu, Qingpo Wuwu, Weihang Xiao, Yongyi Xiong, Fan Xu, Ruiling Xu, Mingxuan Yan, Benjamin Yang, Jirong Yang, Sen Yang, Xiaoli Yang, Yushi Yang, Haoran Ye, Xiaohu Yu, Zhengming Yu, Chenlong Zhang, Chi Zhang, Hanning Zhang, Hanwen Zhang, Junge Zhang, Kunpeng Zhang, Song Zhang, Wenjin Zhang, Wenshuo Zhang, Ying Zhang, Yizhi Zhang, Brian Zhao, Qijian Zhao, Yimin Zhao, Yuhaohua Zheng, Liwei Zhou, Tianyue Zhou, Sichen Zhu, Siqi Zhu, Yan Zhu, Yishu Zhu, Jierui Zuo, Chonghao Cai, Helena Casademunt, Wenjia Chen, Benjamin Cheng, Nawen Deng, Rao Fu, Tianfu Fu, Yifan Han, Ren He, Zhenyu He, Qiao Jin, Lang Lang, Yuetai Li, Sylvia Liu, Lu Lu, Qing Lu, Subhabrata Mukherjee, Yunqi Ouyang, Yin Ren, Dawei Shi, Haoran Wu, Zhiyue Wu, Hannah Yao, Zhuoran Yi, Jenny Yu, Rhea Zhan, Hang Zhou, Blake Zhu, Junfan Zhu, Alan Yuille, Yang Liu, Russell Alan Poldrack, Jiachen Li, Zhenglu Li, Molei Tao, Jing Huang, Wenqi Shi, Costas Spanos, Lichao Sun, Chenguang Wang, Orson Xu, Zhen Dong, Hector Gomez, Aylin Caliskan, Ali Emami, Haimin Hu, Zhi Li, Lihui Liu, Murphy Niu, Yi Shao, Jianxin Sun, Mikko Tolonen, Ting Wang, Sanjiv Das, Yanjun Gao, Wenbo Guo, Erika J Schneider, Zhiyong Lu, Mark Mueller, Radha Poovendran, Somayeh Sojoudi, Dawn Song

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、長年ロボットシェフを訓練してきたと想像してください。あなたはレシピに関するクイズを出したり、材料の名前を答えさせたり、「玉ねぎを切って」といった単純な指示に従わせたりして、テストを行ってきました。これらのテストにおいて、ロボットは満点を叩き出します。まるで料理の天才であるかのように見えます。

しかし、いざ忙しいレストランのラッシュ時に、複雑で本格的なディナーを実際に作らせようとすると、事態は一変します。ロボットはソースを焦がしたり、注文を忘れたり、コンロの操作に混乱したりするのです。結局のところ、「料理について話す」のが得意であることと、「実際に作業を行う」のが得意であることは別物なのです。

これこそが、論文「Agents' Last Exam (ALE)」が解決しようとしている問題です。

問題点:「クイズ」の罠

長い間、AI研究者たちは、AIエージェント(賢いコンピュータプログラム)を、選択式のクイズのようなベンチマークでテストしてきました。これらのテストは、AIが何を「知っている」かを測定するには優れていますが、AIが現実世界で何を「できる」かを測定するものではありません。

著者らは、AIが数学のテストやコーディングのクイズに合格したからといって、それが実際にビジネスを運営したり、橋を設計したり、病院のスケジュールを管理したりできることを意味するわけではないと主張しています。「テストに合格すること」と「利益を生み出すこと」の間には、巨大な溝が存在します。

解決策:「最後の試験(Last Exam)」

これを解決するために、チームは「ALE (Agents' Last Exam)」を作成しました。これは単なるクイズではなく、AIに対する**「実社会での最終採用試験」**だと考えてください。

「フランスの首都は何ですか?」や「Pythonのループを書いてください」と尋なく代わりに、ALEは、人間の専門家が実際に行うような、リアルで混沌とした数日間にわたるプロジェクトをAIに与えます。

  • タスクの内容: 試験は55の異なる職種(エンジニアリング、医学、金融、ビデオゲームデザインなど)を網羅しています。
  • 難易度: タスクは「ロングホライゾン(長期的な工程)」であり、完了までに数時間または数日を要します。AIは、人間が従業員として行うように、さまざまなソフトウェアを開き、ボタンをクリックし、ファイルをチェックし、自らのミスを修正する必要があります。
  • ソース(情報源): これらは研究者が作り上げた架空のタスクではありません。250人以上の業界エキスパートが、実際の業務で行った実在のプロジェクトです。エキスパートたちが自身の過去の仕事を提供し、チームがそれをテストへと変換しました。

試験の仕組み

AIが仮想オフィス内のコンピュータの前に座っているところを想像してください。

  1. 割り当て: AIには、「車の部品用の金型を設計せよ」や「これらの医療用X線画像を分析せよ」といった、現実世界のタスクが与えられます。
  2. ツール: AIは、人間と同じように、実際のソフトウェア(3Dモデリングツール、財務スプレッドシート、医療用画像ソフトウェアなど)を使用しなければなりません。メニューをクリックし、コマンドを入力し、ファイルを管理する必要があります。
  3. 採点: ここが巧妙な点です。この試験は、人間の教師が結果を見て「良さそうだ」と判断することに依存しません。それでは時間がかかりすぎ、主観的になってしまうからです。代わりに、試験は自動チェッカーを使用します。
    • もしタスクが3Dモデルの構築であった場合、コンピュータは寸法が正確に合っているかをチェックします。
    • もしタスクが財務報告書の作成であった場合、コンピュータは数字が正しく計算されているかをチェックします。
    • もしAIが「ゲート(障壁)」(例えば、機械を故障させるようなミス)で失敗した場合、残りの仕事がいかに立派に見えたとしても、即座にゼロ点となります。

結果:AIはまだ「学生」である

論文では、世界で最もスマートなAIエージェントをこの試験にかけてテストしました。その結果は、非常に厳しいものでした。

  • 「イージー」層: 最も優れたAIエージェントであっても、「近未来的な(比較的容易な)」タスクの約30%しかパスできませんでした。
  • 「ハード」層: 最も困難なタスク(「ラスト・エグザム」層)においては、合格率は**0%**でした。AIはそれらを全くこなせませんでした。
  • ギャップ: 標準的なコーディングテスト(Terminal-Bench)で82%のスコアを取るAIが、この実社会の試験では約25%しか得点できないのです。

著者らは、これを「最後の試験(Last Exam)」と呼んでいます。なぜなら、これが最終的なハードルだからです。もしAIがこれをパスできれば、それはAIが実際に仕事をこなす準備ができ、人間の労働者に取って代わる準備ができたことを意味します。現在、論文によれば、AIはまだ合格には程遠い状態にあります。

なぜ重要なのか

この論文は、単に「より難しいテストを作る」ことについてではなく、「目標を変える」ことについて述べています。

  • 現在の目標: クイズで100%を取るようにすること。
  • 新しい目標: 経済的価値(GDP)を生み出す「実社会の仕事」で100%を取るようにすること。

著者らは、これらの検証可能な実世界のタスクに焦点を当てることで、単に「話すのが上手いAI」ではなく、「働くのが上手いAI」を構築できるようになると信じています。AIがこの「最後の試験」をパスできるまで、それは実社会の労働力に入る準備ができているとは言えません。

要約の比喩

現在のAIベンチマークを**「運転理論テスト」だと考えてください。あなたは道路交通法をすべて暗記し、満点を取ることができるかもしれません。しかし、ALEは、激しい交通の中を運転し、並列駐車を行い、何にもぶつからずに建設現場を通り抜けるという、実際の「運転免許試験」**なのです。

論文はこう述べています。「私たちのAIドライバーたちは、理論テストでは優秀ですが、実際の運転テストではまだ衝突事故を起こしています。理論のスコアを祝うのはやめて、彼らに『運転の仕方』を教え始めましょう。」

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →