← Derniers articles
🤖 AI

Agents' Last Exam

Cet article présente Agents' Last Exam (ALE), un benchmark vivant développé avec plus de 250 experts de l'industrie pour évaluer les agents d'IA sur des tâches réelles à long terme et économiquement précieuses à travers 13 clusters industriels, visant à combler l'écart entre le succès des benchmarks actuels et un déploiement significatif pertinent pour le PIB.

Auteurs originaux : Yiyou Sun, Xinyang Han, Weichen Zhang, Yuanbo Pang, Tianyu Wang, Yuhan Cao, Yixiao Huang, Chris Duroiu, Haoyun Zhang, Jeffrey Lin, Weishu Zhang, Tyler Zeng, Ying Yan, Bo Liu, Hanson Wen, Mingyang Xu
Publié 2026-06-05
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yiyou Sun, Xinyang Han, Weichen Zhang, Yuanbo Pang, Tianyu Wang, Yuhan Cao, Yixiao Huang, Chris Duroiu, Haoyun Zhang, Jeffrey Lin, Weishu Zhang, Tyler Zeng, Ying Yan, Bo Liu, Hanson Wen, Mingyang Xu, Xiaoyuan Liu, Zimeng Chen, Weiyan Shi, Amanda Dsouza, Vincent Sunn Chen, Patrick Bryant, Carl Boettiger, Yamini Rangan, Bradley Rothenberg, Kyle Steinfeld, Arvind Rao, Tapio Schneider, Georgios Yannakakis, Laure Zanna, Kaan Ozbay, Ida Sim, Tarek Zohdi, George Em Karniadakis, Jack Gallant, Teresa Head-gordon, Yushan Li, Wenxi Deng, Tao Sun, Huiqi Wang, Zhun Wang, Justin Xu, Chris Yuhao Liu, Yafei Cheng, Rongwang Hu, Aras Bacho, Shengcao Cao, Zengyi Qin, Yixiong Chen, Hengduan Fan, Hao Liu, Lin Zeng, Shashank Muralidhar Bharadwaj, Litian Gong, Yingxuan Yang, Maojia Song, Ruheng Wang, Zongzheng Zhang, Honglin Bao, Shuo Lu, Jianhong Tu, Zhonghua Wang, Zheng Zhang, Zijiao Chen, yanqiong Jiang, Zhendong Li, Bohan Lyu, Chang Ma, Peiran Xu, Benran Zhang, Shangding Gu, Haoyue Hua, Haoyang Li, Wanzhe Liao, Chengzhi Liu, Junbo Peng, Haoran Sun, Zechen Xu, Bo Chen, Jiayi Cheng, Yi Jiang, Keying Kuang, Yuan Li, Youbang Pan, Ziyan Rao, Alexander Schubert, Yifan Shen, Vincent Siu, Xiatao Sun, Kangqi Zhang, Xiaopan Zhang, Yuchen Zhu, Ishaan Singh Chandok, Lei Ding, Jingxuan Fan, Andrew Glover, Jiaming Hu, Yiran Hu, Wenbo Huang, Zixin Jiang, Haoran Jin, Lukas Kim, Ming Liu, Yang Liu, Alireza Rafiei, Xuhuan Shen, Kunyang Sun, Sophia Sun, Ting Sun, Eric Wang, Yixin Wang, Hanwen Xing, Sihan Xu, Yuzheng Xu, Zhongxing Xu, Zhiling Yan, Boqin Yuan, Ruiqi Zhang, Yifan Zhang, Zibo Zhao, Liana, Santanu Bosu Antu, Haoyue Bai, Carlo Bosio, Joseph Cavanagh, Patricia Cavazos-Rehg, Tianxing Chen, Xuewen Chen, Yipu Chen, Zhu Chenyu, Chen Dai, Stefano De Castro, Yunfu Deng, Kaustubh Dhole, Jiayuan Ding, Chenchen Du, Zhehang Du, Hao Fan, Run-ze Fan, Hengyu Fu, Shi Gu, Yifan Gu, Charlie Guo, Baihe Huang, Baixiang Huang, Rimika Jaiswal, Zhihan Jiang, Ran Jin, Erin Kasson, Xin Lan, Joseph Lee, Deren Lei, Chenyu Li, Daofeng Li, Haitao Li, Hongwei Li, Jingyan Li, Xiao Li, Yi Li, Yinsheng Li, Yuangang Li, Zhixu Li, Wenyu Liang, Longtai Liao, Kevin Qinghong Lin, AndyZeyi Liu, Che Liu, Jiaming Liu, Kaiyuan Liu, Xuan Liu, Pan Lu, Wenbo Lv, Yicheng Lv, Qiuyang Mang, Kyle Montgomery, Yuzhou Nie, Ruoxi Ning, Jorin Overwiening, Xu Pan, Layna Paraboschi, Core Francisco Park, Justin Purnomo, Swati Rajwal, Scott Rankin, Bixuan Ren, Yiren Rong, HaoYang Shang, Ventus Shaw, Fiona Shen, Jiawei Shen, Minqi Shi, Qiu Shi, Huaxiu Yao, Tianneng Shi, Jonah So, Vladislav Susoy, Hannah Szlyk, Haocheng Wang, Jialu Wang, Wei Wang, Xinyu Wang, Zehao Wang, Dowling Wong, Angela Wu, Dehao Wu, Fangyu Wu, Mengyuan "Millie" Wu, Yu Wu, Yuchen Wu, Yuhao Wu, Qingpo Wuwu, Weihang Xiao, Yongyi Xiong, Fan Xu, Ruiling Xu, Mingxuan Yan, Benjamin Yang, Jirong Yang, Sen Yang, Xiaoli Yang, Yushi Yang, Haoran Ye, Xiaohu Yu, Zhengming Yu, Chenlong Zhang, Chi Zhang, Hanning Zhang, Hanwen Zhang, Junge Zhang, Kunpeng Zhang, Song Zhang, Wenjin Zhang, Wenshuo Zhang, Ying Zhang, Yizhi Zhang, Brian Zhao, Qijian Zhao, Yimin Zhao, Yuhaohua Zheng, Liwei Zhou, Tianyue Zhou, Sichen Zhu, Siqi Zhu, Yan Zhu, Yishu Zhu, Jierui Zuo, Chonghao Cai, Helena Casademunt, Wenjia Chen, Benjamin Cheng, Nawen Deng, Rao Fu, Tianfu Fu, Yifan Han, Ren He, Zhenyu He, Qiao Jin, Lang Lang, Yuetai Li, Sylvia Liu, Lu Lu, Qing Lu, Subhabrata Mukherjee, Yunqi Ouyang, Yin Ren, Dawei Shi, Haoran Wu, Zhiyue Wu, Hannah Yao, Zhuoran Yi, Jenny Yu, Rhea Zhan, Hang Zhou, Blake Zhu, Junfan Zhu, Alan Yuille, Yang Liu, Russell Alan Poldrack, Jiachen Li, Zhenglu Li, Molei Tao, Jing Huang, Wenqi Shi, Costas Spanos, Lichao Sun, Chenguang Wang, Orson Xu, Zhen Dong, Hector Gomez, Aylin Caliskan, Ali Emami, Haimin Hu, Zhi Li, Lihui Liu, Murphy Niu, Yi Shao, Jianxin Sun, Mikko Tolonen, Ting Wang, Sanjiv Das, Yanjun Gao, Wenbo Guo, Erika J Schneider, Zhiyong Lu, Mark Mueller, Radha Poovendran, Somayeh Sojoudi, Dawn Song

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous entraînez un robot chef depuis des années. Vous l'avez testé sur des quiz de recettes, vous lui avez demandé de nommer des ingrédients et même de suivre des instructions simples comme « hacher l'oignon ». Lors de ces tests, le robot obtient des scores parfaits. Il semble être un génie culinaire.

Mais ensuite, vous lui demandez de cuisiner un dîner complet et complexe pour un restaurant très fréquenté pendant l'heure de pointe. Soudain, le robot brûle la sauce, oublie les commandes ou s'embrouille avec la cuisinière. Il s'avère que savoir parler de cuisine n'est pas la même chose que savoir faire le travail.

C'est exactement le problème que l'article « Agents' Last Exam » (ALE) tente de résoudre.

Le Problème : Le piège du « Quiz »

Pendant longtemps, les chercheurs en IA ont testé leurs agents d'IA (des programmes informatiques intelligents) sur des benchmarks qui sont comme des questionnaires à choix multiples. Ces tests sont excellents pour mesurer ce qu'une IA sait, mais ils ne mesurent pas ce qu'une IA peut faire dans le monde réel.

Les auteurs soutiennent que le fait qu'une IA puisse réussir un test de mathématiques ou un quiz de codage ne signifie pas qu'elle peut réellement gérer une entreprise, concevoir un pont ou gérer le planning d'un hôpital. L'écart entre « réussir le test » et « générer des revenus » est immense.

La Solution : Le « Dernier Examen »

Pour corrifier cela, l'équipe a créé l'ALE (Agents' Last Exam). Voyez cela non pas comme un quiz, mais comme un véritable entretien d'embauche dans le monde réel pour l'IA.

Au lieu de demander : « Quelle est la capitale de la France ? » ou « Écrivez une boucle Python », l'ALE soumet l'IA à un projet réel, complexe et s'étalant sur plusieurs jours, qu'un professionnel humain accomplirait réellement.

  • Les Tâches : L'examen couvre 55 domaines professionnels différents (comme l'ingénierie, la médecine, la finance et le design de jeux vidéo).
  • La Difficulté : Les tâches sont à « long horizon », ce qui signifie qu'elles prennent des heures ou des jours pour être achevées. Elles exigent que l'IA ouvre différents logiciels, clique sur des boutons, écrive du code, vérifie des fichiers et corrige ses propres erreurs, tout comme un employé humain.
  • La Source : Ce ne sont pas des tâches fictives inventées par des chercheurs. Ce sont de vrais projets que plus de 250 experts du secteur ont réellement accomplis dans leur travail. Les experts ont soumis leurs travaux passés, et l'équipe les a transformés en tests.

Comment fonctionne l'examen

Imaginez l'IA assise devant un ordinateur dans un bureau virtuel.

  1. L'Assignation : L'IA reçoit une tâche réelle, comme « Concevoir un moule pour une pièce de voiture » ou « Analyser ces radiographies médicales ».
  2. Les Outils : L'IA doit utiliser de vrais logiciels (comme des outils de modélisation 3D, des feuilles de calcul financières ou des logiciels d'imagerie médicale) tout comme un humain le ferait. Elle doit cliquer sur des menus, taper des commandes et gérer des fichiers.
  3. La Notation : C'est la partie ingénieuse. L'examen ne repose pas sur un professeur humain qui regarderait le résultat en disant : « Ça a l'air bien ! ». Ce serait trop lent et subjectif. Au lieu de cela, l'examen utilise des vérificateurs automatisés.
    • Si la tâche consistait à construire un modèle 3D, l'ordinateur vérifie si les dimensions sont exactement correctes.
    • Si la tâche consistait à rédiger un rapport financier, l'ordinateur vérifie si les chiffres concordent.
    • Si l'IA échoue à une « étape charnière » (comme commettre une erreur qui briserait une machine), elle reçoit immédiatement un zéro, peu importe la beauté du reste du travail.

Les Résultats : L'IA est encore à l'école

L'article a testé les agents d'IA les plus intelligents du monde sur cet examen. Les résultats sont sans appel :

  • Le niveau « Facile » : Même les meilleurs agents d'IA n'ont réussi qu'environ 30 % des tâches considérées comme « à court terme » (les plus faciles).
  • Le niveau « Difficile » : Sur les tâches les plus complexes (le niveau « Last Exam »), le taux de réussite était de 0 %. L'IA était incapable de les réaliser.
  • L'Écart : Une IA qui obtient 82 % à un test de codage standard (Terminal-Bench) n'obtient qu'environ 25 % sur cet examen du monde réel.

Les auteurs appellent cela le « Dernier Examen » car il représente l'ultime obstacle. Si une IA peut réussir cela, cela signifie qu'elle est prête à effectuer réellement le travail et à remplacer un travailleur humain. Pour l'instant, l'article indique que l'IA est encore loin de réussir.

Pourquoi c'est important

L'article ne porte pas seulement sur la création d'un test plus difficile ; il s'agit de changer l'objectif.

  • Objectif Actuel : Faire en sorte que l'IA obtienne 100 % aux quiz.
  • Nouvel Objectif : Faire en sorte que l'IA obtienne 100 % sur de vrais emplois qui génèrent de la valeur économique (PIB).

Les auteurs pensent qu'en se concentrant sur ces tâches réelles et vérifiables, nous arrêterons de construire des IA qui sont simplement douées pour parler et commencerons à construire des IA qui sont douées pour travailler. Tant que l'IA ne peut pas réussir ce « Dernier Examen », elle n'est pas prête pour la vie active.

Analogie de Synthèse

Considérez les benchmarks actuels de l'IA comme des examens théoriques du permis de conduire. Vous pouvez mémoriser toutes les règles de la route et obtenir un score parfait. Mais l'ALE est l'examen pratique où vous devez réellement conduire une voiture dans un trafic dense, faire un créneau et naviguer dans une zone de travaux sans rien percuter.

L'article dit : « Nos conducteurs d'IA sont excellents pour l'examen théorique, mais ils font encore des accidents lors de l'examen pratique. Arrêtons de célébrer les scores théoriques et commençons à leur apprendre à conduire. »

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →