Humanity's Last Exam
Pour remédier à la saturation des benchmarks actuels où les grands modèles de langage atteignent plus de 90 % de précision, les auteurs introduisent Humanity's Last Exam (HLE), un benchmark multimodal développé à l'échelle mondiale comprenant 2 500 questions de niveau expert à travers diverses disciplines, qui révèle d'importantes lacunes de capacités dans les modèles de pointe et qui est publié publiquement pour guider la recherche et les politiques futures.
Auteurs originaux : Long Phan, Alice Gatti, Ziwen Han, Nathaniel Li, Josephina Hu, Hugh Zhang, Chen Bo Calvin Zhang, Mohamed Shaaban, John Ling, Sean Shi, Michael Choi, Anish Agrawal, Arnav Chopra, Adam Khoja, Ryan Kim, Richard Ren, Jason Hausenloy, Oliver Zhang, Mantas Mazeika, Dmitry Dodonov, Tung Nguyen, Jaeho Lee, Daron Anderson, Mikhail Doroshenko, Alun Cennyth Stokes, Mobeen Mahmood, Oleksandr Pokutnyi, Oleg Iskra, Jessica P. Wang, John-Clark Levin, Mstyslav Kazakov, Fiona Feng, Steven Y. Feng, Haoran Zhao, Michael Yu, Varun Gangal, Chelsea Zou, Zihan Wang, Serguei Popov, Robert Gerbicz, Geoff Galgon, Johannes Schmitt, Will Yeadon, Yongki Lee, Scott Sauers, Alvaro Sanchez, Fabian Giska, Marc Roth, Søren Riis, Saiteja Utpala, Noah Burns, Gashaw M. Goshu, Mohinder Maheshbhai Naiya, Chidozie Agu, Zachary Giboney, Antrell Cheatom, Francesco Fournier-Facio, Sarah-Jane Crowson, Lennart Finke, Zerui Cheng, Jennifer Zampese, Ryan G. Hoerr, Mark Nandor, Hyunwoo Park, Tim Gehrunger, Jiaqi Cai, Ben McCarty, Alexis C Garretson, Edwin Taylor, Damien Sileo, Qiuyu Ren, Usman Qazi, Lianghui Li, Jungbae Nam, John B. Wydallis, Pavel Arkhipov, Jack Wei Lun Shi, Aras Bacho, Chris G. Willcocks, Hangrui Cao, Sumeet Motwani, Emily de Oliveira Santos, Johannes Veith, Edward Vendrow, Doru Cojoc, Kengo Zenitani, Joshua Robinson, Longke Tang, Yuqi Li, Joshua Vendrow, Natanael Wildner Fraga, Vladyslav Kuchkin, Andrey Pupasov Maksimov, Pierre Marion, Denis Efremov, Jayson Lynch, Kaiqu Liang, Aleksandar Mikov, Andrew Gritsevskiy, Julien Guillod, Gözdenur Demir, Dakotah Martinez, Ben Pageler, Kevin Zhou, Saeed Soori, Ori Press, Henry Tang, Paolo Rissone, Sean R. Green, Lina Brüssel, Moon Twayana, Aymeric Dieuleveut, Joseph Marvin Imperial, Ameya Prabhu, Jinzhou Yang, Nick Crispino, Arun Rao, Dimitri Zvonkine, Gabriel Loiseau, Mikhail Kalinin, Marco Lukas, Ciprian Manolescu, Nate Stambaugh, Subrata Mishra, Tad Hogg, Carlo Bosio, Brian P Coppola, Julian Salazar, Jaehyeok Jin, Rafael Sayous, Stefan Ivanov, Philippe Schwaller, Shaipranesh Senthilkuma, Andres M Bran, Andres Algaba, Kelsey Van den Houte, Lynn Van Der Sypt, Brecht Verbeken, David Noever, Alexei Kopylov, Benjamin Myklebust, Bikun Li, Lisa Schut, Evgenii Zheltonozhskii, Qiaochu Yuan, Derek Lim, Richard Stanley, Tong Yang, John Maar, Julian Wykowski, Martí Oller, Anmol Sahu, Cesare Giulio Ardito, Yuzheng Hu, Ariel Ghislain Kemogne Kamdoum, Alvin Jin, Tobias Garcia Vilchis, Yuexuan Zu, Martin Lackner, James Koppel, Gongbo Sun, Daniil S. Antonenko, Steffi Chern, Bingchen Zhao, Pierrot Arsene, Joseph M Cavanagh, Daofeng Li, Jiawei Shen, Donato Crisostomi, Wenjin Zhang, Ali Dehghan, Sergey Ivanov, David Perrella, Nurdin Kaparov, Allen Zang, Ilia Sucholutsky, Arina Kharlamova, Daniil Orel, Vladislav Poritski, Shalev Ben-David, Zachary Berger, Parker Whitfill, Michael Foster, Daniel Munro, Linh Ho, Shankar Sivarajan, Dan Bar Hava, Aleksey Kuchkin, David Holmes, Alexandra Rodriguez-Romero, Frank Sommerhage, Anji Zhang, Richard Moat, Keith Schneider, Zakayo Kazibwe, Don Clarke, Dae Hyun Kim, Felipe Meneguitti Dias, Sara Fish, Veit Elser, Tobias Kreiman, Victor Efren Guadarrama Vilchis, Immo Klose, Ujjwala Anantheswaran, Adam Zweiger, Kaivalya Rawal, Jeffery Li, Jeremy Nguyen, Nicolas Daans, Haline Heidinger, Maksim Radionov, Václav Rozhoň, Vincent Ginis, Christian Stump, Niv Cohen, Rafał Poświata, Josef Tkadlec, Alan Goldfarb, Chenguang Wang, Piotr Padlewski, Stanislaw Barzowski, Kyle Montgomery, Ryan Stendall, Jamie Tucker-Foltz, Jack Stade, T. Ryan Rogers, Tom Goertzen, Declan Grabb, Abhishek Shukla, Alan Givré, John Arnold Ambay, Archan Sen, Muhammad Fayez Aziz, Mark H Inlow, Hao He, Ling Zhang, Younesse Kaddar, Ivar Ängquist, Yanxu Chen, Harrison K Wang, Kalyan Ramakrishnan, Elliott Thornley, Antonio Terpin, Hailey Schoelkopf, Eric Zheng, Avishy Carmi, Ethan D. L. Brown, Kelin Zhu, Max Bartolo, Richard Wheeler, Martin Stehberger, Peter Bradshaw, JP Heimonen, Kaustubh Sridhar, Ido Akov, Jennifer Sandlin, Yury Makarychev, Joanna Tam, Hieu Hoang, David M. Cunningham, Vladimir Goryachev, Demosthenes Patramanis, Michael Krause, Andrew Redenti, David Aldous, Jesyin Lai, Shannon Coleman, Jiangnan Xu, Sangwon Lee, Ilias Magoulas, Sandy Zhao, Ning Tang, Michael K. Cohen, Orr Paradise, Jan Hendrik Kirchner, Maksym Ovchynnikov, Jason O. Matos, Adithya Shenoy, Michael Wang, Yuzhou Nie, Anna Sztyber-Betley, Paolo Faraboschi, Robin Riblet, Jonathan Crozier, Shiv Halasyamani, Shreyas Verma, Prashant Joshi, Eli Meril, Ziqiao Ma, Jérémy Andréoletti, Raghav Singhal, Jacob Platnick, Volodymyr Nevirkovets, Luke Basler, Alexander Ivanov, Seri Khoury, Nils Gustafsson, Marco Piccardo, Hamid Mostaghimi, Qijia Chen, Virendra Singh, Tran Quoc Khánh, Paul Rosu, Hannah Szlyk, Zachary Brown, Himanshu Narayan, Aline Menezes, Jonathan Roberts, William Alley, Kunyang Sun, Arkil Patel, Max Lamparth, Anka Reuel, Linwei Xin, Hanmeng Xu, Jacob Loader, Freddie Martin, Zixuan Wang, Andrea Achilleos, Thomas Preu, Tomek Korbak, Ida Bosio, Fereshteh Kazemi, Ziye Chen, Biró Bálint, Eve J. Y. Lo, Jiaqi Wang, Maria Inês S. Nunes, Jeremiah Milbauer, M Saiful Bari, Zihao Wang, Behzad Ansarinejad, Yewen Sun, Stephane Durand, Hossam Elgnainy, Guillaume Douville, Daniel Tordera, George Balabanian, Hew Wolff, Lynna Kvistad, Hsiaoyun Milliron, Ahmad Sakor, Murat Eron, Andrew Favre D. O., Shailesh Shah, Xiaoxiang Zhou, Firuz Kamalov, Sherwin Abdoli, Tim Santens, Shaul Barkan, Allison Tee, Robin Zhang, Alessandro Tomasiello, G. Bruno De Luca, Shi-Zhuo Looi, Vinh-Kha Le, Noam Kolt, Jiayi Pan, Emma Rodman, Jacob Drori, Carl J Fossum, Niklas Muennighoff, Milind Jagota, Ronak Pradeep, Honglu Fan, Jonathan Eicher, Michael Chen, Kushal Thaman, William Merrill, Moritz Firsching, Carter Harris, Stefan Ciobâcă, Jason Gross, Rohan Pandey, Ilya Gusev, Adam Jones, Shashank Agnihotri, Pavel Zhelnov, Mohammadreza Mofayezi, Alexander Piperski, David K. Zhang, Kostiantyn Dobarskyi, Roman Leventov, Ignat Soroko, Joshua Duersch, Vage Taamazyan, Andrew Ho, Wenjie Ma, William Held, Ruicheng Xian, Armel Randy Zebaze, Mohanad Mohamed, Julian Noah Leser, Michelle X Yuan, Laila Yacar, Johannes Lengler, Katarzyna Olszewska, Claudio Di Fratta, Edson Oliveira, Joseph W. Jackson, Andy Zou, Muthu Chidambaram, Timothy Manik, Hector Haffenden, Dashiell Stander, Ali Dasouqi, Alexander Shen, Bita Golshani, David Stap, Egor Kretov, Mikalai Uzhou, Alina Borisovna Zhidkovskaya, Nick Winter, Miguel Orbegozo Rodriguez, Robert Lauff, Dustin Wehr, Colin Tang, Zaki Hossain, Shaun Phillips, Fortuna Samuele, Fredrik Ekström, Angela Hammon, Oam Patel, Faraz Farhidi, George Medley, Forough Mohammadzadeh, Madellene Peñaflor, Haile Kassahun, Alena Friedrich, Rayner Hernandez Perez, Daniel Pyda, Taom Sakal, Omkar Dhamane, Ali Khajegili Mirabadi, Eric Hallman, Kenchi Okutsu, Mike Battaglia, Mohammad Maghsoudimehrabani, Alon Amit, Dave Hulbert, Roberto Pereira, Simon Weber, Handoko, Anton Peristyy, Stephen Malina, Mustafa Mehkary, Rami Aly, Frank Reidegeld, Anna-Katharina Dick, Cary Friday, Mukhwinder Singh, Hassan Shapourian, Wanyoung Kim, Mariana Costa, Hubeyb Gurdogan, Harsh Kumar, Chiara Ceconello, Chao Zhuang, Haon Park, Micah Carroll, Andrew R. Tawfeek, Stefan Steinerberger, Daattavya Aggarwal, Michael Kirchhof, Linjie Dai, Evan Kim, Johan Ferret, Jainam Shah, Yuzhou Wang, Minghao Yan, Krzysztof Burdzy, Lixin Zhang, Antonio Franca, Diana T. Pham, Kang Yong Loh, Joshua Robinson, Abram Jackson, Paolo Giordano, Philipp Petersen, Adrian Cosma, Jesus Colino, Colin White, Jacob Votava, Vladimir Vinnikov, Ethan Delaney, Petr Spelda, Vit Stritecky, Syed M. Shahid, Jean-Christophe Mourrat, Lavr Vetoshkin, Koen Sponselee, Renas Bacho, Zheng-Xin Yong, Florencia de la Rosa, Nathan Cho, Xiuyu Li, Guillaume Malod, Orion Weller, Guglielmo Albani, Leon Lang, Julien Laurendeau, Dmitry Kazakov, Fatimah Adesanya, Julien Portier, Lawrence Hollom, Victor Souza, Yuchen Anna Zhou, Julien Degorre, Yiğit Yalın, Gbenga Daniel Obikoya, Rai, Filippo Bigi, M. C. Boscá, Oleg Shumar, Kaniuar Bacho, Gabriel Recchia, Mara Popescu, Nikita Shulga, Ngefor Mildred Tanwie, Thomas C. H. Lux, Ben Rank, Colin Ni, Matthew Brooks, Alesia Yakimchyk, Huanxu, Liu, Stefano Cavalleri, Olle Häggström, Emil Verkama, Joshua Newbould, Hans Gundlach, Leonor Brito-Santana, Brian Amaro, Vivek Vajipey, Rynaa Grover, Ting Wang, Yosi Kratish, Wen-Ding Li, Sivakanth Gopi, Andrea Caciolai, Christian Schroeder de Witt, Pablo Hernández-Cámara, Emanuele RodolÃ, Jules Robins, Dominic Williamson, Vincent Cheng, Brad Raynor, Hao Qi, Ben Segev, Jingxuan Fan, Sarah Martinson, Erik Y. Wang, Kaylie Hausknecht, Michael P. Brenner, Mao Mao, Christoph Demian, Peyman Kassani, Xinyu Zhang, David Avagian, Eshawn Jessica Scipio, Alon Ragoler, Justin Tan, Blake Sims, Rebeka Plecnik, Aaron Kirtland, Omer Faruk Bodur, D. P. Shinde, Yan Carlos Leyva Labrador, Zahra Adoul, Mohamed Zekry, Ali Karakoc, Tania C. B. Santos, Samir Shamseldeen, Loukmane Karim, Anna Liakhovitskaia, Nate Resman, Nicholas Farina, Juan Carlos Gonzalez, Gabe Maayan, Earth Anderson, Rodrigo De Oliveira Pena, Elizabeth Kelley, Hodjat Mariji, Rasoul Pouriamanesh, Wentao Wu, Ross Finocchio, Ismail Alarab, Joshua Cole, Danyelle Ferreira, Bryan Johnson, Mohammad Safdari, Liangti Dai, Siriphan Arthornthurasuk, Isaac C. McAlister, Alejandro José Moyano, Alexey Pronin, Jing Fan, Angel Ramirez-Trinidad, Yana Malysheva, Daphiny Pottmaier, Omid Taheri, Stanley Stepanic, Samuel Perry, Luke Askew, Raúl Adrián Huerta Rodríguez, Ali M. R. Minissi, Ricardo Lorena, Krishnamurthy Iyer, Arshad Anil Fasiludeen, Ronald Clark, Josh Ducey, Matheus Piza, Maja Somrak, Eric Vergo, Juehang Qin, Benjámin Borbás, Eric Chu, Jack Lindsey, Antoine Jallon, I. M. J. McInnis, Evan Chen, Avi Semler, Luk Gloor, Tej Shah, Marc Carauleanu, Pascal Lauer, Tran Đuc Huy, Hossein Shahrtash, Emilien Duc, Lukas Lewark, Assaf Brown, Samuel Albanie, Brian Weber, Warren S. Vaz, Pierre Clavier, Yiyang Fan, Gabriel Poesia Reis e Silva, Long, Lian, Marcus Abramovitch, Xi Jiang, Sandra Mendoza, Murat Islam, Juan Gonzalez, Vasilios Mavroudis, Justin Xu, Pawan Kumar, Laxman Prasad Goswami, Daniel Bugas, Nasser Heydari, Ferenc Jeanplong, Thorben Jansen, Antonella Pinto, Archimedes Apronti, Abdallah Galal, Ng Ze-An, Ankit Singh, Tong Jiang, Joan of Arc Xavier, Kanu Priya Agarwal, Mohammed Berkani, Gang Zhang, Zhehang Du, Benedito Alves de Oliveira Junior, Dmitry Malishev, Nicolas Remy, Taylor D. Hartman, Tim Tarver, Stephen Mensah, Gautier Abou Loume, Wiktor Morak, Farzad Habibi, Sarah Hoback, Will Cai, Javier Gimenez, Roselynn Grace Montecillo, Jakub Łucki, Russell Campbell, Asankhaya Sharma, Khalida Meer, Shreen Gul, Daniel Espinosa Gonzalez, Xavier Alapont, Alex Hoover, Gunjan Chhablani, Freddie Vargus, Arunim Agarwal, Yibo Jiang, Deepakkumar Patil, David Outevsky, Kevin Joseph Scaria, Rajat Maheshwari, Abdelkader Dendane, Priti Shukla, Ashley Cartwright, Sergei Bogdanov, Niels Mündler, Sören Möller, Luca Arnaboldi, Kunvar Thaman, Muhammad Rehan Siddiqi, Prajvi Saxena, Himanshu Gupta, Tony Fruhauff, Glen Sherman, Mátyás Vincze, Siranut Usawasutsakorn, Dylan Ler, Anil Radhakrishnan, Innocent Enyekwe, Sk Md Salauddin, Jiang Muzhen, Aleksandr Maksapetyan, Vivien Rossbach, Chris Harjadi, Mohsen Bahaloohoreh, Claire Sparrow, Jasdeep Sidhu, Sam Ali, Song Bian, John Lai, Eric Singer, Justine Leon Uro, Greg Bateman, Mohamed Sayed, Ahmed Menshawy, Darling Duclosel, Dario Bezzi, Yashaswini Jain, Ashley Aaron, Murat Tiryakioglu, Sheeshram Siddh, Keith Krenek, Imad Ali Shah, Jun Jin, Scott Creighton, Denis Peskoff, Zienab EL-Wasif, Ragavendran P, Michael Richmond, Joseph McGowan, Tejal Patwardhan, Hao-Yu Sun, Ting Sun, Nikola Zubić, Samuele Sala, Stephen Ebert, Jean Kaddour, Manuel Schottdorf, Dianzhuo Wang, Gerol Petruzella, Alex Meiburg, Tilen Medved, Ali ElSheikh, S Ashwin Hebbar, Lorenzo Vaquero, Xianjun Yang, Jason Poulos, Vilém Zouhar, Sergey Bogdanik, Mingfang Zhang, Jorge Sanz-Ros, David Anugraha, Yinwei Dai, Anh N. Nhu, Xue Wang, Ali Anil Demircali, Zhibai Jia, Yuyin Zhou, Juncheng Wu, Mike He, Nitin Chandok, Aarush Sinha, Gaoxiang Luo, Long Le, Mickaël Noyé, Michał Perełkiewicz, Ioannis Pantidis, Tianbo Qi, Soham Sachin Purohit, Letitia Parcalabescu, Thai-Hoa Nguyen, Genta Indra Winata, Edoardo M. Ponti, Hanchen Li, Kaustubh Dhole, Jongee Park, Dario Abbondanza, Yuanli Wang, Anupam Nayak, Diogo M. Caetano, Antonio A. W. L. Wong, Maria del Rio-Chanona, Dániel Kondor, Pieter Francois, Ed Chalstrey, Jakob Zsambok, Dan Hoyer, Jenny Reddish, Jakob Hauser, Francisco-Javier Rodrigo-Ginés, Suchandra Datta, Maxwell Shepherd, Thom Kamphuis, Qizheng Zhang, Hyunjun Kim, Ruiji Sun, Jianzhu Yao, Franck Dernoncourt, Satyapriya Krishna, Sina Rismanchian, Bonan Pu, Francesco Pinto, Yingheng Wang, Kumar Shridhar, Kalon J. Overholt, Glib Briia, Hieu Nguyen, David, Soler Bartomeu, Tony CY Pang, Adam Wecker, Yifan Xiong, Fanfei Li, Lukas S. Huber, Joshua Jaeger, Romano De Maddalena, Xing Han Lù, Yuhui Zhang, Claas Beger, Patrick Tser Jern Kon, Sean Li, Vivek Sanker, Ming Yin, Yihao Liang, Xinlu Zhang, Ankit Agrawal, Li S. Yifei, Zechen Zhang, Mu Cai, Yasin Sonmez, Costin Cozianu, Changhao Li, Alex Slen, Shoubin Yu, Hyun Kyu Park, Gabriele Sarti, Marcin Briański, Alessandro Stolfo, Truong An Nguyen, Mike Zhang, Yotam Perlitz, Jose Hernandez-Orallo, Runjia Li, Amin Shabani, Felix Juefei-Xu, Shikhar Dhingra, Orr Zohar, My Chiffon Nguyen, Alexander Pondaven, Abdurrahim Yilmaz, Xuandong Zhao, Chuanyang Jin, Muyan Jiang, Stefan Todoran, Xinyao Han, Jules Kreuer, Brian Rabern, Anna Plassart, Martino Maggetti, Luther Yap, Robert Geirhos, Jonathon Kean, Dingsu Wang, Sina Mollaei, Chenkai Sun, Yifan Yin, Shiqi Wang, Rui Li, Yaowen Chang, Anjiang Wei, Alice Bizeul, Xiaohan Wang, Alexandre Oliveira Arrais, Kushin Mukherjee, Jorge Chamorro-Padial, Jiachen Liu, Xingyu Qu, Junyi Guan, Adam Bouyamourn, Shuyu Wu, Martyna Plomecka, Junda Chen, Mengze Tang, Jiaqi Deng, Shreyas Subramanian, Haocheng Xi, Haoxuan Chen, Weizhi Zhang, Yinuo Ren, Haoqin Tu, Sejong Kim, Yushun Chen, Sara Vera Marjanović, Junwoo Ha, Grzegorz Luczyna, Jeff J. Ma, Zewen Shen, Dawn Song, Cedegao E. Zhang, Zhun Wang, Gaël Gendron, Yunze Xiao, Leo Smucker, Erica Weng, Kwok Hao Lee, Zhe Ye, Stefano Ermon, Ignacio D. Lopez-Miguel, Theo Knights, Anthony Gitter, Namkyu Park, Boyi Wei, Hongzheng Chen, Kunal Pai, Ahmed Elkhanany, Han Lin, Philipp D. Siedler, Jichao Fang, Ritwik Mishra, Károly Zsolnai-Fehér, Xilin Jiang, Shadab Khan, Jun Yuan, Rishab Kumar Jain, Xi Lin, Mike Peterson, Zhe Wang, Aditya Malusare, Maosen Tang, Isha Gupta, Ivan Fosin, Timothy Kang, Barbara Dworakowska, Kazuki Matsumoto, Guangyao Zheng, Gerben Sewuster, Jorge Pretel Villanueva, Ivan Rannev, Igor Chernyavsky, Jiale Chen, Deepayan Banik, Ben Racz, Wenchao Dong, Jianxin Wang, Laila Bashmal, Duarte V. Gonçalves, Wei Hu, Kaushik Bar, Ondrej Bohdal, Atharv Singh Patlan, Shehzaad Dhuliawala, Caroline Geirhos, Julien Wist, Yuval Kansal, Bingsen Chen, Kutay Tire, Atak Talay Yücel, Brandon Christof, Veerupaksh Singla, Zijian Song, Sanxing Chen, Jiaxin Ge, Kaustubh Ponkshe, Isaac Park, Tianneng Shi, Martin Q. Ma, Joshua Mak, Sherwin Lai, Antoine Moulin, Zhuo Cheng, Zhanda Zhu, Ziyi Zhang, Vaidehi Patil, Ketan Jha, Qiutong Men, Jiaxuan Wu, Tianchi Zhang, Bruno Hebling Vieira, Alham Fikri Aji, Jae-Won Chung, Mohammed Mahfoud, Ha Thi Hoang, Marc Sperzel, Wei Hao, Kristof Meding, Sihan Xu, Vassilis Kostakos, Davide Manini, Yueying Liu, Christopher Toukmaji, Jay Paek, Eunmi Yu, Arif Engin Demircali, Zhiyi Sun, Ivan Dewerpe, Hongsen Qin, Roman Pflugfelder, James Bailey, Johnathan Morris, Ville Heilala, Sybille Rosset, Zishun Yu, Peter E. Chen, Woongyeong Yeo, Eeshaan Jain, Ryan Yang, Sreekar Chigurupati, Julia Chernyavsky, Sai Prajwal Reddy, Subhashini Venugopalan, Hunar Batra, Core Francisco Park, Hieu Tran, Guilherme Maximiano, Genghan Zhang, Yizhuo Liang, Hu Shiyu, Rongwu Xu, Rui Pan, Siddharth Suresh, Ziqi Liu, Samaksh Gulati, Songyang Zhang, Peter Turchin, Christopher W. Bartlett, Christopher R. Scotese, Phuong M. Cao, Ben Wu, Jacek Karwowski, Davide Scaramuzza, Aakaash Nattanmai, Gordon McKellips, Anish Cheraku, Asim Suhail, Ethan Luo, Marvin Deng, Jason Luo, Ashley Zhang, Kavin Jindel, Jay Paek, Kasper Halevy, Allen Baranov, Michael Liu, Advaith Avadhanam, David Zhang, Vincent Cheng, Brad Ma, Evan Fu, Liam Do, Joshua Lass, Hubert Yang, Surya Sunkari, Vishruth Bharath, Violet Ai, James Leung, Rishit Agrawal, Alan Zhou, Kevin Chen, Tejas Kalpathi, Ziqi Xu, Gavin Wang, Tyler Xiao, Erik Maung, Sam Lee, Ryan Yang, Roy Yue, Ben Zhao, Julia Yoon, Sunny Sun, Aryan Singh, Ethan Luo, Clark Peng, Tyler Osbey, Taozhi Wang, Daryl Echeazu, Hubert Yang, Timothy Wu, Spandan Patel, Vidhi Kulkarni, Vijaykaarti Sundarapandiyan, Ashley Zhang, Andrew Le, Zafir Nasim, Srikar Yalam, Ritesh Kasamsetty, Soham Samal, Hubert Yang, David Sun, Nihar Shah, Abhijeet Saha, Alex Zhang, Leon Nguyen, Laasya Nagumalli, Kaixin Wang, Alan Zhou, Aidan Wu, Jason Luo, Anwith Telluri, Steven Dillmann, Zhengxiang Wang, Junyu Luo, Hugo Lunn, Artem Gazizov, Haitz Sáez de Ocáriz Borde, Ivan Trus, Morgan Hervault, Zheyu Zhang, Bo Chen, Yuchen Wu, Christopher J. Cordier, Gün Kaynar, Cansin Ayvaz, Polina Avdiunina, Johannes Brust, Xingjian Diao, K. D. Meaney, Yifan Gu, Chenyu Wang, Chenzhuo Dong, William Wright, Simon Brave, Owen Root, Jiayuan Liu, Chow Chun Lok, Tianqin Li, Shiyi Du, Dailan He, Lufeiya Liu, Sina Jamalzadegan, Anil Ramakrishna, Xuanqing Xu, Xin Qing, Xin Luo, Wenkai Li, Shi Bo, Filipp Gusev, Maximos Skandalis, Desheng Ma, Chunhui Zhang, Haoran Qiu, Allen G Hart, Rickard Brüel Gabrielsson, Ido Akov, Artem Lukoianov, Summer Yue, Alexandr Wang, Dan Hendrycks
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayiez de mesurer la vitesse à laquelle une nouvelle génération de robots super-intelligents apprend. Pendant longtemps, nous les avons testés avec des examens scolaires standards, comme ceux que vous pourriez passer au lycée ou à l'université. Mais voici le problème : ces robots sont devenus si bons qu'ils réussissent maintenant ces tests avec des scores quasi parfaits. C'est comme si vous essayiez de mesurer la vitesse d'une Ferrari en la regardant faire la course contre un vélo ; le test est trop facile, donc les résultats ne nous disent rien d'utile sur les véritables limites de la voiture. Les scientifiques appellent cela la « saturation des benchmarks ». Lorsqu'un test devient trop facile, nous ne pouvons plus dire si les robots deviennent réellement plus intelligents ou s'ils ont simplement mémorisé les réponses. Pour corriger cela, nous avons besoin d'un test qui soit si difficile, si profond et si spécifique que même les humains les plus brillants éprouveraient des difficultés à le résoudre. C'est là qu'intervient le nouvel article, introduisant un défi massif et terrifiant de difficulté, conçu pour être l'ultime test de résistance pour l'intelligence artificielle.
L'article présente Humanity's Last Exam (HLE), une immense collection de 2 500 questions incroyablement difficiles couvrant tout, des mathématiques avancées et de la physique à l'histoire obscure et la biologie. Considérez cela comme les « Jeux Olympiques du Savoir » pour l'IA, mais au lieu de courir ou de sauter, les robots doivent résoudre des problèmes qui nécessitent les connaissances approfondies et spécialisées d'un professeur de doctorat. Les créateurs ne se sont pas contentés de piocher des questions dans un manuel ; ils ont demandé à des centaines de véritables experts — scientifiques, chercheurs et professeurs de plus de 500 institutions à travers le monde — de rédiger de nouvelles questions que les modèles d'IA actuels les plus performants ne pourraient pas résoudre. L'objectif était de créer un examen « à questions fermées », ce qui signifie que chaque question possède une réponse spécifique et correcte (comme un choix multiple ou un nombre court), afin que nous puissions noter les robots équitablement sans avoir à deviner ce qu'ils voulaient dire.
Lorsque les chercheurs ont finalement soumis les modèles d'IA les plus avancés au test, les résultats ont été un choc. Malgré le fait qu'ils soient les ordinateurs les plus intelligents de la planète, ces modèles ont obtenu des scores médiocres. La meilleure IA a réussi à répondre correctement à seulement environ 13,4 % des questions, tandis que d'autres ont obtenu des scores aussi bas que 2,7 %. Pour mettre cela en perspective, si vous passiez cet examen, obtenir 13 % de bonnes réponses serait une note éliminatoire, mais pour ces machines super-intelligentes, c'était en réalité le score le plus élevé jamais atteint. L'article suggère qu'il existe encore un fossé massif entre ce que l'IA peut faire aujourd'hui et le niveau de raisonnement humain profond et expert requis pour résoudre ces problèmes.
Plus intéressant encore est la façon dont les robots se sont comportés lorsqu'ils étaient bloqués. Au lieu de dire : « Je ne sais pas », les modèles ont répondu avec assurance une mauvaise réponse. Les chercheurs ont constaté que la confiance de l'IA était totalement décalée par rapport à sa capacité réelle ; elles « hallucinaient » avec une grande confiance. L'article a mesuré cette « erreur de calibration » et a constaté qu'elle était incroyablement élevée, dépassant souvent les 80 %. C'est comme un étudiant qui est sûr à 100 % d'avoir écrit « chat » comme « ch-a-t » et qui se trompe, puis insiste sur le fait qu'il a raison. Cela suggère que, bien que l'IA s'améliore dans beaucoup de domaines, elle manque encore d'une véritable compréhension de ses propres limites et peut être dangereusement trop confiante face à des défis complexes et inconnus.
L'article souligne également que ces questions ont été conçues pour qu'il soit impossible de tricher. Vous ne pouviez pas simplement chercher la réponse sur Google ou la trouver dans une base de données, car les questions étaient originales, exigeant souvent une synthèse de connaissances spécifiques et de niche qui n'existent pas sur l'internet ouvert. Pour garantir que les questions soient réellement difficiles, l'équipe a effectué un « contrôle de difficulté » en testant chaque question contre les meilleurs modèles d'IA d'abord. Si une IA pouvait la résoudre, la question était rejetée. Ils ont enregistré plus de 70 000 tentatives par l'IA avant de trouver les 13 000 questions qui ont dérouté les machines, lesquelles ont ensuite été affinées par des experts humains pour constituer les 2 500 questions finales de l'examen.
En résumé, cet article ne prétend pas que l'IA a atteint un niveau de « super-intelligence » magique. Au contraire, il suggère que nous avons enfin trouvé une règle assez longue pour mesurer tout le chemin qu'il nous reste à parcourir. Les auteurs préviennent que, bien que l'IA progresse rapidement, elle n'est pas encore prête à remplacer les experts humains dans les domaines exigeant un raisonnement profond et vérifié. Ils offrent même une enveloppe de prix de 500 000 $ pour encourager davantage d'experts à écrire ce genre de questions difficiles, garantissant que l'examen devienne de plus en plus dur à mesure que l'IA devient plus intelligente. L'article conclut que, bien que ce puisse être le dernier « examen académique » que nous ayons besoin de donner à l'IA sous sa forme actuelle, il est loin d'être le dernier benchmark dont nous aurons besoin, servant de rappel crucial à la réalité pour les chercheurs et les décideurs politiques.
Résumé Technique : Humanity's Last Exam (HLE)
Énoncé du Problème
Les grands modèles de langage (LLM) ont progressé rapidement, atteignant plus de 90 % de précision sur les benchmarks établis comme le MMLU. Cette saturation limite la capacité à mesurer précisément les capacités des modèles de pointe, particulièrement à la frontière de la connaissance humaine. Les benchmarks existants échouent souvent à distinguer les modèles qui ont simplement mémorisé les données d'entraînement de ceux qui possèdent de véritables compétences de raisonnement de niveau expert. Par conséquent, il existe un besoin critique pour un benchmark académique à questions fermées plus exigeant, capable d'évaluer efficacement l'écart entre les capacités actuelles de l'IA et l'expertise humaine.
Méthodologie
Construction du Jeu de Données
Humanity's Last Exam (HLE) est un benchmark multimodal comprenant 2 500 questions extrêmement difficiles couvrant des dizaines de sujets, incluant les mathématiques, les sciences naturelles, les sciences humaines et l'ingénierie. Le jeu de données a été construit grâce à un effort de collaboration mondiale impliquant près de 1 000 experts thématiques provenant de plus de 500 institutions dans 50 pays.
Le processus de création a suivi un pipeline rigoureux en plusieurs étapes :
- Soumission et Filtrage par LLM : Les questions ont été soumises par des experts et d'abord validées par confrontation avec des LLM de pointe (ex: GPT-4O, Gemini 1.5 Pro, Claude 3.5 Sonnet, O1).
- Les questions à correspondance exacte devaient déjouer tous les modèles testés.
- Les questions à choix multiples devaient déjouer tous les modèles sauf un, afin de tenir compte du hasard.
- Environ 13 000 questions ayant déjoué les LLM ont été transmises pour examen humain.
- Examen par les Experts : Deux cycles d'examen humain ont été menés par des réviseurs titulaires de diplômes de niveau supérieur (Master, Doctorat, JD, etc.) dans leurs domaines respectifs.
- Cycle 1 : Axé sur l'affinement itératif des soumissions pour garantir qu'elles soient à questions fermées, robustes et de haute qualité.
- Cycle 2 : Sélection des meilleures questions pour l'inclusion dans le jeu de données final, garantissant le respect des critères de soumission.
- Contrôle Qualité : Les questions devaient être précises, non ambiguës, solubles et non consultables (résistantes à une simple recherche sur Internet). Elles nécessitaient généralement une expertise de niveau master ou la connaissance de sujets hautement spécifiques. Une cagnotte de 500 000 $ a été établie pour encourager les soumissions de haute qualité.
- Raffinement Post-Publication : Suite à la publication initiale, un programme de bug bounty communautaire et un audit ciblé par des étudiants des meilleures universités américaines ont été menés pour identifier et corriger les erreurs d'étiquetage et les inexactitudes majeures de déclaration. Une version « HLE-Rolling » est prévue pour des mises à jour continues.
Configuration de l'Évaluation
Les auteurs ont évalué les LLM multimodaux de pointe sur HLE en utilisant un système de prompt standardisé qui structure les réponses en « Raisonnement » suivi d'une « Réponse Finale ».
- Métriques : La performance a été mesurée via la Précision (Accuracy) et l'Erreur de Calibration RMS.
- Calibration : Les modèles ont été incités à fournir des scores de confiance (0–100 %) aux côtés de leurs réponses. L'erreur de calibration mesure l'écart entre la confiance déclarée et la précision réelle.
- Jugement : Un juge automatisé (O3-MINI) a été utilisé pour vérifier la correction des réponses par rapport à la vérité terrain, en tenant compte des formats équivalents (ex: décimales vs fractions).
Contributions Clés
- Jeu de Données HLE : La publication d'un benchmark multimodal de 2 500 questions conçu pour être le dernier benchmark académique à questions fermées de son genre, couvrant plus d'une centaine de sujets.
- Processus de Curation Rigoureux : Un pipeline novateur combinant un filtrage automatisé par LLM et un examen humain par étapes pour garantir que les questions sont à la fois difficiles pour les modèles actuels et scientifiquement valides.
- Évaluation Complète : Une analyse détaillée de la performance des modèles de pointe, mettant en évidence non seulement la précision, mais aussi les erreurs de calibration et l'utilisation des tokens.
- Publication Publique : La mise à disposition publique du jeu de données (avec un ensemble réservé privé pour éviter le surapprentissage) sur
lastexam.aiafin de servir de référence commune pour les chercheurs et les décideurs politiques.
Résultats
L'évaluation des modèles de pointe sur HLE révèle des limitations significatives dans les capacités actuelles de l'IA :
- Faible Précision : Tous les modèles testés ont obtenu des scores de précision très bas. Le modèle le plus performant, O3-MINI (High), a atteint 13,4 % de précision. Les autres modèles varient de 2,7 % (GPT-4O) à 8,5 % (DeepSeek-R1).
- Mauvaise Calibration : Les modèles ont présenté des erreurs de calibration RMS élevées, allant de 73 % à 89 %. Cela indique que les modèles fournissent fréquemment des réponses incorrectes avec une grande confiance, échouant à reconnaître quand les questions dépassent leurs capacités.
- Efficacité des Tokens : Les modèles de raisonnement ont nécessité un calcul d'inférence nettement plus important (tokens de complétion) pour obtenir des améliorations marginales de performance par rapport aux modèles sans raisonnement.
- Performance par Domaine : La performance varie selon le domaine, les modèles étant généralement légèrement plus performants en Mathématiques et en Ingénierie qu'en Sciences Humaines, bien que tous les scores restent faibles.
Signification et Revendications
L'article soutient que HLE fournit un outil nécessaire pour suivre les progrès de l'IA à mesure que les modèles approchent de la performance humaine experte.
- Mesurer la Frontière : HLE offre une mesure claire de l'écart entre les LLM actuels et la performance académique de niveau expert sur des questions fermées et vérifiables.
- Informer la Gouvernance : En fournissant des mesures de capacité précises, HLE vise à éclairer les trajectoires de recherche, les évaluations de risques et les politiques de gouvernance.
- Limites : Les auteurs déclarent explicitement qu'une haute performance sur HLE démontrerait des capacités d'expert sur des problèmes académiques structurés, mais ne suggérerait pas à elle seule des capacités de recherche autonome ou une « Intelligence Artificielle Générale » (AGI). HLE teste les connaissances et le raisonnement structurés plutôt que la créativité ou la recherche en accès ouvert.
- Perspectives Futures : Compte tenu du rythme rapide du développement de l'IA, les auteurs reconnaissent que les modèles pourraient dépasser 50 % de précision sur HLE d'ici la fin de 2025, suggérant que si HLE peut être le dernier examen académique nécessaire, il n'est pas le dernier benchmark requis pour l'IA.
L'article conclut que HLE sert de point de référence critique pour la communauté scientifique afin d'évaluer si les systèmes d'IA maîtrisent réellement les frontières du savoir humain ou s'ils exploitent simplement des motifs statistiques dans les données existantes.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.
Recevez les meilleurs articles NLP chaque semaine.
Adopté par des chercheurs de Stanford, Cambridge et de l'Académie des sciences.
Vérifiez votre boîte mail pour confirmer votre inscription.
Quelque chose s'est mal passé. Réessayer ?
Pas de spam, désinscription à tout moment.