Humanity's Last Exam
Om de verzadiging van huidige benchmarks aan te pakken waarbij grote taalmodellen een nauwkeurigheid van meer dan 90% bereiken, introduceren de auteurs Humanity's Last Exam (HLE), een wereldwijd ontwikkelde, multimodale benchmark van 2.500 vragen op expertniveau over diverse onderwerpen die significante capaciteitsverschillen in state-of-the-art modellen onthult en publiekelijk wordt vrijgegeven om toekomstig onderzoek en beleid te begeleiden.
Oorspronkelijke auteurs: Long Phan, Alice Gatti, Ziwen Han, Nathaniel Li, Josephina Hu, Hugh Zhang, Chen Bo Calvin Zhang, Mohamed Shaaban, John Ling, Sean Shi, Michael Choi, Anish Agrawal, Arnav Chopra, Adam Khoja, Ryan Kim, Richard Ren, Jason Hausenloy, Oliver Zhang, Mantas Mazeika, Dmitry Dodonov, Tung Nguyen, Jaeho Lee, Daron Anderson, Mikhail Doroshenko, Alun Cennyth Stokes, Mobeen Mahmood, Oleksandr Pokutnyi, Oleg Iskra, Jessica P. Wang, John-Clark Levin, Mstyslav Kazakov, Fiona Feng, Steven Y. Feng, Haoran Zhao, Michael Yu, Varun Gangal, Chelsea Zou, Zihan Wang, Serguei Popov, Robert Gerbicz, Geoff Galgon, Johannes Schmitt, Will Yeadon, Yongki Lee, Scott Sauers, Alvaro Sanchez, Fabian Giska, Marc Roth, Søren Riis, Saiteja Utpala, Noah Burns, Gashaw M. Goshu, Mohinder Maheshbhai Naiya, Chidozie Agu, Zachary Giboney, Antrell Cheatom, Francesco Fournier-Facio, Sarah-Jane Crowson, Lennart Finke, Zerui Cheng, Jennifer Zampese, Ryan G. Hoerr, Mark Nandor, Hyunwoo Park, Tim Gehrunger, Jiaqi Cai, Ben McCarty, Alexis C Garretson, Edwin Taylor, Damien Sileo, Qiuyu Ren, Usman Qazi, Lianghui Li, Jungbae Nam, John B. Wydallis, Pavel Arkhipov, Jack Wei Lun Shi, Aras Bacho, Chris G. Willcocks, Hangrui Cao, Sumeet Motwani, Emily de Oliveira Santos, Johannes Veith, Edward Vendrow, Doru Cojoc, Kengo Zenitani, Joshua Robinson, Longke Tang, Yuqi Li, Joshua Vendrow, Natanael Wildner Fraga, Vladyslav Kuchkin, Andrey Pupasov Maksimov, Pierre Marion, Denis Efremov, Jayson Lynch, Kaiqu Liang, Aleksandar Mikov, Andrew Gritsevskiy, Julien Guillod, Gözdenur Demir, Dakotah Martinez, Ben Pageler, Kevin Zhou, Saeed Soori, Ori Press, Henry Tang, Paolo Rissone, Sean R. Green, Lina Brüssel, Moon Twayana, Aymeric Dieuleveut, Joseph Marvin Imperial, Ameya Prabhu, Jinzhou Yang, Nick Crispino, Arun Rao, Dimitri Zvonkine, Gabriel Loiseau, Mikhail Kalinin, Marco Lukas, Ciprian Manolescu, Nate Stambaugh, Subrata Mishra, Tad Hogg, Carlo Bosio, Brian P Coppola, Julian Salazar, Jaehyeok Jin, Rafael Sayous, Stefan Ivanov, Philippe Schwaller, Shaipranesh Senthilkuma, Andres M Bran, Andres Algaba, Kelsey Van den Houte, Lynn Van Der Sypt, Brecht Verbeken, David Noever, Alexei Kopylov, Benjamin Myklebust, Bikun Li, Lisa Schut, Evgenii Zheltonozhskii, Qiaochu Yuan, Derek Lim, Richard Stanley, Tong Yang, John Maar, Julian Wykowski, Martí Oller, Anmol Sahu, Cesare Giulio Ardito, Yuzheng Hu, Ariel Ghislain Kemogne Kamdoum, Alvin Jin, Tobias Garcia Vilchis, Yuexuan Zu, Martin Lackner, James Koppel, Gongbo Sun, Daniil S. Antonenko, Steffi Chern, Bingchen Zhao, Pierrot Arsene, Joseph M Cavanagh, Daofeng Li, Jiawei Shen, Donato Crisostomi, Wenjin Zhang, Ali Dehghan, Sergey Ivanov, David Perrella, Nurdin Kaparov, Allen Zang, Ilia Sucholutsky, Arina Kharlamova, Daniil Orel, Vladislav Poritski, Shalev Ben-David, Zachary Berger, Parker Whitfill, Michael Foster, Daniel Munro, Linh Ho, Shankar Sivarajan, Dan Bar Hava, Aleksey Kuchkin, David Holmes, Alexandra Rodriguez-Romero, Frank Sommerhage, Anji Zhang, Richard Moat, Keith Schneider, Zakayo Kazibwe, Don Clarke, Dae Hyun Kim, Felipe Meneguitti Dias, Sara Fish, Veit Elser, Tobias Kreiman, Victor Efren Guadarrama Vilchis, Immo Klose, Ujjwala Anantheswaran, Adam Zweiger, Kaivalya Rawal, Jeffery Li, Jeremy Nguyen, Nicolas Daans, Haline Heidinger, Maksim Radionov, Václav Rozhoň, Vincent Ginis, Christian Stump, Niv Cohen, Rafał Poświata, Josef Tkadlec, Alan Goldfarb, Chenguang Wang, Piotr Padlewski, Stanislaw Barzowski, Kyle Montgomery, Ryan Stendall, Jamie Tucker-Foltz, Jack Stade, T. Ryan Rogers, Tom Goertzen, Declan Grabb, Abhishek Shukla, Alan Givré, John Arnold Ambay, Archan Sen, Muhammad Fayez Aziz, Mark H Inlow, Hao He, Ling Zhang, Younesse Kaddar, Ivar Ängquist, Yanxu Chen, Harrison K Wang, Kalyan Ramakrishnan, Elliott Thornley, Antonio Terpin, Hailey Schoelkopf, Eric Zheng, Avishy Carmi, Ethan D. L. Brown, Kelin Zhu, Max Bartolo, Richard Wheeler, Martin Stehberger, Peter Bradshaw, JP Heimonen, Kaustubh Sridhar, Ido Akov, Jennifer Sandlin, Yury Makarychev, Joanna Tam, Hieu Hoang, David M. Cunningham, Vladimir Goryachev, Demosthenes Patramanis, Michael Krause, Andrew Redenti, David Aldous, Jesyin Lai, Shannon Coleman, Jiangnan Xu, Sangwon Lee, Ilias Magoulas, Sandy Zhao, Ning Tang, Michael K. Cohen, Orr Paradise, Jan Hendrik Kirchner, Maksym Ovchynnikov, Jason O. Matos, Adithya Shenoy, Michael Wang, Yuzhou Nie, Anna Sztyber-Betley, Paolo Faraboschi, Robin Riblet, Jonathan Crozier, Shiv Halasyamani, Shreyas Verma, Prashant Joshi, Eli Meril, Ziqiao Ma, Jérémy Andréoletti, Raghav Singhal, Jacob Platnick, Volodymyr Nevirkovets, Luke Basler, Alexander Ivanov, Seri Khoury, Nils Gustafsson, Marco Piccardo, Hamid Mostaghimi, Qijia Chen, Virendra Singh, Tran Quoc Khánh, Paul Rosu, Hannah Szlyk, Zachary Brown, Himanshu Narayan, Aline Menezes, Jonathan Roberts, William Alley, Kunyang Sun, Arkil Patel, Max Lamparth, Anka Reuel, Linwei Xin, Hanmeng Xu, Jacob Loader, Freddie Martin, Zixuan Wang, Andrea Achilleos, Thomas Preu, Tomek Korbak, Ida Bosio, Fereshteh Kazemi, Ziye Chen, Biró Bálint, Eve J. Y. Lo, Jiaqi Wang, Maria Inês S. Nunes, Jeremiah Milbauer, M Saiful Bari, Zihao Wang, Behzad Ansarinejad, Yewen Sun, Stephane Durand, Hossam Elgnainy, Guillaume Douville, Daniel Tordera, George Balabanian, Hew Wolff, Lynna Kvistad, Hsiaoyun Milliron, Ahmad Sakor, Murat Eron, Andrew Favre D. O., Shailesh Shah, Xiaoxiang Zhou, Firuz Kamalov, Sherwin Abdoli, Tim Santens, Shaul Barkan, Allison Tee, Robin Zhang, Alessandro Tomasiello, G. Bruno De Luca, Shi-Zhuo Looi, Vinh-Kha Le, Noam Kolt, Jiayi Pan, Emma Rodman, Jacob Drori, Carl J Fossum, Niklas Muennighoff, Milind Jagota, Ronak Pradeep, Honglu Fan, Jonathan Eicher, Michael Chen, Kushal Thaman, William Merrill, Moritz Firsching, Carter Harris, Stefan Ciobâcă, Jason Gross, Rohan Pandey, Ilya Gusev, Adam Jones, Shashank Agnihotri, Pavel Zhelnov, Mohammadreza Mofayezi, Alexander Piperski, David K. Zhang, Kostiantyn Dobarskyi, Roman Leventov, Ignat Soroko, Joshua Duersch, Vage Taamazyan, Andrew Ho, Wenjie Ma, William Held, Ruicheng Xian, Armel Randy Zebaze, Mohanad Mohamed, Julian Noah Leser, Michelle X Yuan, Laila Yacar, Johannes Lengler, Katarzyna Olszewska, Claudio Di Fratta, Edson Oliveira, Joseph W. Jackson, Andy Zou, Muthu Chidambaram, Timothy Manik, Hector Haffenden, Dashiell Stander, Ali Dasouqi, Alexander Shen, Bita Golshani, David Stap, Egor Kretov, Mikalai Uzhou, Alina Borisovna Zhidkovskaya, Nick Winter, Miguel Orbegozo Rodriguez, Robert Lauff, Dustin Wehr, Colin Tang, Zaki Hossain, Shaun Phillips, Fortuna Samuele, Fredrik Ekström, Angela Hammon, Oam Patel, Faraz Farhidi, George Medley, Forough Mohammadzadeh, Madellene Peñaflor, Haile Kassahun, Alena Friedrich, Rayner Hernandez Perez, Daniel Pyda, Taom Sakal, Omkar Dhamane, Ali Khajegili Mirabadi, Eric Hallman, Kenchi Okutsu, Mike Battaglia, Mohammad Maghsoudimehrabani, Alon Amit, Dave Hulbert, Roberto Pereira, Simon Weber, Handoko, Anton Peristyy, Stephen Malina, Mustafa Mehkary, Rami Aly, Frank Reidegeld, Anna-Katharina Dick, Cary Friday, Mukhwinder Singh, Hassan Shapourian, Wanyoung Kim, Mariana Costa, Hubeyb Gurdogan, Harsh Kumar, Chiara Ceconello, Chao Zhuang, Haon Park, Micah Carroll, Andrew R. Tawfeek, Stefan Steinerberger, Daattavya Aggarwal, Michael Kirchhof, Linjie Dai, Evan Kim, Johan Ferret, Jainam Shah, Yuzhou Wang, Minghao Yan, Krzysztof Burdzy, Lixin Zhang, Antonio Franca, Diana T. Pham, Kang Yong Loh, Joshua Robinson, Abram Jackson, Paolo Giordano, Philipp Petersen, Adrian Cosma, Jesus Colino, Colin White, Jacob Votava, Vladimir Vinnikov, Ethan Delaney, Petr Spelda, Vit Stritecky, Syed M. Shahid, Jean-Christophe Mourrat, Lavr Vetoshkin, Koen Sponselee, Renas Bacho, Zheng-Xin Yong, Florencia de la Rosa, Nathan Cho, Xiuyu Li, Guillaume Malod, Orion Weller, Guglielmo Albani, Leon Lang, Julien Laurendeau, Dmitry Kazakov, Fatimah Adesanya, Julien Portier, Lawrence Hollom, Victor Souza, Yuchen Anna Zhou, Julien Degorre, Yiğit Yalın, Gbenga Daniel Obikoya, Rai, Filippo Bigi, M. C. Boscá, Oleg Shumar, Kaniuar Bacho, Gabriel Recchia, Mara Popescu, Nikita Shulga, Ngefor Mildred Tanwie, Thomas C. H. Lux, Ben Rank, Colin Ni, Matthew Brooks, Alesia Yakimchyk, Huanxu, Liu, Stefano Cavalleri, Olle Häggström, Emil Verkama, Joshua Newbould, Hans Gundlach, Leonor Brito-Santana, Brian Amaro, Vivek Vajipey, Rynaa Grover, Ting Wang, Yosi Kratish, Wen-Ding Li, Sivakanth Gopi, Andrea Caciolai, Christian Schroeder de Witt, Pablo Hernández-Cámara, Emanuele RodolÃ, Jules Robins, Dominic Williamson, Vincent Cheng, Brad Raynor, Hao Qi, Ben Segev, Jingxuan Fan, Sarah Martinson, Erik Y. Wang, Kaylie Hausknecht, Michael P. Brenner, Mao Mao, Christoph Demian, Peyman Kassani, Xinyu Zhang, David Avagian, Eshawn Jessica Scipio, Alon Ragoler, Justin Tan, Blake Sims, Rebeka Plecnik, Aaron Kirtland, Omer Faruk Bodur, D. P. Shinde, Yan Carlos Leyva Labrador, Zahra Adoul, Mohamed Zekry, Ali Karakoc, Tania C. B. Santos, Samir Shamseldeen, Loukmane Karim, Anna Liakhovitskaia, Nate Resman, Nicholas Farina, Juan Carlos Gonzalez, Gabe Maayan, Earth Anderson, Rodrigo De Oliveira Pena, Elizabeth Kelley, Hodjat Mariji, Rasoul Pouriamanesh, Wentao Wu, Ross Finocchio, Ismail Alarab, Joshua Cole, Danyelle Ferreira, Bryan Johnson, Mohammad Safdari, Liangti Dai, Siriphan Arthornthurasuk, Isaac C. McAlister, Alejandro José Moyano, Alexey Pronin, Jing Fan, Angel Ramirez-Trinidad, Yana Malysheva, Daphiny Pottmaier, Omid Taheri, Stanley Stepanic, Samuel Perry, Luke Askew, Raúl Adrián Huerta Rodríguez, Ali M. R. Minissi, Ricardo Lorena, Krishnamurthy Iyer, Arshad Anil Fasiludeen, Ronald Clark, Josh Ducey, Matheus Piza, Maja Somrak, Eric Vergo, Juehang Qin, Benjámin Borbás, Eric Chu, Jack Lindsey, Antoine Jallon, I. M. J. McInnis, Evan Chen, Avi Semler, Luk Gloor, Tej Shah, Marc Carauleanu, Pascal Lauer, Tran Đuc Huy, Hossein Shahrtash, Emilien Duc, Lukas Lewark, Assaf Brown, Samuel Albanie, Brian Weber, Warren S. Vaz, Pierre Clavier, Yiyang Fan, Gabriel Poesia Reis e Silva, Long, Lian, Marcus Abramovitch, Xi Jiang, Sandra Mendoza, Murat Islam, Juan Gonzalez, Vasilios Mavroudis, Justin Xu, Pawan Kumar, Laxman Prasad Goswami, Daniel Bugas, Nasser Heydari, Ferenc Jeanplong, Thorben Jansen, Antonella Pinto, Archimedes Apronti, Abdallah Galal, Ng Ze-An, Ankit Singh, Tong Jiang, Joan of Arc Xavier, Kanu Priya Agarwal, Mohammed Berkani, Gang Zhang, Zhehang Du, Benedito Alves de Oliveira Junior, Dmitry Malishev, Nicolas Remy, Taylor D. Hartman, Tim Tarver, Stephen Mensah, Gautier Abou Loume, Wiktor Morak, Farzad Habibi, Sarah Hoback, Will Cai, Javier Gimenez, Roselynn Grace Montecillo, Jakub Łucki, Russell Campbell, Asankhaya Sharma, Khalida Meer, Shreen Gul, Daniel Espinosa Gonzalez, Xavier Alapont, Alex Hoover, Gunjan Chhablani, Freddie Vargus, Arunim Agarwal, Yibo Jiang, Deepakkumar Patil, David Outevsky, Kevin Joseph Scaria, Rajat Maheshwari, Abdelkader Dendane, Priti Shukla, Ashley Cartwright, Sergei Bogdanov, Niels Mündler, Sören Möller, Luca Arnaboldi, Kunvar Thaman, Muhammad Rehan Siddiqi, Prajvi Saxena, Himanshu Gupta, Tony Fruhauff, Glen Sherman, Mátyás Vincze, Siranut Usawasutsakorn, Dylan Ler, Anil Radhakrishnan, Innocent Enyekwe, Sk Md Salauddin, Jiang Muzhen, Aleksandr Maksapetyan, Vivien Rossbach, Chris Harjadi, Mohsen Bahaloohoreh, Claire Sparrow, Jasdeep Sidhu, Sam Ali, Song Bian, John Lai, Eric Singer, Justine Leon Uro, Greg Bateman, Mohamed Sayed, Ahmed Menshawy, Darling Duclosel, Dario Bezzi, Yashaswini Jain, Ashley Aaron, Murat Tiryakioglu, Sheeshram Siddh, Keith Krenek, Imad Ali Shah, Jun Jin, Scott Creighton, Denis Peskoff, Zienab EL-Wasif, Ragavendran P, Michael Richmond, Joseph McGowan, Tejal Patwardhan, Hao-Yu Sun, Ting Sun, Nikola Zubić, Samuele Sala, Stephen Ebert, Jean Kaddour, Manuel Schottdorf, Dianzhuo Wang, Gerol Petruzella, Alex Meiburg, Tilen Medved, Ali ElSheikh, S Ashwin Hebbar, Lorenzo Vaquero, Xianjun Yang, Jason Poulos, Vilém Zouhar, Sergey Bogdanik, Mingfang Zhang, Jorge Sanz-Ros, David Anugraha, Yinwei Dai, Anh N. Nhu, Xue Wang, Ali Anil Demircali, Zhibai Jia, Yuyin Zhou, Juncheng Wu, Mike He, Nitin Chandok, Aarush Sinha, Gaoxiang Luo, Long Le, Mickaël Noyé, Michał Perełkiewicz, Ioannis Pantidis, Tianbo Qi, Soham Sachin Purohit, Letitia Parcalabescu, Thai-Hoa Nguyen, Genta Indra Winata, Edoardo M. Ponti, Hanchen Li, Kaustubh Dhole, Jongee Park, Dario Abbondanza, Yuanli Wang, Anupam Nayak, Diogo M. Caetano, Antonio A. W. L. Wong, Maria del Rio-Chanona, Dániel Kondor, Pieter Francois, Ed Chalstrey, Jakob Zsambok, Dan Hoyer, Jenny Reddish, Jakob Hauser, Francisco-Javier Rodrigo-Ginés, Suchandra Datta, Maxwell Shepherd, Thom Kamphuis, Qizheng Zhang, Hyunjun Kim, Ruiji Sun, Jianzhu Yao, Franck Dernoncourt, Satyapriya Krishna, Sina Rismanchian, Bonan Pu, Francesco Pinto, Yingheng Wang, Kumar Shridhar, Kalon J. Overholt, Glib Briia, Hieu Nguyen, David, Soler Bartomeu, Tony CY Pang, Adam Wecker, Yifan Xiong, Fanfei Li, Lukas S. Huber, Joshua Jaeger, Romano De Maddalena, Xing Han Lù, Yuhui Zhang, Claas Beger, Patrick Tser Jern Kon, Sean Li, Vivek Sanker, Ming Yin, Yihao Liang, Xinlu Zhang, Ankit Agrawal, Li S. Yifei, Zechen Zhang, Mu Cai, Yasin Sonmez, Costin Cozianu, Changhao Li, Alex Slen, Shoubin Yu, Hyun Kyu Park, Gabriele Sarti, Marcin Briański, Alessandro Stolfo, Truong An Nguyen, Mike Zhang, Yotam Perlitz, Jose Hernandez-Orallo, Runjia Li, Amin Shabani, Felix Juefei-Xu, Shikhar Dhingra, Orr Zohar, My Chiffon Nguyen, Alexander Pondaven, Abdurrahim Yilmaz, Xuandong Zhao, Chuanyang Jin, Muyan Jiang, Stefan Todoran, Xinyao Han, Jules Kreuer, Brian Rabern, Anna Plassart, Martino Maggetti, Luther Yap, Robert Geirhos, Jonathon Kean, Dingsu Wang, Sina Mollaei, Chenkai Sun, Yifan Yin, Shiqi Wang, Rui Li, Yaowen Chang, Anjiang Wei, Alice Bizeul, Xiaohan Wang, Alexandre Oliveira Arrais, Kushin Mukherjee, Jorge Chamorro-Padial, Jiachen Liu, Xingyu Qu, Junyi Guan, Adam Bouyamourn, Shuyu Wu, Martyna Plomecka, Junda Chen, Mengze Tang, Jiaqi Deng, Shreyas Subramanian, Haocheng Xi, Haoxuan Chen, Weizhi Zhang, Yinuo Ren, Haoqin Tu, Sejong Kim, Yushun Chen, Sara Vera Marjanović, Junwoo Ha, Grzegorz Luczyna, Jeff J. Ma, Zewen Shen, Dawn Song, Cedegao E. Zhang, Zhun Wang, Gaël Gendron, Yunze Xiao, Leo Smucker, Erica Weng, Kwok Hao Lee, Zhe Ye, Stefano Ermon, Ignacio D. Lopez-Miguel, Theo Knights, Anthony Gitter, Namkyu Park, Boyi Wei, Hongzheng Chen, Kunal Pai, Ahmed Elkhanany, Han Lin, Philipp D. Siedler, Jichao Fang, Ritwik Mishra, Károly Zsolnai-Fehér, Xilin Jiang, Shadab Khan, Jun Yuan, Rishab Kumar Jain, Xi Lin, Mike Peterson, Zhe Wang, Aditya Malusare, Maosen Tang, Isha Gupta, Ivan Fosin, Timothy Kang, Barbara Dworakowska, Kazuki Matsumoto, Guangyao Zheng, Gerben Sewuster, Jorge Pretel Villanueva, Ivan Rannev, Igor Chernyavsky, Jiale Chen, Deepayan Banik, Ben Racz, Wenchao Dong, Jianxin Wang, Laila Bashmal, Duarte V. Gonçalves, Wei Hu, Kaushik Bar, Ondrej Bohdal, Atharv Singh Patlan, Shehzaad Dhuliawala, Caroline Geirhos, Julien Wist, Yuval Kansal, Bingsen Chen, Kutay Tire, Atak Talay Yücel, Brandon Christof, Veerupaksh Singla, Zijian Song, Sanxing Chen, Jiaxin Ge, Kaustubh Ponkshe, Isaac Park, Tianneng Shi, Martin Q. Ma, Joshua Mak, Sherwin Lai, Antoine Moulin, Zhuo Cheng, Zhanda Zhu, Ziyi Zhang, Vaidehi Patil, Ketan Jha, Qiutong Men, Jiaxuan Wu, Tianchi Zhang, Bruno Hebling Vieira, Alham Fikri Aji, Jae-Won Chung, Mohammed Mahfoud, Ha Thi Hoang, Marc Sperzel, Wei Hao, Kristof Meding, Sihan Xu, Vassilis Kostakos, Davide Manini, Yueying Liu, Christopher Toukmaji, Jay Paek, Eunmi Yu, Arif Engin Demircali, Zhiyi Sun, Ivan Dewerpe, Hongsen Qin, Roman Pflugfelder, James Bailey, Johnathan Morris, Ville Heilala, Sybille Rosset, Zishun Yu, Peter E. Chen, Woongyeong Yeo, Eeshaan Jain, Ryan Yang, Sreekar Chigurupati, Julia Chernyavsky, Sai Prajwal Reddy, Subhashini Venugopalan, Hunar Batra, Core Francisco Park, Hieu Tran, Guilherme Maximiano, Genghan Zhang, Yizhuo Liang, Hu Shiyu, Rongwu Xu, Rui Pan, Siddharth Suresh, Ziqi Liu, Samaksh Gulati, Songyang Zhang, Peter Turchin, Christopher W. Bartlett, Christopher R. Scotese, Phuong M. Cao, Ben Wu, Jacek Karwowski, Davide Scaramuzza, Aakaash Nattanmai, Gordon McKellips, Anish Cheraku, Asim Suhail, Ethan Luo, Marvin Deng, Jason Luo, Ashley Zhang, Kavin Jindel, Jay Paek, Kasper Halevy, Allen Baranov, Michael Liu, Advaith Avadhanam, David Zhang, Vincent Cheng, Brad Ma, Evan Fu, Liam Do, Joshua Lass, Hubert Yang, Surya Sunkari, Vishruth Bharath, Violet Ai, James Leung, Rishit Agrawal, Alan Zhou, Kevin Chen, Tejas Kalpathi, Ziqi Xu, Gavin Wang, Tyler Xiao, Erik Maung, Sam Lee, Ryan Yang, Roy Yue, Ben Zhao, Julia Yoon, Sunny Sun, Aryan Singh, Ethan Luo, Clark Peng, Tyler Osbey, Taozhi Wang, Daryl Echeazu, Hubert Yang, Timothy Wu, Spandan Patel, Vidhi Kulkarni, Vijaykaarti Sundarapandiyan, Ashley Zhang, Andrew Le, Zafir Nasim, Srikar Yalam, Ritesh Kasamsetty, Soham Samal, Hubert Yang, David Sun, Nihar Shah, Abhijeet Saha, Alex Zhang, Leon Nguyen, Laasya Nagumalli, Kaixin Wang, Alan Zhou, Aidan Wu, Jason Luo, Anwith Telluri, Steven Dillmann, Zhengxiang Wang, Junyu Luo, Hugo Lunn, Artem Gazizov, Haitz Sáez de Ocáriz Borde, Ivan Trus, Morgan Hervault, Zheyu Zhang, Bo Chen, Yuchen Wu, Christopher J. Cordier, Gün Kaynar, Cansin Ayvaz, Polina Avdiunina, Johannes Brust, Xingjian Diao, K. D. Meaney, Yifan Gu, Chenyu Wang, Chenzhuo Dong, William Wright, Simon Brave, Owen Root, Jiayuan Liu, Chow Chun Lok, Tianqin Li, Shiyi Du, Dailan He, Lufeiya Liu, Sina Jamalzadegan, Anil Ramakrishna, Xuanqing Xu, Xin Qing, Xin Luo, Wenkai Li, Shi Bo, Filipp Gusev, Maximos Skandalis, Desheng Ma, Chunhui Zhang, Haoran Qiu, Allen G Hart, Rickard Brüel Gabrielsson, Ido Akov, Artem Lukoianov, Summer Yue, Alexandr Wang, Dan Hendrycks
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert te meten hoe snel een nieuwe generatie superintelligente robots leert. Een lange tijd hebben we ze getest met standaard schoolexamens, zoals de examens die je in de middelbare school of het hoger onderwijs zou maken. Maar dit is het probleem: deze robots zijn zo goed geworden dat ze die tests nu met bijna perfecte scores afronden. Het is alsoğ als proberen de snelheid van een Ferrari te meten door hem een race tegen een fiets te laten rijden; de test is te makkelijk, dus de resultaten vertellen ons niets nuttigs over de werkelijke grenzen van de auto. Wetenschappers noemen dit "benchmark verzadiging". Wanneer een test te makkelijk wordt, kunnen we niet meer zien of de robots echt slimmer worden of dat ze gewoon de antwoorden hebben uit het hoofd geleerd. Om dit op te lossen, hebben we een test nodig die zo moeilijk, zo diepgaand en zo specifiek is dat zelfs de slimste mensen er moeite mee hebben. Hier komt het nieuwe artikel om de hoek kijken, dat een enorme, angstaanjagend moeilijke uitdaging introduceert die is ontworpen als de ultieme stresstest voor kunstmatige intelligentie.
Het artikel introduceert Humanity's Last Exam (HLE), een gigantische collectie van 2.500 ongelooflijk moeilijke vragen die alles beslaat van geavanceerde wiskunde en natuurkunde tot obscure geschiedenis en biologie. Denk aan de "Olympische Spelen van Kennis" voor AI, maar in plaats van hardlopen of springen, moeten de robots problemen oplossen die de diepe, gespecialiseerde kennis van een PhD-professor vereisen. De makers hebben niet zomaar vragen uit een tekstboek gegrepen; ze hebben honderden echte experts gevraagd — wetenschappers, onderzoekers en professoren van meer dan 500 instellingen wereldwijd — om gloednieuwe vragen te schrijven die de huidige top AI-modellen niet zouden kunnen oplossen. Het doel was om een "gesloten" examen te creëren, wat betekent dat elke vraag één specifiek, correct antwoord heeft (zoals een meerkeuzevraag of een kort getal), zodat we de robots eerlijk kunnen beoordelen zonder te moeten gissen naar wat ze bedoelden.
Toen de onderzoekers de meest geavanceerde AI-modellen van de wereld eindelijk aan de test legden, waren de resultaten een schok. Ondanks dat dit de slimste computers op de planeet zijn, scoorden deze modellen erbarmelijk slecht. Het best presterende AI-model slaagde er slechts in om ongeveer 13,4% van de vragen goed te beantwoorden, terwijl anderen zo laag scoorden als 2,7%. Om dit in perspectief te plaatsen: als jij dit examen zou maken, zou 13% goed zijn een onvoldoendes, maar voor deze superintelligente machines was dit eigenlijk de hoogste score die iemand behaalde. Het artikel suggereert dat er nog steeds een enorme kloof bestaat tussen wat AI vandaag de dag kan en het niveau van diep, menselijk expert-redeneren dat nodig is om deze problemen op te lossen.
Nog interessanter is hoe de robots zich gedroegen wanneer ze vastliepen. In plaats van te zeggen: "Ik weet het niet," gokten de modellen vol vertrouwen het foute antwoord. De onderzoekers ontdekten dat het zelfvertrouwen van de AI volledig uit de pas liep met de werkelijke capaciteiten; ze "hallucineerden" met een hoog vertrouwen. Het onderzoek mat deze "kalibratiefout" en stelde vast dat deze ongelooflijk hoog was, vaak boven de 80%. Het is alsof een student voor 100% zeker is dat hij "kat" als "k-a-t" heeft gespeld en het fout heeft, en dan nog steeds beweert dat hij gelijk heeft. Dit suggereert dat, hoewel AI beter wordt in veel zaken, het nog steeds een echt begrip mist van zijn eigen grenzen en gevaarlijk overmoedig kan zijn wanneer het geconfronteerd wordt met complexe, onbekende uitdagingen.
Het artikel benadrukt ook dat deze vragen zo zijn ontworpen dat er niet op te valsspelen valt. Je kon het antwoord niet zomaar op Google opzoeken of in een database vinden, omdat de vragen origineel zijn en vaak een synthese vereisen van specifieke, niche-kennis die niet op het openbare internet bestaat. Om te garanderen dat de vragen echt moeilijk waren, voerde het team een "moeilijkheidsgraad-check" uit waarbij ze elke vraag eerst tegen de beste AI-modellen testten. Als een AI de vraag kon oplossen, werd de vraag weggegooid. Ze logden meer dan 70.000 pogingen door AI voordat ze de 13.000 vragen vonden die de machines in verwarring brachten, die vervolgens door menselijke experts werden verfijnd tot de uiteindelijke 2.500 vragen voor het examen.
Kortom, dit artikel beweert niet dat AI het niveau van een magische "superintelligentie" heeft bereikt. In plaats daarvan suggereert het dat we eindelijk een liniaal hebben gevonden die lang genoeg is om te meten hoe ver we nog moeten gaan. De auteurs waarschuwen dat hoewel AI snel verbetert, het nog niet klaar is om menselijke experts te vervangen in vakgebieden die diep, geverifieerd redeneren vereisen. Ze bieden zelfs een prijskaartje van $500.000 aan om experts aan te moedigen om dit soort moeilijke vragen te schrijven, zodat het examen steeds moeilijker wordt naarmate de AI slimmer wordt. Het artikel concludeert dat hoewel dit misschien het laatste "academische examen" is dat we AI in zijn huidige vorm kunnen geven, het lang niet de laatste benchmark zal zijn die we ooit nodig hebben, dienend als een cruciale reality check voor zowel onderzoekers als beleidsmakers.
Technische Samenvatting: Humanity's Last Exam (HLE)
Probleemstelling
Large Language Models (LLMs) hebben zich razendsnel ontwikkeld en hebben een nauwkeurigheid van meer dan 90% bereikt op gevestigde benchmarks zoals MMLU. Deze verzadiging beperkt de mogelijkheid om de capaciteiten van state-of-the-art modellen nauwkeurig te meten, met name op de grens van de menselijke kennis. Bestaande benchmarks schieten vaak tekort in het onderscheiden van modellen die louter trainingsdata hebben gememoriseerd versus modellen die werkelijk beschikken over expert-niveau redeneervaardigheden. Daarom is er een kritieke behoefte aan een meer uitdagende, gesloten academische benchmark die effectief het gat tussen de huidige AI-capaciteiten en menselijke expertise kan beoordelen.
Methodologie
Dataset Constructie
Humanity's Last Exam (HLE) is een multimodale benchmark bestaande uit 2.500 extreem uitdagende vragen over tientallen onderwerpen, waaronder wiskunde, natuurwetenschappen, geesteswetenschappen en techniek. De dataset werd samengesteld via een wereldwijde collaboratieve inspanning waarbij bijna 1.000 vakexperts van meer dan 500 instellingen uit 50 landen betrokken waren.
Het creatieproces volgde een rigoureuze meerfasige pipeline:
- Indiening en LLM-filtering: Vragen werden ingediend door experts en eerst gevalideerd tegen frontier LLMs (bijv. GPT-4O, Gemini 1.5 Pro, Claude 3.5 Sonnet, O1).
- Exact-match vragen moesten alle geteste modellen verslaan.
- Multiple-choice vragen moesten alle modellen behalve één verslaan om rekening te houden met willekeurige gokken.
- Ongeveer 13.000 vragen die LLMs versloegen, werden doorgestuurd voor menselijke beoordeling.
- Expertbeoordeling: Twee rondes van menselijke beoordeling werden uitgevoerd door reviewers met een academische graad (Master, PhD, JD, etc.) in hun respectievelijke vakgebieden.
- Ronde 1: Richtte zich op het iteratief verfijnen van inzendingen om ervoor te zorgen dat ze gesloten, robuust en van hoge kwaliteit waren.
- Ronde 2: Selecteerde de beste vragen voor opname in de definitieve dataset, waarbij werd toegezien op de naleving van de indieningscriteria.
- Kwaliteitscontrole: Vragen moesten precies, eenduidig, oplosbaar en niet-zoekbaar zijn (resistent tegen eenvoudige internetretrieval). Ze vereisten doorgaans expertise op graduate-niveau of kennis van zeer specifieke onderwerpen. Een prijzenpot van $500.000 werd ingesteld om kwalitatief hoogwaardige inzendingen te stimuleren.
- Verfijning na release: Na de initiële release werd een community feedback bug bounty-programma en een gerichte audit door studenten van top Amerikaanse universiteiten uitgevoerd om fouten in labels en grote onjuistheden in stellingen te identificeren en te corrigeren. Een "HLE-Rolling" versie is gepland voor continue updates.
Evaluatieopstelling
De auteurs evalueerden state-of-the-art multimodale LLMs op HLE met behulp van een gestandaardiseerde systeemprompt die antwoorden structureert in "Reasoning" gevolgd door een "Final Answer".
- Metrics: Prestaties werden gemeten met behulp van Accuracy (nauwkeurigheid) en RMS Calibration Error.
- Kalibratie: Modellen werden geprompt om betrouwbaarheidsscores (0–100%) op te geven naast hun antwoorden. De kalibratiefout meet de discrepantie tussen de opgegeven betrouwbaarheid en de werkelijke nauwkeurigheid.
- Beoordeling: Een geautomatiseerde judge (O3-MINI) werd gebruikt om de correctheid van antwoorden te verifiëren tegen de grondwaarheid (ground truth), rekening houdend met equivalente formaten (bijv. decimalen versus breuken).
Belangrijkste Bijdragen
- HLE Dataset: De release van een 2.500-vragen tellende, multimodale benchmark ontworpen als de definitieve gesloten academische benchmark van zijn soort, dekkend over meer dan honderd onderwerpen.
- Rigoureuze Curatieproces: Een nieuwe pipeline die automatische LLM-filtering combineert met meerfasige menselijke expertbeoordeling om te garanderen dat vragen zowel moeilijk zijn voor huidige modellen als wetenschappelijk valide.
- Uitgebreide Evaluatie: Een gedetailleerde analyse van de prestaties van frontier-modellen, waarbij niet alleen de nauwkeurigheid, maar ook de kalibratiefouten en tokengebruik worden belicht.
- Publieke Release: De publieke release van de dataset (met een private helder-set om overfitting te voorkomen) op
lastexam.aiom te dienen als een gemeenschappelijk referentiepunt voor onderzoekers en beleidsmakers.
Resultaten
Evaluatie van frontier-modellen op HLE onthult significante beperkingen in de huidige AI-capaciteiten:
- Lage Nauwkeurigheid: Alle geteste modellen behaalden zeer lage nauwkeurigheidsscores. Het best presterende model, O3-MINI (High), behaalde een nauwkeurigheid van 13,4%. Andere modellen varieerden van 2,7% (GPT-4O) tot 8,5% (DeepSeek-R1).
- Slechte Kalibratie: Modellen vertoonden hoge RMS-kalibratiefouten, variërend van 73% tot 89%. Dit geeft aan dat modellen frequent onjuiste antwoorden geven met een hoge mate van zelfvertrouwen, waarbij ze niet herkennen wanneer vragen hun capaciteiten overstijgen.
- Token Efficiëntie: Reasoning-modellen hadden aanzienlijk meer inference compute (completion tokens) nodig om marginale verbeteringen in prestaties te bereiken vergeleken met non-reasoning modellen.
- Domeinprestaties: Prestaties varieerden per domein, waarbij modellen over het algemeen iets beter presteerden in Wiskunde en Techniek vergeleken met de Geesteswetenschappen, hoewel alle scores laag bleven.
Betekenis en Claims
Het paper stelt dat HLE een noodzakelijk instrument biedt om de voortgang van AI bij te houden naarmate modellen de menselijke expertprestaties benaderen.
- Het Meten van de Frontier: HLE biedt een duidelijke maatstaf voor de kloof tussen huidige LLMs en expert-niveau academische prestaties op gesloten, verifieerbare vragen.
- Informatie voor Governance: Door nauwkeurige capaciteitsmetingen te leveren, beoogt HLE onderzoekstrajecten, risicobeoordelingen en governance-beleid te informeren.
- Beperkingen: De auteurs stellen expliciet dat een hoge prestatie op HLE weliswaar expert-niveau capaciteiten zou aantonen op gestructureerde academische problemen, maar dat dit op zichzelf niet duidt op autonome onderzoeksvaardigheden of "Artificial General Intelligence" (AGI). HLE test gestructureerde kennis en redeneren in plaats van open-ended creativiteit of onderzoek.
- Toekomstverwachting: Gezien het snelle tempo van AI-ontwikkeling, erkennen de auteurs dat modellen tegen het einde van 2025 mogelijk een nauwkeurigheid van meer dan 50% op HLE zullen bereiken, wat suggereert dat hoewel HLE wellicht de laatste academische examen is die nodig is, het niet de laatste benchmark is die voor AI vereist is.
Het paper concludeert dat HLE dient als een cruciaal referentiepunt voor de wetenschappelijke gemeenschap om te beoordelen of AI-systemen werkelijk de grenzen van de menselijke kennis beheersen of slechts statistische patronen in bestaande data exploiteren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.
Ontvang wekelijks de beste NLP papers.
Vertrouwd door onderzoekers van Stanford, Cambridge en de Franse Academie van Wetenschappen.
Check je inbox om je aanmelding te bevestigen.
Er ging iets mis. Opnieuw proberen?
Geen spam, altijd opzegbaar.