Humanity's Last Exam
현재의 벤치마크들이 대규모 언어 모델에서 90% 이상의 정확도를 달성하며 포화 상태에 이른 문제를 해결하기 위해, 저자들은 다양한 주제에 걸친 2,500개의 전문가 수준 질문들로 구성되어 최첨단 모델들의 상당한 능력 격차를 드러내는 전 세계적으로 개발된 멀티모달 벤치마크인 '인류의 마지막 시험(Humanity's Last Exam, HLE)'을 도입하며, 이를 향후 연구와 정책을 안내하기 위해 공개적으로 출시한다.
원저자: Long Phan, Alice Gatti, Ziwen Han, Nathaniel Li, Josephina Hu, Hugh Zhang, Chen Bo Calvin Zhang, Mohamed Shaaban, John Ling, Sean Shi, Michael Choi, Anish Agrawal, Arnav Chopra, Adam Khoja, Ryan Kim, Richard Ren, Jason Hausenloy, Oliver Zhang, Mantas Mazeika, Dmitry Dodonov, Tung Nguyen, Jaeho Lee, Daron Anderson, Mikhail Doroshenko, Alun Cennyth Stokes, Mobeen Mahmood, Oleksandr Pokutnyi, Oleg Iskra, Jessica P. Wang, John-Clark Levin, Mstyslav Kazakov, Fiona Feng, Steven Y. Feng, Haoran Zhao, Michael Yu, Varun Gangal, Chelsea Zou, Zihan Wang, Serguei Popov, Robert Gerbicz, Geoff Galgon, Johannes Schmitt, Will Yeadon, Yongki Lee, Scott Sauers, Alvaro Sanchez, Fabian Giska, Marc Roth, Søren Riis, Saiteja Utpala, Noah Burns, Gashaw M. Goshu, Mohinder Maheshbhai Naiya, Chidozie Agu, Zachary Giboney, Antrell Cheatom, Francesco Fournier-Facio, Sarah-Jane Crowson, Lennart Finke, Zerui Cheng, Jennifer Zampese, Ryan G. Hoerr, Mark Nandor, Hyunwoo Park, Tim Gehrunger, Jiaqi Cai, Ben McCarty, Alexis C Garretson, Edwin Taylor, Damien Sileo, Qiuyu Ren, Usman Qazi, Lianghui Li, Jungbae Nam, John B. Wydallis, Pavel Arkhipov, Jack Wei Lun Shi, Aras Bacho, Chris G. Willcocks, Hangrui Cao, Sumeet Motwani, Emily de Oliveira Santos, Johannes Veith, Edward Vendrow, Doru Cojoc, Kengo Zenitani, Joshua Robinson, Longke Tang, Yuqi Li, Joshua Vendrow, Natanael Wildner Fraga, Vladyslav Kuchkin, Andrey Pupasov Maksimov, Pierre Marion, Denis Efremov, Jayson Lynch, Kaiqu Liang, Aleksandar Mikov, Andrew Gritsevskiy, Julien Guillod, Gözdenur Demir, Dakotah Martinez, Ben Pageler, Kevin Zhou, Saeed Soori, Ori Press, Henry Tang, Paolo Rissone, Sean R. Green, Lina Brüssel, Moon Twayana, Aymeric Dieuleveut, Joseph Marvin Imperial, Ameya Prabhu, Jinzhou Yang, Nick Crispino, Arun Rao, Dimitri Zvonkine, Gabriel Loiseau, Mikhail Kalinin, Marco Lukas, Ciprian Manolescu, Nate Stambaugh, Subrata Mishra, Tad Hogg, Carlo Bosio, Brian P Coppola, Julian Salazar, Jaehyeok Jin, Rafael Sayous, Stefan Ivanov, Philippe Schwaller, Shaipranesh Senthilkuma, Andres M Bran, Andres Algaba, Kelsey Van den Houte, Lynn Van Der Sypt, Brecht Verbeken, David Noever, Alexei Kopylov, Benjamin Myklebust, Bikun Li, Lisa Schut, Evgenii Zheltonozhskii, Qiaochu Yuan, Derek Lim, Richard Stanley, Tong Yang, John Maar, Julian Wykowski, Martí Oller, Anmol Sahu, Cesare Giulio Ardito, Yuzheng Hu, Ariel Ghislain Kemogne Kamdoum, Alvin Jin, Tobias Garcia Vilchis, Yuexuan Zu, Martin Lackner, James Koppel, Gongbo Sun, Daniil S. Antonenko, Steffi Chern, Bingchen Zhao, Pierrot Arsene, Joseph M Cavanagh, Daofeng Li, Jiawei Shen, Donato Crisostomi, Wenjin Zhang, Ali Dehghan, Sergey Ivanov, David Perrella, Nurdin Kaparov, Allen Zang, Ilia Sucholutsky, Arina Kharlamova, Daniil Orel, Vladislav Poritski, Shalev Ben-David, Zachary Berger, Parker Whitfill, Michael Foster, Daniel Munro, Linh Ho, Shankar Sivarajan, Dan Bar Hava, Aleksey Kuchkin, David Holmes, Alexandra Rodriguez-Romero, Frank Sommerhage, Anji Zhang, Richard Moat, Keith Schneider, Zakayo Kazibwe, Don Clarke, Dae Hyun Kim, Felipe Meneguitti Dias, Sara Fish, Veit Elser, Tobias Kreiman, Victor Efren Guadarrama Vilchis, Immo Klose, Ujjwala Anantheswaran, Adam Zweiger, Kaivalya Rawal, Jeffery Li, Jeremy Nguyen, Nicolas Daans, Haline Heidinger, Maksim Radionov, Václav Rozhoň, Vincent Ginis, Christian Stump, Niv Cohen, Rafał Poświata, Josef Tkadlec, Alan Goldfarb, Chenguang Wang, Piotr Padlewski, Stanislaw Barzowski, Kyle Montgomery, Ryan Stendall, Jamie Tucker-Foltz, Jack Stade, T. Ryan Rogers, Tom Goertzen, Declan Grabb, Abhishek Shukla, Alan Givré, John Arnold Ambay, Archan Sen, Muhammad Fayez Aziz, Mark H Inlow, Hao He, Ling Zhang, Younesse Kaddar, Ivar Ängquist, Yanxu Chen, Harrison K Wang, Kalyan Ramakrishnan, Elliott Thornley, Antonio Terpin, Hailey Schoelkopf, Eric Zheng, Avishy Carmi, Ethan D. L. Brown, Kelin Zhu, Max Bartolo, Richard Wheeler, Martin Stehberger, Peter Bradshaw, JP Heimonen, Kaustubh Sridhar, Ido Akov, Jennifer Sandlin, Yury Makarychev, Joanna Tam, Hieu Hoang, David M. Cunningham, Vladimir Goryachev, Demosthenes Patramanis, Michael Krause, Andrew Redenti, David Aldous, Jesyin Lai, Shannon Coleman, Jiangnan Xu, Sangwon Lee, Ilias Magoulas, Sandy Zhao, Ning Tang, Michael K. Cohen, Orr Paradise, Jan Hendrik Kirchner, Maksym Ovchynnikov, Jason O. Matos, Adithya Shenoy, Michael Wang, Yuzhou Nie, Anna Sztyber-Betley, Paolo Faraboschi, Robin Riblet, Jonathan Crozier, Shiv Halasyamani, Shreyas Verma, Prashant Joshi, Eli Meril, Ziqiao Ma, Jérémy Andréoletti, Raghav Singhal, Jacob Platnick, Volodymyr Nevirkovets, Luke Basler, Alexander Ivanov, Seri Khoury, Nils Gustafsson, Marco Piccardo, Hamid Mostaghimi, Qijia Chen, Virendra Singh, Tran Quoc Khánh, Paul Rosu, Hannah Szlyk, Zachary Brown, Himanshu Narayan, Aline Menezes, Jonathan Roberts, William Alley, Kunyang Sun, Arkil Patel, Max Lamparth, Anka Reuel, Linwei Xin, Hanmeng Xu, Jacob Loader, Freddie Martin, Zixuan Wang, Andrea Achilleos, Thomas Preu, Tomek Korbak, Ida Bosio, Fereshteh Kazemi, Ziye Chen, Biró Bálint, Eve J. Y. Lo, Jiaqi Wang, Maria Inês S. Nunes, Jeremiah Milbauer, M Saiful Bari, Zihao Wang, Behzad Ansarinejad, Yewen Sun, Stephane Durand, Hossam Elgnainy, Guillaume Douville, Daniel Tordera, George Balabanian, Hew Wolff, Lynna Kvistad, Hsiaoyun Milliron, Ahmad Sakor, Murat Eron, Andrew Favre D. O., Shailesh Shah, Xiaoxiang Zhou, Firuz Kamalov, Sherwin Abdoli, Tim Santens, Shaul Barkan, Allison Tee, Robin Zhang, Alessandro Tomasiello, G. Bruno De Luca, Shi-Zhuo Looi, Vinh-Kha Le, Noam Kolt, Jiayi Pan, Emma Rodman, Jacob Drori, Carl J Fossum, Niklas Muennighoff, Milind Jagota, Ronak Pradeep, Honglu Fan, Jonathan Eicher, Michael Chen, Kushal Thaman, William Merrill, Moritz Firsching, Carter Harris, Stefan Ciobâcă, Jason Gross, Rohan Pandey, Ilya Gusev, Adam Jones, Shashank Agnihotri, Pavel Zhelnov, Mohammadreza Mofayezi, Alexander Piperski, David K. Zhang, Kostiantyn Dobarskyi, Roman Leventov, Ignat Soroko, Joshua Duersch, Vage Taamazyan, Andrew Ho, Wenjie Ma, William Held, Ruicheng Xian, Armel Randy Zebaze, Mohanad Mohamed, Julian Noah Leser, Michelle X Yuan, Laila Yacar, Johannes Lengler, Katarzyna Olszewska, Claudio Di Fratta, Edson Oliveira, Joseph W. Jackson, Andy Zou, Muthu Chidambaram, Timothy Manik, Hector Haffenden, Dashiell Stander, Ali Dasouqi, Alexander Shen, Bita Golshani, David Stap, Egor Kretov, Mikalai Uzhou, Alina Borisovna Zhidkovskaya, Nick Winter, Miguel Orbegozo Rodriguez, Robert Lauff, Dustin Wehr, Colin Tang, Zaki Hossain, Shaun Phillips, Fortuna Samuele, Fredrik Ekström, Angela Hammon, Oam Patel, Faraz Farhidi, George Medley, Forough Mohammadzadeh, Madellene Peñaflor, Haile Kassahun, Alena Friedrich, Rayner Hernandez Perez, Daniel Pyda, Taom Sakal, Omkar Dhamane, Ali Khajegili Mirabadi, Eric Hallman, Kenchi Okutsu, Mike Battaglia, Mohammad Maghsoudimehrabani, Alon Amit, Dave Hulbert, Roberto Pereira, Simon Weber, Handoko, Anton Peristyy, Stephen Malina, Mustafa Mehkary, Rami Aly, Frank Reidegeld, Anna-Katharina Dick, Cary Friday, Mukhwinder Singh, Hassan Shapourian, Wanyoung Kim, Mariana Costa, Hubeyb Gurdogan, Harsh Kumar, Chiara Ceconello, Chao Zhuang, Haon Park, Micah Carroll, Andrew R. Tawfeek, Stefan Steinerberger, Daattavya Aggarwal, Michael Kirchhof, Linjie Dai, Evan Kim, Johan Ferret, Jainam Shah, Yuzhou Wang, Minghao Yan, Krzysztof Burdzy, Lixin Zhang, Antonio Franca, Diana T. Pham, Kang Yong Loh, Joshua Robinson, Abram Jackson, Paolo Giordano, Philipp Petersen, Adrian Cosma, Jesus Colino, Colin White, Jacob Votava, Vladimir Vinnikov, Ethan Delaney, Petr Spelda, Vit Stritecky, Syed M. Shahid, Jean-Christophe Mourrat, Lavr Vetoshkin, Koen Sponselee, Renas Bacho, Zheng-Xin Yong, Florencia de la Rosa, Nathan Cho, Xiuyu Li, Guillaume Malod, Orion Weller, Guglielmo Albani, Leon Lang, Julien Laurendeau, Dmitry Kazakov, Fatimah Adesanya, Julien Portier, Lawrence Hollom, Victor Souza, Yuchen Anna Zhou, Julien Degorre, Yiğit Yalın, Gbenga Daniel Obikoya, Rai, Filippo Bigi, M. C. Boscá, Oleg Shumar, Kaniuar Bacho, Gabriel Recchia, Mara Popescu, Nikita Shulga, Ngefor Mildred Tanwie, Thomas C. H. Lux, Ben Rank, Colin Ni, Matthew Brooks, Alesia Yakimchyk, Huanxu, Liu, Stefano Cavalleri, Olle Häggström, Emil Verkama, Joshua Newbould, Hans Gundlach, Leonor Brito-Santana, Brian Amaro, Vivek Vajipey, Rynaa Grover, Ting Wang, Yosi Kratish, Wen-Ding Li, Sivakanth Gopi, Andrea Caciolai, Christian Schroeder de Witt, Pablo Hernández-Cámara, Emanuele RodolÃ, Jules Robins, Dominic Williamson, Vincent Cheng, Brad Raynor, Hao Qi, Ben Segev, Jingxuan Fan, Sarah Martinson, Erik Y. Wang, Kaylie Hausknecht, Michael P. Brenner, Mao Mao, Christoph Demian, Peyman Kassani, Xinyu Zhang, David Avagian, Eshawn Jessica Scipio, Alon Ragoler, Justin Tan, Blake Sims, Rebeka Plecnik, Aaron Kirtland, Omer Faruk Bodur, D. P. Shinde, Yan Carlos Leyva Labrador, Zahra Adoul, Mohamed Zekry, Ali Karakoc, Tania C. B. Santos, Samir Shamseldeen, Loukmane Karim, Anna Liakhovitskaia, Nate Resman, Nicholas Farina, Juan Carlos Gonzalez, Gabe Maayan, Earth Anderson, Rodrigo De Oliveira Pena, Elizabeth Kelley, Hodjat Mariji, Rasoul Pouriamanesh, Wentao Wu, Ross Finocchio, Ismail Alarab, Joshua Cole, Danyelle Ferreira, Bryan Johnson, Mohammad Safdari, Liangti Dai, Siriphan Arthornthurasuk, Isaac C. McAlister, Alejandro José Moyano, Alexey Pronin, Jing Fan, Angel Ramirez-Trinidad, Yana Malysheva, Daphiny Pottmaier, Omid Taheri, Stanley Stepanic, Samuel Perry, Luke Askew, Raúl Adrián Huerta Rodríguez, Ali M. R. Minissi, Ricardo Lorena, Krishnamurthy Iyer, Arshad Anil Fasiludeen, Ronald Clark, Josh Ducey, Matheus Piza, Maja Somrak, Eric Vergo, Juehang Qin, Benjámin Borbás, Eric Chu, Jack Lindsey, Antoine Jallon, I. M. J. McInnis, Evan Chen, Avi Semler, Luk Gloor, Tej Shah, Marc Carauleanu, Pascal Lauer, Tran Đuc Huy, Hossein Shahrtash, Emilien Duc, Lukas Lewark, Assaf Brown, Samuel Albanie, Brian Weber, Warren S. Vaz, Pierre Clavier, Yiyang Fan, Gabriel Poesia Reis e Silva, Long, Lian, Marcus Abramovitch, Xi Jiang, Sandra Mendoza, Murat Islam, Juan Gonzalez, Vasilios Mavroudis, Justin Xu, Pawan Kumar, Laxman Prasad Goswami, Daniel Bugas, Nasser Heydari, Ferenc Jeanplong, Thorben Jansen, Antonella Pinto, Archimedes Apronti, Abdallah Galal, Ng Ze-An, Ankit Singh, Tong Jiang, Joan of Arc Xavier, Kanu Priya Agarwal, Mohammed Berkani, Gang Zhang, Zhehang Du, Benedito Alves de Oliveira Junior, Dmitry Malishev, Nicolas Remy, Taylor D. Hartman, Tim Tarver, Stephen Mensah, Gautier Abou Loume, Wiktor Morak, Farzad Habibi, Sarah Hoback, Will Cai, Javier Gimenez, Roselynn Grace Montecillo, Jakub Łucki, Russell Campbell, Asankhaya Sharma, Khalida Meer, Shreen Gul, Daniel Espinosa Gonzalez, Xavier Alapont, Alex Hoover, Gunjan Chhablani, Freddie Vargus, Arunim Agarwal, Yibo Jiang, Deepakkumar Patil, David Outevsky, Kevin Joseph Scaria, Rajat Maheshwari, Abdelkader Dendane, Priti Shukla, Ashley Cartwright, Sergei Bogdanov, Niels Mündler, Sören Möller, Luca Arnaboldi, Kunvar Thaman, Muhammad Rehan Siddiqi, Prajvi Saxena, Himanshu Gupta, Tony Fruhauff, Glen Sherman, Mátyás Vincze, Siranut Usawasutsakorn, Dylan Ler, Anil Radhakrishnan, Innocent Enyekwe, Sk Md Salauddin, Jiang Muzhen, Aleksandr Maksapetyan, Vivien Rossbach, Chris Harjadi, Mohsen Bahaloohoreh, Claire Sparrow, Jasdeep Sidhu, Sam Ali, Song Bian, John Lai, Eric Singer, Justine Leon Uro, Greg Bateman, Mohamed Sayed, Ahmed Menshawy, Darling Duclosel, Dario Bezzi, Yashaswini Jain, Ashley Aaron, Murat Tiryakioglu, Sheeshram Siddh, Keith Krenek, Imad Ali Shah, Jun Jin, Scott Creighton, Denis Peskoff, Zienab EL-Wasif, Ragavendran P, Michael Richmond, Joseph McGowan, Tejal Patwardhan, Hao-Yu Sun, Ting Sun, Nikola Zubić, Samuele Sala, Stephen Ebert, Jean Kaddour, Manuel Schottdorf, Dianzhuo Wang, Gerol Petruzella, Alex Meiburg, Tilen Medved, Ali ElSheikh, S Ashwin Hebbar, Lorenzo Vaquero, Xianjun Yang, Jason Poulos, Vilém Zouhar, Sergey Bogdanik, Mingfang Zhang, Jorge Sanz-Ros, David Anugraha, Yinwei Dai, Anh N. Nhu, Xue Wang, Ali Anil Demircali, Zhibai Jia, Yuyin Zhou, Juncheng Wu, Mike He, Nitin Chandok, Aarush Sinha, Gaoxiang Luo, Long Le, Mickaël Noyé, Michał Perełkiewicz, Ioannis Pantidis, Tianbo Qi, Soham Sachin Purohit, Letitia Parcalabescu, Thai-Hoa Nguyen, Genta Indra Winata, Edoardo M. Ponti, Hanchen Li, Kaustubh Dhole, Jongee Park, Dario Abbondanza, Yuanli Wang, Anupam Nayak, Diogo M. Caetano, Antonio A. W. L. Wong, Maria del Rio-Chanona, Dániel Kondor, Pieter Francois, Ed Chalstrey, Jakob Zsambok, Dan Hoyer, Jenny Reddish, Jakob Hauser, Francisco-Javier Rodrigo-Ginés, Suchandra Datta, Maxwell Shepherd, Thom Kamphuis, Qizheng Zhang, Hyunjun Kim, Ruiji Sun, Jianzhu Yao, Franck Dernoncourt, Satyapriya Krishna, Sina Rismanchian, Bonan Pu, Francesco Pinto, Yingheng Wang, Kumar Shridhar, Kalon J. Overholt, Glib Briia, Hieu Nguyen, David, Soler Bartomeu, Tony CY Pang, Adam Wecker, Yifan Xiong, Fanfei Li, Lukas S. Huber, Joshua Jaeger, Romano De Maddalena, Xing Han Lù, Yuhui Zhang, Claas Beger, Patrick Tser Jern Kon, Sean Li, Vivek Sanker, Ming Yin, Yihao Liang, Xinlu Zhang, Ankit Agrawal, Li S. Yifei, Zechen Zhang, Mu Cai, Yasin Sonmez, Costin Cozianu, Changhao Li, Alex Slen, Shoubin Yu, Hyun Kyu Park, Gabriele Sarti, Marcin Briański, Alessandro Stolfo, Truong An Nguyen, Mike Zhang, Yotam Perlitz, Jose Hernandez-Orallo, Runjia Li, Amin Shabani, Felix Juefei-Xu, Shikhar Dhingra, Orr Zohar, My Chiffon Nguyen, Alexander Pondaven, Abdurrahim Yilmaz, Xuandong Zhao, Chuanyang Jin, Muyan Jiang, Stefan Todoran, Xinyao Han, Jules Kreuer, Brian Rabern, Anna Plassart, Martino Maggetti, Luther Yap, Robert Geirhos, Jonathon Kean, Dingsu Wang, Sina Mollaei, Chenkai Sun, Yifan Yin, Shiqi Wang, Rui Li, Yaowen Chang, Anjiang Wei, Alice Bizeul, Xiaohan Wang, Alexandre Oliveira Arrais, Kushin Mukherjee, Jorge Chamorro-Padial, Jiachen Liu, Xingyu Qu, Junyi Guan, Adam Bouyamourn, Shuyu Wu, Martyna Plomecka, Junda Chen, Mengze Tang, Jiaqi Deng, Shreyas Subramanian, Haocheng Xi, Haoxuan Chen, Weizhi Zhang, Yinuo Ren, Haoqin Tu, Sejong Kim, Yushun Chen, Sara Vera Marjanović, Junwoo Ha, Grzegorz Luczyna, Jeff J. Ma, Zewen Shen, Dawn Song, Cedegao E. Zhang, Zhun Wang, Gaël Gendron, Yunze Xiao, Leo Smucker, Erica Weng, Kwok Hao Lee, Zhe Ye, Stefano Ermon, Ignacio D. Lopez-Miguel, Theo Knights, Anthony Gitter, Namkyu Park, Boyi Wei, Hongzheng Chen, Kunal Pai, Ahmed Elkhanany, Han Lin, Philipp D. Siedler, Jichao Fang, Ritwik Mishra, Károly Zsolnai-Fehér, Xilin Jiang, Shadab Khan, Jun Yuan, Rishab Kumar Jain, Xi Lin, Mike Peterson, Zhe Wang, Aditya Malusare, Maosen Tang, Isha Gupta, Ivan Fosin, Timothy Kang, Barbara Dworakowska, Kazuki Matsumoto, Guangyao Zheng, Gerben Sewuster, Jorge Pretel Villanueva, Ivan Rannev, Igor Chernyavsky, Jiale Chen, Deepayan Banik, Ben Racz, Wenchao Dong, Jianxin Wang, Laila Bashmal, Duarte V. Gonçalves, Wei Hu, Kaushik Bar, Ondrej Bohdal, Atharv Singh Patlan, Shehzaad Dhuliawala, Caroline Geirhos, Julien Wist, Yuval Kansal, Bingsen Chen, Kutay Tire, Atak Talay Yücel, Brandon Christof, Veerupaksh Singla, Zijian Song, Sanxing Chen, Jiaxin Ge, Kaustubh Ponkshe, Isaac Park, Tianneng Shi, Martin Q. Ma, Joshua Mak, Sherwin Lai, Antoine Moulin, Zhuo Cheng, Zhanda Zhu, Ziyi Zhang, Vaidehi Patil, Ketan Jha, Qiutong Men, Jiaxuan Wu, Tianchi Zhang, Bruno Hebling Vieira, Alham Fikri Aji, Jae-Won Chung, Mohammed Mahfoud, Ha Thi Hoang, Marc Sperzel, Wei Hao, Kristof Meding, Sihan Xu, Vassilis Kostakos, Davide Manini, Yueying Liu, Christopher Toukmaji, Jay Paek, Eunmi Yu, Arif Engin Demircali, Zhiyi Sun, Ivan Dewerpe, Hongsen Qin, Roman Pflugfelder, James Bailey, Johnathan Morris, Ville Heilala, Sybille Rosset, Zishun Yu, Peter E. Chen, Woongyeong Yeo, Eeshaan Jain, Ryan Yang, Sreekar Chigurupati, Julia Chernyavsky, Sai Prajwal Reddy, Subhashini Venugopalan, Hunar Batra, Core Francisco Park, Hieu Tran, Guilherme Maximiano, Genghan Zhang, Yizhuo Liang, Hu Shiyu, Rongwu Xu, Rui Pan, Siddharth Suresh, Ziqi Liu, Samaksh Gulati, Songyang Zhang, Peter Turchin, Christopher W. Bartlett, Christopher R. Scotese, Phuong M. Cao, Ben Wu, Jacek Karwowski, Davide Scaramuzza, Aakaash Nattanmai, Gordon McKellips, Anish Cheraku, Asim Suhail, Ethan Luo, Marvin Deng, Jason Luo, Ashley Zhang, Kavin Jindel, Jay Paek, Kasper Halevy, Allen Baranov, Michael Liu, Advaith Avadhanam, David Zhang, Vincent Cheng, Brad Ma, Evan Fu, Liam Do, Joshua Lass, Hubert Yang, Surya Sunkari, Vishruth Bharath, Violet Ai, James Leung, Rishit Agrawal, Alan Zhou, Kevin Chen, Tejas Kalpathi, Ziqi Xu, Gavin Wang, Tyler Xiao, Erik Maung, Sam Lee, Ryan Yang, Roy Yue, Ben Zhao, Julia Yoon, Sunny Sun, Aryan Singh, Ethan Luo, Clark Peng, Tyler Osbey, Taozhi Wang, Daryl Echeazu, Hubert Yang, Timothy Wu, Spandan Patel, Vidhi Kulkarni, Vijaykaarti Sundarapandiyan, Ashley Zhang, Andrew Le, Zafir Nasim, Srikar Yalam, Ritesh Kasamsetty, Soham Samal, Hubert Yang, David Sun, Nihar Shah, Abhijeet Saha, Alex Zhang, Leon Nguyen, Laasya Nagumalli, Kaixin Wang, Alan Zhou, Aidan Wu, Jason Luo, Anwith Telluri, Steven Dillmann, Zhengxiang Wang, Junyu Luo, Hugo Lunn, Artem Gazizov, Haitz Sáez de Ocáriz Borde, Ivan Trus, Morgan Hervault, Zheyu Zhang, Bo Chen, Yuchen Wu, Christopher J. Cordier, Gün Kaynar, Cansin Ayvaz, Polina Avdiunina, Johannes Brust, Xingjian Diao, K. D. Meaney, Yifan Gu, Chenyu Wang, Chenzhuo Dong, William Wright, Simon Brave, Owen Root, Jiayuan Liu, Chow Chun Lok, Tianqin Li, Shiyi Du, Dailan He, Lufeiya Liu, Sina Jamalzadegan, Anil Ramakrishna, Xuanqing Xu, Xin Qing, Xin Luo, Wenkai Li, Shi Bo, Filipp Gusev, Maximos Skandalis, Desheng Ma, Chunhui Zhang, Haoran Qiu, Allen G Hart, Rickard Brüel Gabrielsson, Ido Akov, Artem Lukoianov, Summer Yue, Alexandr Wang, Dan Hendrycks
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 새로운 세대의 초지능 로봇들이 얼마나 빨리 학습하고 있는지를 측정하려 한다고 상상해 보십시오. 오랫동안 우리는 그들에게 고등학교나 대학교에서 치르는 것과 같은 표준적인 학교 시험들로 테스트를 해왔습니다. 하지만 여기에는 문제가 있습니다. 이 로보트들은 너무나 똑똑해져서 이제는 그 시험들을 거의 완벽한 점수로 통과하고 있다는 점입니다. 이것은 마치 페라리의 속도를 측정하기 위해 자전거 경주를 지켜보는 것과 같습니다. 테스트가 너무 쉬워서 결과가 자동차의 진정한 한계를 알려주지 못하는 것입니다. 과학자들은 이를 "벤치마크 포화(benchmark saturation)"라고 부릅니다. 테스트가 너무 쉬워지면, 로봇들이 실제로 더 똑똑해지고 있는 것인지 아니면 단순히 정답을 암기한 것인지 구분할 수 없게 됩니다. 이를 해결하기 위해, 우리는 가장 똑똑한 인간들조차 고전할 정도로 매우 어렵고, 깊이 있으며, 특수한 테스트가 필요합니다. 바로 여기서 새로운 논문이 등장하여, 인공지능을 위한 궁극의 스트레스 테스트로 설계된 거대하고도 무시무지하게 어려운 도전을 소개합니다.
이 논문은 고급 수학과 물리학부터 생소한 역사와 생물학에 이르기까지 믿기 힘들 정도로 어려운 질문 2,500개를 모은 거대한 컬렉션인 **Humanity's Last Exam (HLE)**를 소개합니다. 이것은 AI를 위한 "지식의 올림픽"이라고 할 수 있는데, 달리기나 점프 대신 로봇들이 박사급 교수의 깊고 전문적인 지식을 요구하는 문제들을 풀어야 합니다. 제작자들은 단순히 교과서에서 질문을 가져온 것이 아닙니다. 그들은 전 세계 500개 이상의 기관에서 온 수백 명의 실제 전문가들—과학자, 연구원, 교수들—에게 현재의 최고 AI 모델들이 풀 수 없는 새로운 질문들을 작성해 달라고 요청했습니다. 목표는 "폐쇄형(closed-ended)" 시험을 만드는 것이었습니다. 즉, 모든 질문에는 하나의 특정하고 정확한 정답(객관식이나 짧은 숫자와 같은 형태)이 있어, 우리가 그들의 의도를 추측할 필요 없이 로봇들을 공정하게 채점할 수 있도록 하는 것입니다.
연구진이 마침내 세계에서 가장 진보된 AI 모델들을 테스트했을 때, 그 결과는 충격적이었습니다. 지구상에서 가장 똑똑한 컴퓨터들임에도 불구하고, 이 모델들은 형편없는 성적을 기록했습니다. 가장 뛰어난 성능을 보인 AI는 질문의 약 **13.4%**만을 맞혔으며, 다른 모델들은 **2.7%**만큼 낮은 점수를 기록하기도 했습니다. 이를 비교해 보자면, 만약 당신이 이 시험을 치른다면 13%를 맞히는 것은 낙제점이겠지만, 이 초지능 기계들에게는 그것이 실제로 달성한 가장 높은 점수였습니다. 논문은 오늘날의 AI가 할 수 있는 것과, 이 문제들을 해결하는 데 필요한 깊고 전문적인 인간의 추론 능력 사이에는 여전히 거대한 격차가 존재한다고 시사합니다.
더 흥러운 점은 로봇들이 막혔을 때 어떻게 행동했는가 하는 것입니다. 모델들은 "모르겠습니다"라고 말하는 대신, 자신 있게 틀린 답을 골랐습니다. 연구진은 AI의 확신이 실제 능력과 완전히 어긋나 있다는 것을 발견했습니다. 그들은 "환각(hallucinating)"을 일으키며 높은 확신을 가졌던 것입니다. 연구진은 이 "교정 오차(calibration error)"를 측정했으며, 그 수치가 종종 **80%**를 넘을 정도로 매우 높다는 것을 발견했습니다. 이는 마치 어떤 학생이 "cat"의 철자를 "k-a-t"라고 적어놓고도 틀렸다고 생각하면서, 자신이 맞다고 주장하는 것과 같습니다. 이는 AI가 많은 분야에서 나아지고는 있지만, 자신의 한계를 진정으로 이해하는 능력은 여전히 부족하며, 복잡하고 낯선 도전에 직면했을 때 위험할 정도로 과도하게 자신만만할 수 있음을 시사합니다.
또한 이 논문은 이 질문들이 속임수를 쓰기 불가능하도록 설계되었다는 점을 강조합니다. 질문들이 독창적이고, 인터넷상에 존재하지 않는 특정적이고 미세한 지식의 합성을 요구하기 때문에 구글링을 하거나 데이터베이스에서 답을 찾아낼 수 없습니다. 질문들이 정말로 어려운지 확인하기 위해, 팀은 모든 질문을 최고의 AI 모델들에 대해 먼저 테스트하는 "난이도 체크"를 실시했습니다. 만약 AI가 문제를 풀 수 있다면, 그 질문은 탈락되었습니다. 그들은 최종적인 2,500개의 질문을 완성하기 위해, 기계들을 당황하게 만든 13,000개의 질문을 찾아내는 과정에서 70,000회 이상의 AI 시도를 기록했으며, 이 질문들은 인간 전문가들에 의해 정교하게 다듬어졌습니다.
요약하자면, 이 논문은 AI가 마법 같은 "초지능" 수준에 도달했다고 주장하는 것이 아닙니다. 대신, 우리가 얼마나 더 가야 하는지를 측정할 수 있는 충분히 긴 자를 마침내 찾아냈다고 제안합니다. 저자들은 AI가 빠르게 발전하고 있지만, 깊고 검증된 추론을 요구하는 분야에서 인간 전문가를 대체할 준비는 아직 되지 않았다고 경고합니다. 그들은 또한 AI가 더 똑똑해짐에 따라 시험이 계속 어려워질 수 있도록, 이러한 종류의 어려운 질문을 더 많이 작성하도록 장려하기 위해 50만 달러의 상금을 제시합니다. 논문은 이것이 현재의 형태로서 우리가 AI에게 줄 수 있는 마지막 "학술 시험"일 수는 있지만, 우리가 필요로 할 마지막 벤치마크는 결코 아닐 것이며, 연구자와 정책 입안자 모두에게 중요한 현실 점검 역할을 할 것이라고 결론짓습니다.
기술 요약: 인류의 마지막 시험 (Humanity's Last Exam, HLE)
문제 정의
대규모 언어 모델(LLM)은 MMLU와 같은 기존 벤치마크에서 90% 이상의 정확도를 달성하며 급격히 발전해 왔다. 이러한 포화 상태는 최첨단 모델의 능력을, 특히 인류 지식의 최전선에 있는 영역을 정밀하게 측정하는 데 한계를 가져온다. 기존의 벤치마크들은 단순히 학습 데이터를 암기한 모델과 진정한 전문가 수준의 추론 능력을 갖춘 모델을 구분하지 못하는 경우가 많다. 결과적으로, 현재의 AI 역량과 인간의 전문성 사이의 간극을 효과적으로 평가할 수 있는 더 도전적인 폐쇄형 학술 벤치마크에 대한 절실한 필요성이 존재한다.
방법론
데이터셋 구축
**인류의 마지막 시험 (HLE)**은 수학, 자연과학, 인문학, 공학을 포함한 수십 개의 주제를 아우르는 2,500개의 매우 까다로운 문항으로 구성된 멀티모달 벤치마크이다. 이 데이터셋은 50개국 500개 이상의 기관에 소속된 약 1,000명의 분야별 전문가들이 참여한 글로벌 협업을 통해 구축되었다.
구축 과정은 엄격한 다단계 파이프라인을 따랐다:
- 제출 및 LLM 필터링: 전문가들이 제출한 질문은 먼저 최첨단 LLM(예: GPT-4O, Gemini 1.5 Pro, Claude 3.5 Sonnet, O1)을 대상으로 검증되었다.
- *정답 일치형 질문(Exact-match questions)*은 테스트된 모든 모델을 당혹스럽게 만들어야 했다.
- *객관식 질문(Multiple-choice questions)*은 무작위 추측을 고려하여, 단 하나의 모델을 제외한 모든 모델을 당혹스럽게 만들어야 했다.
- LLM을 당혹스럽게 만든 약 13,000개의 질문이 인간 검토를 위해 전달되었다.
- 전문가 검토: 각자의 분야에서 석사, 박사, 법학박사(JD) 등의 학위를 보유한 검토자들에 의해 두 차례의 인간 검토가 수행되었다.
- 1차 검토: 제출된 질문이 폐쇄형이며 견고하고 품질이 높은지 확인하기 위해 반복적인 수정 과정을 거쳤다.
- 2차 검토: 제출 기준 준수를 보장하며 최종 데이터셋에 포함될 최적의 질문들을 선정하였다.
- 품질 관리: 질문은 정밀하고 모호함이 없으며, 해결 가능하고, 검색이 불가능해야(단순한 인터넷 검색에 저항력이 있어야) 한다. 이 질문들은 통상적으로 대학원 수준의 전문 지식이나 매우 구체적인 주제에 대한 지식을 요구한다. 고품질의 제출을 장려하기 위해 500,000달러의 상금이 책정되었다.
- 출시 후 개선: 초기 출시 이후, 레이블 오류와 주요 진술의 부정확성을 식발하고 수정하기 위해 커뮤니티 피드백 버그 바운티 프로그램과 미국 명문대 학생들에 의한 표적 감사가 실시되었다. 지속적인 업데이트를 위한 "HLE-Rolling" 버전이 계획되어 있다.
평가 설정
저자들은 답변을 "추론(Reasoning)" 후 "최종 답변(Final Answer)" 순으로 구조화하는 표준화된 시스템 프롬프트를 사용하여 최첨단 멀티모달 LLM을 HLE로 평가하였다.
- 지표: 성능은 **정확도(Accuracy)**와 **RMS 캘리브레이션 오차(RMS Calibration Error)**를 사용하여 측정되었다.
- 캘리로이션(Calibration): 모델은 답변과 함께 신뢰도 점수(0–100%)를 제공하도록 프롬프트되었다. 캘리브레이션 오차는 명시된 신뢰도와 실제 정확도 사이의 불일치를 측정한다.
- 판정: 자동 판정 도구(O3-MINI)를 사용하여 정답(Ground Truth)과 비교하여 정답 여부를 검증하였으며, 이때 서로 다른 형식(예: 소수점 vs 분수)을 고려하였다.
주요 기여
- HLE 데이터셋: 100개 이상의 주제를 다루며, 해당 종류의 마지막 폐쇄형 학술 벤치마크가 되도록 설계된 2,500개 문항의 멀티모달 벤치마크를 공개하였다.
- 엄격한 큐레이션 프로세스: 자동화된 LLM 필터링과 다단계 인간 전문가 검토를 결합하여, 질문이 현재 모델들에게 어렵고 과학적으로 타당함을 보장하는 새로운 파이프라인을 제시하였다.
- 포괄적 평가: 최첨단 모델의 성능을 상세히 분석하여, 정확도뿐만 아니라 캘리브레이션 오차와 토큰 사용량까지 강조하였다.
- 공개 배포: 연구자와 정책 입안자들의 공통 참조점으로 활용하기 위해
lastexam.ai를 통해 데이터셋(과적합 방지를 위한 비공개 홀드아웃 세트 포함)을 공개하였다.
결과
HLE에서 최첨단 모델들을 평가한 결과, 현재 AI 역량의 상당한 한계가 드러났다:
- 낮은 정확도: 테스트된 모든 모델이 매우 낮은 정확도를 기록했다. 가장 높은 성능을 보인 모델은 **O3-MINI (High)**로, **13.4%**의 정확도를 달성했다. 다른 모델들은 2.7%(GPT-4O)에서 8.5%(DeepSeek-R1) 사이의 범위를 보였다.
- 부족한 캘리브레이션: 모델들은 **73%에서 89%**에 이르는 높은 RMS 캘리브레이션 오차를 보였다. 이는 모델들이 오답을 내놓으면서도 높은 확신을 가지는 경우가 빈번하며, 자신의 능력을 초과하는 질문을 인지하지 못하고 있음을 나타낸다.
- 토큰 효율성: 추론 모델들은 비추론 모델에 비해 성능의 미미한 향상을 달ра성하기 위해 실질적으로 더 많은 추론 연산(완성 토큰)을 필요로 했다.
- 도메인별 성능: 도메인별로 성능 차이가 있었는데, 모델들은 일반적으로 인문학에 비해 수학 및 공학에서 약간 더 나은 성능을 보였으나, 모든 점수가 낮게 유지되었다.
의의 및 주장
본 논문은 HLE가 모델이 인간 전문가의 성능에 도달함에 따라 AI의 발전을 추적하는 데 필요한 도구를 제공한다고 주장한다.
- 경계 측정: HLE는 폐쇄형이고 검증 가능한 질문에 대해 현재의 LLM과 전문가 수준의 학술적 성취 사이의 간극을 측정하는 명확한 척도를 제공한다.
- 거버넌스에 정보 제공: 정밀한 역량 측정을 제공함으로써, HLE는 연구 궤적, 위험 평가 및 거버넌스 정책에 정보를 제공하는 것을 목표로 한다.
- 한계: 저자들은 HLE에서의 높은 성적이 구조화된 학술적 문제에 대한 전문가 수준의 능력을 입증할 수는 있지만, 그것이 자율적 연구 능력이나 "범용 인공지능(AGI)"을 단독으로 시사하지는 않는다는 점을 명시적으로 밝혔다. HLE는 개방형 창의성이나 연구보다는 구조화된 지식과 추론을 테스트한다.
- 향 전망: AI 발전의 빠른 속도를 고려할 때, 저자들은 모델들이 2025년 말까지 HLE에서 50% 이상의 정확도를 넘어설 수 있다고 인정하며, HLE가 마지막 학술 시험이 될 수는 있어도 AI를 위한 마지막 벤치마크는 아닐 수 있음을 시사한다.
결론적으로 HLE는 AI 시스템이 단순히 기존 데이터의 통계적 패턴을 이용하는 것인지, 아니면 진정으로 인류 지식의 최전선을 마스터하고 있는지를 과학계가 평가할 수 있는 중요한 기준점 역할을 한다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.
매주 최고의 NLP 논문을 받아보세요.
스탠포드, 케임브리지, 프랑스 과학 아카데미 연구자들이 신뢰합니다.
받은편지함에서 구독을 확인해주세요.
문제가 발생했습니다. 다시 시도하시겠어요?
스팸 없음, 언제든 구독 취소 가능.