Humanity's Last Exam
Para abordar la saturación de los bancos de pruebas actuales donde los modelos de lenguaje de gran tamaño alcanzan más del 90% de precisión, los autores introducen Humanity's Last Exam (HLE), un banco de pruebas multimodal desarrollado globalmente con 2.500 preguntas de nivel experto a través de diversos temas que revela brechas de capacidad significativas en los modelos de vanguardia y es publicado para guiar la investigación y las políticas futuras.
Autores originales: Long Phan, Alice Gatti, Ziwen Han, Nathaniel Li, Josephina Hu, Hugh Zhang, Chen Bo Calvin Zhang, Mohamed Shaaban, John Ling, Sean Shi, Michael Choi, Anish Agrawal, Arnav Chopra, Adam Khoja, Ryan Kim, Richard Ren, Jason Hausenloy, Oliver Zhang, Mantas Mazeika, Dmitry Dodonov, Tung Nguyen, Jaeho Lee, Daron Anderson, Mikhail Doroshenko, Alun Cennyth Stokes, Mobeen Mahmood, Oleksandr Pokutnyi, Oleg Iskra, Jessica P. Wang, John-Clark Levin, Mstyslav Kazakov, Fiona Feng, Steven Y. Feng, Haoran Zhao, Michael Yu, Varun Gangal, Chelsea Zou, Zihan Wang, Serguei Popov, Robert Gerbicz, Geoff Galgon, Johannes Schmitt, Will Yeadon, Yongki Lee, Scott Sauers, Alvaro Sanchez, Fabian Giska, Marc Roth, Søren Riis, Saiteja Utpala, Noah Burns, Gashaw M. Goshu, Mohinder Maheshbhai Naiya, Chidozie Agu, Zachary Giboney, Antrell Cheatom, Francesco Fournier-Facio, Sarah-Jane Crowson, Lennart Finke, Zerui Cheng, Jennifer Zampese, Ryan G. Hoerr, Mark Nandor, Hyunwoo Park, Tim Gehrunger, Jiaqi Cai, Ben McCarty, Alexis C Garretson, Edwin Taylor, Damien Sileo, Qiuyu Ren, Usman Qazi, Lianghui Li, Jungbae Nam, John B. Wydallis, Pavel Arkhipov, Jack Wei Lun Shi, Aras Bacho, Chris G. Willcocks, Hangrui Cao, Sumeet Motwani, Emily de Oliveira Santos, Johannes Veith, Edward Vendrow, Doru Cojoc, Kengo Zenitani, Joshua Robinson, Longke Tang, Yuqi Li, Joshua Vendrow, Natanael Wildner Fraga, Vladyslav Kuchkin, Andrey Pupasov Maksimov, Pierre Marion, Denis Efremov, Jayson Lynch, Kaiqu Liang, Aleksandar Mikov, Andrew Gritsevskiy, Julien Guillod, Gözdenur Demir, Dakotah Martinez, Ben Pageler, Kevin Zhou, Saeed Soori, Ori Press, Henry Tang, Paolo Rissone, Sean R. Green, Lina Brüssel, Moon Twayana, Aymeric Dieuleveut, Joseph Marvin Imperial, Ameya Prabhu, Jinzhou Yang, Nick Crispino, Arun Rao, Dimitri Zvonkine, Gabriel Loiseau, Mikhail Kalinin, Marco Lukas, Ciprian Manolescu, Nate Stambaugh, Subrata Mishra, Tad Hogg, Carlo Bosio, Brian P Coppola, Julian Salazar, Jaehyeok Jin, Rafael Sayous, Stefan Ivanov, Philippe Schwaller, Shaipranesh Senthilkuma, Andres M Bran, Andres Algaba, Kelsey Van den Houte, Lynn Van Der Sypt, Brecht Verbeken, David Noever, Alexei Kopylov, Benjamin Myklebust, Bikun Li, Lisa Schut, Evgenii Zheltonozhskii, Qiaochu Yuan, Derek Lim, Richard Stanley, Tong Yang, John Maar, Julian Wykowski, Martí Oller, Anmol Sahu, Cesare Giulio Ardito, Yuzheng Hu, Ariel Ghislain Kemogne Kamdoum, Alvin Jin, Tobias Garcia Vilchis, Yuexuan Zu, Martin Lackner, James Koppel, Gongbo Sun, Daniil S. Antonenko, Steffi Chern, Bingchen Zhao, Pierrot Arsene, Joseph M Cavanagh, Daofeng Li, Jiawei Shen, Donato Crisostomi, Wenjin Zhang, Ali Dehghan, Sergey Ivanov, David Perrella, Nurdin Kaparov, Allen Zang, Ilia Sucholutsky, Arina Kharlamova, Daniil Orel, Vladislav Poritski, Shalev Ben-David, Zachary Berger, Parker Whitfill, Michael Foster, Daniel Munro, Linh Ho, Shankar Sivarajan, Dan Bar Hava, Aleksey Kuchkin, David Holmes, Alexandra Rodriguez-Romero, Frank Sommerhage, Anji Zhang, Richard Moat, Keith Schneider, Zakayo Kazibwe, Don Clarke, Dae Hyun Kim, Felipe Meneguitti Dias, Sara Fish, Veit Elser, Tobias Kreiman, Victor Efren Guadarrama Vilchis, Immo Klose, Ujjwala Anantheswaran, Adam Zweiger, Kaivalya Rawal, Jeffery Li, Jeremy Nguyen, Nicolas Daans, Haline Heidinger, Maksim Radionov, Václav Rozhoň, Vincent Ginis, Christian Stump, Niv Cohen, Rafał Poświata, Josef Tkadlec, Alan Goldfarb, Chenguang Wang, Piotr Padlewski, Stanislaw Barzowski, Kyle Montgomery, Ryan Stendall, Jamie Tucker-Foltz, Jack Stade, T. Ryan Rogers, Tom Goertzen, Declan Grabb, Abhishek Shukla, Alan Givré, John Arnold Ambay, Archan Sen, Muhammad Fayez Aziz, Mark H Inlow, Hao He, Ling Zhang, Younesse Kaddar, Ivar Ängquist, Yanxu Chen, Harrison K Wang, Kalyan Ramakrishnan, Elliott Thornley, Antonio Terpin, Hailey Schoelkopf, Eric Zheng, Avishy Carmi, Ethan D. L. Brown, Kelin Zhu, Max Bartolo, Richard Wheeler, Martin Stehberger, Peter Bradshaw, JP Heimonen, Kaustubh Sridhar, Ido Akov, Jennifer Sandlin, Yury Makarychev, Joanna Tam, Hieu Hoang, David M. Cunningham, Vladimir Goryachev, Demosthenes Patramanis, Michael Krause, Andrew Redenti, David Aldous, Jesyin Lai, Shannon Coleman, Jiangnan Xu, Sangwon Lee, Ilias Magoulas, Sandy Zhao, Ning Tang, Michael K. Cohen, Orr Paradise, Jan Hendrik Kirchner, Maksym Ovchynnikov, Jason O. Matos, Adithya Shenoy, Michael Wang, Yuzhou Nie, Anna Sztyber-Betley, Paolo Faraboschi, Robin Riblet, Jonathan Crozier, Shiv Halasyamani, Shreyas Verma, Prashant Joshi, Eli Meril, Ziqiao Ma, Jérémy Andréoletti, Raghav Singhal, Jacob Platnick, Volodymyr Nevirkovets, Luke Basler, Alexander Ivanov, Seri Khoury, Nils Gustafsson, Marco Piccardo, Hamid Mostaghimi, Qijia Chen, Virendra Singh, Tran Quoc Khánh, Paul Rosu, Hannah Szlyk, Zachary Brown, Himanshu Narayan, Aline Menezes, Jonathan Roberts, William Alley, Kunyang Sun, Arkil Patel, Max Lamparth, Anka Reuel, Linwei Xin, Hanmeng Xu, Jacob Loader, Freddie Martin, Zixuan Wang, Andrea Achilleos, Thomas Preu, Tomek Korbak, Ida Bosio, Fereshteh Kazemi, Ziye Chen, Biró Bálint, Eve J. Y. Lo, Jiaqi Wang, Maria Inês S. Nunes, Jeremiah Milbauer, M Saiful Bari, Zihao Wang, Behzad Ansarinejad, Yewen Sun, Stephane Durand, Hossam Elgnainy, Guillaume Douville, Daniel Tordera, George Balabanian, Hew Wolff, Lynna Kvistad, Hsiaoyun Milliron, Ahmad Sakor, Murat Eron, Andrew Favre D. O., Shailesh Shah, Xiaoxiang Zhou, Firuz Kamalov, Sherwin Abdoli, Tim Santens, Shaul Barkan, Allison Tee, Robin Zhang, Alessandro Tomasiello, G. Bruno De Luca, Shi-Zhuo Looi, Vinh-Kha Le, Noam Kolt, Jiayi Pan, Emma Rodman, Jacob Drori, Carl J Fossum, Niklas Muennighoff, Milind Jagota, Ronak Pradeep, Honglu Fan, Jonathan Eicher, Michael Chen, Kushal Thaman, William Merrill, Moritz Firsching, Carter Harris, Stefan Ciobâcă, Jason Gross, Rohan Pandey, Ilya Gusev, Adam Jones, Shashank Agnihotri, Pavel Zhelnov, Mohammadreza Mofayezi, Alexander Piperski, David K. Zhang, Kostiantyn Dobarskyi, Roman Leventov, Ignat Soroko, Joshua Duersch, Vage Taamazyan, Andrew Ho, Wenjie Ma, William Held, Ruicheng Xian, Armel Randy Zebaze, Mohanad Mohamed, Julian Noah Leser, Michelle X Yuan, Laila Yacar, Johannes Lengler, Katarzyna Olszewska, Claudio Di Fratta, Edson Oliveira, Joseph W. Jackson, Andy Zou, Muthu Chidambaram, Timothy Manik, Hector Haffenden, Dashiell Stander, Ali Dasouqi, Alexander Shen, Bita Golshani, David Stap, Egor Kretov, Mikalai Uzhou, Alina Borisovna Zhidkovskaya, Nick Winter, Miguel Orbegozo Rodriguez, Robert Lauff, Dustin Wehr, Colin Tang, Zaki Hossain, Shaun Phillips, Fortuna Samuele, Fredrik Ekström, Angela Hammon, Oam Patel, Faraz Farhidi, George Medley, Forough Mohammadzadeh, Madellene Peñaflor, Haile Kassahun, Alena Friedrich, Rayner Hernandez Perez, Daniel Pyda, Taom Sakal, Omkar Dhamane, Ali Khajegili Mirabadi, Eric Hallman, Kenchi Okutsu, Mike Battaglia, Mohammad Maghsoudimehrabani, Alon Amit, Dave Hulbert, Roberto Pereira, Simon Weber, Handoko, Anton Peristyy, Stephen Malina, Mustafa Mehkary, Rami Aly, Frank Reidegeld, Anna-Katharina Dick, Cary Friday, Mukhwinder Singh, Hassan Shapourian, Wanyoung Kim, Mariana Costa, Hubeyb Gurdogan, Harsh Kumar, Chiara Ceconello, Chao Zhuang, Haon Park, Micah Carroll, Andrew R. Tawfeek, Stefan Steinerberger, Daattavya Aggarwal, Michael Kirchhof, Linjie Dai, Evan Kim, Johan Ferret, Jainam Shah, Yuzhou Wang, Minghao Yan, Krzysztof Burdzy, Lixin Zhang, Antonio Franca, Diana T. Pham, Kang Yong Loh, Joshua Robinson, Abram Jackson, Paolo Giordano, Philipp Petersen, Adrian Cosma, Jesus Colino, Colin White, Jacob Votava, Vladimir Vinnikov, Ethan Delaney, Petr Spelda, Vit Stritecky, Syed M. Shahid, Jean-Christophe Mourrat, Lavr Vetoshkin, Koen Sponselee, Renas Bacho, Zheng-Xin Yong, Florencia de la Rosa, Nathan Cho, Xiuyu Li, Guillaume Malod, Orion Weller, Guglielmo Albani, Leon Lang, Julien Laurendeau, Dmitry Kazakov, Fatimah Adesanya, Julien Portier, Lawrence Hollom, Victor Souza, Yuchen Anna Zhou, Julien Degorre, Yiğit Yalın, Gbenga Daniel Obikoya, Rai, Filippo Bigi, M. C. Boscá, Oleg Shumar, Kaniuar Bacho, Gabriel Recchia, Mara Popescu, Nikita Shulga, Ngefor Mildred Tanwie, Thomas C. H. Lux, Ben Rank, Colin Ni, Matthew Brooks, Alesia Yakimchyk, Huanxu, Liu, Stefano Cavalleri, Olle Häggström, Emil Verkama, Joshua Newbould, Hans Gundlach, Leonor Brito-Santana, Brian Amaro, Vivek Vajipey, Rynaa Grover, Ting Wang, Yosi Kratish, Wen-Ding Li, Sivakanth Gopi, Andrea Caciolai, Christian Schroeder de Witt, Pablo Hernández-Cámara, Emanuele RodolÃ, Jules Robins, Dominic Williamson, Vincent Cheng, Brad Raynor, Hao Qi, Ben Segev, Jingxuan Fan, Sarah Martinson, Erik Y. Wang, Kaylie Hausknecht, Michael P. Brenner, Mao Mao, Christoph Demian, Peyman Kassani, Xinyu Zhang, David Avagian, Eshawn Jessica Scipio, Alon Ragoler, Justin Tan, Blake Sims, Rebeka Plecnik, Aaron Kirtland, Omer Faruk Bodur, D. P. Shinde, Yan Carlos Leyva Labrador, Zahra Adoul, Mohamed Zekry, Ali Karakoc, Tania C. B. Santos, Samir Shamseldeen, Loukmane Karim, Anna Liakhovitskaia, Nate Resman, Nicholas Farina, Juan Carlos Gonzalez, Gabe Maayan, Earth Anderson, Rodrigo De Oliveira Pena, Elizabeth Kelley, Hodjat Mariji, Rasoul Pouriamanesh, Wentao Wu, Ross Finocchio, Ismail Alarab, Joshua Cole, Danyelle Ferreira, Bryan Johnson, Mohammad Safdari, Liangti Dai, Siriphan Arthornthurasuk, Isaac C. McAlister, Alejandro José Moyano, Alexey Pronin, Jing Fan, Angel Ramirez-Trinidad, Yana Malysheva, Daphiny Pottmaier, Omid Taheri, Stanley Stepanic, Samuel Perry, Luke Askew, Raúl Adrián Huerta Rodríguez, Ali M. R. Minissi, Ricardo Lorena, Krishnamurthy Iyer, Arshad Anil Fasiludeen, Ronald Clark, Josh Ducey, Matheus Piza, Maja Somrak, Eric Vergo, Juehang Qin, Benjámin Borbás, Eric Chu, Jack Lindsey, Antoine Jallon, I. M. J. McInnis, Evan Chen, Avi Semler, Luk Gloor, Tej Shah, Marc Carauleanu, Pascal Lauer, Tran Đuc Huy, Hossein Shahrtash, Emilien Duc, Lukas Lewark, Assaf Brown, Samuel Albanie, Brian Weber, Warren S. Vaz, Pierre Clavier, Yiyang Fan, Gabriel Poesia Reis e Silva, Long, Lian, Marcus Abramovitch, Xi Jiang, Sandra Mendoza, Murat Islam, Juan Gonzalez, Vasilios Mavroudis, Justin Xu, Pawan Kumar, Laxman Prasad Goswami, Daniel Bugas, Nasser Heydari, Ferenc Jeanplong, Thorben Jansen, Antonella Pinto, Archimedes Apronti, Abdallah Galal, Ng Ze-An, Ankit Singh, Tong Jiang, Joan of Arc Xavier, Kanu Priya Agarwal, Mohammed Berkani, Gang Zhang, Zhehang Du, Benedito Alves de Oliveira Junior, Dmitry Malishev, Nicolas Remy, Taylor D. Hartman, Tim Tarver, Stephen Mensah, Gautier Abou Loume, Wiktor Morak, Farzad Habibi, Sarah Hoback, Will Cai, Javier Gimenez, Roselynn Grace Montecillo, Jakub Łucki, Russell Campbell, Asankhaya Sharma, Khalida Meer, Shreen Gul, Daniel Espinosa Gonzalez, Xavier Alapont, Alex Hoover, Gunjan Chhablani, Freddie Vargus, Arunim Agarwal, Yibo Jiang, Deepakkumar Patil, David Outevsky, Kevin Joseph Scaria, Rajat Maheshwari, Abdelkader Dendane, Priti Shukla, Ashley Cartwright, Sergei Bogdanov, Niels Mündler, Sören Möller, Luca Arnaboldi, Kunvar Thaman, Muhammad Rehan Siddiqi, Prajvi Saxena, Himanshu Gupta, Tony Fruhauff, Glen Sherman, Mátyás Vincze, Siranut Usawasutsakorn, Dylan Ler, Anil Radhakrishnan, Innocent Enyekwe, Sk Md Salauddin, Jiang Muzhen, Aleksandr Maksapetyan, Vivien Rossbach, Chris Harjadi, Mohsen Bahaloohoreh, Claire Sparrow, Jasdeep Sidhu, Sam Ali, Song Bian, John Lai, Eric Singer, Justine Leon Uro, Greg Bateman, Mohamed Sayed, Ahmed Menshawy, Darling Duclosel, Dario Bezzi, Yashaswini Jain, Ashley Aaron, Murat Tiryakioglu, Sheeshram Siddh, Keith Krenek, Imad Ali Shah, Jun Jin, Scott Creighton, Denis Peskoff, Zienab EL-Wasif, Ragavendran P, Michael Richmond, Joseph McGowan, Tejal Patwardhan, Hao-Yu Sun, Ting Sun, Nikola Zubić, Samuele Sala, Stephen Ebert, Jean Kaddour, Manuel Schottdorf, Dianzhuo Wang, Gerol Petruzella, Alex Meiburg, Tilen Medved, Ali ElSheikh, S Ashwin Hebbar, Lorenzo Vaquero, Xianjun Yang, Jason Poulos, Vilém Zouhar, Sergey Bogdanik, Mingfang Zhang, Jorge Sanz-Ros, David Anugraha, Yinwei Dai, Anh N. Nhu, Xue Wang, Ali Anil Demircali, Zhibai Jia, Yuyin Zhou, Juncheng Wu, Mike He, Nitin Chandok, Aarush Sinha, Gaoxiang Luo, Long Le, Mickaël Noyé, Michał Perełkiewicz, Ioannis Pantidis, Tianbo Qi, Soham Sachin Purohit, Letitia Parcalabescu, Thai-Hoa Nguyen, Genta Indra Winata, Edoardo M. Ponti, Hanchen Li, Kaustubh Dhole, Jongee Park, Dario Abbondanza, Yuanli Wang, Anupam Nayak, Diogo M. Caetano, Antonio A. W. L. Wong, Maria del Rio-Chanona, Dániel Kondor, Pieter Francois, Ed Chalstrey, Jakob Zsambok, Dan Hoyer, Jenny Reddish, Jakob Hauser, Francisco-Javier Rodrigo-Ginés, Suchandra Datta, Maxwell Shepherd, Thom Kamphuis, Qizheng Zhang, Hyunjun Kim, Ruiji Sun, Jianzhu Yao, Franck Dernoncourt, Satyapriya Krishna, Sina Rismanchian, Bonan Pu, Francesco Pinto, Yingheng Wang, Kumar Shridhar, Kalon J. Overholt, Glib Briia, Hieu Nguyen, David, Soler Bartomeu, Tony CY Pang, Adam Wecker, Yifan Xiong, Fanfei Li, Lukas S. Huber, Joshua Jaeger, Romano De Maddalena, Xing Han Lù, Yuhui Zhang, Claas Beger, Patrick Tser Jern Kon, Sean Li, Vivek Sanker, Ming Yin, Yihao Liang, Xinlu Zhang, Ankit Agrawal, Li S. Yifei, Zechen Zhang, Mu Cai, Yasin Sonmez, Costin Cozianu, Changhao Li, Alex Slen, Shoubin Yu, Hyun Kyu Park, Gabriele Sarti, Marcin Briański, Alessandro Stolfo, Truong An Nguyen, Mike Zhang, Yotam Perlitz, Jose Hernandez-Orallo, Runjia Li, Amin Shabani, Felix Juefei-Xu, Shikhar Dhingra, Orr Zohar, My Chiffon Nguyen, Alexander Pondaven, Abdurrahim Yilmaz, Xuandong Zhao, Chuanyang Jin, Muyan Jiang, Stefan Todoran, Xinyao Han, Jules Kreuer, Brian Rabern, Anna Plassart, Martino Maggetti, Luther Yap, Robert Geirhos, Jonathon Kean, Dingsu Wang, Sina Mollaei, Chenkai Sun, Yifan Yin, Shiqi Wang, Rui Li, Yaowen Chang, Anjiang Wei, Alice Bizeul, Xiaohan Wang, Alexandre Oliveira Arrais, Kushin Mukherjee, Jorge Chamorro-Padial, Jiachen Liu, Xingyu Qu, Junyi Guan, Adam Bouyamourn, Shuyu Wu, Martyna Plomecka, Junda Chen, Mengze Tang, Jiaqi Deng, Shreyas Subramanian, Haocheng Xi, Haoxuan Chen, Weizhi Zhang, Yinuo Ren, Haoqin Tu, Sejong Kim, Yushun Chen, Sara Vera Marjanović, Junwoo Ha, Grzegorz Luczyna, Jeff J. Ma, Zewen Shen, Dawn Song, Cedegao E. Zhang, Zhun Wang, Gaël Gendron, Yunze Xiao, Leo Smucker, Erica Weng, Kwok Hao Lee, Zhe Ye, Stefano Ermon, Ignacio D. Lopez-Miguel, Theo Knights, Anthony Gitter, Namkyu Park, Boyi Wei, Hongzheng Chen, Kunal Pai, Ahmed Elkhanany, Han Lin, Philipp D. Siedler, Jichao Fang, Ritwik Mishra, Károly Zsolnai-Fehér, Xilin Jiang, Shadab Khan, Jun Yuan, Rishab Kumar Jain, Xi Lin, Mike Peterson, Zhe Wang, Aditya Malusare, Maosen Tang, Isha Gupta, Ivan Fosin, Timothy Kang, Barbara Dworakowska, Kazuki Matsumoto, Guangyao Zheng, Gerben Sewuster, Jorge Pretel Villanueva, Ivan Rannev, Igor Chernyavsky, Jiale Chen, Deepayan Banik, Ben Racz, Wenchao Dong, Jianxin Wang, Laila Bashmal, Duarte V. Gonçalves, Wei Hu, Kaushik Bar, Ondrej Bohdal, Atharv Singh Patlan, Shehzaad Dhuliawala, Caroline Geirhos, Julien Wist, Yuval Kansal, Bingsen Chen, Kutay Tire, Atak Talay Yücel, Brandon Christof, Veerupaksh Singla, Zijian Song, Sanxing Chen, Jiaxin Ge, Kaustubh Ponkshe, Isaac Park, Tianneng Shi, Martin Q. Ma, Joshua Mak, Sherwin Lai, Antoine Moulin, Zhuo Cheng, Zhanda Zhu, Ziyi Zhang, Vaidehi Patil, Ketan Jha, Qiutong Men, Jiaxuan Wu, Tianchi Zhang, Bruno Hebling Vieira, Alham Fikri Aji, Jae-Won Chung, Mohammed Mahfoud, Ha Thi Hoang, Marc Sperzel, Wei Hao, Kristof Meding, Sihan Xu, Vassilis Kostakos, Davide Manini, Yueying Liu, Christopher Toukmaji, Jay Paek, Eunmi Yu, Arif Engin Demircali, Zhiyi Sun, Ivan Dewerpe, Hongsen Qin, Roman Pflugfelder, James Bailey, Johnathan Morris, Ville Heilala, Sybille Rosset, Zishun Yu, Peter E. Chen, Woongyeong Yeo, Eeshaan Jain, Ryan Yang, Sreekar Chigurupati, Julia Chernyavsky, Sai Prajwal Reddy, Subhashini Venugopalan, Hunar Batra, Core Francisco Park, Hieu Tran, Guilherme Maximiano, Genghan Zhang, Yizhuo Liang, Hu Shiyu, Rongwu Xu, Rui Pan, Siddharth Suresh, Ziqi Liu, Samaksh Gulati, Songyang Zhang, Peter Turchin, Christopher W. Bartlett, Christopher R. Scotese, Phuong M. Cao, Ben Wu, Jacek Karwowski, Davide Scaramuzza, Aakaash Nattanmai, Gordon McKellips, Anish Cheraku, Asim Suhail, Ethan Luo, Marvin Deng, Jason Luo, Ashley Zhang, Kavin Jindel, Jay Paek, Kasper Halevy, Allen Baranov, Michael Liu, Advaith Avadhanam, David Zhang, Vincent Cheng, Brad Ma, Evan Fu, Liam Do, Joshua Lass, Hubert Yang, Surya Sunkari, Vishruth Bharath, Violet Ai, James Leung, Rishit Agrawal, Alan Zhou, Kevin Chen, Tejas Kalpathi, Ziqi Xu, Gavin Wang, Tyler Xiao, Erik Maung, Sam Lee, Ryan Yang, Roy Yue, Ben Zhao, Julia Yoon, Sunny Sun, Aryan Singh, Ethan Luo, Clark Peng, Tyler Osbey, Taozhi Wang, Daryl Echeazu, Hubert Yang, Timothy Wu, Spandan Patel, Vidhi Kulkarni, Vijaykaarti Sundarapandiyan, Ashley Zhang, Andrew Le, Zafir Nasim, Srikar Yalam, Ritesh Kasamsetty, Soham Samal, Hubert Yang, David Sun, Nihar Shah, Abhijeet Saha, Alex Zhang, Leon Nguyen, Laasya Nagumalli, Kaixin Wang, Alan Zhou, Aidan Wu, Jason Luo, Anwith Telluri, Steven Dillmann, Zhengxiang Wang, Junyu Luo, Hugo Lunn, Artem Gazizov, Haitz Sáez de Ocáriz Borde, Ivan Trus, Morgan Hervault, Zheyu Zhang, Bo Chen, Yuchen Wu, Christopher J. Cordier, Gün Kaynar, Cansin Ayvaz, Polina Avdiunina, Johannes Brust, Xingjian Diao, K. D. Meaney, Yifan Gu, Chenyu Wang, Chenzhuo Dong, William Wright, Simon Brave, Owen Root, Jiayuan Liu, Chow Chun Lok, Tianqin Li, Shiyi Du, Dailan He, Lufeiya Liu, Sina Jamalzadegan, Anil Ramakrishna, Xuanqing Xu, Xin Qing, Xin Luo, Wenkai Li, Shi Bo, Filipp Gusev, Maximos Skandalis, Desheng Ma, Chunhui Zhang, Haoran Qiu, Allen G Hart, Rickard Brüel Gabrielsson, Ido Akov, Artem Lukoianov, Summer Yue, Alexandr Wang, Dan Hendrycks
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás tratando de medir qué tan rápido está aprendiendo una nueva generación de robots superinteligentes. Durante mucho tiempo, los probamos con exámenes escolares estándar, como los que podrías tomar en la secundaria o la universidad. Pero aquí está el problema: estos robots se han vuelto tan buenos que ahora están aprobando esos exámenes con puntuaciones casi perfectas. Es como intentar medir la velocidad de un Ferrari observándolo correr contra una bicicleta; la prueba es demasiado fácil, por lo que los resultados no nos dicen nada útil sobre los verdaderos límites del coche. Los científicos llaman a esto "saturación de los puntos de referencia" (benchmark saturation). Cuando una prueba se vuelve demasiado fácil, no podemos saber si los robots realmente se están volviendo más inteligentes o si simplemente han memorizado las respuestas. Para solucionar esto, necesitamos una prueba que sea tan difícil, tan profunda y tan específica que incluso los humanos más brillantes tengan dificultades con ella. Aquí es donde entra el nuevo artículo, presentando un desafío masivo y aterradoramente difícil diseñado para ser la prueba de estrés definitiva para la inteligencia artificial.
El artículo presenta el Examen de la Última Humanidad (HLE, por sus siglas en inglés), una gigantesca colección de 2,500 preguntas increíblemente difíciles que cubren desde matemáticas y física avanzadas hasta historia y biología oscuras. Piensa en esto como las "Olimpiadas del Conocimiento" para la IA, pero en lugar de correr o saltar, los robots tienen que resolver problemas que requieren el conocimiento profundo y especializado de un profesor con doctorado. Los creadores no se limitaron a tomar preguntas de un libro de texto; pidieron a cientos de expertos del mundo real —científicos, investigadores y profesores de más de 500 instituciones de todo el globo— que escribieran preguntas totalmente nuevas que los modelos de IA actuales no pudieran resolver. El objetivo era crear un examen de "respuesta cerrada", lo que significa que cada pregunta tiene una única respuesta correcta (como una opción múltiple o un número corto), para que podamos calificar a los robots de manera justa sin tener que adivinar qué quisieron decir.
Cuando los investigadores finalmente sometieron a prueba a los modelos de IA más avanzados del mundo, los resultados fueron un choque. A pesar de ser las computadoras más inteligentes del planeta, estos modelos puntuaron terriblemente mal. El modelo con mejor desempeño logró acertar solo alrededor del 13.4% de las preguntas, mientras que otros puntuaron tan bajo como el 2.7%. Para ponerlo en perspectiva, si tú estuvieras tomando este examen, obtener un 13% de aciertos sería una nota reprobatoria, pero para estas máquinas superinteligentes, esa fue en realidad la puntuación más alta alcanzada. El artículo sugiere que todavía existe una brecha masiva entre lo que la IA puede hacer hoy y el nivel de razonamiento humano profundo y experto requerido para resolver estos problemas.
Aún más interesante es cómo se comportaron los robots cuando se quedaban atascados. En lugar de decir "no lo sé", los modelos respondieron con total confianza con la respuesta incorrecta. Los investigadores descubrieron que la confianza de la IA estaba completamente desincronizada con su capacidad real; estaban "alucinando" con alta confianza. El artículo midió este "error de calibración" y encontró que era increíblemente alto, a menudo por encima del 80%. Es como un estudiante que está 100% seguro de que escribió "gato" como "g-a-t-o" y se equivoca, y luego insiste en que tiene razón. Esto sugiere que, aunque la IA está mejorando en muchas cosas, todavía carece de una verdadera comprensión de sus propios límites y puede ser peligrosamente excesivamente confiada cuando enfrenta desafíos complejos y desconocidos.
El artículo también destaca que estas preguntas fueron diseñadas para que fuera imposible hacer trampa. No podías simplemente buscar la respuesta en Google o consultarla en una base de datos porque las preguntas eran originales, requiriendo a menudo una síntesis de conocimiento específico y de nicho que no existe en el internet abierto. Para asegurar que las preguntas fueran verdaderamente difíciles, el equipo realizó una "verificación de dificultad" donde probaron cada una de las preguntas contra los mejores modelos de IA primero. Si una IA podía resolverla, la pregunta era descartada. Registraron más de 70,000 intentos por parte de la IA antes de encontrar las 13,000 preguntas que confundieron a las máquinas, las cuales fueron luego refinadas por expertos humanos para crear las 2,500 preguntas finales del examen.
En resumen, este artículo no afirma que la IA haya alcanzado un nivel de "superinteligencia" mágica. En cambio, sugiere que finalmente hemos encontrado una regla lo suficientemente larga para medir qué tan lejos estamos todavía. Los autores advierten que, si bien la IA está mejorando rápidamente, aún no está lista para reemplazar a los expertos humanos en campos que requieren un razonamiento profundo y verificado. Incluso ofrecen un fondo de premios de $500,000 para incentivar a más expertos a escribir este tipo de preguntas difíciles, asegurando que el examen se vuelva cada vez más difícil a medida que la IA se vuelve más inteligente. El artículo concluye que, aunque este pueda ser el último "examen académico" que necesitemos darle a la IA en su forma actual, está lejos de ser el último punto de referencia que necesitaremos, sirviendo como un crucial baño de realidad tanto para investigadores como para responsables de políticas.
Resumen Técnico: El Último Examen de la Humanidad (HLE)
Planteamiento del Problema
Los Modelos de Lenguaje Extensos (LLMs) han avanzado rápidamente, alcanzando una precisión superior al 90% en los bancos de pruebas establecidos como MMLU. Esta saturación limita la capacidad de medir con precisión las capacidades de los modelos de vanguardia, particularmente en la frontera del conocimiento humano. Los bancos de pruebas existentes a menudo no logran distinguir entre modelos que simplemente han memorizado los datos de entrenamiento y aquellos que poseen verdaderas habilidades de razonamiento de nivel experto. En consecuencia, existe una necesidad crítica de un banco de pruebas académico de opción cerrada más desafiante que pueda evaluar eficazmente la brecha entre las capacidades actuales de la IA y la pericia humana.
Metodología
Construcción del Conjunto de Datos
Humanity's Last Exam (HLE) es un banco de pruebas multimodal que comprende 2,500 preguntas extremadamente desafiantes en docenas de materias, incluyendo matemáticas, ciencias naturales, humanidades e ingeniería. El conjunto de datos fue construido a través de un esfuerzo de colaboración global que involucró a casi 1,000 expertos en la materia de más de 500 instituciones en 50 países.
El proceso de creación siguió un riguroso flujo de trabajo de múltiples etapas:
- Envío y Filtrado por LLM: Las preguntas fueron enviadas por expertos y validadas primero contra LLMs de vanguardia (por ejemplo, GPT-4O, Gemini 1.5 Pro, Claude 3.5 Sonnet, O1).
- Se requirieron preguntas de coincidencia exacta que frustraran a todos los modelos probados.
- Se requirieron preguntas de opción múltiple que frustraran a todos excepto a un modelo para contabilizar el azar en las respuestas.
- Aproximadamente 13,000 preguntas que frustraron a los LLMs fueron remitidas para revisión humana.
- Revisión por Expertos: Se llevaron a cabo dos rondas de revisión humana realizadas por revisores con títulos de posgrado (Maestría, Doctorado, Juris Doctor, etc.) en sus respectivos campos.
- Ronda 1: Se centró en refinar iterativamente los envíos para asegurar que fueran de opción cerrada, robustos y de alta calidad.
- Ronda 2: Seleccionó las mejores preguntas para la inclusión en el conjunto de datos final, asegurando el cumplimiento de los criterios de envío.
- Control de Calidad: Se requería que las preguntas fueran precisas, inequívocas, resolubles y no rastreables (resistentes a la búsqueda simple en internet). Por lo general, requerían pericia de nivel de posgrado o conocimiento de temas altamente específicos. Se estableció un fondo de premios de $500,000 para incentivar envíos de alta calidad.
- Refinamiento Post-Lanzamiento: Tras el lanzamiento inicial, se llevó a cabo un programa de recompensas por errores (bug bounty) de la comunidad y una auditoría dirigida por estudiantes de las principales universidades de EE. UU. para identificar y corregir errores de etiquetado e inexactitudes mayores en las declaraciones. Se planea una versión "HLE-Rolling" para actualizaciones continuas.
Configuración de la Evaluación
Los autores evaluaron LLMs multimodales de vanguardia en HLE utilizando un prompt de sistema estandarizado que estructura las respuestas en "Razonamiento" seguido de una "Respuesta Final".
- Métricas: El rendimiento se midió mediante la Precisión (Accuracy) y el Error de Calibración RMS.
- Calibración: Se instó a los modelos a proporcionar puntuaciones de confianza (0–100%) junto con sus respuestas. El error de calibración mide la discrepancia entre la confianza declarada y la precisión real.
- Juicio: Se utilizó un juez automatizado (O3-MINI) para verificar la corrección de las respuestas frente a la verdad fundamental (ground truth), teniendo en cuenta formatos equivalentes (por ejemplo, decimales frente a fracciones).
Contribuciones Clave
- Dataset HLE: El lanzamiento de un banco de pruebas multimodal de 2,500 preguntas diseñado para ser el último banco de pruebas académico de opción cerrada de su tipo, cubriendo más de cien materias.
- Proceso de Curación Riguroso: Un flujo de trabajo novedoso que combina el filtrado automatizado por LLM con una revisión humana de múltiples etapas para asegurar que las preguntas sean tanto difíciles para los modelos actuales como científicamente válidas.
- Evaluación Exhaustiva: Un análisis detallado del rendimiento de los modelos de vanguardia, destacando no solo la precisión, sino también los errores de calibración y el uso de tokens.
- Lanzamiento Público: El lanzamiento público del conjunto de datos (con un conjunto privado reservado para evitar el sobreajuste) en
lastexam.aipara servir como punto de referencia común para investigadores y responsables de políticas.
Resultados
La evaluación de los modelos de vanguardia en HLE revela limitaciones significativas en las capacidades actuales de la IA:
- Baja Precisión: Todos los modelos probados lograron puntuaciones de precisión muy bajas. El modelo con mayor rendimiento, O3-MINI (High), alcanzó un 13.4% de precisión. Otros modelos oscilaron entre el 2.7% (GPT-4O) y el 8.5% (DeepSeek-R1).
- Calibración Deficiente: Los modelos exhibieron errores de calibración RMS elevados, que oscilaron entre el 73% y el 89%. Esto indica que los modelos proporcionan frecuentemente respuestas incorrectas con alta confianza, fallando al reconocer cuándo las preguntas exceden sus capacidades.
- Eficiencia de Tokens: Los modelos de razonamiento requirieron sustancialmente más cómputo de inferencia (tokens de finalización) para lograr mejoras marginales en el rendimiento en comparación con los modelos que no son de razonamiento.
- Rendimiento por Dominio: El rendimiento varió según el dominio, con los modelos desempeñándose generalmente un poco mejor en Matemáticas e Ingeniería en comparación con Humanidades, aunque todas las puntuaciones se mantuvieron bajas.
Significado y Reivindicaciones
El artículo postula que HLE proporciona una herramienta necesaria para rastrear el progreso de la IA a medida que los modelos se acercan al rendimiento experto humano.
- Midiendo la Frontera: HLE ofrece una medida clara de la brecha entre los LLMs actuales y el rendimiento académico de nivel experto en preguntas de opción cerrada y verificables.
- Informando la Gobernanza: Al proporcionar mediciones de capacidad precisas, HLE busca informar las trayectorias de investigación, las evaluaciones de riesgo y las políticas de gobernanza.
- Limitaciones: Los autores declaran explícitamente que un alto rendimiento en HLE demostraría capacidades de nivel experto en problemas académicos estructurados, pero no sugeriría por sí solo capacidades de investigación autónoma o "Inteligencia Artificial General" (AGI). HLE evalúa el conocimiento y el razonamiento estructurados en lugar de la creatividad o la investigación de código abierto.
- Perspectiva Futura: Dada la rápida velocidad del desarrollo de la IA, los autores reconocen que los modelos podrían superar el 50% de precisión en HLE para finales de 2025, sugiriendo que, si bien HLE puede ser el último examen académico necesario, no es el último banco de pruebas requerido para la IA.
El artículo concluye que HLE sirve como un punto de referencia crítico para que la comunidad científica evalúe si los sistemas de IA están realmente dominando las fronteras del conocimiento humano o simplemente explotando patrones estadísticos en los datos existentes.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.
Recibe los mejores artículos de NLP cada semana.
Utilizado por investigadores de Stanford, Cambridge y la Academia Francesa de Ciencias.
Revisa tu bandeja de entrada para confirmar tu suscripción.
Algo salió mal. ¿Intentar de nuevo?
Sin spam, cancela cuando quieras.