← Ultimi articoli
🤖 AI

Agents' Last Exam

Questo articolo introduce Agents' Last Exam (ALE), un benchmark dinamico sviluppato con oltre 250 esperti del settore per valutare gli agenti IA su compiti del mondo reale a lungo termine e dal valore economico, attraverso 13 cluster industriali, con l'obiettivo di colmare il divario tra il successo degli attuali benchmark e un dispiegamento significativo rilevante per il PIL.

Autori originali: Yiyou Sun, Xinyang Han, Weichen Zhang, Yuanbo Pang, Tianyu Wang, Yuhan Cao, Yixiao Huang, Chris Duroiu, Haoyun Zhang, Jeffrey Lin, Weishu Zhang, Tyler Zeng, Ying Yan, Bo Liu, Hanson Wen, Mingyang Xu
Pubblicato 2026-06-05
📖 5 min di lettura🧠 Approfondimento

Autori originali: Yiyou Sun, Xinyang Han, Weichen Zhang, Yuanbo Pang, Tianyu Wang, Yuhan Cao, Yixiao Huang, Chris Duroiu, Haoyun Zhang, Jeffrey Lin, Weishu Zhang, Tyler Zeng, Ying Yan, Bo Liu, Hanson Wen, Mingyang Xu, Xiaoyuan Liu, Zimeng Chen, Weiyan Shi, Amanda Dsouza, Vincent Sunn Chen, Patrick Bryant, Carl Boettiger, Yamini Rangan, Bradley Rothenberg, Kyle Steinfeld, Arvind Rao, Tapio Schneider, Georgios Yannakakis, Laure Zanna, Kaan Ozbay, Ida Sim, Tarek Zohdi, George Em Karniadakis, Jack Gallant, Teresa Head-gordon, Yushan Li, Wenxi Deng, Tao Sun, Huiqi Wang, Zhun Wang, Justin Xu, Chris Yuhao Liu, Yafei Cheng, Rongwang Hu, Aras Bacho, Shengcao Cao, Zengyi Qin, Yixiong Chen, Hengduan Fan, Hao Liu, Lin Zeng, Shashank Muralidhar Bharadwaj, Litian Gong, Yingxuan Yang, Maojia Song, Ruheng Wang, Zongzheng Zhang, Honglin Bao, Shuo Lu, Jianhong Tu, Zhonghua Wang, Zheng Zhang, Zijiao Chen, yanqiong Jiang, Zhendong Li, Bohan Lyu, Chang Ma, Peiran Xu, Benran Zhang, Shangding Gu, Haoyue Hua, Haoyang Li, Wanzhe Liao, Chengzhi Liu, Junbo Peng, Haoran Sun, Zechen Xu, Bo Chen, Jiayi Cheng, Yi Jiang, Keying Kuang, Yuan Li, Youbang Pan, Ziyan Rao, Alexander Schubert, Yifan Shen, Vincent Siu, Xiatao Sun, Kangqi Zhang, Xiaopan Zhang, Yuchen Zhu, Ishaan Singh Chandok, Lei Ding, Jingxuan Fan, Andrew Glover, Jiaming Hu, Yiran Hu, Wenbo Huang, Zixin Jiang, Haoran Jin, Lukas Kim, Ming Liu, Yang Liu, Alireza Rafiei, Xuhuan Shen, Kunyang Sun, Sophia Sun, Ting Sun, Eric Wang, Yixin Wang, Hanwen Xing, Sihan Xu, Yuzheng Xu, Zhongxing Xu, Zhiling Yan, Boqin Yuan, Ruiqi Zhang, Yifan Zhang, Zibo Zhao, Liana, Santanu Bosu Antu, Haoyue Bai, Carlo Bosio, Joseph Cavanagh, Patricia Cavazos-Rehg, Tianxing Chen, Xuewen Chen, Yipu Chen, Zhu Chenyu, Chen Dai, Stefano De Castro, Yunfu Deng, Kaustubh Dhole, Jiayuan Ding, Chenchen Du, Zhehang Du, Hao Fan, Run-ze Fan, Hengyu Fu, Shi Gu, Yifan Gu, Charlie Guo, Baihe Huang, Baixiang Huang, Rimika Jaiswal, Zhihan Jiang, Ran Jin, Erin Kasson, Xin Lan, Joseph Lee, Deren Lei, Chenyu Li, Daofeng Li, Haitao Li, Hongwei Li, Jingyan Li, Xiao Li, Yi Li, Yinsheng Li, Yuangang Li, Zhixu Li, Wenyu Liang, Longtai Liao, Kevin Qinghong Lin, AndyZeyi Liu, Che Liu, Jiaming Liu, Kaiyuan Liu, Xuan Liu, Pan Lu, Wenbo Lv, Yicheng Lv, Qiuyang Mang, Kyle Montgomery, Yuzhou Nie, Ruoxi Ning, Jorin Overwiening, Xu Pan, Layna Paraboschi, Core Francisco Park, Justin Purnomo, Swati Rajwal, Scott Rankin, Bixuan Ren, Yiren Rong, HaoYang Shang, Ventus Shaw, Fiona Shen, Jiawei Shen, Minqi Shi, Qiu Shi, Huaxiu Yao, Tianneng Shi, Jonah So, Vladislav Susoy, Hannah Szlyk, Haocheng Wang, Jialu Wang, Wei Wang, Xinyu Wang, Zehao Wang, Dowling Wong, Angela Wu, Dehao Wu, Fangyu Wu, Mengyuan "Millie" Wu, Yu Wu, Yuchen Wu, Yuhao Wu, Qingpo Wuwu, Weihang Xiao, Yongyi Xiong, Fan Xu, Ruiling Xu, Mingxuan Yan, Benjamin Yang, Jirong Yang, Sen Yang, Xiaoli Yang, Yushi Yang, Haoran Ye, Xiaohu Yu, Zhengming Yu, Chenlong Zhang, Chi Zhang, Hanning Zhang, Hanwen Zhang, Junge Zhang, Kunpeng Zhang, Song Zhang, Wenjin Zhang, Wenshuo Zhang, Ying Zhang, Yizhi Zhang, Brian Zhao, Qijian Zhao, Yimin Zhao, Yuhaohua Zheng, Liwei Zhou, Tianyue Zhou, Sichen Zhu, Siqi Zhu, Yan Zhu, Yishu Zhu, Jierui Zuo, Chonghao Cai, Helena Casademunt, Wenjia Chen, Benjamin Cheng, Nawen Deng, Rao Fu, Tianfu Fu, Yifan Han, Ren He, Zhenyu He, Qiao Jin, Lang Lang, Yuetai Li, Sylvia Liu, Lu Lu, Qing Lu, Subhabrata Mukherjee, Yunqi Ouyang, Yin Ren, Dawei Shi, Haoran Wu, Zhiyue Wu, Hannah Yao, Zhuoran Yi, Jenny Yu, Rhea Zhan, Hang Zhou, Blake Zhu, Junfan Zhu, Alan Yuille, Yang Liu, Russell Alan Poldrack, Jiachen Li, Zhenglu Li, Molei Tao, Jing Huang, Wenqi Shi, Costas Spanos, Lichao Sun, Chenguang Wang, Orson Xu, Zhen Dong, Hector Gomez, Aylin Caliskan, Ali Emami, Haimin Hu, Zhi Li, Lihui Liu, Murphy Niu, Yi Shao, Jianxin Sun, Mikko Tolonen, Ting Wang, Sanjiv Das, Yanjun Gao, Wenbo Guo, Erika J Schneider, Zhiyong Lu, Mark Mueller, Radha Poovendran, Somayeh Sojoudi, Dawn Song

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immaginate di aver addestrato un robot chef per anni. Lo avete testato con quiz sulle ricette, gli avete chiesto di nominare gli ingredienti e persino di seguire istruzioni semplici come "taglia la cipolla". In questi test, il robot ottiene punteggi perfetti. Sembra un genio della cucina.

Ma poi, gli chiedete di cucinare una cena completa e complessa per un ristorante affollato durante l'ora di punta. Improvvisamente, il robot brucia la salsa, dimentica l'ordine o si confonde con la stufa. Si scopre che essere bravi a parlare di cucina non è la stessa cosa che essere bravi a fare il lavoro.

Questo è esattamente il problema che il documento "Agents' Last Exam" (ALE) sta cercando di risolvere.

Il Problema: La Trappola del "Quiz"

Per molto tempo, i ricercatori di IA hanno testato i loro agenti IA (programmi informatici intelligenti) su benchmark che sono simili a quiz a scelta multipla. Questi test sono ottimi per misurare ciò che un'IA sa, ma non misurano ciò che un'IA sa fare nel mondo reale.

Gli autori sostengono che il fatto che un'IA possa superare un test di matematica o un quiz di programmazione non significhi che possa effettivamente gestire un'azienda, progettare un ponte o gestire la pianificazione di un ospedale. Il divario tra "superare il test" e "generare profitto" è enorme.

La Soluzione: L' "Ultimo Esame"

Per risolvere questo problema, il team ha creato ALE (Agents' Last Exam). Pensate a questo non come a un quiz, ma come a un vero colloquio di lavoro finale per l'IA.

Invece di chiedere: "Qual è la capitale della Francia?" o "Scrivi un ciclo Python", ALE fornisce all'IA un progetto reale, disordinato e plurigiornaliero che un professionista umano farebbe realmente.

  • I Compiti: L'esame copre 55 diversi settori lavorativi (come l'ingegneria, la medicina, la finanza e il game design).
  • La Difficoltà: I compiti sono a "lungo termine" (long-horizon), il che significa che richiedono ore o giorni per essere completati. Richiedono all'IA di aprire diversi programmi software, cliccare pulsanti, scrivere codice, controllare file e correggere i propri errori, proprio come farebbe un dipendente umano.
  • La Fonte: Questi non sono compiti finti inventati dai ricercatori. Sono progetti reali che oltre 250 esperti del settore hanno effettivamente svolto nel loro lavoro. Gli esperti hanno inviato i loro lavori passati e il team li ha trasformati in test.

Come Funziona l'Esame

Immaginate l'IA seduta davanti a un computer in un uffico virtuale.

  1. L'Assegnazione: L'IA riceve un compito del mondo reale, come "Progetta uno stampo per un componente automobilistico" o "Analizza queste radiografie mediche".
  2. Gli Strumenti: L'IA deve usare software reali (come strumenti di modellazione 3D, fogli di calcolo finanziari o software di imaging medico) proprio come farebbe un essere umano. Deve cliccare menu, digitare comandi e gestire file.
  3. La Valutazione: Questa è la parte geniale. L'esame non si affida a un insegnante umano che guarda il risultato e dice: "Sembra buono!". Sarebbe troppo lento e soggettivo. Inveve, l'esame utilizza controlli automatizzati.
    • Se il compito era costruire un modello 3D, il computer controlla se le dimensioni sono esattamente corrette.
    • Se il compito era scrivere un rapporto finanziario, il computer controlla se i numeri tornano correttamente.
    • Se l'IA fallisce un "gate" (come commettere un errore che danneggerebbe una macchina), riceve immediatamente zero, indipendentemente da quanto sia bello il resto del lavoro.

I Risultati: L'IA è Ancora a Scuola

Il documento ha testato i più intelligenti agenti IA del mondo su questo esame. I risultati sono stati severi:

  • Il Livello "Facile": Anche i migliori agenti IA hanno superato solo circa il 30% dei compiti considerati "a breve termine" (quelli più semplici).
  • Il Livello "Difficile": Sui compiti più difficili (il livello "Last Exam"), il tasso di successo è stato dello 0%. L'IA non è stata in grado di farli affatto.
  • Il Divario: Un'IA che ottiene l'82% in un test di programmazione standard (Terminal-Bench) ottiene solo circa il 25% in questo esame del mondo reale.

Gli autori lo chiamano "L'Ultimo Esame" perché rappresenta l'ultimo ostacolo. Se un'IA può superarlo, significa che è pronta per svolgere effettivamente il lavoro e sostituire un lavoratore umano. Al momento, il documento afferma che l'IA è ancora lontana dal superarlo.

Perché è Importante

Il documento non riguarda solo la creazione di un test più difficile; riguarda il cambiamento dell'obiettivo.

  • Obiettivo Attuale: Far sì che l'IA ottenga il 100% nei quiz.
  • Nuovo Obiettivo: Far sì che l'IA ottenga il 100% nei veri lavori che generano valore economico (PIL).

Gli autori credono che concentrandoci su questi compiti reali e verificabili, smetteremo di costruire IA che sono solo brave a parlare e inizieremo a costruire IA che sono brave a lavorare. Finché l'IA non sarà in grado di superare questo "Ultimo Esame", non sarà pronta per la forza lavoro reale.

Analogia Riassuntiva

Pensate agli attuali benchmark dell'IA come ai test teorici sulla guida. Potete memorizzare tutte le regole della strada e ottenere un punteggio perfetto. Ma ALE è l'esame pratico della patente, dove dovete effettivamente guidare un'auto nel traffico intenso, fare un parcheggio in doppia fila e navigare in una zona di lavori in corso senza colpire nulla.

Il documento dice: "I nostri conducenti IA sono bravissimi al test teorico, ma stanno ancora andando a sbattere nell'esame pratico. Smettiamo di celebrare i punteggi della teoria e iniziamo a insegnare loro come guidare davvero".

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →