← Ultimi articoli
💬 NLP

SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring

Il documento introduce SWE-bench ProMax, un benchmark multilingue di 170 compiti di refactoring del codice su larga scala rigorosamente curati, progettato per superare i difetti e la saturazione delle valutazioni esistenti, dimostrando che gli attuali agenti IA all'avanguardia faticano ancora con sfide complesse di ingegneria del software che preservino il comportamento.

Autori originali: Yuling Shi, Jinghan Xu, Kelin Fu, Wenhao Zeng, Shilin He, Lei Zhang, Yue Liu, Zelin Zhao, Terry Yue Zhuo, Jialun Cao, Siyu Ye, Tianyu Liu, Kai Cai, Shing-Chi Cheung, Xiaodong Gu

Pubblicato 2026-08-11
📖 3 min di lettura☕ Lettura da pausa caffè

Autori originali: Yuling Shi, Jinghan Xu, Kelin Fu, Wenhao Zeng, Shilin He, Lei Zhang, Yue Liu, Zelin Zhao, Terry Yue Zhuo, Jialun Cao, Siyu Ye, Tianyu Liu, Kai Cai, Shing-Chi Cheung, Xiaodong Gu

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immaginate un mondo in cui i computer stanno imparando a diventare ingegneri del software. Per anni, gli scienziati hanno testato questi "agenti di codifica IA" chiedendo loro di risolvere piccoli enigmi isolati, come scrivere una singola funzione per sommare due numeri. È come testare un pilota facendogli rullare un aereo sulla pista. Ma il vero software non è costruito una riga alla volta; è una metropoli massiccia e interconnessa di codice dove cambiare un singolo cartello stradale potrebbe richiedere l'aggiornamento di mappe, semafori e orari degli autobus in tutta la città. La grande domanda che i ricercatori si pongono è: questi agenti IA sono in grado di gestire la realtà disordinata e complessa di riscrivere enormi blocchi di software senza rompere nulla? Questo è il regno del "refactoring del codice": l'arte di riorganizzare l'impianto elettrico interno di un edificio senza cambiare il modo in cui le luci si accendono per le persone all'interno.

Entra in scena SWE-Bench ProMax, un nuovo test super impegnativo progettato per vedere se gli agenti IA sono pronti per le grandi leghe. I test precedenti erano come un videogioco in "Modalità Facile", dove l'IA poteva spesso contare sulla memorizzazione delle risposte o sulla risoluzione di problemi troppo semplici. I creatori di questo nuovo benchmark si sono resi conto che, se i test sono troppo facili o mal progettati, i punteggi elevati dell'IA sono solo un'illusione di intelligenza. Così, hanno costruito una sfida in "Modalità Difficile". Hanno raccolto 170 sfide software reali provenienti da sette diversi linguaggi di programmazione (tra cui Python, Java, C++ e Rust). Queste non sono piccole correzioni; sono ristrutturazioni massicce in cui l'IA deve coordinare modifiche attraverso una media di 11,4 file diversi e riscrivere oltre 260 righe di codice, il tutto assicurandosi che il software si comporti esattamente come prima.

I risultati sono un bagno di realtà per l'induste dell'IA. Quando i modelli IA più intelligenti e costosi sono stati lanciati in questa arena, non hanno vinto la sfida. Il miglior modello è riuscito a risolvere solo il 41,2% dei compiti. Ciò suggerisce che, sebbene l'IA stia diventando brava nei piccoli lavori domestici, fatica ancora con la coordinazione complessa e multi-step richiesta dalla vera ingegneria del mondo reale. Interessante notare che il documento ha scoperto che spendere più soldi per un modello non significava sempre ottenere risultati migliori; alcuni modelli open-source più economici hanno ottenuto prestazioni quasi uguali a quelle dei giganti costosi. Il motivo principale per cui l'IA è fallita? Tendeva a essere un lavoratore "parziale". Risolveva il problema principale ma dimenticava di aggiornare i file di supporto, come riparare un tubo che perde ma dimenticare di avvisare il contatore dell'acqua, causando il fallimento dell'intero sistema. Questo benchmark dimosta che la vera maestria nell'ingegneria del software per l'IA è ancora un lavoro in corso, che richiede un livello di pianificazione e coordinamento tra i file che gli agenti attuali non hanno ancora del tutto padroneggiato.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →