← Ultimi articoli
🔬 materials science

BOOM: Benchmarking Out-Of-distribution Molecular Property Predictions of Machine Learning Models

Questo articolo introduce BOOM, il primo benchmark open-source chimicamente informato per valutare sistematicamente la generalizzazione fuori distribuzione (OOD) nella predizione delle proprietà molecolari, rivelando che gli attuali modelli di apprendimento automatico faticano a estrapolare oltre i propri dati di addestramento e sottolineando la necessità di nuovi approcci per ottenere una prestazione OOD robusta.

Autori originali: Evan R. Antoniuk, Shehtab Zaman, Tal Ben-Nun, Peggy Li, James Diffenderfer, Busra Sahin, Obadiah Smolenski, Everett Grethel, Tim Hsu, Anna M. Hiszpanski, Kenneth Chiu, Bhavya Kailkhura, Brian Van Esse
Pubblicato 2026-09-17
📖 6 min di lettura🧠 Approfondimento

Autori originali: Evan R. Antoniuk, Shehtab Zaman, Tal Ben-Nun, Peggy Li, James Diffenderfer, Busra Sahin, Obadiah Smolenski, Everett Grethel, Tim Hsu, Anna M. Hiszpanski, Kenneth Chiu, Bhavya Kailkhura, Brian Van Essen

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

La ricerca di nuovi medicinali e materiali spesso inizia con una domanda semplice e scoraggiante: quali tra i miliardi di possibili strutture chimiche funzioneranno davvero? Per decenni, gli scienziati si sono affidati al metodo del tentativi ed errori, ma una nuova ondata di intelligenza artificiale promette di accelerare questo processo prevedendo come una molecola si comporterà prima ancora che venga costruita. Questi modelli informatici vengono addestrati su vaste librerie di sostanze chimiche note, imparando a riconoscere schemi che collegano la forma di una molecola alle sue proprietà, come quanto bene si dissolve in acqua o quanta energia rilascia quando brucia. La speranza è che questi modelli possano poi esaminare una molecola completamente nuova e mai vista prima e indovinare accuratamente il suo comportamento, permettendo di fatto ai ricercatori di progettare il futuro della chimica su uno schermo di un computer.

Tuttavia, c'è un grosso problema. La maggior parte di questi modelli di IA è eccellente nel riconoscere schemi all'interno dei dati con cui è stata istruita, ma spesso inciampa quando le viene chiesto di prevedere le proprietà di molecole che sono veramente diverse da tutto ciò che era presente nella loro libreria di addestramento. Nel mondo del machine learning, questo è noto come il problema dell' "out-of-distribution" (fuori distribuzione). È la differenza tra uno studente che impara a memoria le risposte di un test di pratica e uno che è effettivamente in grado di risolvere un problema nuovo e inaspettato. Se un modello non può generalizzare oltre i suoi dati di addestramento, diventa uno strumento per confermare ciò che già sappiamo, piuttosto che uno strumento per scoprire l'ignoto. Questa limitazione è un importante collo di bottiglia per la prossima generazione di scoperta di farmaci e scienza dei materiali, dove l'obiettivo è trovare molecole che spingano i confini di ciò che è attualmente possibile.

Un team di ricercatori del Lawrence Livermore National Laboratory e della Binghamton University ha esaminato attentamente questo problema con un nuovo benchmark chiamato BOOM. Invece di testare solo quanto bene i modelli si comportano su dati familiari, hanno progettato un insieme rigoroso di test specificamente per vedere se questi sistemi di intelligenza artificiale riescono a gestire l'infamiliarità. Hanno raccolto dieci diversi dataset contenenti migliaia di molecole, che vanno da piccoli composti organici a strutture complesse con specifiche proprietà elettroniche. Per ogni dataset, hanno separato attentamente le molecole in tre gruppi: un set di addestramento, un set di test standard di molecole familiari e un set di test speciale "out-of-distribution". Questo gruppo speciale consisteva in molecole con proprietà estreme — valori così alti o così bassi da apparire raramente nei dati di addestramento. I ricercatori hanno poi messo alla prova quindici diversi modelli di machine learning, chiedendo a ciascuno di essi di prevedere le proprietà di queste molecole estreme.

I risultati sono stati severi. Nonostante le impressionanti capacità dell'intelligenza artificiale moderna, lo studio ha scoperto che nessun modello singolo poteva prevedere costantemente le proprietà di queste molecole estreme in tutti i compiti. Anche i modelli con le migliori prestazioni commettevano errori su questi casi difficili e inediti che erano tre volte superiori ai loro errori sui dati familiari. I ricercatori hanno osservato un comune modo di fallimento: i modelli erano bravi a raggruppare molecole simili, ma fallivano nel prolungare le loro previsioni nel territorio sconosciuto. Inveve di ipotizzare un valore che fosse veramente al di fuori dell'intervallo di ciò che avevano visto, i modelli tendevano a comprimere le loro previsioni, riportando i valori estremi verso la media. Questo comportamento suggerisce che i modelli stiano imparando scorciatoie che funzionano bene per i dati standard, ma che si interrompono quando si trovano di fronte alla vera novità richiesta dalla scoperta scientifica.

Il team ha anche indagato sul perché questi modelli avessero difficoltà e ha testato diverse strategie comuni per risolvere il problema. Hanno esaminato se il pre-addestramento dei modelli su enormi dataset di miliardi di molecole — una tecnica che ha rivoluzionato i modelli linguistici — potesse aiutare. Sorprendentemente, hanno scoperto che, sebbene il pre-addestramento rendesse i modelli migliori nel gestire i dati familiari, non migliorava la loro capacità di prevedere valori estremi. In effetti, per alcuni modelli, il pre-addestramento ha reso le prestazioni out-of-distribution peggiori. Hanno anche testato se aggiungere semplicemente più dati al set di addestramento potesse aiutare. Sebbene l'inclusione di un piccolo numero di esempi estremi abbia migliorato le prestazioni per alcune proprietà, non è stata una cura universale. Lo studio suggerisce che il modo in cui questi modelli sono attualmente costruiti, in particolare la loro dipendenza dalle rappresentazioni testuali delle molecole, possa essere un limite fondamentale alla loro capacità di comprendere le leggi fisiche profonde che governano il comportamento chimico.

Una delle scoperte più rivelatrici è stata che il tipo di rappresentazione dei dati contava più della dimensione del modello. I modelli che utilizzavano informazioni geometriche tridimensionali sugli atomi e sulle loro posizioni hanno ottenuto prestazioni significativamente migliori rispetto a quelli che si affidavano a stringhe di testo lineari, che sono come nomi chimici scritti in una sequenza. I modelli tridimensionali, che rispettano le simmetrie fisiche dello spazio, sono stati in grado di generalizzare molto meglio ai casi estremi. Questo indica una via chiara da seguire: per costruire un'IA che possa davvero scoprire la nuova chimica, i modelli devono essere radicati nella realtà fisica di come gli atomi si muovono e interagiscono, piuttosto che solo nei modelli di come essi vengono descritti nel testo. I ricercatori hanno concluso che ottenere prestazioni elevate in questi compiti difficili richiederà probabilmente una combinazione di dataset più grandi e diversificati e modelli che comprendano esplicitamente la struttura elettronica delle molecole.

Il benchmark BOOM funge da realtà dei fatti per il settore, mostrando che l'attuale generazione di IA chimica, pur essendo potente, non è ancora pronta per navigare in modo affidabile nell'ignoto. Lo studio non sostiene che il problema sia insolubile, ma esclude l'idea che basti aumentare la scala dei modelli esistenti o utilizzare tecniche di pre-addestramento standard per risolverlo. Invezione, evidenzia che la prossima frontiera del machine learning chimico richiede un cambiamento nel modo in cui questi sistemi vengono progettati. Fornendo un modo standardizzato per testare questa specifica debolezza, i ricercatori sperano di guidare la comunità verso la costruzione di modelli che non siano solo bravi a ricordare il passato, ma che siano veramente capaci di immaginare il futuro. Il percorso per scoprire la prossima generazione di farmaci salvavita e materiali avanzati potrebbe dipendere dalla risoluzione di questo specifico enigma della generalizzazione.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →