Breaking the Exascale Barrier for the Electronic Structure Problem in Ab-Initio Molecular Dynamics
Questo articolo dimostra che un metodo di sottomatrice locale non ortogonale modificato raggiunge oltre 1,1 EFLOP/s su 4.400 GPU NVIDIA A100, consentendo simulazioni di dinamica molecolare ab-initio di proteine spike del SARS-CoV-2 contenenti fino a 83 milioni di atomi.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA di un preprint non sottoposto a revisione paritaria. Non è un consiglio medico. Non prendere decisioni sulla salute basandoti su questo contenuto. Leggi il disclaimer completo
Per comprendere come la materia si comporta al suo livello più fondamentale, gli scienziati ricorrono spesso a una tecnica chiamata dinamica molecolare ab-initio. Questo approccio tenta di simulare il movimento degli atomi in molecole, superfici o solidi, calcolando le forze che li spingono e li attraggono. A differenza dei metodi più vecchi che si basano su regole empiriche semplificate, questa tecnica risolve direttamente il complesso problema quantistico degli elettroni. Tratta gli elettroni non come un vago sfondo, ma come i protagonisti primari il cui comportamento detta il modo in cui gli atomi interagiscono. Sebbene ciò fornisca un quadro altamente accurato delle reazioni chimiche e delle proprietà dei materiali, comporta un prezzo elevato: lo sforzo computazionale richiesto cresce così rapidamente con la dimensione del sistema che simulare strutture grandi e realistiche è stato a lungo considerato impossibile. Per decenni, i ricercatori sono stati costretti a studiare minuscoli frammenti di materia, impossibilitati a vedere l'immagine completa di come miliardi di atomi si muovano insieme in una cellula vivente o in un materiale complesso.
Un team di ricercatori dell'Università di Paderborn, in Germania, ha ora superato questa barriera, dimostrando un modo per simulare le strutture elettroniche per sistemi contenenti fino a 83 milioni di atomi. Adattando un metodo noto come tecnica delle sottomatrici locali non ortogonali e facendolo girare su un supercomputer massiccio dotato di migliaia di processori grafici specializzati, hanno raggiunto una velocità di calcolo sostenuta di oltre 1,1 exaflops. Ciò significa che il sistema ha eseguito più di un quintilione di operazioni in virgola mobile al secondo, un traguardo che colloca questa specifica applicazione scientifica tra le primissime ad abbattere la barriera dell' "exascale". I ricercatori non si sono limitati a eseguire una simulazione; hanno progettato un nuovo modo per organizzare il lavoro matematico in modo che l'hardware potesse operare a quasi l'80 percento della sua massima capacità teorica. Il loro lavoro dimostra che, con le giuste regolazioni algoritmiche, è possibile calcolare il comportamento quantistico di intere proteine in soluzione, aprendo la porta allo studio del macchinario biologico e dei materiali complessi con un dettaglio senza precedenti.
La sfida centrale in queste simulazioni è che ogni volta che un atomo si muove, anche solo di una frazione minima, l'intera struttura elettronica del sistema deve essere ricalcolata per determinare le nuove forze che agiscono su quell'atomo. Nei approcci tradizionali, questo ricalcolo diventa proibitivamente lento all'aumentare del numero di atomi. I ricercatori hanno utilizzato un metodo che suddivide il massiccio problema matematico in pezzi più piccoli e gestibili chiamati sottomatrici. Invece di cercare di risolvere l'equazione per l'intero sistema in una sola volta, il computer isola piccole sezioni di dati, le risolve indipendentemente e poi riassembla i risultati. Questo approccio "locale" evita la necessità di una comunicazione costante tra le diverse parti del computer, che è solitamente il collo di bottiglia nelle simulazioni su larga scala. Il team ha applicato questo metodo a un bersaglio biologico specifico: la proteina Spike del virus SARS-CoV-2, ovvero la struttura che il virus utilizza per attaccarsi alle cellule umane. Hanno simulato la proteina ancorata in uno strato lipidico e circondata da acqua, creando un sistema con circa 1,7 milioni di atomi per i loro test iniziali, per poi scalare fino a una griglia di queste proteine per raggiungere un totale di 83 milioni di atomi.
Per raggiungere questo livello di prestazione, i ricercatori hanno dovuto andare oltre il semplice uso di più computer; hanno dovuto ripensare fondamentalmente il modo in cui il software interagisce con l'hardware. Il supercomputer che hanno utilizzato, situato presso il National Energy Research Scientific Computing Center, è dotato di 4.400 unità di elaborazione grafica NVIDIA A100. Questi chip sono progettati per gestire enormi quantità di calcoli paralleli, ma sono più efficienti quando lavorano su grandi blocchi densi di dati. La versione originale dell'algoritmo creava sottomatrici che erano spesso troppo piccole per sfruttare appieno la potenza di questi chip. Il team ha introato una nuova euristica, o un insieme di regole decisionali, che combinava più colonne di dati in sottomatrici più grandi prima dell'elaborazione. Questo aggiustamento non è stato un semplice accorgimento minore; è stato un cambiamento strategico basato sulle specifiche caratteristiche di prestazione dei processori grafici. Misurando la velocità con cui i chip potevano moltiplicare matrici di diverse dimensioni, i ricercatori hanno ottimizzato il raggruppamento dei dati per garantire che l'hardware lavorasse al massimo della sua efficienza. Questa modifica ha permesso al sistema di sostenere un livello di prestazione precedentemente ritenuto irraggiungibile per questo tipo di calcolo.
I risultati di questo sforzo sono stati misurati eseguendo la simulazione su una griglia di proteine Spike, creando effettivamente un ambiente virtuale con 83 milioni di atomi. Il team ha monitorato il tempo necessario per completare ogni fase del calcolo e il numero totale di operazioni matematiche eseguite. Hanno scoperto che il sistema forniva costantemente una velocità compresa tra 1,106 e 1,127 exaflops, mantenendo circa l'80 percento della prestazione teorica di picco dell'hardware. Questo è un risultato significativo perché i sistemi di calcolo ad alte prestazioni spesso faticano a mantenere un'elevata efficienza quando scalano su migliaia di processori; di solito, l'efficienza diminuisce all'aumentare dell'overhead di comunicazione. In questo caso, la natura locale del metodo ha permesso ai processori di trascorrere quasi tutto il tempo a calcolare piuttosto che ad attendere i dati. I ricercatori hanno verificato che l'accuratezza della simulazione rimanesse elevata, assicurando che i guadagni di velocità non avvenissero a scapito della validità scientifica.
Questa svolta non riguarda solo la simulazione di un virus; rappresenta una nuova capacità per la scienza computazionale. La capacità di modellare le strutture elettroniche per sistemi con decine di milioni di atomi significa che gli scienziati possono ora studiare fenomeni che erano precedentemente fuori portata, come il comportamento di grandi biomolecole nei loro ambienti acquosi naturali o le proprietà di materiali complessi sotto stress. Il metodo è abbastanza versatile da poter essere applicato a qualsiasi problema che richieda la valutazione di una funzione matematica per un grande insieme di dati sparsi, non solo alla dinamica molecolare. Dimostrando che le prestazioni exascale sono raggiungibili in un'applicazione scientifica reale, i ricercatori hanno fornito un modello per il futuro dell'informatica ad alte prestazioni. Hanno dimostrato che, allineando il design algoritmico con le capacità dell'hardware, è possibile risolvere problemi che un tempo erano considerati troppo grandi per essere computati, portando il mondo della meccanica quantistica di atomi ed elettroni in un fuoco più chiaro per lo studio della vita e della materia.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.