Breaking the Exascale Barrier for the Electronic Structure Problem in Ab-Initio Molecular Dynamics
Este artigo demonstra que um método de submatriz local não ortogonal modificado alcança mais de 1,1 EFLOP/s em 4.400 GPUs NVIDIA A100, permitindo simulações de dinâmica molecular ab initio de proteínas spike do SARS-CoV-2 contendo até 83 milhões de átomos.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA de um preprint que não foi revisado por pares. Não é aconselhamento médico. Não tome decisões de saúde com base neste conteúdo. Ler aviso legal completo
Para entender como a matéria se comporta em seu nível mais fundamental, os cientistas frequentemente recorrem a uma técnica chamada dinâmica molecular ab-initio. Esta abordagem tenta simular o movimento de átomos em moléculas, superfícies ou sólidos, calculando as forças que os empurram e puxam. Diferente de métodos mais antigos que dependem de regras empíricas simplificadas, esta técnica resolve o complexo problema quântico-mecânico dos elétrons diretamente. Ela trata os elétrons não como um pano de fundo vago, mas como os protagonistas principais cujo comportamento dita como os átomos interagem. Embora isso proporcione uma imagem altamente precisa de reações químicas e propriedades de materiais, isso vem com um preço elevado: o esforço computacional necessário cresce tão rapidamente com o tamanho do sistema que simular estruturas grandes e realistas foi considerado impossível por muito tempo. Durante décadas, os pesquisadores foram forçados a estudar fragmentos minúsculos de matéria, incapazes de ver o quadro completo de como bilhões de átomos se movem juntos em uma célula viva ou em um material complexo.
Uma equipe de pesquisadores da Universidade de Paderborn, na Alemanha, conseguiu agora ultrapassar essa barreira, demonstrando uma maneira de simular estruturas eletrônicas para sistemas contendo até 83 milhões de átomos. Ao adaptar um método conhecido como a técnica de submatrizes locais não ortogonais e executá-lo em um supercomputador massivo equipado com milhares de processadores gráficos especializados, eles alcançaram uma velocidade de computação sustentada de mais de 1,1 exaflops. Isso significa que o sistema realizou mais de um quintilhão de operações de ponto flutuante por segundo, um marco que coloca esta aplicação científica específica entre as primeiras a romper a barreira do "exaescala". Os pesquisadores não apenas executaram uma simulação; eles projetaram uma nova forma de organizar o trabalho matemático para que o hardware pudesse operar a quase 80 por cento de sua capacidade teórica máxima. O trabalho deles prova que, com os ajustes algorítmicos corretos, é possível calcular o comportamento quântico de proteínas inteiras em solução, abrindo as portas para o estudo de maquinaria biológica e materiais complexos com detalhes sem precedentes.
O desafio central nessas simulações é que, toda vez que um átomo se move, mesmo que por uma fração mínima, toda a estrutura eletrônica do sistema deve ser recalculada para determinar as novas forças que atuam sobre esse átomo. Nas abordagens tradicionais, esse recálculo torna-se proibitivamente lento à medida que o número de átomos aumenta. Os pesquisadores utilizaram um método que divide o enorme problema matemático em partes menores e gerenciáveis chamadas submatrizes. Em vez de tentar resolver a equação para todo o sistema de uma só vez, o computador isola pequenas seções dos dados, resolve-as independentemente e depois reassembla os resultados. Essa abordagem "local" evita a necessidade de comunicação constante entre diferentes partes do computador, o que geralmente é o gargalo em simulações de grande escala. A equipe aplicou este método a um alvo biológico específico: a proteína spike do vírus SARS-CoV-2, que é a estrutura que o vírus utiliza para se fixar às células humanas. Eles simularam a proteína ancorada em uma camada lipídica e cercada por água, criando um sistema com aproximadamente 1,7 milhão de átomos para seus testes iniciais, e depois escalonando para uma grade dessas proteínas para atingir um total de 83 milhões de átomos.
Para alcançar este nível de desempenho, os pesquisadores tiveram que ir além de simplesmente usar mais computadores; eles tiveram que repensar fundamentalmente como o software interage com o hardware. O supercomputador que utilizaram, localizado no National Energy Research Scientific Computing Center, está equipado com 4.400 unidades de processamento gráfico NVIDIA A100. Esses chips são projetados para lidar com quantidades massivas de cálculos paralelos, mas são mais eficientes quando trabalham com blocos de dados grandes e densos. A versão original do algoritmo criava submatrizes que eram frequentemente pequenas demais para utilizar plenamente o poder desses chips. A equipe introduziu uma nova heurística, ou um conjunto de regras para tomada de decisão, que combinava múltiplas colunas de dados em submatrizes maiores antes do processamento. Este ajuste não foi apenas um pequeno ajuste; foi uma mudança estratégica baseada nas características específicas de desempenho dos processadores gráficos. Ao medir a velocidade com que os chips multiplicavam matrizes de diferentes tamanhos, os pesquisadores otimizaram o agrupamento de dados para garantir que o hardware estivesse trabalhando em seu pico de eficiência. Essa modificação permitiu que o sistema sustentasse um nível de desempenho que anteriormente era considerado inalcançável para este tipo de cálculo.
Os resultados deste esforço foram medidos através da execução da simulação em uma grade de proteínas spike, criando efetivamente um ambiente virtual com 83 milhões de átomos. A equipe monitorou o tempo levado para completar cada etapa do cálculo e o número total de operações matemáticas realizadas. Eles descobriram que o sistema entregou consistentemente uma velocidade entre 1,106 e 1,127 exaflops, mantendo cerca de 80 por cento do desempenho de pico teórico do hardware. Este é um feito significativo porque os sistemas de computação de alto desempenho frequentemente lutam para manter alta eficiência ao escalar para milhares de processadores; geralmente, a eficiência cai conforme o overhead de comunicação aumenta. Neste caso, a natureza local do método significou que os processadores passaram quase todo o seu tempo calculando, em vez de esperar por dados. Os pesquisadores verificaram que a precisão da simulação permaneceu alta, garantindo que os ganhos de velocidade não viessem à custa da validade científica.
Este avanço não é apenas sobre simular um vírus; representa uma nova capacidade para a ciência computacional. A habilidade de modelar estruturas eletrônicas para sistemas com dezenas de milhões de átomos significa que os cientistas agora podem estudar fenômenos que antes estavam fora de alcance, como o comportamento de grandes biomoléculas em seus ambientes aquosos naturais ou as propriedades de materiais complexos sob estresse. O método é versátil o suficiente para ser aplicado a qualquer problema que exija a avaliação de uma função matemática para um grande conjunto de dados esparsos, não apenas dinâmica molecular. Ao demonstrar que o desempenho de exaescala é alcançável em uma aplicação científica do mundo real, os pesquisadores forneceram um modelo para a futura computação de alto desempenho. Eles mostraram que, ao alinhar o design algorítmico com as capacidades do hardware, é possível resolver problemas que antes eram considerados grandes demais para serem computados, trazendo o mundo mecânico-quântico de átomos e elétrons para um foco mais claro para o estudo da vida e da matéria.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.