BOOM: Benchmarking Out-Of-distribution Molecular Property Predictions of Machine Learning Models
Este artigo apresenta o BOOM, o primeiro benchmark de código aberto quimicamente informado para avaliar sistematicamente a generalização fora da distribuição (OOD) na previsão de propriedades moleculares, revelando que os modelos atuais de aprendizado de máquina têm dificuldade em extrapolar além de seus dados de treinamento e destacando a necessidade de novas abordagens para alcançar um desempenho robusto de OOD.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
A busca pela descoberta de novos medicamentos e materiais começa frequentemente com uma pergunta simples e assustadora: quais das bilhões de estruturas químicas possíveis realmente funcionarão? Durante décadas, os cientistas confiaram em tentativa e erro, mas uma nova onda de inteligência artificial promete acelerar esse processo ao prever como uma molécula se comportará antes mesmo de ser construída. Esses modelos computacionais são treinados em vastas bibliotecas de produtos químicos conhecidos, aprendendo a reconhecer padrões que ligam a forma de uma molécula às suas propriedades, como o quão bem ela se dissolve na água ou quanta energia libera ao ser queimada. A esperança é que esses modelos possam, então, olhar para uma molécula completamente nova e inédita e adivinhar seu comportamento com precisão, permitindo efetivamente que os pesquisadores projetem o futuro da química em uma tela de computador.
No entanto, há um problema significativo. A maioria desses modelos de IA é excelente em reconhecer padrões dentro dos dados para os quais foram ensinados, mas frequentemente tropeça quando solicitada a prever as propriedades de moléculas que são verdadeiramente diferentes de qualquer coisa em sua biblioteca de treinamento. No mundo do aprendizado de máquina, isso é conhecido como o problema "fora da distribuição" (out-of-distribution). É a diferença entre um aluno que memoriza as respostas de um teste prático e um que consegue realmente resolver um problema novo e inesperado. Se um modelo não consegue generalizar além de seus dados de treinamento, ele se torna uma ferramenta para confirmar o que já sabemos, em vez de uma ferramenta para descobrir o desconhecido. Essa limitação é um grande gargalo para a próxima geração de descoberta de fármacos e ciência dos materiais, onde o objetivo é encontrar moléculas que expandam os limites do que é atualmente possível.
Uma equipe de pesquisadores do Lawrence Livermore National Laboratory e da Universidade de Binghamton analisou rigorosamente esse problema com um novo benchmark chamado BOOM. Em vez de apenas testar o quão bem os modelos performam em dados familiares, eles projetaram um conjunto rigoroso de testes especificamente para ver se esses sistemas de inteligência artificial conseguem lidar com o desconhecido. Eles reuniram dez conjuntos de dados diferentes contendo milhares de moléculas, variando de pequenos compostos orgânicos a estruturas complexas com propriedades eletrônicas específicas. Para cada conjunto de dados, eles separaram cuidadosamente as moléculas em três grupos: um conjunto de treinamento, um conjunto de teste padrão de moléculas familiares e um conjunto de teste especial "fora da distribuição". Este grupo especial consistia em moléculas com propriedades extremas — valores tão altos ou tão baixos que raramente aparecem nos dados de treinamento. Os pesquisadores então submeteram quinze modelos diferentes de aprendizado de máquina ao teste, pedindo a cada um que previsse as propriedades dessas moléculas extremas.
Os resultados foram desanimadores. Apesar das capacidades impressionantes da inteligência artificial moderna, o estudo descobriu que nenhum modelo único conseguia prever consistentemente as propriedades dessas moléculas extremas em todas as tarefas. Mesmo os modelos de melhor desempenho cometeram erros nesses casos difíceis e inéditos que foram três vezes maiores do que seus erros em dados familiares. Os pesquisadores observaram um modo de falha comum: os modelos eram bons em agrupar moléculas semelhantes, mas falhavam ao estender suas previsões para o território desconhecido. Em vez de adivinhar um valor que fosse verdadeiramente fora do intervalo do que haviam visto, os modelos tendiam a comprimir suas previsões, puxando os valores extremos de volta para a média. Esse comportamento sugere que os modelos estão aprendendo atalhos que funcionam bem para dados padrão, mas que falham quando confrontados com a verdadeira novidade necessária para a descoberta científica.
A equipe também investigou por que esses modelos tinham dificuldade e testou várias estratégias comuns para corrigir o problema. Eles examinaram se o pré-treinamento de modelos em conjuntos de dados massivos de bilhões de moléculas — uma técnica que revolucionou os modelos de linguagem — ajudaria. Surpreendentemente, descobriram que, embora esse pré-treinamento tornasse os modelos melhores em lidar com dados familiares, não melhorou sua capacidade de prever valores extremos. Na verdade, para alguns modelos, o pré-treinamento tornou o desempenho fora da distribuição ainda pior. Eles também testaram se simplesmente adicionar mais dados ao conjunto de treinamento ajudaria. Embora a inclusão de um pequeno número de exemplos extremos tenha melhorado o desempenho para algumas propriedades, não foi uma cura universal. O estudo sugere que a maneira como esses modelos são construídos atualmente, particularmente sua dependência de representações baseadas em texto de moléculas, pode estar limitando fundamentalmente sua capacidade de compreender as leis físicas profundas que regem o comportamento químico.
Uma das descobertas mais reveladoras foi que o tipo de representação de dados importava mais do que o tamanho do modelo. Modelos que utilizavam informações geométricas tridimensionais sobre os átomos e suas posições tiveram um desempenho significativamente superior aos que dependiam de sequências de texto lineares, que são como nomes químicos escritos em uma sequência. Os modelos tridimensionais, que respeitam as simetrias físicas do espaço, foram capazes de generalizar muito melhor para os casos extremos. Isso aponta para um caminho claro a seguir: para construir uma IA que possa verdadeiramente descobrir a nova química, os modelos precisam estar fundamentados na realidade física de como os átomos se movem e interagem, em vez de apenas nos padrões de como eles são descritos em texto. Os pesquisadores concluíram que alcançar um desempenho forte nessas tarefas difíceis exigirá provavelmente uma combinação de conjuntos de dados maiores e mais diversos e modelos que compreendam explicitamente a estrutura eletrônica das moléculas.
O benchmark BOOM serve como um choque de realidade para a área, mostrando que a geração atual de IA química, embora poderosa, ainda não está pronta para navegar confiavelmente no desconhecido. O estudo não afirma que o problema seja insolúvel, mas descarta a ideia de que simplesmente aumentar a escala dos modelos existentes ou usar técnicas de pré-treinamento padrão será suficiente para resolvê-lo. Em vez disso, destaca que a próxima fronteira no aprendizado de máquina químico exige uma mudança na forma como esses sistemas são projetados. Ao fornecer uma maneira padronizada de testar essa fraqueza específica, os pesquisadores esperam guiar a comunidade para a construção de modelos que não sejam apenas bons em lembrar o passado, mas que sejam verdadeiramente capazes de imaginar o futuro. O caminho para descobrir a próxima geração de medicamentos vitais e materiais avançados pode depender da resolução deste enigma específico de generalização.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.