← Últimos artigos
📄 chemistry

JURY: A Comprehensive Training-Free to Fully-Supervised Framework for Evaluating Chemical Language Models

O artigo apresenta o JURY, um framework abrangente que utiliza quatro sondagens distintas, variando de métodos sem necessidade de treinamento até métodos totalmente supervisionados, para avaliar rigorosamente modelos de linguagem química, revelando que suas verdadeiras capacidades de codificação química são frequentemente obscurecidas por cabeças de predição poderosas e são mais comparáveis a impressões digitais tradicionais do que se pensava anteriormente.

Autores originais: Daanish Uddin Khan, Naafey Aamer, Muhammad Sajjad, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

Publicado 2026-08-19
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Daanish Uddin Khan, Naafey Aamer, Muhammad Sajjad, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Na corrida para descobrir novos medicamentos, os cientistas enfrentam um gargalo que retarda cada avanço: antes que um novo composto químico possa se tornar um fármaco, ele deve passar por uma série rigorosa de verificações de segurança. Os pesquisadores precisam saber se o corpo irá absorvê-lo, como ele viajará pelo sangue, se o fígado irá decompô-lo e se poderá ser tóxico. Essas verificações, conhecidas como absorção, distribuição, metabolismo, excreção e toxicidade, são caras e lentas para realizar em laboratório. Para acelerar o processo, os cientistas recorreram aos computadores, usando inteligência artificial para prever essas propriedades apenas observando a estrutura de uma molécula. Por anos, as ferramentas mais bem-sucedidas foram os "modelos de linguagem", treinados em milhões de fórmulas químicas escritas como sequências de texto. Esses modelos aprendem a comprimir uma molécula complexa em uma única lista fixa de números, uma impressão digital digital que captura sua essência química. A forma padrão de julgar o quão bons esses modelos são tem sido anexar uma ferramenta de previsão simples a eles, treinar essa ferramenta em um pequeno conjunto de dados experimentais e ver o quão bem ela adivinha a resposta. Se o palpite for bom, o modelo recebe uma pontuação alta.

No entanto, um novo estudo sugere que esse método padrão tem escondido uma verdade crucial. Os pesquisadores descobriram que a própria ferramenta de previsão muitas vezes está fazendo grande parte do trabalho pesado, o que mascara o que o modelo subjacente realmente aprendeu. Uma ferramenta poderosa pode aprender muito apenas com as respostas que lhe são dadas, mesmo que a impressão digital digital que ela está lendo seja fraca ou pouco útil. Para resolver isso, uma equipe de pesquisadores da Alemanha desenvolveu uma nova maneira de testar esses modelos, chamada JURY. Em vez de depender de uma única ferramenta treinada, eles usaram quatro métodos diferentes para ler as impressões digitais digitais desses modelos. Dois desses métodos não exigiam treinamento nenhum, apenas observando o quão próximas as moléculas estão umas das outras no espaço digital. Os outros dois métodos utilizaram um treinamento simples, variando de um cálculo básico de linha reta a uma rede pequena e flexível. Ao aplicar esses quatro métodos a dez modelos químicos diferentes em setenta e três testes de segurança distintos, a equipe descobou que os modelos são muito mais semelhantes entre si do que qualquer um imaginava. Nenhum modelo único era o melhor em tudo. Na verdade, um método artesanal, criado há décadas para descrever moléculas, teve o desempenho tão bom quanto o da IA moderna mais avançada em muitos casos.

A descoberta mais surpreendente foi que os modelos não diferem em quanto conhecimento químico detêm, mas em como organizam esse conhecimento. Alguns modelos organizam suas impressões digitais digitais de modo que moléculas com propriedades semelhantes fiquem naturalmente próximas, tornando-as fáceis de encontrar sem qualquer treinamento adicional. Outros modelos escondem esse mesmo conhecimento químico de uma forma que só é visível após um preditor ser treinado para reorganizar os dados. É como olhar para uma biblioteca onde um bibliotecário já organizou os livros por gênero, enquanto outro empilhou-os aleatoriamente, mas sabe exatamente onde encontrar um livro específico se você fizer a pergunta certa. O estudo mostrou que um modelo que se destaca na primeira abordagem pode falhar na segunda, e vice-versa. Isso significa que um único escore não pode dizer se um modelo é bom; você deve observar seu perfil através de diferentes métodos de teste para entender onde residem seus pontos fortes.

Os pesquisadores testaram dez diferentes modelos de linguagem química, incluindo vários que utilizam três famílias de transformers distintas, juntamente com um método tradicional artesanal conhecido como impressão digital de conectividade estendida. Eles aplicaram seus quatro métodos de teste a setenta e três tarefas diferentes, abrangendo desde como um fármaco é absorvido até o quão tóxico ele pode ser. Quando analisaram os resultados, descobriram que a classificação dos modelos mudava completamente dependendo de qual método de teste era utilizado. Um modelo que ficava em primeiro lugar quando testado com um método que não exigia treinamento frequentemente caía para o final da lista quando testado com um método que envolvia o treinamento de um preditor. Por outro lado, um modelo que tinha dificuldades sem treinamento subia ao topo da lista assim que um preditor simples era adicionado. Essa inconsistência provou que os modelos não eram simplesmente "melhores" ou "piores", mas que armazenavam seu conhecimento químico de formas fundamentalmente diferentes.

Um modelo, chamado MoLFormer-XL, demonstrou que havia organizado seu espaço digital de forma tão clara que moléculas com comportamentos semelhantes já estavam agrupadas. Ele teve um desempenho excepcional quando os pesquisadores simplesmente observaram os vizinhos mais próximos no espaço digital, sem treinar nenhuma ferramenta extra. Em contraste, outro modelo, o MolEncoder, teve um desempenho ruim quando os pesquisadores observaram o arranjo bruto do espaço. No entanto, uma vez que um preditor simples foi treinado em seus dados, o MolEncoder saltou para o topo dos rankings. Isso mostrou que o MolEncoder detinha a mesma quantidade de conhecimento químico, mas que este estava escondido em um formato que exigia uma ferramenta treinada para ser desbloqueado. O estudo também descobriu que o método de impressão digital tradicional, artesanal, que precede a IA moderna, frequentemente superou os modelos mais avançados quando nenhum treinamento era permitido, particularmente ao prever como os produtos químicos se comportam no corpo. Isso sugere que, para certas tarefas, a forma antiga de organizar dados químicos ainda é altamente eficaz.

A equipe concluiu que o campo tem dependido de um único número para julgar sistemas complexos, o que é como julgar um músico por apenas uma música. Um modelo pode ser excelente em um tipo de previsão, mas terrível em outra, dependendo de como seus dados internos estão estruturados. O novo framework, JURY, substitui esse escore único por um perfil detalhado que mostra como um modelo performa através de diferentes níveis de supervisão. Isso permite que os cientistas escolham a ferramenta certa para o trabalho. Se um pesquisador precisa fazer uma triagem rápida de uma biblioteca de produtos químicos sem gastar tempo treinando uma nova ferramenta, ele deve escolher um modelo que performe bem nos testes não treinados. Se ele tiver muitos dados e quiser treinar um preditor específico para uma tarefa de alto risco, pode escolher um modelo que se destaque apenas após o treinamento. Ao compreender onde o conhecimento de um modelo reside e como ele é organizado, os cientistas podem tomar melhores decisões sobre quais ferramentas usar, indo além de simples classificações para uma compreensão mais profunda do que essas inteligências artificiais realmente aprenderam.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →