← Últimos artigos
🤖 machine learning

Mat-Pref: Verifiable-Reward Training Improves Compositional Reasoning in Inorganic Materials

Este artigo apresenta o Mat-Pref, um benchmark de recompensa verificável para materiais inorgânicos, e demonstra que um pipeline de treinamento em duas etapas combinando ajuste fino supervisionado com Otimização de Política Relativa de Grupo (GRPO) supera significativamente modelos zero-shot maiores ao aprimorar o raciocínio composicional e a generalização para famílias de estruturas e propriedades não vistas.

Autores originais: Sarrah R. Mikhail Leung, Taehan Kim, Jeongbin Park

Publicado 2026-06-23
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Sarrah R. Mikhail Leung, Taehan Kim, Jeongbin Park

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um chef brilhante, mas inexperiente, a cozinhar uma refeição perfeita. Você tem uma biblioteca enorme de receitas (os dados de treinamento), mas o chef continua errando os ingredientes ou se perdendo nas instruções.

Este artigo, MAT-PREF, trata de ensinar um tipo específico de "chef" (uma Inteligência Artificial) a resolver quebra-cabeças complexos envolvendo materiais inorgânicos — pense neles como os blocos de construção para novas baterias, painéis solares ou chips de computador.

Aqui está a história do que eles fizeram, explicada de forma simples:

1. O Problema: O Chef Não Consegue "Raciocinar", Ele Apenas Chuta

Os pesquisadores queriam ver se grandes modelos de IA conseguiam descobrir a melhor maneira de substituir um ingrediente (um átomo) em uma estrutura cristalina por outro para torná-la mais forte ou mais eficiente.

Eles testaram quatro dos chefes de IA mais inteligentes do mundo (modelos com 70 a 671 bilhões de "células cerebrais"). Apesar de serem modelos gigantescos, eles acertaram apenas cerca de 33% a 54% das respostas.

  • A Analogia: É como dar a um gênio uma prova de matemática de múltipla escolha, mas ele continua escolhendo a resposta errada porque está apenas chutando com base na aparência das palavras, em vez de realmente fazer a conta. Eles ainda não aprenderam a lógica da química.

2. A Solução: Uma Nova "Academia de Treinamento" (MAT-PREF)

Para corrigir isso, a equipe construiu um novo campo de treinamento chamado MAT-PREF.

  • A Fonte: Eles usaram um banco de dados massivo e confiável de fatos químicos (Materials Project), onde cada resposta é verificada por uma simulação de computador superprecisa (chamada DFT). É como ter um professor que sabe a resposta exata para cada pergunta.
  • O Teste: Eles criaram mais de 10.000 perguntas. Algumas eram fáceis (semelhantes ao que a IA viu no treinamento), algumas eram difíceis (formas de cristais totalmente novas) e algumas eram traiçoeiras (usando as mesmas formas, mas perguntando sobre uma propriedade diferente, como "quanta luz ela bloqueia" em vez de "quão estável ela é").

3. O Método de Treinamento: Dois Passos para o Sucesso

Os pesquisadores não apenas alimentaram a IA com mais dados. Eles usaram um processo de treinamento de dois passos:

  • Passo 1: Ajuste Fino Supervisionado (SFT) – "Aprendendo as Regras"
    Primeiro, eles ensinaram a IA a pensar como um químico. Eles deram exemplos de perguntas e os passos de raciocínio corretos (ex: "Verifique o tamanho do átomo", "Verifique a carga elétrica").

    • Resultado: A IA ficou muito melhor em seguir o formato e entender a lógica, saltando de um chute quase aleatório para cerca de 45% de precisão. Mas ainda era inconsistente.
  • Passo 2: GRPO (Otimização de Política Relativa de Grupo) – "Aprendendo com os Erros"
    Este é o ingrediente secreto. Imagine que a IA tenta responder a uma pergunta 8 vezes.

    • Se ela acerta a resposta, recebe um "mimo" (recompensa).
    • Se ela erra, recebe um "não".
    • A IA então compara suas 8 tentativas. Ela aprende: "Ei, a resposta que escolhi na tentativa nº 3 estava certa, mas a da tentativa nº 7 estava errada. Devo parar de escolher a nº 7."
    • Resultado: Esse processo força a IA a parar de chutar e começar a se comprometer com a lógica correta.

4. Os Resultados: Um Pequeno Chef Vence os Gigantes

Após esse treinamento de dois passos, eles pegaram um modelo de IA relativamente pequeno (Qwen3-8B) e o testaram novamente.

  • O Choque: Este modelo pequeno e treinado obteve 65% a 71% de precisão.
  • A Comparação: Ele venceu os "gigantes" não treinados (que tinham 30 vezes mais poder cerebral) por uma margem enorme (mais de 20 pontos percentuais).
  • O Custo: Eles realizaram todo esse treinamento por menos de US$ 50.

5. Por Que Isso Importa: Consistência é a Chave

O artigo descobriu algo fascinante sobre como a IA melhorou.

  • Antes: A IA sabia a resposta às vezes, mas era como um aluno nervoso que sabia a resposta, mas tinha medo de levantar a mão. Se você fizesse a mesma pergunta com uma redação ligeiramente diferente (distratores), a IA oscilava entre o certo e o errado.
  • Depois: O treinamento tornou a IA confiante. Ela não apenas encontrou a resposta certa; ela aprendeu a manter o posicionamento.
    • A Analogia: Pense em um aluno fazendo uma prova. Antes, ele poderia circular "A" em uma versão da questão e "B" em outra, mesmo que a lógica fosse a mesma. Depois do treinamento, ele circula "A" todas as vezes porque realmente entendeu o conceito.

Resumo

O artigo mostra que tamanho não é tudo. Você não precisa do maior e mais caro modelo de IA para resolver problemas científicos complexos. Em vez disso, você precisa de um método de treinamento inteligente que use fatos verificados para ensinar a IA a raciocinar de forma lógica e confiante. Ao usar esta nova "academia" (MAT-PREF) e o treinamento de dois passos, uma IA pequena aprendeu a superar os gigantes na tarefa de descobrir como construir melhores materiais.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →