← Últimos artigos
🤖 AI

QED-Nano: Teaching a Tiny Model to Prove Hard Theorems

O artigo apresenta o QED-Nano, um modelo de linguagem aberto de apenas 4 bilhões de parâmetros que, através de um processo de treinamento em três etapas envolvendo fine-tuning supervisionado e aprendizado por reforço com cache de raciocínio, alcança desempenho competitivo em provas matemáticas de nível olímpico, superando modelos abertos muito maiores e aproximando-se de sistemas proprietários com custo de inferência significativamente reduzido.

Autores originais: LM-Provers, Yuxiao Qu, Amrith Setlur, Jasper Dekoninck, Edward Beeching, Jia Li, Ian Wu, Lewis Tunstall, Aviral Kumar

Publicado 2026-04-07
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: LM-Provers, Yuxiao Qu, Amrith Setlur, Jasper Dekoninck, Edward Beeching, Jia Li, Ian Wu, Lewis Tunstall, Aviral Kumar

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um jovem prodígio de 4 anos (o modelo de IA chamado QED-Nano) e quer ensiná-lo a resolver os problemas de matemática mais difíceis do mundo, como os do Olimpíada Internacional de Matemática (IMO). Normalmente, para resolver esses problemas, você precisaria de um "gênio" adulto com uma biblioteca inteira de livros (modelos gigantes de 100 bilhões de parâmetros), o que é caro e difícil de acessar.

A grande pergunta deste artigo é: Será que podemos treinar esse "criança" pequena para pensar como um gênio, sem precisar de um cérebro gigante?

A resposta é sim. Os autores criaram o QED-Nano, um modelo pequeno que, com o método certo, consegue provar teoremas tão bem quanto modelos gigantes e até concorre com sistemas proprietários caríssimos.

Aqui está como eles fizeram isso, usando analogias do dia a dia:

1. O Problema: A Criança vs. O Gigante

Antes, para resolver problemas de matemática complexa, a IA precisava de "cérebros" enormes (como o Gemini 3 Pro ou o DeepSeek-Math-V2). Eles funcionavam bem, mas eram como fábricas industriais: custam milhões para operar, ninguém sabe exatamente como foram construídos e são difíceis de estudar.

O QED-Nano é como uma pequena oficina de bairro. É leve, barata e totalmente aberta para todos verem como funciona. O desafio era fazer essa pequena oficina produzir obras-primas de engenharia.

2. A Receita Mágica: 3 Passos para Transformar a Criança em Mestre

Os autores não apenas jogaram dados na criança; eles usaram uma receita de treinamento em três etapas, como se estivessem educando um atleta de elite:

Etapa 1: A Aula de Estilo (SFT - Ajuste Fino Supervisionado)

  • A Analogia: Imagine que a criança está aprendendo a escrever. Ela sabe falar, mas não sabe escrever um ensaio formal. Então, eles a colocaram para ler e copiar os melhores trabalhos de um Mestre de 685B (o DeepSeek-Math-V2).
  • O que aconteceu: A criança aprendeu a "maneira" de escrever provas matemáticas. Ela aprendeu a estrutura, o vocabulário e como organizar os pensamentos.
  • O Problema: A criança começou a imitar demais. Ela escrevia textos tão longos e repetitivos que se perdia no meio do caminho (como um aluno que escreve 10 páginas de "blá blá blá" para tentar parecer inteligente).

Etapa 2: O Treino com Critérios Rigorosos (RL com Rubrica)

  • A Analogia: Agora que ela sabe escrever, precisamos ensiná-la a pensar. Em vez de apenas dizer "está certo" ou "está errado" (como um professor que dá apenas um X ou um V), eles criaram um julgador com uma lista de critérios detalhada (uma "rubrica").
  • Como funciona: O modelo tenta resolver um problema. O "julgador" (uma IA menor, mas inteligente) lê a prova e dá pontos parciais: "Você provou o passo A, ganha 1 ponto. Esqueceu de justificar o passo B, perde 2 pontos. O raciocínio está confuso, perde mais 1 ponto".
  • O Resultado: A criança aprende que não basta chegar à resposta certa; ela precisa construir o caminho de forma lógica e rigorosa. Ela começa a melhorar seus "músculos" de raciocínio.

Etapa 3: O "Gabinete de Pensamento" (Reasoning Cache)

  • A Analogia: Este é o truque mais genial. Imagine que a criança está resolvendo um quebra-cabeça gigante. Se ela tentar resolver tudo de uma vez, ela fica cansada e confusa.
  • A Solução: Eles ensinaram a criança a parar, resumir o que fez até agora, e começar de novo com esse resumo.
    • Passo 1: Pense um pouco.
    • Passo 2: Escreva um resumo curto do que descobriu (o "Cache" ou "Memória").
    • Passo 3: Use esse resumo para pensar no próximo passo.
  • O Efeito: Isso permite que a criança "pense" por horas (milhões de tokens) sem se perder. É como se ela tivesse um diário de bordo onde anota suas descobertas e as usa para avançar, em vez de tentar segurar tudo na cabeça de uma vez só.

3. Os Resultados: A Pequena Oficina Venceu o Gigante?

Os resultados foram impressionantes:

  • Sozinha: O QED-Nano (sem ajuda extra) já superou modelos muito maiores (como o Nomos-1 de 30B) em testes de prova matemática.
  • Com o "Gabinete de Pensamento": Quando permitiram que o modelo usasse o método de resumo e refinamento (o scaffold), ele saltou de 40% para 57% de acerto em provas muito difíceis.
  • Comparação: Ele chegou perto do desempenho de gigantes proprietários (como o Gemini 3 Pro), mas custando uma fração do preço para rodar.

4. Por que isso é importante?

Este trabalho mostra que não precisamos de modelos gigantes e caros para resolver problemas difíceis.

  • Custo: É muito mais barato treinar e rodar um modelo pequeno com uma boa estratégia de "pensamento lento" do que usar um modelo gigante.
  • Transparência: Como o QED-Nano é aberto, qualquer pesquisador pode estudar como ele funciona, melhorar o método e compartilhar o conhecimento.
  • O Futuro: A lição principal é que a qualidade do treinamento (ensinar a pensar, resumir e revisar) é mais importante do que apenas aumentar o tamanho do cérebro da IA.

Resumo em uma frase:
Os autores pegaram um modelo pequeno, ensinaram a imitar mestres, treinaram com critérios rigorosos e deram a ele um "diário de bordo" para pensar passo a passo, transformando uma pequena IA em uma máquina de provar teoremas capaz de competir com os maiores do mundo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →