← Últimos artigos
🤖 AI

Base Models Know How to Reason, Thinking Models Learn When

Este artigo revela que, embora os modelos base já possuam os mecanismos subjacentes para o raciocínio, os modelos de "pensamento" treinados com Aprendizado por Reforço aprendem primordialmente as heurísticas para orquestrar essas capacidades pré-existentes, ao passo que aqueles treinados via destilação de SFT adquirem mecanismos de raciocínio inteiramente novos.

Autores originais: Constantin Venhoff, Iván Arcuschin, Philip Torr, Arthur Conmy, Neel Nanda

Publicado 2026-07-08
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Constantin Venhoff, Iván Arcuschin, Philip Torr, Arthur Conmy, Neel Nanda

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Pergunta

Imagine que você tem um aluno muito inteligente e bem instruído (o Modelo Base) que conhece muitos fatos e consegue fazer matemática básica. Então, você treina esse aluno para se tornar um "Modelo de Pensamento" (como os novos modelos de IA que levam tempo extra para resolver problemas difíceis).

O grande mistério que este artigo tenta resolver é: O que exatamente o aluno aprendeu durante esse treinamento?

  • Eles aprenderam novas formas de pensar que não possuíam antes?
  • Ou eles apenas aprenderam quando usar as habilidades de pensamento inteligentes que já possuíam?

O Trabalho de Detetive: "Diferenciação Construtiva de Modelos" (Constructive Model Diffing)

Para responder a isso, os pesquisadores construíram uma ferramenta de detetive especial chamada Diferenciação Construtiva de Modelos. Pense nisso como desmontar uma máquina complexa para ver como ela funciona e, depois, tentar reconstruí-la usando apenas duas partes específicas:

  1. O "Como" (Mecanismos de Raciocínio): Estas são as habilidades reais, como "fazer divisão longa", "conferir seu próprio trabalho" ou "voltar atrás quando comete um erro". Os pesquisadores encontraram isso ao olhar para o cérebro do Modelo Base e identificar "interruptores" (vetores) específicos que podem forçá-lo a fazer essas coisas.
  2. O "Quando" (Heurísticas de Raciocínio): Esta é a parte da tomada de decisão. É um pequeno gerente interno que diz: "Ok, o problema é difícil, agora é a hora de conferir seu trabalho" ou "Estamos travados, agora é a hora de voltar atrás".

Os pesquisadores tentaram reconstruir o "Modelo de Pensamento" pegando o Modelo Base (que possui as habilidades) e dando a ele o Gerente do Modelo de Pensamento (que sabe quando usar as habilidades).

Os Dois Tipos de Treinamento

O artigo analisou duas maneiras diferentes pelas quais esses Modelos de Pensamento foram treinados:

1. O Grupo de "Aprendizado por Reforço" (RL - Reinforcement Learning)

Estes modelos foram treinados jogando um jogo onde ganhavam pontos por acertar a resposta e penalidades por errar. Eles tiveram que descobrir a estratégia por conta própria.

  • O Resultado: Quando os pesquisadores reconstruíram esses modelos usando a receita "Modelo Base + Gerente", funcionou incrivelmente bem. Eles recuperaram cerca de 76% da diferença de desempenho.
  • A Analogia: Imagine um pianista talentoso que já sabe tocar cada nota perfeitamente. O treinamento por RL foi como contratar um regente que ensinou a ele quando tocar rápido, quando desacelerar e quando fazer uma pausa para efeito. O pianista não precisou aprender novas notas; ele só precisava aprender o tempo.
  • Conclusão: O RL ensina o modelo a orquestrar as habilidades de raciocínio que ele já possui.

2. O Grupo de "SFT-Distillation" (Destilação por SFT)

Estes modelos foram treinados copiando um modelo "professor". Eles viram exemplos de como uma IA inteligente resolve um problema e foram instruídos a imitar essa resolução.

  • O Resultado: Quando os pesquisadores tentaram reconstruir esses modelos usando a mesma receita "Modelo Base + Gerente", o processo falhou. Eles recuperaram apenas cerca de 11% da diferença de desempenho.
  • A Analogia:** Imagine um aluno que é ensinado a copiar a caligrafia de um professor. Mas o professor está usando uma caneta que o aluno nunca segurou antes. O aluno aprende a copiar o formato das letras, mas não aprendeu como segurar a caneta ou a memória muscular necessária para escrever. O "Gerente" (o tempo/ritmo) está lá, mas o "Modelo Base" (a mão do aluno) não sabe realmente como realizar os movimentos específicos que o professor está fazendo.
  • Conclusão: A destilação por SFT força o modelo a aprender novos mecanismos de raciocínio (novas formas de pensar) que o modelo base não tinha. Você não pode apenas dizer ao modelo base quando fazer essas coisas; você precisa ensinar primeiro como fazê-las.

O Momento "Aha!"

O artigo encontrou uma diferença marcante:

  • Modelos de RL são como um mestre chef que já sabe picar, refogar e assar. O treinamento apenas ensinou a ele quando usar cada técnica para fazer um prato perfeito.
  • Modelos de Destilação são como um chef que viu um vídeo de um mestre chef fazendo um prato usando um tempero secreto que o chef desconhecia. O aluno aprendeu a copiar as ações de usar o tempero, mas teve que mudar fundamentalmente seu estilo de cozinha para incluir esse novo ingrediente.

Por Que Isso Importa?

O artigo conclui que o Aprendizado por Reforço (RL) é uma maneira muito eficiente de extrair o raciocínio de um modelo porque desbloqueia o que já está lá. Ele ensina o modelo a ser um melhor regente de sua própria orquestra.

Em contraste, a Destilação (copiar um professor) muitas vezes tenta ensinar habilidades inteiramente novas. Se o professor usa um estilo de raciocínio que o modelo base não possui naturalmente, o modelo base tem dificuldade em aprender apenas observando, o que leva a uma taxa de sucesso muito menor ao tentar "direcioná-lo" de volta ao seu estado original.

Resumo em Uma Sentença

Os modelos base já sabem como raciocinar; o Aprendizado por Reforço ensina quando usar essas habilidades, enquanto a Destilação tenta ensinar novas habilidades que o modelo base não sabia que era capaz de fazer.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →