← Últimos artigos
💬 NLP

How to Fine-Tune a Reasoning Model? A Teacher-Student Cooperation Framework to Synthesize Student-Consistent SFT Data

O artigo propõe o framework TESSY, que utiliza uma cooperação alternada entre modelos professor e aluno para sintetizar dados de treinamento com raciocínio avançado e estilo consistente, superando as quedas de desempenho observadas ao usar apenas dados sintéticos gerados por modelos mais fortes para o ajuste fino de modelos de raciocínio.

Autores originais: Zixian Huang, Kaichen Yang, Xu Huang, Feiyang Hao, Qiming Ge, Bowen Li, He Du, Kai Chen, Qipeng Guo

Publicado 2026-04-17
📖 4 min de leitura☕ Leitura rápida

Autores originais: Zixian Huang, Kaichen Yang, Xu Huang, Feiyang Hao, Qiming Ge, Bowen Li, He Du, Kai Chen, Qipeng Guo

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

🧠 O Grande Problema: O "Mestre" e o "Aprendiz" que não se entendem

Imagine que você tem um Mestre Chef (um modelo de IA super inteligente, como o GPT-OSS-120B) e um Aprendiz de Cozinha (um modelo menor, como o Qwen3-8B).

O objetivo é ensinar o Aprendiz a cozinhar pratos complexos (resolver problemas de lógica e programação). A estratégia comum seria: o Mestre escreve o livro de receitas completo e o Aprendiz apenas copia.

O que deu errado?
O Mestre escreve as receitas com um estilo muito específico: ele usa frases como "Vamos analisar a química molecular", "Observe a estrutura cristalina", e explicações super técnicas. O Aprendiz, no entanto, tem um "jeito de falar" próprio. Ele pensa: "Ok, vamos ver...", "Hmm, talvez...", "Primeiro eu faço isso...".

Quando o Aprendiz tenta copiar o livro do Mestre, ele fica confuso. Ele não consegue apenas copiar a receita (a lógica), porque o estilo do texto (as frases de transição) é muito diferente do que ele está acostumado a usar. É como tentar aprender a falar português lendo um livro escrito em um dialeto muito antigo e formal; você acaba esquecendo como falar a sua própria língua e, pior, começa a falar mal em ambas.

No mundo das IAs, isso é chamado de "esquecimento catastrófico". O modelo pequeno tenta imitar o grande, perde sua própria identidade e, no final, fica pior do que antes.


💡 A Solução: O Projeto "TESSY" (A Cooperação)

Os autores do artigo criaram uma nova maneira de ensinar, chamada TESSY. Em vez de o Mestre escrever tudo e o Aprendiz copiar, eles decidiram fazer uma cozinha compartilhada.

A ideia é dividir o trabalho de escrever a resposta em duas partes:

  1. A Parte da "Solução" (O Cérebro): Quem sabe a resposta certa e a lógica complexa é o Mestre. Ele escreve apenas os pedaços técnicos: o código, a fórmula matemática, o passo a passo lógico.
  2. A Parte do "Estilo" (A Voz): Quem escreve as frases de conexão, os "Vamos ver", os "Ok, entendi" e a forma como o texto flui é o Aprendiz.

Como funciona na prática?
Imagine que o Mestre e o Aprendiz estão escrevendo um livro juntos, alternando parágrafos:

  • Aprendiz: "Ok, vamos ver. O problema é encontrar o menor número de operações..." (Estilo do aprendiz).
  • Mestre: "...então, a equação dinâmica é dp[i][j] = min(dp[i+1][j], ...)" (Lógica do mestre).
  • Aprendiz: "Hmm, isso faz sentido. Vamos tentar um exemplo..." (Estilo do aprendiz).
  • Mestre: "Se s[i] for igual a s[j], então..." (Lógica do mestre).

O resultado é um texto que tem a inteligência de um gênio (o Mestre) mas a voz e o ritmo de um estudante (o Aprendiz).


🛠️ A Ferramenta Mágica: O "Filtro de Fronteira"

Como saber exatamente onde o Mestre deve parar e o Aprendiz deve começar? Eles criaram um "filtro inteligente" (um preditor de fronteira).

É como se houvesse um editor de texto que olha para o que foi escrito e diz:

  • "Isso aqui é lógica pura? Então o Mestre continua."
  • "Isso aqui é apenas uma frase de transição ou um 'hum...'? Então o Aprendiz assume."

Se o Mestre escrever uma frase de transição que o Aprendiz não usaria, o filtro corta e pede para o Aprendiz reescrever aquela parte. Isso garante que o texto final seja perfeitamente natural para o modelo menor.


🏆 O Resultado: O Aprendiz Vira um Mestre (sem perder a voz)

Os testes mostraram que essa abordagem foi um sucesso estrondoso:

  • Método Antigo (Mestre escreve tudo): O Aprendiz tentou copiar e ficou pior. Ele perdeu 10% de sua capacidade de resolver problemas. Foi como tentar aprender a andar de bicicleta segurando o guidão de um caminhão.
  • Método TESSY (Cooperação): O Aprendiz melhorou em 11% a 16%! Ele aprendeu a lógica difícil do Mestre, mas manteve o seu próprio estilo de pensar.

A lição principal:
Para ensinar uma IA inteligente a pensar melhor, você não pode apenas jogar dados gerados por uma IA superpoderosa nela. Você precisa garantir que os dados "conversem" com a personalidade da IA que está aprendendo. O TESSY é a ponte que permite que o conhecimento do gigante seja absorvido pelo pequeno, sem que o pequeno precise deixar de ser ele mesmo.

Em resumo: Não force o aluno a falar como o professor; deixe o professor ensinar a matéria, mas deixe o aluno explicar com as próprias palavras.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →