← Últimos artigos
💬 NLP

Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling

Este artigo apresenta o Prefix-RFT, um método híbrido de ajuste fino que combina o ajuste fino supervisionado e o ajuste fino por reforço por meio de amostragem de prefixos para superar as limitações de cada abordagem individual, demonstrando desempenho e robustez superiores em tarefas de raciocínio matemático.

Autores originais: Zeyu Huang, Tianhao Cheng, Zihan Qiu, Zili Wang, Yinghui Xu, Edoardo M. Ponti, Ivan Titov

Publicado 2026-05-18
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zeyu Huang, Tianhao Cheng, Zihan Qiu, Zili Wang, Yinghui Xu, Edoardo M. Ponti, Ivan Titov

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um estudante muito inteligente, mas inexperiente, a resolver quebra-cabeças matemáticos complexos. Você tem duas maneiras principais de ensiná-lo, mas ambas apresentam uma falha grave por si só.

Os Dois Estilos de Ensino Defeituosos

  1. O Método "Copista" (Ajuste Fino Supervisionado ou SFT):
    Você senta o estudante com um livro didático de soluções perfeitas. Você diz: "Leia isto, memorize e escreva exatamente como está."

    • O Bom: O estudante aprende o formato correto e os fatos muito rapidamente.
    • O Ruim: O estudante se torna um robô. Se ele encontrar um quebra-cabeça ligeiramente diferente, ele congela, porque só sabe copiar, não como pensar. Ele imita o livro, mas não entende verdadeiramente a lógica.
  2. O Método "Tentativa e Erro" (Ajuste Fino por Reforço ou RFT):
    Você joga o estudante na parte funda da piscina. Você diz: "Vá resolver esses quebra-cabeças. Se você acertar a resposta, ganha uma estrela dourada. Se errar, não ganha nada."

    • O Bom: O estudante aprende a pensar criativamente e a encontrar novas soluções. Ele se torna muito bom em resolver problemas que nunca viu antes.
    • O Ruim: Sem um guia, o estudante pode desenvolver hábitos estranhos. Ele pode começar a falar em uma mistura de idiomas ou seguir caminhos bizarros e ineficientes apenas para ganhar uma estrela dourada. Além disso, se ele começar com um hábito ruim, é muito difícil quebrá-lo.

A Nova Solução: O Treinador "Prefixo" (Prefix-RFT)

Os autores deste artigo propõem um novo método chamado Prefix-RFT. Pense nele como um treinador híbrido que usa uma estratégia de "Dica Inicial".

Veja como funciona, usando uma analogia simples:

Imagine que o estudante está tentando resolver um labirinto.

  • A Maneira Antiga (SFT): Você entrega a ele um mapa de todo o labirinto e pede para memorizar o caminho.
  • A Maneira Antiga (RFT): Você o veda os olhos e pede para caminhar até encontrar a saída.
  • A Maneira Nova (Prefix-RFT): Você entrega a ele um mapa, mas apenas para os primeiros 20% do labirinto. Você diz: "Comece exatamente como este mapa mostra. Uma vez que você alcance este ponto, guarde o mapa e descubra o restante do labirinto sozinho."

Por que isso é brilhante?

  1. Oferece um início seguro: Ao forçar o estudante a seguir o caminho do especialista no início, você impede que ele se perca imediatamente em um beco sem saída (corrigindo o problema do RFT de "hábitos estranhos").
  2. Força o pensamento independente: Como o estudante deve descobrir o restante do labirinto sozinho, ele não se torna apenas um copista. Ele precisa usar seu cérebro para terminar o trabalho (corrigindo o problema do SFT de "falta de generalização").
  3. A Lógica da "Estrela Dourada": Se o estudante seguir o início do especialista e encontrar uma ótima solução para o restante, ele recebe uma recompensa enorme. Isso ensina ao modelo que o início do especialista foi uma boa ideia, mas que o término feito pelo próprio estudante também foi valioso.

O Filtro "Entropia" (A Válvula de Segurança)

O artigo menciona um detalhe técnico complicado chamado "Clipping Baseado em Entropia". Aqui está a versão simples:

Às vezes, o mapa do especialista é tão diferente do que o estudante sabe que, se ele tentar copiá-lo, pode ficar confuso e "quebrar o cérebro" (matematicamente, os "gradientes" ficam grandes demais).

Para corrigir isso, o treinador só permite que o estudante copie as partes do mapa onde ele está inseguro.

  • Se o estudante já conhece o primeiro passo perfeitamente, o treinador diz: "Pule isso, você já sabe."
  • Se o estudante está confuso sobre um passo, o treinador diz: "Olhe para o movimento do especialista aqui; é aqui que você precisa aprender."

Isso garante que o estudante aprenda com o especialista apenas onde realmente precisa de ajuda, sem ficar sobrecarregado.

O Que os Resultados Mostram

Os autores testaram isso em problemas matemáticos (como a competição AIME).

  • O Copista (SFT) era aceitável, mas não conseguia lidar com problemas novos e difíceis.
  • O Tentativa e Erro (RFT) era bom, mas às vezes ficava preso ou desenvolvia hábitos ruins.
  • O Treinador Prefixo (Prefix-RFT) venceu ambos. Ele aprendeu os padrões do especialista e manteve a capacidade de explorar novas soluções.

Na verdade, quando deram ao modelo um grande número de tentativas (como 2.048 tentativas) para resolver um único problema difícil, o Treinador Prefixo foi o único método que melhorou significativamente as chances de encontrar a solução. Isso provou que este método não apenas torna o modelo melhor em copiar; ele realmente eleva o teto do que o modelo é capaz de alcançar.

Em Resumo
O Prefix-RFT é como dar a um estudante "rodinhas de apoio" para a primeira parte de uma jornada e, em seguida, retirá-las para que ele possa percorrer o restante sozinho. Ele combina a segurança de um guia com a liberdade de exploração, resultando em um aprendiz que é ao mesmo tempo conhecedor e criativo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →