← Últimos artigos
🤖 machine learning

RASFT: Rollout-Adaptive Supervised Fine-Tuning for Reasoning

O artigo propõe o RASFT, um framework de ajuste fino supervisionado consciente da política que ajusta dinamicamente o equilíbrio entre a imitação de especialistas e o raciocínio autogerado com base na resolubilidade do problema e na confiança da política, alcançando um desempenho superior em benchmarks de raciocínio matemático e de código em comparação com os métodos existentes de SFT e RL.

Autores originais: Yongliang Miao, Fengyuan Liu, Wei Shi, Yanguang Liu, Fei Sun, Na Zou, Mengnan Du

Publicado 2026-06-08
📖 4 min de leitura☕ Leitura rápida

Autores originais: Yongliang Miao, Fengyuan Liu, Wei Shi, Yanguang Liu, Fei Sun, Na Zou, Mengnan Du

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um aluno brilhante, mas um pouco teimoso, a resolver quebra-cabeças complexos, como problemas matemáticos avançados ou escrever código de computador.

O Jeito Antigo: "Apenas Copie o Mestre"

Tradicionalmente, quando treinamos esses modelos de IA (chamados de Large Language Models), usamos um método chamado Supervised Fine-Tuning (SFT). Pense nisso como entregar ao aluno uma solução única e perfeita escrita por um mestre professor e dizer: "Memorize este caminho exato. Faça exatamente o que eu fiz, palavra por palavra."

O problema é que o raciocínio não é apenas sobre copiar. Um quebra-cabeça pode ser resolvido de muitas maneiras diferentes e válidas. Se o aluno copiar rigidamente o caminho específico do mestre, ele pode:

  1. Esquecer sua própria intuição: Ele para de usar sua própria capacidade cerebral porque está ocupado demais imitando o professor.
  2. Sobreajustar-se à superfície: Ele aprende o estilo da resposta em vez da lógica por trás dela.
  3. Falhar quando estiver travado: Se o caminho do professor for difícil demais para o nível de habilidade atual do aluno, o aluno apenas fica confuso e desiste.

O Novo Jeito: RASFT (O "Treinador Inteligente")

O artigo apresenta um novo método chamado RASFT (Rollout-Adaptive Supervised Fine-Tuning). Em vez de um professor rígido, imagine um Treinador Inteligente que observa o aluno praticar antes de decidir o quanto deve intervir.

Aqui está como o Treinador funciona, passo a passo:

1. A Fase de "Experimentação" (Rollouts)

Antes da lição começar, o Treinador pede ao aluno que tente resolver o problema sozinho algumas vezes (estas são chamadas de "rollouts").

  • Se o aluno acertar: O Treinador diz: "Bom trabalho! Você claramente entende isso. Eu não preciso forçá-lo a copiar minha solução. Vamos olhar para sua própria resposta correta."
  • Se o aluno falhar: O Treinador diz: "Ok, você está tendo dificuldades com este aqui. Eu preciso intervir e mostrar a solução do mestre para guiá-lo."

Esta é a parte Adaptativa. A quantidade de "orientação do professor" muda com base em quão bem o aluno está se saindo naquele momento.

2. A "Rede de Segurança" (Razão Inversa)

Existe o risco de que, se o Treinador for prestativo demais, o aluno possa esquecer completamente sua própria maneira única de pensar e se tornar apenas um robô que só conhece o jeito do professor.

Para evitar isso, o RASFT usa uma Rede de Segurança. Ele verifica constantemente: "O aluno está se afastando demais de sua maneira natural e original de pensar?"

  • Se o aluno estiver mudando seu estilo drasticamente para corresponder ao do professor, a Rede de Segurança o puxa gentilmente de volta.
  • Isso garante que o aluno mantenha sua própria "personalidade de raciocínio" enquanto aprende novos truques, em vez de apenas sobrescrever seu cérebro com os dados do professor.

Por que Funciona Melhor

O artigo testou este "Treinador Inteligente" contra o "Professor Rígido" antigo e outros métodos em testes de matemática e programação.

  • O Resultado: Os alunos treinados com RASFT tornaram-se muito melhores em resolver problemas. Eles não apenas copiaram; eles aprenderam a combinar a sabedoria do professor com suas próprias habilidades crescentes.
  • A Analogia: Imagine um músico aprendendo uma música.
    • SFT Antigo: O aluno é forçado a tocar a partitura exatamente como escrita, mesmo que seja um músico de jazz. Ele perde suas habilidades de improvisação.
    • RASFT: O professor ouve o aluno improvisar. Se o aluno estiver tocando bem, o professor o deixa manter seu estilo de jazz. Se o aluno errar uma nota, o professor mostra a partitura para corrigir o erro específico. O aluno acaba se tornando um músico melhor e mais versátil.

O Problema (Limitações)

O artigo admite que este método não é gratuito.

  • Leva mais tempo: O "Treinador" tem que observar o aluno praticar (gerar rollouts) e verificar se ele está certo antes de ensinar. Isso é mais lento do que apenas entregar o gabarito.
  • Precisa de um gabarito claro: Isso funciona muito bem para matemática (onde a resposta é um número específico) e programação (onde o código ou funciona ou não funciona). É mais difícil de usar para perguntas abertas como "Escreva um poema", porque não há uma maneira fácil de verificar automaticamente se o poema está "correto".

Resumo

RASFT é uma maneira mais inteligente de treinar IA. Em vez de forçar cegamente a IA a copiar um único especialista, ele verifica a capacidade atual da IA. Se a IA estiver com dificuldades, ela se apoia fortemente no especialista. Se a IA estiver indo bem, ela permite que a IA confie em seu próprio raciocínio. Isso cria um modelo que é tanto conhecedor quanto flexível.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →