RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs
Este artigo apresenta um novo quadro analítico que examina trajetórias de raciocínio nos níveis de trajetória e de passo, revelando que o Aprendizado por Reforço com Recompensas Verificáveis (RLVR) comprime trajetórias incorretas e concentra o raciocínio em menos passos, enquanto o Ajuste Fino Supervisionado (SFT) expande trajetórias corretas e distribui o raciocínio ao longo de muitos passos, explicando assim o sucesso complementar do atual paradigma de treinamento em duas etapas.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
A Visão Geral: Duas Maneiras de Ensinar um Robô a Pensar
Imagine que você tem um robô que é bom em falar, mas não é ótimo em resolver problemas complexos de matemática ou de programação. Para torná-lo mais inteligente, os pesquisadores usam dois métodos principais de treinamento:
- SFT (Ajuste Fino Supervisionado): Isso é como imitação. Você mostra ao robô um exemplo perfeito de como um especialista humano resolve um problema, passo a passo, e diz: "Faça exatamente isso".
- RL (Aprendizado por Reforço): Isso é como tentativa e erro com um placar. Você deixa o robô tentar resolver o problema sozinho. Se ele acertar a resposta, ganha uma "estrelinha de ouro" (recompensa). Se errar, não ganha nada. Com o tempo, ele aprende a evitar os caminhos que levam ao fracasso.
O artigo pergunta: O que realmente acontece dentro do cérebro do robô quando usamos esses dois métodos diferentes? Eles mudam como o robô pensa ou apenas o que ele responde?
Os autores descobriram que esses dois métodos fazem coisas opostas ao "processo de pensamento" do robô.
Analogia 1: A "Trilha de Raciocínio" (Nível de Trajetória)
Imagine o processo de pensamento do robô como um caminhante atravessando uma floresta enorme e nebulosa para encontrar um tesouro escondido (a resposta correta). Existem muitos caminhos: alguns levam ao tesouro, e muitos levam a becos sem saída ou penhascos.
SFT (O Imitador) "Expande" os Bons Caminhos:
Quando você mostra ao robô um mapa de um especialista (SFT), ele aprende a andar pelo caminho correto. Mas aqui está a pegadinha: ele também começa a andar em muitas variações diferentes desse caminho correto. Ele se torna muito criativo e diversificado na forma como encontra o tesouro.- A Pegadinha: Ele não para de andar nos caminhos ruins. Se o robô já estava vagando por um pântano (cometendo erros), o SFT ensina a ele novas formas de andar, mas ele ainda pode vagar para o pântano ocasionalmente. Ele "expande" o número de rotas corretas, mas não necessariamente limpa as ruins.
RL (O Pontuador) "Aperta" os Caminhos Ruins:
Quando você deixa o robô jogar o jogo com recompensas (RL), ele percebe rapidamente que os caminhos do pântano levam a zero pontos. Então, ele para de andar por lá. Ele "aperta" todos os caminhos incorretos, confusos ou sem saída, fazendo-os desaparecer.- A Pegadinha: Ele também tende a "apertar" os bons caminhos. Ele pode parar de explorar variações criativas da resposta correta e apenas se ater ao único caminho que sabe funcionar melhor. Ele se torna muito focado, mas menos diversificado.
A Combinação Vencedora (SFT + RL):
O artigo explica por que a melhor prática atual é fazer SFT primeiro, depois RL.- Primeiro, use SFT para ensinar ao robô novas maneiras de encontrar o tesouro (expandindo os caminhos corretos).
- Depois, use RL para punir o robô por vagar para o pântano (apertando os caminhos incorretos).
- Resultado: Você obtém um robô que conhece muitas maneiras de resolver o problema, mas é muito disciplinado em evitar erros.
Analogia 2: A "Cidade de Pensamentos" (Nível de Passo)
Agora, vamos olhar para o pensamento do robô não como um único caminho, mas como um mapa de cidade. Cada "passo" no raciocínio (como "calcular a área" ou "verificar a fórmula") é um prédio nesta cidade. As conexões entre os passos são as ruas.
RL Cria uma Cidade "Hub-e-Raio":
Após o treinamento com RL, a cidade muda. O robô começa a depender fortemente de alguns prédios específicos, superimportantes (hubs). Ele visita esses passos-chave uma e outra vez.- O Efeito: A cidade torna-se muito eficiente, mas lotada ao redor desses poucos pontos. O robô concentra seu "poder de pensamento" em um pequeno número de passos críticos. É como um trabalhador que usa apenas três pontes específicas para atravessar o rio, ignorando todas as outras.
SFT Cria uma Cidade "Distribuída":
Após o treinamento com SFT, a cidade parece diferente. O robô espalha seu pensamento. Ele visita muitos prédios diferentes, e nenhum prédio único é visitado de forma tão avassaladora quanto na cidade de RL.- O Efeito: O pensamento é "homogeneizado" ou espalhado uniformemente. É como uma cidade onde todos usam uma grande variedade de ruas, e nenhuma rua única é um engarrafamento.
A Descoberta Chave:
- RL torna o pensamento do robô intenso e focado em alguns passos-chave (Apertando).
- SFT torna o pensamento do robô amplo e distribuído entre muitos passos (Expandindo).
A Forma da Cidade (Topologia)
Os pesquisadores também olharam para a "forma" dessas cidades de pensamento usando geometria.
- O Modelo Base (Antes do treinamento): A cidade está dividida em bairros isolados (comunidades). É difícil ir de um bairro para outro. O robô fica preso em loops locais.
- RL: Ele derruba os muros entre os bairros. Ele cria uma cidade dominada por alguns "hubs" massivos que conectam tudo. Isso torna o robô muito rápido em encontrar a resposta se ele acertar o hub certo, mas ele depende desses hubs específicos.
- SFT: Ele também derruba os muros, mas, em vez de criar hubs, ele constrói uma teia onde tudo está conectado a tudo o mais. Isso torna a cidade muito robusta e fácil de navegar de qualquer ponto para qualquer outro ponto.
Resumo das Alegações do Artigo
- RL é um "Apertador": Ele esmaga os caminhos de pensamento incorretos e concentra o raciocínio do robô em alguns passos altamente eficientes e de alto tráfego. Ele torna o robô muito bom em obter a resposta correta na primeira tentativa (Pass@1) eliminando opções ruins.
- SFT é um "Expansor": Ele ensina ao robô novas e corretas maneiras de pensar e espalha a carga de raciocínio por muitos passos. No entanto, ele não elimina automaticamente os caminhos ruins que o robô pode ter estado usando antes.
- Por que SFT + RL Funciona: Os melhores resultados vêm de usar o SFT para ensinar ao robô como pensar corretamente (expandindo os bons caminhos) e, em seguida, usar o RL para forçá-lo a parar de cometer erros (apertando os caminhos ruins).
- A Estrutura Importa: O RL cria uma estrutura de raciocínio "pesada em hubs", enquanto o SFT cria uma estrutura "distribuída". Ambas são diferentes da estrutura "fragmentada" de um modelo não treinado.
O artigo conclui que entender essas diferenças mecânicas ajuda a explicar por que a atual receita de treinamento "em duas etapas" (SFT seguido de RL) é tão bem-sucedida na criação de IA de raciocínio inteligente.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.