← Últimos artigos
🤖 AI

Where Rollouts Begin: Low-Load, High-Leverage First-Token Diversification for RLVR

O artigo apresenta o REFT, um método leve que aprimora o Aprendizado por Reforço com Recompensas Verificáveis (RLVR) ao diversificar o primeiro token após o marcador de raciocínio para ampliar a exploração durante a geração de trajetórias, melhorando assim o desempenho do modelo em diversas dimensões de tamanho e níveis de dificuldade sem alterar o pipeline de treinamento central.

Autores originais: Soeun Kim, Albert No

Publicado 2026-05-28
📖 3 min de leitura☕ Leitura rápida

Autores originais: Soeun Kim, Albert No

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

`) é quase sempre o mesmo.

  • A Analogia: Imagine pedir a um grupo de estudantes que resolva um problema de matemática. Mesmo sendo inteligentes, todos começam instintivamente a frase com "Primeiro, vamos..." ou "Para resolver isso...".
  • O Problema: O robô é tão confiante nessas palavras iniciais que quase nunca tenta começar com "Vamos...", "Dado que..." ou "Inicialmente...". Ele fica preso em uma rotina, repetindo a mesma frase inicial uma e outra vez.

Os autores descobriram algo surpreendente: A primeira palavra não altera realmente a matemática.

  • A Analogia: É como um viajante escolhendo entre um ônibus vermelho, um ônibus azul ou um ônibus verde para chegar à mesma cidade. A cor do ônibus (a primeira palavra) não altera o destino nem a rota percorrida dentro do ônibus. No entanto, se você deixar o robô pegar apenas o ônibus vermelho, você nunca verá como são os ônibus azul ou verde.
  • A Descoberta: Embora o robô pense que o "ônibus vermelho" (a primeira palavra mais comum) seja a melhor escolha, os "ônibus azul" e "verde" (palavras iniciais menos comuns) têm a mesma probabilidade de levar à resposta correta. O robô está apenas sendo muito exigente quanto à cor do ônibus.

A Solução: REFT (Exploração com Rolagem e Diversificação do Primeiro Token)

Os autores criaram uma solução simples chamada REFT. Em vez de deixar o robô escolher a primeira palavra naturalmente (o que geralmente leva à mesma palavra), o REFT força o robô a tentar intencionalmente algumas palavras iniciais diferentes.

  • Como funciona:

    1. O robô observa suas 20 palavras iniciais favoritas.
    2. O REFT seleciona 4 diferentes dessa lista (por exemplo, "Primeiro", "Vamos", "Dado", "Inicialmente").
    3. Em seguida, envia o robô por 4 caminhos diferentes, um para cada palavra inicial.
    4. Uma vez definida a primeira palavra, o robô continua resolvendo o restante do problema exatamente como faria normalmente.
  • A Analogia: Imagine um treinador dizendo a uma equipe de corredores: "Em vez de todos começarem com a mesma música de aquecimento, vamos fazer com que quatro grupos comecem com quatro músicas diferentes." Assim que a música começa, todos correm a mesma prova. O treinador não está mudando a prova; apenas garantindo que a equipe explore diferentes vibrações iniciais para ver se uma leva a um melhor resultado.

Por Que Isso Importa

O artigo mostra que, ao forçar o robô a tentar essas diferentes "linhas de abertura", ele descobre mais soluções corretas sem precisar de mais poder de computação ou alterar a matemática complexa por trás do treinamento.

  • Melhores Resultados: O robô ficou melhor em resolver problemas de matemática (medido pela frequência com que acertou a resposta em 1 tentativa, 8 tentativas ou 64 tentativas).
  • Sem Custo Extra: O treinamento não demorou mais. Na verdade, como o robô encontrou a resposta correta mais rapidamente, às vezes concluiu as tarefas ligeiramente mais rápido.
  • Evitando Grupos "Todos Errados": Às vezes, um grupo inteiro de tentativas falha porque todos começaram com a mesma "mentalidade errada". Ao diversificar o início, o REFT garante que pelo menos um grupo encontre o caminho certo.

Resumo

O artigo argumenta que, no raciocínio da IA, frequentemente buscamos diversidade no meio do processo de pensamento (os passos difíceis de matemática). Mas os autores descobriram que a primeira palavra é um ponto de "baixa carga, alta alavancagem". É fácil de mudar (é apenas uma palavra), mas tem um efeito enorme na variedade de soluções que a IA explora. Ao simplesmente alterar a primeira palavra, a IA torna-se uma melhor solucionadora de problemas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →