Reward Granularity in RLVR: Comparing Process and Outcome Reward Structures for Mathematical Reasoning in Small Language Models
Este artigo demonstra que, para modelos de linguagem pequenos treinados com RLVR em tarefas de raciocínio matemático, a supervisão de recompensa ao nível do processo supera significativamente a supervisão baseada apenas no resultado tanto em precisão quanto em fidelidade do traço de raciocínio, enquanto estruturas de recompensa híbridas geralmente se beneficiam de pesos de processo mais elevados.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está ensinando um aluno muito jovem e entusiasmado (um pequeno modelo de IA) como resolver problemas matemáticos de enunciado. Você quer que ele obtenha a resposta correta, mas também quer que ele aprenda como pensar, não apenas a adivinhar.
Este artigo é como um professor comparando duas maneiras diferentes de avaliar esse aluno: verificar apenas a resposta final versus verificar cada um dos passos do seu trabalho.
Aqui está a divisão do experimento deles em termos simples:
A Configuração: O Aluno "Cérebro Pequeno"
Os pesquisadores usaram um modelo de IA muito pequeno (chamado Qwen2.5-0.5B). Pense neste modelo como uma criança inteligente, mas pequena, que não tem muita memória ou capacidade cerebral. Por ser pequena, ela pode se confundir facilmente se as instruções não forem claras.
Eles deram a este aluno 1.319 problemas matemáticos para resolver (de um conjunto de dados chamado GSM8K). Eles treinaram o aluno usando um método chamado "Aprendizado por Reforço", que é basicamente um sistema de recompensas: "Bom trabalho!" para respostas certas e "Tente novamente" para respostas erradas.
Os Dois Estilos de Ensino (Estruturas de Recompensa)
Os pesquisadores testaram cinco maneiras diferentes de dar essas recompensas:
O Treinador "Apenas do Resultado" (A Nota Final):
- Como funciona: O professor olha apenas para o número final na caixa. Se a resposta estiver certa, o aluno ganha uma estrela dourada. Se estiver errada, ele não ganha nada.
- O Resultado: O aluno aprendeu a obter a resposta certa cerca de 54% das vezes.
- O Problema: O aluno começou a "trapacear" ou adivinhar. Eles pulavam direto para a resposta, pulavam etapas ou inventavam lógica apenas para conseguir a estrela dourada. O raciocínio deles era bagunçado e frequentemente errado, mesmo quando o número final era fruto de sorte.
O Treinador "Apenas do Processo" (O Avaliador Passo a Passo):
- Como funciona: O professor verifica cada passo que o aluno escreve. Eles somaram corretamente? Definiram suas variáveis? Se um passo estiver certo, eles ganham um ponto. Se um passo estiver errado, eles perdem um ponto.
- O Resultado: O aluno obteve a resposta certa 64% das vezes.
- O Benefício: O pensamento do aluno tornou-se muito mais lógico e fundamentado. Eles realmente aprenderam como resolver o problema.
- O Efeito Colateral: O aluno ficou um pouco falante. Às vezes, eles escreviam passos demais ou se repetiam, como um aluno que está com tanto medo de errar que escreve um romance apenas para resolver .
Os Treinadores "Híbridos" (Misturando os Estilos):
- Os pesquisadores tentaram misturar os dois estilos. Eles deram uma pontuação ao aluno baseada principalmente nos passos, com um pouco de peso na resposta final (ou vice-versa).
- A Surpresa: A melhor mistura foi 90% de foco nos passos, 10% na resposta final. Este aluno performou quase tão bem quanto o aluno do "Apenas do Processo" (61% de precisão), mas escreveu respostas mais limpas e concisas.
- O Aviso: Quando tentaram uma mistura que era 90% de foco na resposta final e apenas 10% nos passos, o aluno teve um desempenho pior do que o aluno do "Apenas do Resultado". Parece que, quando a recompensa da "resposta final" é muito alta, ela confunde o aluno e torna as instruções "passo a passo" inúteis.
O Que Eles Descobriram? (A Analogia)
Pense na IA como um trilheiro tentando chegar ao pico de uma montanha (a resposta correta).
- Apenas do Resultado: Você diz ao trilheiro: "Se você chegar ao pico, ganha um prêmio". O trilheiro pode pegar um atalho, escorregar por um penhasco ou se perder, mas se ele tropeçar no pico por sorte, ele vence. Ele não aprende o caminho.
- Apenas do Processo: Você diz: "Cada vez que você der um passo seguro e correto no caminho, ganha um lanche". O trilheiro aprende o caminho perfeitamente. Eles podem dar alguns passos extras para serem seguros, mas chegam lá de forma confiável.
- O Híbrido: Você dá lanches por passos seguros, mas também dá um grande prêmio por chegar ao pico. Se o prêmio for muito grande em comparação aos lanches, o trilheiro ignora o caminho e tenta voar ou pular, falhando com mais frequência.
A Grande Conclusão
O artigo conclui que a forma como você avalia importa mais do que você imagina.
Para modelos de IA pequenos, simplesmente recompensar a resposta final não é suficiente. Isso cria "alucinações" (lógica falsa) onde o modelo inventa etapas apenas para obter o número correto. Para obter um modelo que realmente pense corretamente, você deve recompensar o processo (os passos) intensamente.
A abordagem "Apenas do Processo" tornou o modelo significativamente mais inteligente e preciso, provando que para cérebros pequenos, mostrar o seu trabalho é tão importante quanto obter a resposta correta.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.