← Últimos artigos
🤖 AI

RREDCoT: Segment-Level Reward Redistribution for Reasoning Models

O artigo apresenta o RREDCoT, um novo método que utiliza o próprio modelo de raciocínio para aproximar a redistribuição ideal de recompensa ao nível de segmento para traços de Chain-of-Thought, abordando assim a alta variância e a ineficiência computacional da atribuição de crédito de Monte Carlo tradicional no ajuste fino por reforço.

Autores originais: Mykyta Ielanskyi, Kajetan Schweighofer, Lukas Aichberger, Sepp Hochreiter

Publicado 2026-06-05
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Mykyta Ielanskyi, Kajetan Schweighofer, Lukas Aichberger, Sepp Hochreiter

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: A "Caixa Preta" do Raciocínio

Imagine que você está ensinando um aluno a resolver um problema de matemática muito difícil. O aluno escreve um longo processo de pensamento passo a passo (uma "Cadeia de Pensamento" ou Chain of Thought) antes de finalmente escrever a resposta.

Nos métodos atuais de treinamento de IA, o professor só dá o feedback ao final de tudo.

  • O Aluno: Escreve 50 páginas de pensamento, comete um erro na página 10, mas continua escrevendo e, eventualmente, adivinha a resposta certa na página 50.
  • O Professor: Diz: "Bom trabalho! Você acertou a resposta."
  • O Resultado: O aluno pensa: "Uau, meu erro na página 10 foi realmente útil!" ou "Não sei qual parte das minhas 50 páginas foi realmente útil."

Isso é chamado de problema da recompensa atrasada. Como a IA não sabe quais pensamentos específicos levaram ao sucesso, ela aprende de forma lenta e ineficiente. É como tentar aprender a dirigir um carro recebendo apenas um sinal de "Bom Trabalho" ou "Mau Trabalho" depois que você já estacionou, sem saber se virou o volante cedo demais ou se pisou no freio tarde demais.

A Solução: RREDCoT (A Ferramenta de "Rebobinar e Redistribuir")

Os autores criaram um novo método chamado RREDCoT (Reward REDistribution for Chain of Thoughts - Redistribuição de Recompensa para Cadeias de Pensamento).

Pense no RREDCoT como um editor inteligente que observa o rascunho de 50 páginas do aluno. Em vez de apenas dar uma nota à resposta final, o editor volta e atribui uma "pontuação" a cada parágrafo individualmente.

  • Parágrafo 1-5: "Boa preparação, mas não é crítica." (Pontuação baixa)
  • Parágrafo 10: "Este foi um caminho errado, mas você se recuperou." (Pontuação negativa)
  • Parágrafo 25: "Este foi o insight fundamental que resolveu o enigma!" (Pontuação alta)
  • Parágrafo 50: "Resposta correta." (Pontuação de bônus)

Ao dar crédito (ou culpa) a partes específicas do processo de pensamento, a IA aprende muito mais rápido quais pensamentos são realmente úteis.

Como Funciona (Sem a Matemática)

O artigo explica que métodos anteriores tentaram resolver isso de duas maneiras, ambas com falhas:

  1. O "Jogo de Adivinhação" (Amostragem Monte Carlo): A IA geraria o mesmo problema 100 vezes para ver quais passos geralmente levam ao sucesso. Isso é preciso, mas demora uma eternidade (como correr uma maratona 100 vezes apenas para descobrir a melhor rota).
  2. O "Jogo da Culpa" (Atribuição): Observar a "atenção" interna da IA para adivinhar o que era importante. O artigo argumenta que isso é frequentemente enganoso porque foca no que a IA olhou, não no que realmente funcionou.

O Truque do RREDCoT:
Em vez de rodar a IA 100 vezes ou adivinhar cegamente, o RREDCoT usa o próprio conhecimento da IA para estimar o valor de cada etapa.

  • Ele olha para a "Solução de Referência" (o caminho correto).
  • Ele pergunta: "Se eu tivesse dado este passo específico, o quanto eu estaria mais perto da resposta correta?"
  • Ele usa um atalho matemático inteligente (inspirado em como prevemos a próxima palavra em uma frase) para calcular isso instantaneamente, sem a necessidade de gerar 100 versões extras da história.

A "Segmentação Híbrida" (Cortando o Bolo)

Para fazer isso funcionar, a IA precisa saber onde um "pensamento" termina e outro começa. Você não pode simplesmente olhar para cada letra (token) individual, pois isso gera dados demais.

  • A Ideia do Artigo: Eles usam uma estratégia de "Segmentação Híbrida". Imagine cortar um bolo longo.
    • Primeiro, eles cortam em lugares óbvios (como novos parágrafos ou palavras-chave como "Espere" ou "Portanto").
    • Depois, eles observam a "confusão" (entropia) do texto. Se a IA estava muito incerta sobre o que escrever a seguir, esse é um bom lugar para cortar o bolo.
    • Isso cria "blocos" lógicos de pensamento que são fáceis de avaliar.

O Que Eles Descobriram (Os Resultados)

Os pesquisadores testaram isso em problemas matemáticos (como os conjuntos de dados AIME e MATH).

  • Aprendizado Mais Rápido: Modelos usando RREDCoT aprenderam a resolver problemas melhor e mais rápido do que modelos usando o método padrão (GRPO).
  • Melhor Eficiência: Eles obtiveram melhores resultados mesmo quando a IA gerava cadeias de pensamento muito longas (até 25.000 tokens).
  • Sem Necessidade de Modelos Extras: Ao contrário de outros métodos que exigem uma segunda IA "juiz" para avaliar o trabalho, o RREDCoT usa a própria IA principal para fazer a avaliação, economizando tempo e recursos.

A Ressalva (Limitações)

O artigo é honesto sobre onde este método pode ter dificuldades:

  1. Você Precisa do Gabarito: O RREDCoT funciona melhor quando você já conhece o caminho da solução correta (ou pelo menos um bom indício dela). Se você estiver tentando resolver um problema onde a solução é desconhecida ou o "caminho certo" é vago, este método não pode ajudar muito.
  2. Custa um Pouco Mais: Requer cerca de 1,5 a 2 vezes mais poder computacional do que o método padrão, mas os autores afirmam que esta é uma troca justa pelo nível de velocidade de aprendizado que ele proporciona.

Resumo

RREDCoT é uma nova maneira de treinar a IA para pensar melhor. Em vez de esperar até o fim para dizer "Bom trabalho", ele divide o processo de pensamento em pequenos blocos e diz à IA exatamente quais pensamentos foram úteis e quais foram distrações. Ele faz isso de forma rápida e eficiente, permitindo que a IA aprenda habilidades de raciocínio complexo muito mais rápido do que antes.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →