← Últimos artigos
🤖 machine learning

Learning to Reason Efficiently with Discounted Reinforcement Learning

Este artigo propõe uma abordagem de aprendizado por reforço com desconto que penaliza tokens de raciocínio para incentivar modelos de raciocínio de grande porte a gerar cadeias de pensamento concisas sem sacrificar a precisão, tratando efetivamente o raciocínio como um problema de caminho estocástico mais curto.

Autores originais: Alex Ayoub, Kavosh Asadi, Dale Schuurmans, Csaba Szepesvári, Karim Bouyarmane

Publicado 2026-05-27
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Alex Ayoub, Kavosh Asadi, Dale Schuurmans, Csaba Szepesvári, Karim Bouyarmane

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: A IA "Superpensadora"

Imagine que você tem um estudante muito inteligente (um Modelo de Raciocínio de Grande Escala, ou LRM) que é ótimo em resolver problemas de matemática. No entanto, esse estudante tem um mau hábito: antes de dar a resposta final, ele escreve um ensaio massivo e prolixo sobre seu processo de pensamento. Ele pode dizer: "Ok, deixe-me pensar sobre isso... talvez eu devesse tentar isso... espera, não, isso está errado... deixe-me tentar aquilo novamente..."

Embora essa "Cadeia de Pensamento" ajude-o a obter a resposta correta, isso leva muito tempo e consome muita energia (custo computacional). O artigo faz uma pergunta simples: o estudante precisa escrever um ensaio de 10 páginas para tirar uma nota A, ou ele poderia obter a mesma nota A com um resumo de 2 páginas?

Muitas pessoas assumem que "mais pensamento = maior precisão". Este artigo desafia essa ideia. Ele argumenta que você frequentemente pode obter a mesma alta precisão com raciocínios muito mais curtos, desde que ensine a IA a valorizar a eficiência.

A Solução: O Truque da "Recompensa Descontada"

Os autores propõem uma maneira inteligente de treinar esses estudantes de IA usando um conceito chamado Aprendizado por Reforço Descontado.

A Analogia: O Entregador de Pizza

Imagine que você está treinando um entregador de pizza.

  • O Objetivo: Entregar a pizza ao cliente e receber uma gorjeta (a recompensa).
  • O Jeito Antigo: Você diz ao entregador: "Apenas leve a pizza até lá. Dê quantos desvios quiser, desde que você eventualmente chegue lá." O entregador pode dar voltas no quarteirão cinco vezes para ter "certeza" de que está no caminho certo, desperdiçando gasolina e tempo.
  • O Novo Jeito (Desconto): Você diz ao entregador: "Você ganha uma gorjeta, mas a gorjeta encolhe quanto mais tempo você demora para entregar."
    • Se você entregar em 10 minutos, você recebe 100% da gorjeta.
    • Se você entregar em 20 minutos, a gorjeta é ligeiramente menor.
    • Se você entregar em 30 minutos, a gorjeta é ainda menor.

Isso cria um incentivo natural para o entregador encontrar a rota de sucesso mais curta. Ele ainda quer receber a gorjeta (precisão), mas agora tem uma forte razão para evitar desvios desnecessários (raciocínio mais curto).

Como Funciona no Artigo

Os pesquisadores aplicaram essa ideia de "gorjeta encolhendo" ao raciocínio da IA:

  1. A Configuração: Eles trataram o processo de raciocínio da IA como um jogo. Cada vez que a IA gera um "token de pensamento" (uma palavra em seu monólogo interno), é como dar um passo.
  2. O Desconto: Eles aplicaram um "fator de desconto" matemático (um número ligeiramente menor que 1) à recompensa.
    • Se a IA resolver o problema corretamente, ela recebe uma recompensa.
    • No entanto, essa recompensa é multiplicada pelo fator de desconto por cada token de pensamento individual que ela usou.
    • Detalhe Crucial: Eles descontaram apenas os tokens de raciocínio. Eles não descontaram os tokens necessários para a formatação (como escrever "Resposta:" ou fechar tags). Isso garante que a IA aprenda a ser concisa em seu pensamento, mas ainda siga as regras de como apresentar a resposta.
  3. O Resultado: A IA aprende que a maneira mais rápida de obter a recompensa total é encontrar o caminho mais curto para a resposta correta.

A "Magia" Teórica (Optimalidade de Blackwell)

O artigo usa matemática pesada para provar por que isso funciona. Eles se baseiam em um conceito chamado Optimalidade de Blackwell.

Pense assim: imagine que você tem uma lista de diferentes rotas para chegar a um destino.

  • Algumas rotas são rápidas, mas arriscadas (podem fazer você se perder).
  • Algumas rotas são seguras, mas incrivelmente longas.
  • Algumas rotas são seguras e curtas.

A matemática prova que, se você definir sua "impaciência" (o desconto) exatamente no ponto certo (muito próximo de 1, mas não exatamente 1), a IA naturalmente escolherá a rota mais curta entre aquelas que garantem o sucesso.

O artigo afirma que, para uma determinada faixa de configurações, não há trade-off. Você não precisa escolher entre "curto e burro" ou "longo e inteligente". Você pode ter "curto e inteligente". A IA encontra o caminho mais curto que ainda garante uma resposta correta.

O Que os Experimentos Mostraram

A equipe testou isso em vários benchmarks de matemática (como GSM8K e MATH) usando diferentes modelos de IA (como Qwen e Llama).

  • Precisão: Os modelos "descontados" obtiveram o mesmo número de respostas corretas que os modelos "sem desconto".
  • Comprimento: Os modelos "descontados" escreveram cadeias de raciocínio significativamente mais curtas.
    • Em um teste, o comprimento médio da resposta caiu 22% sem perder precisão alguma.
    • Em outro, caiu 13%.

Em alguns casos, os modelos mais curtos até performaram ligeiramente melhor, sugerindo que cortar a "encheção de linguiça" pode realmente ajudar a IA a focar melhor.

Resumo

O artigo introduz um truque de treinamento simples, mas poderoso: Faça a IA pagar um pequeno "imposto" por cada palavra extra que ela pensa.

Ao fazer isso, a IA aprende a ser um "pensador eficiente". Ela para de divagar e começa a encontrar o caminho mais direto para a resposta correta, economizando tempo e poder computacional sem sacrificar sua inteligência. Os autores provam matematicamente que isso funciona e mostram através de experimentos que faz exatamente o que previram.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →