← Últimos artigos
🤖 AI

Credit Assignment with Resets in Language Model Reasoning

Este artigo propõe a Otimização de Política com Reinício Aleatório e Reinício Automático (RRPO e SRPO) para melhorar o raciocínio de modelos de linguagem, permitindo a atribuição precisa de crédito por meio do reinício para estados intermediários e da reamostragem de continuação, com o SRPO alcançando desempenho superior ao localizar e corrigir autonomamente etapas errôneas sem supervisão externa.

Autores originais: Ankur Samanta, Akshayaa Magesh, Ayush Jain, Youliang Yu, Daniel Jiang, Kavosh Asadi, Daniel Jiang, Kaveh Hassani, Paul Sajda, Jalaj Bhandari, Yonathan Efroni

Publicado 2026-05-26
📖 4 min de leitura☕ Leitura rápida

Autores originais: Ankur Samanta, Akshayaa Magesh, Ayush Jain, Youliang Yu, Daniel Jiang, Kavosh Asadi, Daniel Jiang, Kaveh Hassani, Paul Sajda, Jalaj Bhandari, Yonathan Efroni

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um estudante a resolver um problema matemático complexo ou a escrever um trecho de código. Nos métodos tradicionais, se o estudante errar a resposta final, o professor pode dizer: "Você falhou", e fazer o estudante reescrever a solução inteira do zero, esperando que ele acerte na próxima vez. O problema com essa abordagem é que o estudante não sabe qual passo específico causou a falha. Será que ele cometeu um erro na primeira frase? Ou se perdeu três parágrafos depois?

Este artigo apresenta uma maneira mais inteligente de ensinar modelos de IA (especificamente Modelos de Linguagem de Grande Porte) a raciocinar. É chamado de Atribuição de Crédito com Reinícios.

Abaixo está a explicação de suas ideias usando analogias simples:

1. O Problema: A "Punição Uniforme"

Atualmente, quando uma IA falha em uma tarefa de raciocínio de múltiplos passos, os métodos padrão de treinamento tratam cada palavra que a IA gerou como igualmente responsável pela falha.

  • A Analogia: Imagine uma corrida de revezamento em que a equipe perde porque o corredor da 3ª etapa deixou cair o bastão. Mas o treinador grita com a equipe inteira, fazendo o primeiro corredor, o segundo corredor e o quarto corredor correrem voltas extras. O primeiro corredor não fez nada de errado, mas é punido de qualquer forma. Isso é ineficiente e confuso.

2. A Solução: O "Botão de Reinício"

Os autores propõem um mecanismo chamado Reinício. Em vez de começar tudo do início, a IA é enviada de volta a um ponto específico no meio da tentativa falha. A partir desse ponto, ela tenta gerar um novo final (uma continuação "contrafactual") para ver se uma escolha diferente leva ao sucesso.

  • A Analogia: Imagine que você está dirigindo e dá uma virada errada, ficando perdido. Em vez de dirigir de volta até sua casa para começar tudo de novo, você para exatamente no cruzamento onde cometeu o erro. Você diz: "Ok, eu não deveria ter virado à esquerda aqui; vamos tentar virar à direita". Você só refaz a parte da jornada que importa.

3. Duas Maneiras de Encontrar o Erro

O artigo propõe dois métodos para decidir onde apertar o botão de reinício:

  • RRPO (Reinício Aleatório): Isso é como chutar. A IA escolhe um passo aleatório na cadeia falha e tenta novamente a partir dali.
    • A Analogia: Um professor escolhendo aleatoriamente uma página no ensaio falhado de um estudante e dizendo: "Vamos reescrever a partir daqui". Pode funcionar, mas é principalmente sorte.
  • SRPO (Auto-Reinício): Este é o destaque do show. A IA examina sua própria tentativa falha e pergunta: "Onde exatamente eu errei?". Ela identifica o pensamento ou passo específico onde a lógica se quebrou e reinicia exatamente ali.
    • A Analogia: O estudante lê seu próprio ensaio, identifica a frase exata onde a lógica ficou confusa e diz: "Ah, vejo o problema. Vou reescrever começando daquela frase". Isso não requer ajuda externa; a IA faz isso sozinha.

4. Por Que Isso Funciona Melhor (A "Atribuição de Crédito")

Ao reiniciar no ponto específico do erro e tentar múltiplos novos finais, a IA pode ver claramente: "Se eu tivesse escolhido o caminho A em vez do caminho B neste momento específico, eu teria tido sucesso."

  • O Resultado: A IA aprende a corrigir o hábito específico ruim, em vez de apenas memorizar a solução inteira. É como um cirurgião removendo um tumor em vez de amputar todo o membro.

5. Os Resultados: Mais Rápido e Mais Inteligente

Os pesquisadores testaram isso em problemas matemáticos, perguntas de ciências e tarefas de programação.

  • As Descobertas: O método SRPO (onde a IA encontra seu próprio erro) consistentemente superou os métodos padrão e o método de "chute aleatório".
  • Velocidade: Em tarefas de programação, o SRPO aprendeu 2 a 3 vezes mais rápido do que os métodos padrão. Ele atingiu uma taxa de sucesso maior porque não desperdiçava tempo reaprendendo passos que já sabia que estavam corretos.
  • Auto-correção: O artigo descobriu que, quando a IA identificou corretamente o erro (um prefixo "limpo"), ela conseguiu corrigir o problema quase duas vezes mais frequentemente do que quando chutou o local errado. Isso prova que saber onde reiniciar é a chave para o sucesso.

Resumo

Pense neste artigo como ensinar uma IA a ser sua própria melhor crítica. Em vez de tentar reexecutar tarefas inteiras cegamente, a IA aprende a identificar o momento exato em que saiu do caminho, aperta o botão de "reinício" e tenta um caminho diferente a partir desse momento específico. Isso torna o aprendizado muito mais eficiente, preciso e eficaz, especialmente para tarefas complexas como matemática e programação.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →