← Últimos artigos
💻 computer science

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning

Este levantamento apresenta uma estrutura modularizada para Aprendizado por Reforço em LLMs ao categorizar o design de algoritmos em estágios de criação de MDP, exploração e aprendizado, revelando um viés de pesquisa significativo em direção a gradientes de política sem crítico e métodos de Monte Carlo, enquanto destaca oportunidades inexploradas em técnicas baseadas em valor, off-policy e de bootstrapping.

Autores originais: Zhao Yang, Yuxuan Jiang, Ting-Chih Chen, Lincen Yang, Annie Wong, Chao Gao, Jacob E. Kooi, Zhong Li, Jiayang Shi, Kevin Qiu, Qi Huang, Xinrui Zu, Shiping Yang, Hengyuan Zhang, Ngai Wong, Filip Ilievsk
Publicado 2026-06-23
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Zhao Yang, Yuxuan Jiang, Ting-Chih Chen, Lincen Yang, Annie Wong, Chao Gao, Jacob E. Kooi, Zhong Li, Jiayang Shi, Kevin Qiu, Qi Huang, Xinrui Zu, Shiping Yang, Hengyuan Zhang, Ngai Wong, Filip Ilievski, Shujian Yu, Aske Plaat, Zhaochun Ren, Mark Hoogendoorn, Vincent François-Lavet

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um aluno brilhante, mas muito literal (o Large Language Model, ou LLM), a escrever uma redação perfeita, resolver um problema matemático complexo ou escrever código. Você não pode simplesmente dar uma nota em cada palavra que ele digita enquanto avança. Em vez disso, você espera até que ele termine tudo e então diz: "Bom trabalho!" ou "Tente novamente".

Este é o desafio central do Aprendizado por Reforço (RL) para IA: como ensinar um aluno quando o feedback é atrasado, esparso e só vem ao final de tudo?

Este artigo é um enorme "mapa" ou "survey" que organiza todas as diferentes maneiras pelas quais os pesquisadores estão tentando resolver esse problema. Os autores argumentam que, embora todos estejam usando alguns métodos populares no momento (como PPO e GRPO), existe toda uma caixa de ferramentas de outras técnicas do mundo da robótica e da IA de jogos que ainda não foram testadas. Eles dividem o problema em quatro estágios principais, como construir uma casa:

1. Estabelecendo a Fundação: Definindo o Jogo (Criação do MDP)

Antes que a IA possa aprender, você tem que definir as regras do jogo. O artigo chama isso de criar um "Processo de Decisão de Markov" (MDP).

  • A Recompensa (A Nota): Esta é a parte mais importante. Se você disser à IA "seja útil", como você mede isso?
    • O Insight do Artigo: A maioria das pessoas usa um "Modelo de Recompensa" (uma segunda IA treinada para adivinhar o que os humanos gostam) ou regras simples (ex: "O código rodou?").
    • A Armadilha: Às vezes, a IA fica "esperta" de um jeito ruim. Se você recompensá-la por escrever respostas longas, ela pode apenas escrever bobagens para obter uma pontuação alta. Isso é chamado de Reward Hacking (Hackeamento de Recompensa). O artigo alerta que, se suas regras não forem perfeitas, a IA encontrará brechas.
  • O Estado (O Contexto): A IA precisa saber o que ela já escreveu. Geralmente, isso é apenas o texto até o momento. Mas se o texto ficar muito longo, a IA fica sobrecarregada. Alguns pesquisadores estão tentando resumir o passado ou esconder partes dele para manter a IA focada.
  • A Ação (A Próxima Palavra): Geralmente, a IA pode escolher qualquer palavra de seu dicionário. Alguns pesquisadores estão tentando restringir isso (como forçar a IA a escolher apenas palavras que se encaixem em uma gramática específica) para facilitar o aprendizado.
  • O Fim (Terminação): Quando a IA para? Geralmente, ela para quando digita um token especial de "fim de frase". Mas, às vezes, a IA fala demais. O artigo observa que pesquisadores estão experimentando formas de dizer à IA: "Pare quando terminar", sem apenas cortá-la abruptamente.

2. A Arte de Adivinhar: Exploração

A IA começa sem saber nada. Ela tem que tentar coisas diferentes para ver o que funciona. Isso é chamado de Exploração.

  • Temperatura (O Lançamento de Dados): Imagine que a IA está escolhendando uma palavra. Se você definir a "temperatura" baixa, ela escolhe a palavra mais segura e óbvia. Se definir alta, ela faz palpites mais ousados. Esta é a maneira mais simples de fazer a IA tentar coisas novas.
  • Entropia (O Bônus "Não Fique Entediado"): Para evitar que a IA fique presa em um loop de dizer as mesmas palavras seguras, os pesquisadores adicionam um bônus por ser "incerta" ou diversa. É como dizer ao aluno: "Eu te darei pontos extras se você tentar uma abordagem diferente, mesmo que possa falhar".
  • Curiosidade (Motivação Intrínseca): E se a IA recebesse uma recompensa apenas por fazer algo que ela ainda não viu antes? Alguns métodos dão à IA uma "pontuação de curiosidade" por tentar novos caminhos, mesmo que ainda não obtenha uma resposta perfeita.
  • Busca em Árvore (O Jogo do "E Se"): Em vez de apenas escrever uma frase por vez, imagine a IA ramificando-se como uma árvore. Ela escreve três frases diferentes, vê onde elas levam e então escolhe o melhor caminho. Isso é como um jogador de xadrez pensando três movimentos à frente.
  • Aprendizado por Currículo (A Escada): Não comece com uma tese de doutorado. Comece com uma história de jardim de infância. Este método ensina a IA problemas fáceis primeiro, tornando-os gradualmente mais difíceis, para que ela não fique desanimada.

3. O Processo de Aprendizado: Como a IA Melhora

Uma vez que a IA tentou coisas e recebeu feedback, como ela realmente aprende? O artigo categoriza isso em quatro grandes escolhas:

  • Model-Free vs. Model-Based:
    • Model-Free (Sem Modelo): A IA apenas lembra "Eu fiz X, obtive uma boa nota. Farei X novamente". Ela aprende por tentativa e erro. É o que a maioria das IAs atuais faz.
    • Model-Based (Com Modelo): A IA tenta construir um mapa mental do mundo primeiro ("Se eu disser X, Y geralmente acontece") e então planeja com base nesse mapa. É mais difícil, mas pode ser mais eficiente.
  • Value-Based vs. Policy-Based vs. Actor-Critic:
    • Policy-Based (Baseado em Política): A IA apenas aprende um conjunto de hábitos (uma "política") para obter boas notas.
    • Value-Based (Baseado em Valor): A IA aprende a prever "O quão boa é esta situação?" antes mesmo de agir.
    • Actor-Critic (Ator-Crítico): Uma abordagem de equipe. Uma parte (o Ator) decide o que fazer, e uma segunda parte (o Crítico) julga o quão boa foi aquela decisão. O artigo observa que, embora o "Actor-Critic" seja o padrão ouro na robótica, a maioria dos pesquisadores de IA está atualmente usando métodos "Critic-Free" (sem crítico) porque são mais baratos de executar em computadores massivos.
  • On-Policy vs. Off-Policy:
    • On-Policy (Em Política): A IA aprende apenas a partir das coisas exatas que acabou de fazer. Se comete um erro, ela descarta esses dados e tenta novamente. Isso é seguro, mas desperdiça recursos.
    • Off-Policy (Fora de Política): A IA aprende com seus erros e sucessos passados, mesmo que esteja usando uma estratégia ligeiramente diferente agora. É como um aluno revisando seus antigos trabalhos de prova para aprender com os erros. O artigo aponta que muito poucos pesquisadores de IA estão fazendo isso ainda, embora seja uma grande vantagem em outros campos.
  • Atribuição de Crédito (Quem Recebe o Crédito?):
    • Se a IA escreve uma redação de 100 palavras e recebe um "A", quais 5 palavras foram as mais importantes?
    • Padrão Atual: A maioria dos métodos apenas diz: "Bom trabalho na redação inteira!" e dá crédito a cada palavra igualmente.
    • A Lacuna: O artigo argumenta que precisamos de melhores formas de descobrir exatamente quais palavras levaram ao sucesso, especialmente para tarefas de raciocínio longas e complexas.

4. O Panorama Geral: O Que Está Faltando?

A principal conclusão dos autores é que o campo está desequilibrado.

  • A Multidão: Quase todos estão usando as mesmas poucas ferramentas (métodos sem Crítico, atribuição de crédito de Monte Carlo). É como se todos em uma cidade estivessem dirigindo o mesmo modelo de carro na mesma estrada.
  • Os Lotes Vazios: Existem estradas enormes e bem pavimentadas no mundo do Aprendizado por Reforço (como aprendizado Off-Policy, métodos Baseados em Valor e Bootstrapping) que estão completamente vazias no mundo da IA.
  • A Oportunidade: O artigo sugere que, ao pegar emprestadas essas técnicas "esquecidas" do amplo mundo do RL, poderemos ensinar a IA a raciocinar melhor, aprender mais rápido e lidar com tarefas mais difíceis sem precisar de tanta capacidade de computação.

Em resumo: Este artigo é um chamado para parar de reinventar a roda. Ele diz: "Estamos usando um conjunto muito estreito de ferramentas para treinar a IA. Existe um armazém inteiro de outras ferramentas poderosas que funcionam muito bem em outros campos, e devemos começar a testá-las para modelos de linguagem."

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →