← Últimos artigos
🤖 machine learning

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

Este artigo apresenta o Single-rollout Asynchronous Optimization (SAO), um framework de aprendizado por reforço assíncrono, estável e eficiente, que substitui a amostragem por grupos por estratégias de rollout único e emprega clipping rigoroso ao nível de token para treinar com sucesso modelos agentes de grande escala, como o GLM-5.2, em benchmarks complexos de codificação e raciocínio.

Autores originais: Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong

Publicado 2026-07-09
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está treinando uma equipe de estudantes chefs para cozinhar a refeição perfeita. No jeito antigo de fazer as coisas (que o artigo chama de RL Síncrona), o chef principal gritava: "Todos, comecem a cozinhar!" e depois esperava. Os estudantes todos começavam a trabalhar em seus pratos. Mas aqui está o problema: alguns estudantes são rápidos e outros são lentos. Os estudantes rápidos terminariam seus pratos e ficariam parados encarando a parede, esperando o estudante mais lento terminar. Somente quando todos estivessem prontos é que o chef principal provaria a comida, daria o feedback e diria a todos o que fazer a seguir. Isso é incrivelmente ineficiente; a cozinha está cheia de tempo ocioso.

Para consertar isso, os pesquisadores tentaram o RL Assíncrono. Nesta versão, assim que um estudante termina um prato, o chef o prova imediatamente e dá o feedback. O estudante pode começar seu próximo prato imediatamente. A cozinha nunca para. Isso é muito mais rápido.

No entanto, havia um grande porém. Como o chef estava provando pratos de estudantes que começaram a cozinhar em momentos diferentes, a "receita" que os estudantes estavam seguindo estava mudando constantemente. Alguns estudantes estavam cozinhando baseados em uma receita antiga, enquanto outros usavam uma nova. Essa confusão tornou o treinamento instável, e os estudantes muitas vezes ficavam piores em cozinhar em vez de melhorarem. Além disso, o método popular usado para avaliar esses estudantes (chamado GRPO) exigia que o chef esperasse um grupo de estudantes terminarem antes de dar uma nota, o que trazia de volta o problema da espera.

Os autores deste artigo introduziram um novo método chamado SAO (Otimização Assíncrona de Rollout Único). Eles resolveram o caos com três truques inteligentes:

1. A Regra do "Feedback Instantâneo" (Rollout Único)

Em vez de esperar que um grupo de estudantes termine um lote, o SAO diz: "Assim que um estudante terminar um prato, avalie-o imediatamente."

  • A Metáfora: Imagine um videogame onde você recebe uma pontuação no segundo em que termina uma fase, em vez de esperar que todo o seu grupo termine. Isso remove o atraso de "esperar pelo membro mais lento".
  • O Problema que Resolve: Impede que o "grupo" tenha que esperar pelo membro mais lento, mantendo o treinamento na velocidade máxima.

2. A "Rede de Segurança Estrita" (Clipping de Duplo Lado)

Como os estudantes estão trabalhando tão rápido e as receitas estão mudando, há o risco de eles ficarem loucos e tentarem algo totalmente selvagem e perigoso.

  • A Metáfora: Os autores colocaram uma "cerca" ao redor do treinamento. Se a nova ideia de um estudante for muito diferente do que o professor espera (muito para a esquerda ou muito para a direita), o sistema não apenas ignora; ele bloqueia completamente o estudante de aprender com aquele erro específico. É como um treinador rigoroso que diz: "Se você tentar correr de costas, eu não deixarei você aprender com essa corrida de jeito nenhum."
  • O Problema que Resolve: Isso impede que o treinamento se torne instável ou "exploda" quando os estudantes ficam confusos com o ritmo acelerado.

3. O "Super-Treinador" (Melhor Modelo de Valor)

No antigo método de "grupo", o treinador podia comparar o prato de um estudante com os pratos de seus colegas para ver se era bom. Mas neste método "um por um", não há colegas para comparar. O treinador precisa ser incrivelmente inteligente para saber se um único prato é bom ou ruim por si só.

  • A Metáfora: Os autores treinaram um "Treinador de Valor" especial (um Crítico) que é muito mais inteligente e atualiza seu conhecimento duas vezes mais rápido que os estudantes chefs. Eles também congelaram os "instintos" (camadas de atenção) do treinador para que ele não ficasse confuso, permitindo que o treinador aprenda apenas os detalhes específicos da receita.
  • O Problema que Resolve: Isso garante que, mesmo quando o estudante está trabalhando sozinho, o treinador possa dizer com precisamente: "Sim, esse foi um bom movimento", ou "Não, esse foi um movimento ruim", sem precisar de um grupo para comparar.

Os Resultados

O artigo testou este novo método em duas tarefas muito difíceis:

  1. Programação: Pedir à IA para corrigir bugs em softwares (como um mecânico consertando um carro).
  2. Raciocínio Matemático: Pedir à IA para resolver problemas matemáticos complexos (como um estudante fazendo um exame difícil).

O Resultado:

  • O método antigo (GRPO) começava bem, mas depois colapsava e falhava depois de um tempo porque ficava muito confuso.
  • O novo método SAO manteve o treinamento fluido por um longo tempo (até 1.000 passos) e obteve pontuações consistentemente melhores.
  • Também provou que este método é perfeito para Aprendizado Online, onde as regras do jogo mudam enquanto você joga. Por exemplo, se o professor de repente disser: "Agora eu quero histórias fofas", a IA treinada pelo SAO poderia mudar seu estilo rapidamente, enquanto outros métodos eram lentos demais para se adaptar.

Em resumo, o artigo diz: "Pare de esperar por grupos. Deixe cada um trabalhar no seu próprio ritmo, mas dê a eles uma rede de segurança estrita e um treinador super inteligente que atualiza seu conhecimento instantaneamente. Isso torna o treinamento de IA mais rápido, mais estável e melhor para resolver problemas difíceis e mutáveis."

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →