← Últimos artigos
🤖 AI

RollArt: Disaggregated Multi-Task Agentic RL Training at Scale

O RollArt é um sistema de RL agêntico multitarefa desagregado que otimiza o rendimento de treinamento e a escalabilidade ao mapear estágios de pipeline para hardware especializado, desacoplando interações de nível de trajetória para eliminar gargalos de sincronização e sobrepondo o rollout com o treinamento via atualizações de pesos assíncronas, alcançando até 2,05× tempos de treinamento mais rápidos em clusters de grande escala.

Autores originais: Wei Gao, Yuheng Zhao, Tianyuan Wu, Shaopan Xiong, Weixun Wang, Dakai An, Lunxi Cao, Dilxat Muhtar, Zichen Liu, Haizhou Zhao, Ju Huang, Siran Yang, Yongbin Li, Wenbo Su, Jiamang Wang, Lin Qu, Bo Zheng
Publicado 2026-06-16
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Wei Gao, Yuheng Zhao, Tianyuan Wu, Shaopan Xiong, Weixun Wang, Dakai An, Lunxi Cao, Dilxat Muhtar, Zichen Liu, Haizhou Zhao, Ju Huang, Siran Yang, Yongbin Li, Wenbo Su, Jiamang Wang, Lin Qu, Bo Zheng, Wei Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô brilhante, mas muito específico (uma IA), a resolver problemas complexos, como escrever código de software ou navegar em um site. Para fazer isso, você não apenas lhe dá um livro didático; você o deixa praticar em uma simulação do mundo real. Esse processo é chamado de Aprendizado por Reforço Agêntico (Agentic Reinment Learning).

O artigo apresenta um novo sistema chamado ROLLART, que atua como um controlador de tráfego super eficiente para esse processo de treinamento. Veja como ele funciona, usando analogias simples.

O Problema: O Engarrafamento do "Tamanho Único para Todos"

Imagine uma fábrica onde uma única equipe de trabalhadores tem que realizar três trabalhos muito diferentes:

  1. Pensar: Resolver problemas matemáticos difíceis (requer um cérebro rápido).
  2. Ler: Ler livros longos rapidamente (requer olhos rápidos).
  3. Construir: Montar peças físicas (requer mãos fortes).

Em sistemas antigos, todos usavam o mesmo tipo de trabalhador para tudo. Se você atribuísse um trabalhador de "cérebro rápido" para "leitura", eles seriam lentos. Se você atribuísse um trabalhador de "mãos fortes" para "matemática", eles seriam lentos. Além disso, se um trabalhador ficasse preso consertando um brinquedo quebrado (um "atrasado"), toda a fábrica tinha que parar e esperar por ele antes de passar para a próxima etapa. Isso causava atrasos massivos.

A Solução: A Linha de Montagem Especializada do ROLLART

O ROLLART corrige isso dividindo a fábrica em zonas especializadas e permitindo que diferentes equipes trabalhem em seu próprio ritmo.

1. Combinando Trabalhadores com as Ferramentas Certas (Afinidade de Hardware)

O sistema percebe que algumas tarefas precisam de poder de computação (como resolver matemática) e outras precisam de velocidade de memória (como ler textos longos).

  • O Jeito Antigo: Todos usavam o mesmo computador caro e de alta capacidade.
  • O Jeito ROLLART: Ele envia as tarefas de "matemática" para computadores super rápidos e as tarefas de "leitura" para computadores com memória grande e rápida. É como enviar um chef para uma cozinha com um fogão de alta potência e um bibliotecário para uma biblioteca com um catálogo de fichas enorme e rápido. Eles realizam o trabalho muito mais rápido porque estão usando a ferramenta certa para o trabalho.

2. Deixando os Trabalhadores se Movimentarem no Seu Próprio Ritmo (Assincronia ao Nível de Trajetória)

Na antiga fábrica, se um trabalhador levasse 10 minutos para terminar uma tarefa enquanto outros levavam 1 minuto, toda a linha parava por 10 minutos.

  • O Jeito ROLLART: Ele trata cada execução de prática (chamada de "trajetória") como um projeto independente. Se um robô ficar preso em um quebra-cabeça difícil, os outros robôs continuam trabalhando em seus próprios quebra-cabeças. O sistema não espera pelo lento; ele apenas mantém os rápidos se movendo. Assim que o lento finalmente termina, ele é avaliado, e os rápidos seguem para novas tarefas.

3. Contratando "Trabalhadores Freelancers" para Tarefas Simples (Offloading Serverless)

Depois que um robô termina uma tarefa, alguém tem que avaliá-la. Às vezes isso é uma verificação simples (como "a porta abriu?") e às vezes é uma revisão complexa feita por outra IA.

  • O Jeito Antigo: Você mantinha uma equipe de computadores caros e de alta potência parados, esperando para avaliar essas tarefas simples. Era caro mantê-los em "espera" mesmo quando não estavam trabalhando.
  • O Jeito ROLLART: Ele usa "trabalhadores freelancers" (computação em nuvem serverless). Você só paga pela avaliação quando ela realmente acontece. Se ninguém estiver avaliando, você não paga nada. Isso libera os computadores caros para se concentrarem no trabalho difícil de ensinar o robô.

4. Ensinando Enquanto Aprende (Treinamento de Defasagem Limitada)

Normalmente, o professor (o computador de treinamento) e o aluno (o robô praticando) se revezam. O aluno pratica, para, espera o professor atualizar seu conhecimento e então começa novamente.

  • O Jeito ROLLART: O professor e o aluno trabalham ao mesmo tempo. O aluno continua praticando com a versão do conhecimento do professor de "ontem", enquanto o professor está ocupado atualizando a versão de "hoje". O sistema garante que o aluno não fique tão atrasado (usando um "limite de defasagem/staleness bound"), mas eles nunca precisam parar e esperar. É como um treinador gritando novas instruções para um corredor enquanto o corredor já está correndo em velocidade máxima, em vez de fazer o corredor parar na linha de partida toda vez que o treinador tem uma nova dica.

Os Resultados

O artigo testou este sistema em uma escala massiva (usando mais de 3.000 computadores da Alibaba).

  • Velocidade: Tornou o processo de treinamento de 1,3 a 2 vezes mais rápido do que os métodos anteriores.
  • Eficiência: Parou de desperdiçar o poder de computação caro em tarefas ociosas.
  • Estabilidade: Provou que, mesmo quando algo dá errado (como um computador falhando ou uma tarefa demorando demais), o sistema continua funcionando sem quebrar.

Em resumo, o ROLLART é um gerente inteligente que interrompe o "jogo da espera" no treinamento de IA. Ele coloca a tarefa certa nos computadores certos, deixa os trabalhadores rápidos continuarem se movendo mesmo se os lentos ficarem para trás, e usa ajuda barata e sob demanda para tarefas simples, resultando em uma maneira muito mais rápida e barata de treinar IAs avançadas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →