← Últimos artigos
🤖 AI

AliyunConsoleAgent: Training Web Agents in Real-World Cloud Environments via Distillation and Reinforcement Learning

O artigo apresenta o AliyunConsoleAgent, um framework de agente web de baixo custo que alcança um desempenho próximo ao estado da arte na verificação de documentação de consoles de nuvem por meio de um paradigma de treinamento de dois estágios combinando ajuste fino supervisionado em trajetórias destiladas e aprendizado por reforço com um sistema de recompensa robusto em ambientes do mundo real.

Autores originais: Bojie Rong, Zheyu Shen, Qiaoping Wang, Pengfei Kang, Yang Xu, Yawen Wei, Hanyu Wu, Zhi Zhao, Leihao Pei, Linquan Jiang

Publicado 2026-06-09
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Bojie Rong, Zheyu Shen, Qiaoping Wang, Pengfei Kang, Yang Xu, Yawen Wei, Hanyu Wu, Zhi Zhao, Leihao Pei, Linquan Jiang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é o gerente de um parque temático massivo e em constante mudança (o Cloud Console). Todos os dias, o parque adiciona novas atrações, altera as bilheterias e atualiza as regras de segurança. Enquanto isso, os guias de viagem (a Documentação) são escritos por uma equipe diferente que os atualiza lentamente, manualmente.

O Problema:
Como o parque muda muito rápido, os guias tornam-se rapidamente obsoletos. Um passo no livro pode dizer: "Clique no botão azul", mas no parque real, esse botão agora é vermelho ou foi substituído por uma tela sensível ao toque. Verificar cada instrução individual no guia contra o parque real é um pesadelo. Levaria uma equipe humana milhões de horas por ano para fazer isso e, atualmente, eles verificam apenas cerca de 1% das instruções. Se não verificarem, os clientes ficam perdidos e frustrados.

A Solução Antiga (e por que falhou):
A empresa tentou contratar "robôs superinteligentes" (Modelos Proprietários de Fronteira) para fazer a verificação. Esses robôs são incrivelmente inteligentes e conseguem ler os guias e navegar pelo parque perfeitamente. No entanto, eles são caros (como contratar uma equipe de doutores para cada verificação única) e arriscados (você precisa mostrar a eles seus mapas privados do parque, o que viola as regras de segurança). Você não pode se dar ao luxo de usá-los para as milhões de verificações necessárias.

A Nova Solução: AliyunConsoleAgent
Os autores construíram seu próprio "robô treinável" (um modelo de IA de 32 bilhões de parâmetros) que é mais barato e seguro para rodar em seus próprios servidores. Mas um robô padrão não é inteligente o suficiente para lidar com um parque temático caótico e em mudança. Por isso, eles usaram um método de treinamento de duas etapas:

1. A Fase de "Sombreamento" (Ajuste Fino Supervisionado)

Primeiro, eles pegaram os robôs superinteligentes e fizeram o novo robô sombrear eles.

  • A Analogia: Imagine um mestre chef cozinhando um prato complexo. O novo robô observa o mestre, memorizando cada corte, mexida e tempero.
  • O Resultado: O novo robô aprende o básico de como navegar no parque e seguir instruções. Ele fica muito bom nisso, mas ainda está apenas copiando. Se o parque mudar ligeiramente, ele fica confuso porque não entende verdadeiramente o objetivo, ele apenas memoriza os passos.

2. A Fase de "Tentativa e Erro" (Aprendizado por Reforço)

Em seguida, eles soltaram o robô em uma versão simulada do parque para aprender fazendo.

  • O Desafio: Em um ambiente de nuvem real, o robô frequentemente falha não porque é estúpido, mas porque o "parque" não está pronto. Por exemplo, ele tenta deletar um servidor, mas o servidor ainda não existe. Se o robô for punido por isso, ele aprende a lição errada (que é ruim em deletar servidores) em vez da certa (que precisa construir o servidor primeiro).
  • A Correção (O Rollout de Alta Determinística): A equipe construiu um "campo de treinamento" especial usando Terraform (uma ferramenta que constrói infraestrutura como peças de Lego). Antes de o robô tentar realizar uma tarefa, este sistema constrói automaticamente os pré-requisitos exatos (como construir o servidor, configurar a rede) para que o robô possa ter sucesso se fizer os movimentos corretos.
  • O Sistema de Recompensa: Em vez de um humano avaliando o robô, eles usam um Juiz de Canal Duplo:
    1. O Verificador de Regras: Ele olha para os "logs de auditoria" oficiais (como as câmeras de segurança do parque) para ver se a ação realmente aconteceu. O servidor foi deletado? Sim/Não. Isso é 100% objetivo.
    2. O Painel de Juízes: Se não houver um log claro, dois outros modelos de IA atuam como juízes. Eles só dão um "aprovado" se ambos concordarem que o robô teve sucesso. Isso evita que o robô "trapaceie" ou engane um único juiz.

O Resultado

Após este treinamento, o robô evoluiu de um seguidor sem mente para um solucionador de problemas autônomo.

  • Antes: Se o guia dissesse "Desligar renovação automática", mas o interruptor já estivesse desligado, o robô simplesmente parava e dizia "Eu não posso fazer isso".
  • Depois: O robô pensa: "Espere, eu não posso desligar se já estiver desligado. Preciso ligá-lo primeiro para então poder desligá-lo para provar que fiz isso". Ele descobriu a lógica por conta própria.

O Resultado Final:

  • Desempenho: O novo robô deles (AliyunConsoleAgent-32B) é quase tão bom quanto os "super-robôs" caros (com uma diferença de apenas 1,8%).
  • Custo: Custa 92% menos para rodar.
  • Impacto: Eles usaram este sistema para auditar mais de 54.000 instruções e encontraram quase 4.400 erros reais que as equipes de produtos corrigiram.

Em resumo, eles ensinaram um robô local e acessível a pensar como um gênio ao fazer com que ele sombreasse um gênio e, depois, permitindo que ele praticasse em uma academia de treinamento perfeitamente preparada, onde pudesse aprender com seus erros sem ser punido por coisas fora de seu controle.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →