← Últimos artigos
💻 computer science

AutoRPA: Efficient GUI Automation through LLM-Driven Code Synthesis from Interactions

AutoRPA é um framework que preenche a lacuna entre agentes ReAct baseados em LLM ineficientes e a RPA tradicional ao destilar automaticamente trajetórias de interação em funções de RPA robustas e reutilizáveis, alcançando assim reduções significativas no uso de tokens e nos custos de tempo de execução, ao mesmo tempo em que mantém as capacidades de resolução de tarefas.

Autores originais: Minghao Chen, Xinyi Hu, Zhou Yu, Yufei Yin

Publicado 2026-05-21
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Minghao Chen, Xinyi Hu, Zhou Yu, Yufei Yin

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente pessoal muito inteligente, mas ligeiramente caro, chamado "LLM" (Large Language Model). Este assistente é brilhante em descobrir como usar uma tela de computador ou celular pela primeira vez. Se você pedir para ele "reservar um voo" ou "excluir uma nota", ele pode olhar para a tela, pensar no que fazer, clicar nos botões certos e concluir a tarefa.

No entanto, há um problema: Eles são lentos e caros de usar para tarefas repetitivas.

Toda vez que você pede para reservar um voo, eles precisam "pensar" do zero. Eles leem a tela, planejam os passos e clicam. Se você precisar fazer isso 100 vezes por dia, está pagando por 100 horas de "pensamento", o que é um desperdício de dinheiro e tempo.

Por outro lado, antes da existência desses assistentes inteligentes, as pessoas usavam "Automação Robótica de Processos" (RPA). Pense na RPA como um script pré-gravado. É como um robô que clica cegamente em "Botão 3, depois digite 'Olá', depois clique em 'Salvar'". É incrivelmente rápido e barato de executar. Mas também é frágil. Se o designer do aplicativo mover o "Botão 3" para um local diferente, o robô falha porque não sabe como se adaptar. Ele precisa de um humano para reescrever manualmente o script toda vez que a tela mudar.

O Problema

Queremos a velocidade e o baixo custo do robô (RPA), mas a adaptabilidade inteligente do assistente (LLM). Queremos uma solução que funcione para tarefas repetitivas (como reservar voos todos os dias) sem precisar que um humano reescreva o código toda vez que o aplicativo for atualizado.

A Solução: AutoRPA

O artigo apresenta o AutoRPA, um sistema que atua como um chef de cozinha que transforma uma demonstração culinária bagunçada em uma receita perfeita e reutilizável.

Veja como funciona, passo a passo:

1. A "Exploração" (O Chef Observando)

Primeiro, o AutoRPA usa o assistente LLM inteligente para executar a tarefa (por exemplo, reservar um voo) apenas uma ou algumas vezes. O assistente olha para a tela, pensa e clica. Esta é a fase "ReAct".

  • Analogia: O chef observa um sous-chef cozinhar um prato pela primeira vez, anotando cada movimento.

2. A "Tradução" (Transformando Anotações em Receita)

As ações do assistente geralmente são "codificadas manualmente" (por exemplo, "Clique no botão nas coordenadas de pixel 144, 278"). Isso é ruim porque, se a tela mudar, as coordenadas estarão erradas.
O AutoRPA possui um Agente Tradutor especial que reescreve essas ações. Em vez de dizer "Clique em 144, 278", ele diz "Clique no botão que diz 'Reservar Voo'".

  • Analogia: O chef pega as anotações bagunçadas do sous-chef ("Clique no ponto vermelho no canto superior direito") e as reescreve como uma instrução clara ("Pressione o botão vermelho 'Iniciar'"). Isso faz com que a receita funcione mesmo se o layout da cozinha mudar ligeiramente.

3. A "Construção" (Criando o Script Mestre)

Um Agente Construtor pega essas instruções traduzidas e flexíveis e as combina em um único programa de computador robusto (uma função RPA). Ele analisa muitas tentativas diferentes (trajetórias) para descobrir a melhor maneira de lidar com variações.

  • Analogia: O chef escreve o cartão de receita final e profissional que pode ser usado por qualquer pessoa, em qualquer lugar, para preparar aquele prato perfeitamente.

4. A "Reparação Híbrida" (A Rede de Segurança)

Às vezes, a nova receita pode ter um erro. Se o robô tentar executar o código e falhar, o AutoRPA não desiste simplesmente. Ele possui uma Estratégia de Reparação Híbrida:

  1. Ele pausa o robô.
  2. Ele chama o assistente LLM inteligente de volta para descobrir por que falhou e como corrigir a partir exatamente daquele ponto.
  3. Ele usa a correção do assistente para atualizar a receita.
  • Analogia: Se o robô queimar a torrada, o chef intervém, conserta a torrada e, em seguida, atualiza o cartão de receita para que o robô não queime novamente na próxima vez.

Os Resultados

O artigo testou isso em três ambientes diferentes (aplicativos Android, sites e tarefas web simuladas).

  • Eficiência: O novo código AutoRPA é 82% a 96% mais barato de executar do que pedir para o assistente inteligente fazer a tarefa toda vez. Economiza uma quantidade enorme de uso de "tokens" (a moeda do pensamento da IA).
  • Taxa de Sucesso: Resolve tarefas tão bem quanto, ou às vezes melhor do que, o assistente inteligente sozinho, porque o código gerado é estável e não se confunde com pequenas mudanças na tela.
  • Reutilização: Uma vez que o código é construído para um "tipo" de tarefa (como "reservar um voo"), ele pode ser reutilizado para centenas de instâncias específicas (reservar para Nova York, reservar para Londres) sem precisar pensar novamente.

Resumo

O AutoRPA é um sistema que observa uma IA inteligente aprender uma tarefa, traduz esse aprendizado em um script flexível e reutilizável e, em seguida, polir esse script até que fique perfeito. Oferece o melhor dos dois mundos: a inteligência para lidar com novas situações e a eficiência de um robô para lidar com trabalho repetitivo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →