Agent JIT Compilation for Latency-Optimizing Web Agent Planning and Scheduling
Este artigo apresenta a Compilação JIT de Agentes, um framework que compreende um planejador, um escalonador e um protocolo de aplicação de invariantes, os quais convertem tarefas em linguagem natural em código executável para alcançar acelerações significativas e melhorias de precisão em relação aos loops tradicionais de agentes web sequenciais.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está tentando fazer um robô realizar uma tarefa complexa para você, como "Peça o taco mais barato do Taco Bell".
Atualmente, a maioria dos robôs funciona como um assistente humano muito cauteloso e lento. Eles olham para a tela, perguntam a um cérebro superinteligente (uma IA) o que fazer a seguir, clicam em um botão, esperam a tela mudar, perguntam ao cérebro novamente, digitam uma palavra, esperam e perguntam de novo. Esse ciclo "olhar-pensar-agir" ocorre repetidamente. É lento, caro (porque o cérebro de IA custa dinheiro a cada vez que você o consulta) e propenso a erros, pois o robô pode clicar no lugar errado se a tela parecer ligeiramente diferente.
Este artigo apresenta uma nova maneira de tornar esses robôs mais rápidos e inteligentes, chamada Compilação JIT de Agentes. Pense nisso como mudar de um "manual de instruções passo a passo" para "escrever um script de software personalizado" antes mesmo do robô começar a se mover.
Veja como funciona, dividido em três partes simples:
1. O Planejador "Pré-Voo" (JIT-Planner)
Em vez de perguntar à IA "O que devo fazer a seguir?" a cada passo, o sistema primeiro pega sua solicitação ("Peça o taco mais barato") e gera instantaneamente vários programas de computador (códigos) diferentes que poderiam resolver o problema.
- A Analogia: Imagine que você precisa dirigir de Nova York a Boston.
- Jeito Antigo: Você para em cada posto de gasolina para perguntar a um local: "Qual o caminho para Boston?" Você dirige uma milha, pergunta de novo, dirige mais uma milha, pergunta de novo.
- Jeito Novo: Antes de sair, você pede a um aplicativo de mapas que gere três rotas diferentes. Ele verifica o trânsito, as condições das estradas e a distância. Ele escolhe a rota absolutamente mais rápida e insere as coordenadas de GPS no sistema de navegação do seu carro uma única vez. Depois, você apenas dirige.
- A Magia: O sistema verifica essas rotas geradas para garantir que sejam lógicas (por exemplo, você não pode clicar em "Pedir" antes de clicar em "Adicionar ao Carrinho"). Ele escolhe aquela que usa a menor quantidade de "poder cerebral" (chamadas de IA) e tempo.
2. O "Policial de Trânsito" (JIT-Scheduler)
Uma vez que o robô tem um plano, ele precisa decidir como executá-lo. Deve fazer tudo um de cada vez? Deve tentar fazer três coisas ao mesmo tempo? Ou deve tentar a mesma tarefa três vezes em paralelo e usar apenas a primeira que terminar?
- A Analogia: Imagine que você está pedindo comida para uma festa.
- Série (Um por um): Você liga para um restaurante, espera a resposta, liga para o próximo, espera...
- Paralelo: Você liga para três restaurantes ao mesmo tempo.
- Proteção (Hedging): Você liga para três restaurantes, mas só se importa com o primeiro que atender. Se um for lento, você não espera; você apenas pega a resposta do mais rápido.
- A Magia: O sistema analisa a tarefa específica e usa dados passados para adivinhar qual estratégia é melhor. Se a tarefa for simples, ele vai um por um. Se a tarefa for complicada e puder travar, ele tenta múltiplos caminhos ao mesmo tempo (proteção) para garantir que termine rapidamente. Ele escolhe a estratégia que economiza mais tempo.
3. O "Livro de Regras" (Protocolo de Aplicação de Invariantes)
Para garantir que o robô não trave ou clique no botão errado, cada ferramenta que o robô usa (como "clicar no botão" ou "digitar texto") vem com um livro de regras estrito.
- A Analogia: Pense em uma máquina de venda automática.
- Jeito Antigo: Você apenas aperta botões aleatoriamente. Às vezes você aperta "Lanche" quando a máquina está vazia, e nada acontece.
- Jeito Novo: A máquina tem um sensor. Ela verifica: "A máquina está ligada? Há dinheiro dentro? A porta está fechada?" Se as condições não forem atendidas, a máquina se recusa a deixar você apertar o botão.
- A Magia: Antes de o robô executar o código, ele verifica essas regras. Se um plano tentar "Pedir" quando o "Carrinho" estiver vazio, o sistema detecta esse erro antes mesmo do robô começar, prevenindo erros e tempo desperdiçado.
Os Resultados
Os autores testaram isso em cinco sites diferentes (como entrega de comida, e-mail e sites de compras). Os resultados foram impressionantes:
- Velocidade: Seu novo método foi 10 vezes mais rápido que o método padrão "perguntar-à-IA-a-cada-passo".
- Precisão: Também foi 28% mais preciso, o que significa que conseguiu o taco certo 28% mais vezes.
- Comparação: Mesmo comparado a outros agentes de IA avançados (como os da OpenAI ou Anthropic), seu método foi 2,4 vezes mais rápido e 9% mais preciso.
Resumo
Em resumo, este artigo diz: Não peça à IA para dirigir o carro passo a passo. Em vez disso, faça a IA escrever toda a rota de direção como um script, verifique se a rota é segura, escolha a maneira mais rápida de executá-la e, em seguida, apenas execute o script. Isso transforma uma conversa lenta e trêmula em uma execução suave e de alta velocidade.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.