← Últimos artigos
🤖 AI

Online Skill Learning for Web Agents via State-Grounded Dynamic Retrieval

Este artigo propõe o State-Grounded Dynamic Retrieval (SGDR), um método de aprendizado de habilidades online que aprimora agentes web ao permitir a reutilização de habilidades passo a passo por meio de um mecanismo que associa dinamicamente habilidades tanto aos objetivos da tarefa quanto ao estado atual da página web, superando assim os baselines de recuperação estática no benchmark WebArena.

Autores originais: Jiaxi Li, Ke Deng, Yun Wang, Jingyuan Huang, Yucheng Shi, Qiaoyu Tan, Jin Lu, Ninghao Liu

Publicado 2026-06-04
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Jiaxi Li, Ke Deng, Yun Wang, Jingyuan Huang, Yucheng Shi, Qiaoyu Tan, Jin Lu, Ninghao Liu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a navegar pela internet para fazer coisas como reservar um voo, preencher um formulário ou encontrar uma postagem específica em um fórum. Este robô é um "agente web".

O problema é que a internet é bagunçada e muda constantemente. Um robô pode saber como iniciar uma tarefa, mas, assim que clica em um botão e chega a uma nova página, as instruções antigas podem não fazer mais sentido.

Este artigo apresenta uma nova maneira de ensinar esses robôs, chamada SGDR (Recuperação Dinâmica Baseada em Estado). Veja como funciona, explicado de forma simples:

O Problema: A Instrução "Uma Vez e Pronto"

Pense nos métodos tradicionais como dar ao robô um mapa único e estático no início de uma jornada.

  • O Jeito Antigo: Você diz ao robô: "Vá à loja e compre leite". O robô escolhe uma "habilidade de compras" de sua memória com base nessa frase e permanece com ela até o fim.
  • A Falha: Se o robô entrar na loja e o layout tiver mudado, ou se ele ficar preso no corredor de laticínios, aquele mapa original não ajudará. O robô fica travado porque não consegue atualizar sua estratégia com base em onde ele está agora. É como tentar navegar em uma cidade usando um mapa de 10 anos atrás enquanto você está em um prédio totalmente novo.

A Solução: A Abordagem do "GPS Inteligente"

Os autores propõem o SGDR, que funciona mais como um GPS inteligente que atualiza sua rota a cada poucos segundos com base na sua localização atual e no tráfego.

Aqui estão os três truques principais que o SGDR utiliza:

1. Dividir Tarefas em "Capítulos" (Extração de Janela Deslizante)

Em vez de salvar uma jornada inteira como uma história gigante e rígida, o SGDR divide jornadas bem-sucedidas em capítulos pequenos e reutilizáveis.

  • Analogia: Imagine que você está aprendendo a assar um bolo. Em vez de memorizar toda a receita como um único bloco gigante de texto, você aprende "movimentos" específicos: "como quebrar um ovo", "como incorporar a farinha" e "como verificar se está pronto".
  • Como funciona: Quando o robô termina uma tarefa com sucesso, ele olha para trás para o que fez e a fatia nesses pequenos "movimentos" (subprocedimentos) reutilizáveis. Isso permite que ele pegue apenas o movimento "quebrar um ovo" mais tarde, mesmo que esteja no meio de uma tarefa de confeitaria diferente.

2. O "Cartão de Habilidade Bilíngue" (Representação Texto-Código)

Cada "movimento" que o robô aprende é armazenado como um cartão de duas partes:

  • Parte A (A Descrição): Uma frase simples em inglês comum (ex: "Clique no botão de login"). Isso ajuda o robô a encontrar o cartão certo.
  • Parte B (O Código): As instruções de computador reais para executar a ação.
  • Por que isso importa: Isso garante que o robô não apenas leia sobre o que fazer; ele tem a ferramenta real para fazer a ação imediatamente.

3. A "Busca Contextualizada" (Recuperação Dinâmica Baseada em Estado)

Esta é a parte mais importante. Cada vez que o robô dá um passo, ele não pergunta apenas: "Qual é o meu objetivo?". Ele também pergunta: "Onde eu estou agora?".

  • O Jeito Antigo: "Preciso comprar leite." -> Recupera habilidade "Ir à loja de conveniência". (Para por aí).
  • O Jeito SGDR:
    • Passo 1: "Preciso comprar leite." -> Recupera "Ir à loja de conveniência".
    • Passo 2: (O robô chega à entrada da loja). "Estou agora na entrada, e a porta está trancada." -> Recupera habilidade "Destrancar porta".
    • Passo 3: (O robô está dentro). "Estou no corredor de laticínios." -> Recupera habilidade "Pegar o leite".

O robô reavalia constantemente sua "biblioteca de habilidades" com base na página da web atual que ele está visualizando, não apenas no objetivo original.

Os Resultados: Funciona?

Os pesquisadores testaram isso em uma simulação web realista chamada WebArena (que inclui sites de compras, painéis administrativos, fóruns, etc.).

  • Melhores Taxas de Sucesso: O robô usando SGDR resolveu significativamente mais tarefas do que os robôs usando os antigos métodos de "mapa estático".
    • Com um modelo de IA poderoso (GPT-4.1), as taxas de sucesso aumentaram cerca de 10% em comparação com o melhor método anterior.
    • Com um modelo menor e mais eficiente, também houve uma melhoria de 10%.
  • Execução Mais Rápida: O robô não apenas teve mais sucesso; ele também deu menos passos para chegar lá. Como ele pode pegar o "movimento" certo instantaneamente, ele não precisa perder tempo adivinhando ou tentando ações erradas.

Em Resumo

O artigo argumenta que, para os robôs dominarem a web, eles não podem depender apenas de um plano feito no início. Eles precisam ser capazes de olhar para sua situação atual, encontrar o "movimento" específico que se encaixa naquele momento exato e executá-lo. O SGDR é o sistema que permite que façam exatamente isso, transformando um plano rígido e de uma única vez em um guia flexível, passo a passo, que se adapta conforme a jornada se desenrola.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →