← Últimos artigos
🤖 machine learning

Does The Way You Plan Matter? An Empirical Study of Planning Representations for LLM Web Agents

Este artigo apresenta o framework PlanAhead para demonstrar empiricamente que tanto a escolha da representação de plano em linguagem natural (como subobjetivos sequenciais, narrativa, pseudocódigo ou lista de verificação) quanto o LLM subjacente impactam significativamente a robustez e as taxas de sucesso de agentes web multimodais em tarefas difíceis do WebArena.

Autores originais: Alejandra Zambrano, Sara Vera Marjanovic, Imene Kerboua, Xing Han Lù, Leila Kosseim

Publicado 2026-05-29
📖 4 min de leitura☕ Leitura rápida

Autores originais: Alejandra Zambrano, Sara Vera Marjanovic, Imene Kerboua, Xing Han Lù, Leila Kosseim

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está contratando um robô muito inteligente, mas um pouco desajeitado, para fazer suas compras online. Você diz a ele: "Compre para mim um protetor bucal para o ranger dos dentes." O robô precisa navegar em um site, encontrar o produto e finalizar a compra.

Às vezes, o robô tem sucesso. Outras vezes, ele fica preso em um loop, compra a coisa errada ou desiste completamente.

Este artigo faz uma pergunta simples: O modo como você escreve as instruções importa?

A maioria das pessoas assume que, se você der ao robô uma lista clara e passo a passo (como uma receita), ele funcionará melhor. Mas os pesquisadores por trás deste estudo se perguntaram: E se o robô funcionar melhor com uma história? Ou com uma lista de verificação? Ou até mesmo com um script de código de computador?

Aqui está a explicação do estudo deles, apresentada de forma simples:

1. O Problema: Robôs se Perdem

Mesmo com os melhores cérebros de IA, agentes web (robôs que navegam na internet) frequentemente falham. Eles podem perder uma etapa crítica, ficar confusos com um pop-up ou esquecer o que estavam tentando fazer. Os pesquisadores suspeitavam que o formato do plano que lhes era dado era o culpado.

2. O Experimento: A Cozinha "PLANAHEAD"

Os pesquisadores construíram uma cozinha de testes chamada PLANAHEAD. Eles não inventaram um novo robô; apenas mudaram a receita que davam aos robôs existentes.

Eles pegaram 158 tarefas muito difíceis (como comprar itens específicos em sites complexos) e as atribuíram a diferentes modelos de IA. Mas, antes do robô começar, eles forneceram um plano em uma de quatro "línguas" diferentes:

  • A Receita (Submetas Sequenciais): A maneira padrão. "Passo 1: Vá aqui. Passo 2: Clique naquilo."
  • A História (Narrativa): Um parágrafo descrevendo a jornada. "Para obter o protetor bucal, você deve começar pesquisando..."
  • A Lista de Verificação (Requisitos): Uma lista de coisas que devem acontecer, mas não necessariamente em ordem. "O carrinho deve ter o item. O endereço deve ser preenchido."
  • O Código (Pseudocódigo): Um script lógico com regras "se/então". "Se o item for encontrado, clique em comprar. Se não, pesquise novamente."

3. O Novo Placar: Além de "Aprovado/Reprovado"

Geralmente, os pesquisadores apenas contam quantas vezes um robô concluiu a tarefa (Taxa de Sucesso). Mas a IA é imprevisível; às vezes ela tem sorte, às vezes azar.

Os autores inventaram duas novas formas de pontuar os robôs:

  • Taxa de Conquista (TC): "O robô alguma vez teve sucesso nesta tarefa se permitíssemos que tentasse cinco vezes?" Isso mede se a tarefa é até mesmo possível para aquele robô.
  • Consistência de Tarefa Resolvida (CTR): "Se o robô teve sucesso, com que frequência ele teve sucesso?" Isso mede a confiabilidade. Ele acertou 100% das vezes, ou apenas 20%?

4. Os Resultados Surpreendentes

O estudo descobriu que uma solução não serve para todos. A "melhor" maneira de dar instruções depende inteiramente de qual cérebro de robô você está usando.

  • O Robô "Contador de Histórias": Um modelo (GPT-4.1-mini) funcionou melhor quando recebeu uma Narrativa. Ele parecia entender melhor a "história" da tarefa do que uma lista seca de etapas.
  • O Robô "Criador de Listas": Outro modelo (Qwen) adorou a Lista de Verificação. Ele prosperava ao saber exatamente quais requisitos precisavam ser atendidos, independentemente da ordem.
  • O Robô "Programador": Um terceiro modelo (Gemini) surpreendentemente teve muito bom desempenho com Pseudocódigo, mesmo não sendo escrito para humanos. Ele parecia gostar da estrutura lógica "se/então".

A Grande Conclusão:
Os pesquisadores também descobriram que dividir o trabalho entre dois robôs frequentemente funcionava melhor do que usar apenas um.

  • O Planejador: Um robô lê o objetivo e escreve o plano (a receita).
  • O Executor: Um segundo robô lê esse plano e realmente clica nos botões.
  • Por que funciona: É como ter um chef que escreve a receita e um sous-chef que realmente cozinha. O chef não se distrai picando cebolas, e o cozinheiro não se confunde com o cardápio.

5. A Conclusão

O artigo conclui que como você planeja importa.
Se você quer que seu agente de IA tenha sucesso, não pode apenas jogar uma lista genérica de etapas nele. Você deve combinar o formato do plano com a personalidade do modelo de IA que está usando. Às vezes, uma história é melhor do que uma lista; às vezes, uma lista de verificação é melhor do que uma história.

Ao testar esses diferentes formatos, os pesquisadores mostraram que podemos tornar esses agentes digitais muito mais robustos e confiáveis, simplesmente mudando a maneira como conversamos com eles.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →