← Últimos artigos
🤖 AI

PANDO: Efficient Multimodal AI Agents via Online Skill Distillation

PANDO introduz um framework eficiente de distilação de habilidades online que permite a agentes web multimodais melhorar o desempenho e reduzir o consumo de tokens, mantendo uma biblioteca estruturada de habilidades e empregando técnicas como reflexão de progresso e prompts conscientes de cache, alcançando uma taxa de sucesso de 58,3% no VisualWebArena com custos de inferência significativamente menores em comparação com métodos existentes.

Autores originais: Yubo Li, Yidi Miao, Haotian Shen, Yuxin Liu

Publicado 2026-05-26
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yubo Li, Yidi Miao, Haotian Shen, Yuxin Liu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: A Armadilha do "Pagamento por Clique"

Imagine que você está contratando um assistente muito inteligente, mas caro, para ajudá-lo a fazer compras online. Toda vez que ele olha para uma página da web, pensa sobre o que fazer ou clica em um botão, você precisa pagar uma pequena taxa (chamada de "token").

Atualmente, a maioria dos agentes de IA tenta melhorar no trabalho gastando mais dinheiro. Se falham, tentam novamente. Se ficam presos, pedem uma segunda opinião. Eles executam a mesma tarefa dez vezes e escolhem o melhor resultado. Isso funciona, mas é como pagar por uma corrida de táxi até a mercearia, depois pagar por um segundo táxi para voltar e verificar se esqueceu a carteira, e um terceiro táxi para conferir o preço novamente. O trabalho é feito, mas é incrivelmente caro e lento.

Os autores deste artigo perguntaram: Podemos criar um agente que fique mais barato e mais rápido quanto mais trabalha, em vez de apenas gastar mais dinheiro a cada vez?

A Solução: PANDO (O Agente "Gigante Aspen")

Os pesquisadores criaram um agente chamado PANDO. Eles o nomearam em homenagem ao bosque de álamos "Pando" em Utah.

  • A Metáfora: Pando parece 47.000 árvores separadas, mas na verdade todas estão conectadas por um único sistema radicular subterrâneo. Quando uma árvore cresce, ela compartilha nutrientes com as outras. Quando uma árvore morre, o sistema radicular se lembra dela e mantém toda a floresta viva.
  • A Versão de IA: PANDO é um agente de IA que possui uma "raiz de memória" compartilhada (uma Biblioteca de Habilidades). Em vez de tratar cada nova tarefa como um problema totalmente novo, ele lembra do que aprendeu com tarefas anteriores e usa essas lições para resolver as novas.

Como o PANDO Funciona (O Ciclo de 4 Passos)

O PANDO não apenas chuta e verifica. Ele segue um ciclo: Planejar → Agir → Refletir → Aprender.

  1. Planejar: O "Cérebro" (uma IA inteligente e cara) divide uma grande tarefa (como "encontrar o violão mais barato abaixo de 500 dólares") em pequenos passos.
  2. Agir: As "Mãos" (uma IA mais barata e rápida) realmente clicam nos botões.
  3. Refletir: Um "Gerente" verifica se os passos funcionaram. O filtro de preço realmente alterou a lista? Se não, por quê?
  4. Aprender (A Parte Mágica): É aqui que o PANDO fica mais inteligente.
    • Biblioteca de Habilidades: Se o agente encontrar com sucesso um violão barato, ele anota a receita: "Para encontrar itens baratos, clique em 'Ordenar por Preço' e depois 'Do Menor para o Maior'." Ele salva isso como uma Regra ou uma Rotina.
    • Reutilizando Habilidades: Da próxima vez que o agente precisar encontrar o item "mais caro", ele não precisa pensar muito. Ele apenas olha para sua biblioteca, vê a regra e muda o interruptor para "Do Maior para o Menor".
    • Rebaixamento (A Limpeza): Se uma regra parar de funcionar (por exemplo, um site mudar seu layout), o agente a marca como "quebrada" e para de usá-la. Isso impede que o agente fique preso em loops tentando usar instruções antigas e quebradas.

Por Que É Um Divisor de Águas

O artigo testou o PANDO em 910 tarefas web diferentes (compras, classificados, Reddit). Eis o que aconteceu:

  • Taxa de Sucesso: O PANDO teve sucesso 58,3% das vezes. Isso é melhor do que os principais agentes atuais (que estavam em torno de 54%).
  • Custo: Este é o grande ganho. O PANDO usou 58% menos tokens (dinheiro) do que o próximo melhor agente.
  • O Efeito "Almoço Grátis":
    • No início: O PANDO é um pouco lento porque está aprendendo as regras.
    • Mais tarde: À medida que constrói sua biblioteca de habilidades, ele fica mais rápido e barato. No final do teste, ele estava resolvendo tarefas com menos passos e menos dinheiro do que com que começou.
    • Analogia: Imagine um aluno fazendo uma prova de matemática.
      • Agentes Antigos: Toda vez que veem um novo problema, eles rederivam a fórmula do zero. Demora uma eternidade.
      • PANDO: A primeira vez que veem um problema, eles o resolvem e escrevem a fórmula em uma cola. Nas próximas 99 vezes, eles apenas olham para a cola. Eles terminam a prova mais rápido e com menos esforço mental.

Os "Custos Ocultos" Que o PANDO Evita

O artigo aponta que outros agentes escondem seus custos de duas maneiras:

  1. Descoberta de Pré-avaliação: Alguns agentes passam semanas "treinando" ou "descobrindo" ferramentas antes mesmo do teste começar. O PANDO aprende durante o teste, então não há custos iniciais ocultos.
  2. Escalonamento de Expansão: Alguns agentes apenas tentam a tarefa 10 vezes e escolhem o vencedor. O PANDO tenta uma vez, mas usa sua memória para fazer essa única tentativa valer a pena.

A Conclusão

O PANDO prova que você não precisa jogar mais dinheiro em uma IA para torná-la melhor. Ao dar a ela uma memória estruturada (uma biblioteca de habilidades) e uma maneira de limpar memórias ruins (rebaixamento), o agente se torna mais eficiente quanto mais trabalha.

É a diferença entre um trabalhador que esquece tudo todos os dias e precisa ser retreinado constantemente, versus um trabalhador que mantém um caderno de "como fazer as coisas" e fica mais rápido a cada único dia.

Principais Conclusões: O PANDO não fica apenas mais inteligente; fica mais barato de operar à medida que ganha experiência.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →