← Últimos artigos
🤖 AI

AQuaUI: Visual Token Reduction for GUI Agents with Adaptive Quadtrees

AQuaUI é um método de redução de tokens sem treinamento e em tempo de inferência para agentes de GUI que emprega quadtree adaptativos para explorar a densidade não uniforme de informações espaciais em capturas de tela, alcançando acelerações significativas e redução de tokens enquanto mantém desempenho quase total e consistência temporal em interações de múltiplos passos.

Autores originais: Yuankai Li, Tinghui Zhu, Ha Min Son, Zhe Zhao, Xin Liu, Muhao Chen

Publicado 2026-05-20
📖 4 min de leitura☕ Leitura rápida

Autores originais: Yuankai Li, Tinghui Zhu, Ha Min Son, Zhe Zhao, Xin Liu, Muhao Chen

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô muito inteligente, mas um pouco lento, a usar um computador ou um telefone. Você mostra ao robô uma imagem da tela e diz: "Clique no botão 'Salvar'".

O problema é que as telas de computador são enormes e cheias de detalhes. Para o robô, uma única captura de tela não é apenas uma imagem; ela é decomposta em milhares de pequenas peças de quebra-cabeça chamadas "tokens". Se a tela tem alta resolução, o robô precisa examinar 3.000 dessas peças apenas para entender uma tela simples. Isso é como pedir a um bibliotecário para ler cada página de uma enciclopédia de 1.000 páginas para encontrar a única palavra "maçã". Demora uma eternidade, consome muita energia e o robô fica cansado (esgota a memória) antes de conseguir lembrar toda a conversa.

A Solução do Artigo: AQuaUI

O artigo apresenta uma nova ferramenta chamada AQuaUI (que significa Árvore Quadriculada Adaptativa para Interface de Usuário). Pense no AQuaUI como um batedor superinteligente que vai à frente do robô para limpar a imagem antes mesmo de o robô vê-la.

Veja como funciona, usando algumas analogias do dia a dia:

1. A "Sala Vazia" vs. A "Mesa Bagunçada"

A maioria das telas de computador é bastante entediante em grandes trechos. Imagine uma tela com um fundo branco gigante (uma sala vazia) e um ícone pequeno e complexo no canto (uma mesa bagunçada).

  • Antigo Jeito: O robô olha para cada centímetro quadrado da parede branca e da mesa bagunçada com a mesma intensidade. Ele perde tempo encarando a parede vazia.
  • Jeito AQuaUI: O AQuaUI olha para a tela e diz: "Ei, essa grande área branca está vazia. Não preciso mostrar ao robô cada pixel dela. Vou enviar apenas um pixel 'representativo' para dizer: 'Esta é uma parede branca'." Mas para a mesa bagunçada com o ícone, ele diz: "Isso é importante! Vou enviar ao robô um mapa detalhado apenas dessa pequena área."

2. A Analogia da "Árvore" (A Árvore Quadriculada)

Para fazer isso, o AQuaUI usa um método chamado Árvore Quadriculada. Imagine que você tem um grande mapa de uma cidade.

  • Você desenha um grande quadrado ao redor de toda a cidade.
  • Se a área dentro for apenas um grande parque (vazio), você para ali. Não precisa olhar mais de perto.
  • Se a área dentro for um centro urbano lotado com arranha-céus (complexo), você divide esse quadrado em quatro quadrados menores.
  • Você continua dividindo as áreas lotadas até ter quadrados minúsculos que mostram os detalhes, mas deixa os parques vazios como um único quadrado grande.

O AQuaUI faz isso com a tela. Ele constrói uma "árvore" de quadrados. Para as partes vazias, ele mantém um token. Para as partes movimentadas, ele mantém mais. Isso reduz o número de peças que o robô precisa examinar em cerca de 30%, sem perder nenhuma informação importante.

3. O Truque da "Imagem em Movimento" (Árvore Quadriculada Condicional)

As telas de computador não são estáticas; elas mudam. Se você rolar uma página da web para baixo, a parte superior sobe e novas coisas aparecem na parte inferior.

  • O Problema: Se o robô olhar para a nova tela do zero, pode acidentalmente descartar os detalhes da parte superior porque ela parece "diferente" no novo quadro, mesmo sendo o mesmo conteúdo que apenas se moveu.
  • A Correção do AQuaUI: O AQuaUI lembra da tela anterior. É como um guarda de segurança que sabe: "Vi aquele botão 'Salvar' no canto superior direito há um segundo. Mesmo que a tela tenha se movido, sei exatamente onde esse botão está agora." Ele usa o histórico da tela para manter os detalhes importantes consistentes, para que o robô não fique confuso quando a tela se deslocar ligeiramente.

Por Que Isso Importa (Segundo o Artigo)

Os pesquisadores testaram isso nos modelos de IA mais recentes e avançados (como Qwen e GUI-Owl). Eles descobriram que:

  • Velocidade: O robô trabalha mais rápido. Nos maiores modelos, foi até 13% mais rápido.
  • Mais Inteligente: Mesmo que o robô tenha visto menos peças da imagem, ele não ficou mais burro. Ele ainda obteve as respostas corretas em quase 99% dos casos, comparado a ver a imagem completa.
  • Sem Treinamento Necessário: A melhor parte é que você não precisa reensinar o robô a fazer isso. Basta conectar o AQuaUI e ele funciona imediatamente.

Em Resumo:
O AQuaUI é como um editor inteligente para telas de computador. Ele diz à IA: "Ignore o espaço em branco vazio, foque nos botões e no texto, e lembre-se do que você viu há um segundo." Isso torna os agentes de IA mais rápidos e baratos de executar, permitindo que lidem com conversas mais longas e tarefas mais complexas sem ficar sobrecarregados por dados visuais excessivos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →