← Últimos artigos
💻 computer science

POINTS-GUI-G: GUI-Grounding Journey

Este artigo apresenta o POINTS-GUI-G-8B, um modelo de grounding de GUI estado da arte treinado a partir de uma base com consciência espacial mínima, aproveitando engenharia de dados refinada, estratégias de treinamento aprimoradas e aprendizado por reforço com recompensas verificáveis para alcançar desempenho superior em múltiplos benchmarks.

Autores originais: Zhongyin Zhao, Yuan Liu, Yikun Liu, Haicheng Wang, Le Tian, Xiao Zhou, Yangxiu You, Zilin Yu, Yang Yu, Jie Zhou

Publicado 2026-02-09
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zhongyin Zhao, Yuan Liu, Yikun Liu, Haicheng Wang, Le Tian, Xiao Zhou, Yangxiu You, Zilin Yu, Yang Yu, Jie Zhou

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente robô muito inteligente que consegue ler textos e olhar para imagens. Você quer ensiná-lo a usar seu computador ou celular, exatamente como você faz. Mas há um problema: o robô consegue ler as instruções ("Clique no botão vermelho"), mas ele não sabe onde o botão vermelho realmente está na tela. É como dar a alguém um mapa de uma cidade, mas não dizer em qual rua essa pessoa está no momento.

Este artigo apresenta o POINTS-GUI-G, uma nova versão desse assistente robô que finalmente aprendeu a olhar para uma tela e dizer: "Ah, eu vejo o botão! Ele está bem ali nestas coordenadas exatas".

Aqui está como os pesquisadores ensinaram este robô a se tornar um mestre da tela, explicado através de analogias simples:

1. O Ponto de Partida: Uma Tela em Branco

A maioria dos outros pesquisadores pegou um robô que já era bom em encontrar coisas (como um detetive experiente) e apenas lhe deu algumas pistas extras. Os autores deste artigo decidiram começar com um robô que era ruim em encontrar coisas. Eles queriam construir a habilidade do zero, como ensinar uma criança a ler em vez de apenas corrigir a ortografia de um adolescente. Eles começaram com um modelo base chamado "POINTS-1.5" que tinha quase nenhuma capacidade de apontar para coisas em uma tela.

2. Os Três Pilares do Sucesso

Para transformar este robô "cego" em um robô "vidente", eles usaram três estratégias principais:

A. Limpando e Organizando os Livros Didáticos (Engenharia de Dados Refinada)

Imagine que você está tentando ensinar um aluno usando uma pilha de livros didáticos. Alguns livros usam polegadas, outros centímetros, alguns estão escritos em inglês e outros em francês. Alguns têm páginas rasgadas e outros têm rabiscos por toda parte. Seria um pesadelo aprender assim.

Os pesquisadores fizeram três coisas para consertar isso:

  • Padronização: Eles pegaram todos os conjuntos de dados bagunçados e diferentes e os forçaram a entrar em um único formato. Agora, cada "coordenada" (localização) é medida da mesma forma, como converter tudo para uma régua padrão.
  • Redução de Ruído: Eles atuaram como editores rigorosos. Usaram uma ferramenta especial (chamada OmniParser-v2) para verificar os livros didáticos. Se um livro dizia "O botão está aqui", mas a imagem mostrava claramente que o botão estava em outro lugar, eles jogavam aquela página fora. Eles mantiveram apenas os exemplos perfeitos.
  • Tornando Mais Difícil: Assim que o robô ficou bom em encontrar botões grandes e óbvios, os pesquisadores começaram a alimentá-lo com quebra-cabeças de "modo difícil". Eles criaram telas com botões minúsculos e aglomerados e layouts confusos (como uma mesa bagunçada com papéis por toda parte) para forçar o robô a ser mais aguçado e preciso.

B. Ajustando os Olhos (Estratégias de Treinamento Melhoradas)

Normalmente, ao treinar esses modelos de IA, os "olhos" (a parte do computador que processa imagens) ficam congelados no lugar. Os pesquisadores perceberam que, para encontrar botões em uma tela, os olhos precisavam ser flexíveis.

  • Descongelando a Visão: Eles permitiram que os "olhos" aprendessem e se ajustassem enquanto o resto do cérebro aprendia. Isso permitiu que o robô ficasse melhor em detectar detalhes minúsculos.
  • Consistência de Resolução: Imagine praticar para um jogo de basquete arremessando cestas a 1,5 metro de distância, mas chegar ao jogo real onde a cesta está a 3 metros de distância. Você erraria. Os pesquisadores notaram que seu robô praticava em imagens pequenas e de baixa resolução, mas era testado em telas enormes e de alta definição. Eles corrigiram isso treinando o robão em imagens maiores e mais claras para que sua "visão" estivesse pronta para o mundo real.

C. O Sistema de Recompensa de Videogame (Aprendizado por Reforço)

Esta é a parte mais única. Normalmente, o Aprendizado por Reforço (RL) é usado para ensinar robôs a pensar ou resolver quebra-cabeças de lógica. Aqui, eles o usaram para ensinar o robô a ver.

Pense nisso como um videogame:

  • O robô adivinha onde um botão está.
  • O computador verifica: "Você acertou o botão?"
  • Sim? +100 pontos.
  • Não? 0 pontos.

Como a resposta é ou certa ou errada (não existe "talvez"), o robô recebe um feedback muito claro. Os pesquisadores descobriram que esse ciclo de "tentar, receber uma pontuação, tentar novamente" tornou o robô muito mais preciso do que apenas mostrar exemplos e dizer "isso está certo".

O Resultado

Ao combinar esses três métodos, o modelo POINTS-GUI-G tornou-se um campeão em encontrar coisas nas telas.

  • Ele venceu muitos outros modelos que eram muito maiores e mais caros.
  • Ele obteve pontuações incrivelmente altas em testes que medem o quão bem um robô pode encontrar botões, textos e ícones em telefones, computadores e sites.

Em resumo: o artigo mostra que, se você limpar seus dados de treinamento, permitir que os "olhos" do seu modelo aprendam livremente e usar um sistema de recompensa rigoroso de "certo ou errado", você pode construir um robô pequeno e eficiente que é melhor em navegar na tela do seu computador do que muitas alternativas gigantes e caras.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →