← Últimos artigos
🤖 AI

UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations

O artigo apresenta o UI-Mate, um agente de GUI de pesos abertos que aproveita uma pilha de treinamento escalável fundamentada em ambiente e aprendizado por demonstração em contexto para alcançar o estado da arte em tarefas de uso de computador de longo horizonte, melhorando significavelmente a confiabilidade e as taxas de sucesso em relação ao seu modelo base.

Autores originais: Zihan Ding, Longxu Dou, Qi Gao, Xiangwu Guo, Shengchao Hu, Zilong Huang, Zihang Jiang, Lei Ke, Mengcheng Lan, Weixian Lei, Hanxuan Li, Honglin Li, Xiyun Li, Zaitang Li, Leowei Liang, Xin Luo, Haozhe M
Publicado 2026-08-18
📖 8 min de leitura🧠 Leitura aprofundada

Autores originais: Zihan Ding, Longxu Dou, Qi Gao, Xiangwu Guo, Shengchao Hu, Zilong Huang, Zihang Jiang, Lei Ke, Mengcheng Lan, Weixian Lei, Hanxuan Li, Honglin Li, Xiyun Li, Zaitang Li, Leowei Liang, Xin Luo, Haozhe Ma, Jiayi Mao, Zhoujie Pan, Can Qin, Tianyuan Qu, Weiqi Wang, Wenkai Wang, Yonglin Wang, Yuxin Wang, Chenxu Wu, Yingchen Yu, Chenyu Zhang, Yuhao Zheng

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os computadores tornaram-se ferramentas poderosas para lidar com informações complexas, mas pedir que uma máquina realize um trabalho de escritório de múltiplas etapas muitas vezes parece como tentar ensinar uma criança a dirigir apenas descrevendo o destino. Durante anos, pesquisadores tentaram construir agentes de inteligência artificial que pudessem olhar para uma tela, entender o que precisa ser feito e clicar nos botões corretos para chegar lá. Esses sistemas, conhecidos como agentes de GUI, progrediram, mas lutam contra dois problemas persistentes. Primeiro, eles carecem de dados de prática de alta qualidade suficientes para aprender as regras sutis e não ditas de como as pessoas realmente utilizam o software. Segundo, eles são frequentemente muito rígidos; se um humano der uma instrução vaga, a máquina pode ter sucesso uma vez por sorte, mas falhar na próxima porque não consegue se adaptar a pequenas mudanças na tela ou aos hábitos específicos do usuário. O objetivo tem sido criar um trabalhador digital que não seja apenas inteligente o suficiente para seguir um roteiro, mas confiável o suficiente para lidar com a realidade desordenada de uma área de trabalho real.

Uma equipe da Tencent introduziu um novo sistema chamado UI-Mate que aborda essas questões mudando a forma como o agente aprende e como recebe ajuda. Em vez de apenas memorizar uma lista de cliques, o sistema é treinado em um ambiente simulado onde pode praticar milhares de tarefas, desde organizar planilhas até gerenciar e-mails, enquanto um motor especializado verifica seu trabalho em tempo real. Esse processo permite que o sistema aprenda não apenas como o resultado final deve parecer, mas como se recuperar quando comete um erro. Os pesquisadores descobriram que, ao treinar o agente dessa forma rigorosa de ciclo fechado, conseguiram criar um modelo que desempenha significativamente melhor do que os sistemas de código aberto anteriores, chegando a igualar as capacidades de modelos proprietários muito maiores.

O cerne desta melhoria reside em um método que os pesquisadores chamam de "treinamento fundamentado no ambiente". Imagine um estudante aprendendo a cozinhar não apenas lendo uma receita, mas realmente estando em uma cozinha, cortando vegetais e tendo um professor apontar imediatamente se a faca escorregou ou se o calor estava muito alto. Da mesma forma, o UI-Mate é treinado em um ambiente digital onde cada ação que toma é testada contra uma tela de computador real e funcional. Se o agente tentar salvar um arquivo no lugar errado, o sistema sabe imediatamente e registra essa falência. Esse ciclo de tentar, errar e corrigir acontece milhões de vezes em diferentes aplicações, permitindo que o agente construa uma compreensão profunda de como o software se comporta. Os pesquisadores construíram uma biblioteca massiva dessas tarefas de prática, cobrindo tudo, desde o gerenciamento simples de arquivos até fluxos de trabalho complexos que exigem a movimentação de informações entre um calendário, um cliente de e-mail e uma ferramenta de gestão de projetos. Ao equilibrar cuidadosamente os tipos de tarefas que o agente vê, garantiram que ele aprendesse a lidar tanto com trabalhos curtos e simples quanto com sequências longas e complicadas sem se confundir.

No entanto, mesmo um agente bem treinado pode ter dificuldades quando um humano dá uma instrução vaga, como "processe esta oferta de candidato". O agente pode não saber quais arquivos específicos abrir ou quais botões exatos clicar porque a instrução carece do detalhe necessário. Para resolver isso, os pesquisadores desenvolveram uma nova maneira para o agente aprender através de uma demonstração. Em vez de forçar o agente a copiar cegamente uma sequência registrada de cliques de mouse, o sistema decompõe a demonstração em um plano flexível de subtarefas. Ele observa um vídeo de um humano ou de uma IA mais forte completando um trabalho semelhante e extrai os objetivos: "encontrar a oferta", "verificar o salário", "enviar o e-mail". Durante o trabalho real, o agente usa este plano como um guia, mas ainda olha para a tela ao vivo para decidir exatamente como mover o mouse ou digitar o texto. Isso significa que, se a tela parecer ligeiramente diferente do vídeo, o agente pode ajustar suas ações em vez de ficar travado.

Os resultados desta abordagem são impressionantes. Quando testado em um conjunto padrão de desafios de uso de computador, o novo sistema, especificamente a versão de 27 bilhões de parâmetros, alcançou uma taxa de sucesso de 77,0 por cento, superando outros modelos de código aberto e aproximando-se muito dos melhores sistemas de código fechado disponíveis. Mais importante, os pesquisadores criaram um novo teste chamado OSWorkerBench, que simula o trabalho de escritório realista em dezenas de aplicativos diferentes. Neste teste, o sistema melhorou seu desempenho em quase 18 pontos percentuais em relação ao seu modelo base. O achado mais significativo, no entanto, ocorreu quando adicionaram uma única demonstração às instruções do agente. Para um conjunto de 33 tarefas longas e complexas, fornecer apenas um exemplo de como fazer o trabalho elevou a taxa de sucesso do agente de 17,2 por cento para 35,4 por cento. Isso mostra que o sistema não apenas memoriza o exemplo; ele entende a lógica subjacente e pode aplicá-la a novas situações, tornando-o muito mais confiável para o uso no mundo real.

Os pesquisadores também descobriram que a capacidade do agente de lidar com tarefas longas não é apenas uma questão de poder computacional bruto. Eles testaram modelos de diferentes tamanhos e descobriram que, embora modelos maiores geralmente tenham um desempenho melhor, o método de treinamento específico importava mais do que o tamanho isoladamente. Um modelo menor treinado com sua abordagem rigorosa e fundamentada no ambiente superou um modelo muito maior que não recebeu o mesmo treinamento. Isso sugere que a qualidade dos dados de prática e o ciclo de feedback são mais críticos do que simplesmente aumentar o "cérebro" do agente. O sistema também provou ser capaz de lidar com tarefas que exigem lembrar informações do início de um fluxo de trabalho e usá-las no final, um ponto de falha comum para agentes de IA anteriores.

Para garantir que esses resultados não fossem um acaso, a equipe construiu um benchmark que incluiu 100 tarefas de escritório distintas, variando de recursos humanos a vendas e engenharia. Eles avaliaram o sistema em sua capacidade de completar essas tarefas sem qualquer ajuda, e novamente com uma demonstração. Os dados mostraram que o agente consistentemente melhorou seu desempenho quando recebeu um guia visual, mas não se tornou dependente dele. Ele permaneceu capaz de trabalhar apenas com instruções, provando que a demonstração atuou como um mapa útil em vez de um conjunto rígido de regras. Este equilíbrio é crucial para a implementação prática, pois significa que o sistema pode ser usado em situações onde não existe um exemplo prévio, mantendo a capacidade de aprender rapidamente quando um usuário fornece um.

As implicações deste trabalho estendem-se além de apenas melhores pontuações de teste. Ao demonstrar que um agente pode navegar em fluxos de trabalho complexos de múltiplas aplicações com alta confiabilidade, os pesquisadores deram um passo significativo para tornar a automação digital uma realidade prática para o trabalho de escritório cotidiano. O sistema não exige que um humano microgerencie cada clique; em vez disso, ele pode pegar um objetivo de alto nível e descobrir as etapas necessárias, corrigindo seu curso quando encontra layouts de tela inesperados ou informações ausentes. A capacidade de aprender com uma única demonstração sugere que esses agentes poderão, eventualmente, ser ensinados sobre procedimentos específicos de uma empresa em minutos, em vez de meses.

O estudo também destaca a importância de como avaliamos esses sistemas. Os pesquisadores descobriram que simplesmente contar se uma tarefa foi concluída ou não muitas vezes esconde o fato de que um agente pode ter feito um progresso significativo antes de falhar no último passo. Ao medir o progresso parcial, eles puderam ver que o agente estava frequentemente 80 por cento do caminho em uma tarefa complexa, mesmo que não a terminasse. Essa nuance é importante para entender onde a tecnologia se encontra hoje e onde ela precisa melhorar. A equipe identificou que as falhas restantes mais comuns não estavam nas fases iniciais de uma tarefa, mas nos passos finais, como esquecer de enviar um e-mail de confirmação ou omitir um campo específico em um formulário.

No fim, o trabalho apresenta um caminho claro para a construção de agentes de computador mais capazes. Ele mostra que a combinação de treinamento rigoroso e simulado com a capacidade de aprender de exemplos visuais cria um sistema que é tanto poderoso quanto adaptável. Os pesquisadores disponibilizaram seus dados de treinamento e benchmarks para a comunidade, permitindo que outros construam sobre essas descobertas. À medida que esses sistemas continuam a evoluir, eles se aproximam de um futuro onde a inteligência artificial poderá lidar com as tarefas digitais rotineiras, repetitivas e complexas que atualmente consomem grande parte do dia de trabalho humano, deixando as pessoas livres para focar nas decisões que realmente exigem julgamento humano.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →