← Últimos artigos
💬 NLP

UI-MOPD: Multi-Platform On-Policy Distillation for Unified GUI Agents

Este artigo apresenta o UI-MOPD, um novo framework que aproveita a destilação on-policy de múltiplos professores e o recém-construído conjunto de dados Uni-GUI para treinar um agente de GUI unificado e multiplataforma, integrando efetivamente a especialização em desktop e dispositivos móveis enquanto supera desafios relacionados à escassez de dados e às convenções de interação divergentes.

Autores originais: Niu Lian, Tongbo Chen, Zhehao Yu, Chengzhen Duan, Fazhan Liu, Hui Liu, Pei Fu, Jian Luan, Heng Qu, Shu-Tao Xia, Jinpeng Wang

Publicado 2026-08-11
📖 4 min de leitura☕ Leitura rápida

Autores originais: Niu Lian, Tongbo Chen, Zhehao Yu, Chengzhen Duan, Fazhan Liu, Hui Liu, Pei Fu, Jian Luan, Heng Qu, Shu-Tao Xia, Jinpeng Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um mundo onde o seu assistente digital é um mestre cuca. Mas aqui está a reviravolta: este chef tem que cozinhar em duas cozinhas completamente diferentes ao mesmo tempo. Uma cozinha é um computador desktop de alta tecnologia com uma tela gigante, um mouse e um teclado. A outra é um celular elegante, do tamanho de um bolso, com uma tela sensível ao toque e sem botões físicos. Na cozinha do computador, "voltar" pode significar fechar uma janela. Na cozinha do telefone, significa tocar em uma pequena seta de "voltar". Se você tentar ensinar o chef a cozinhar em ambos os lugares apenas misturando todas as receitas e esperando pelo melhor, o resultado é um desastre: o chef fica confuso, esquece como usar o mouse e tenta acidentalmente deslizar um teclado. Este é exatamente o problema que os cientistas estão enfrentando com os "agentes de GUI" — programas de computador inteligentes projetados para clicar, digitar e deslizar através de nossas vidas digitais para realizar tarefas por nós.

Por muito tempo, esses agentes eram como especialistas: um era ótimo em computadores, outro em telefones, mas eles não consegiam lidar com ambos. Pesquisadores tentaram corrigir isso simplesmente esmagando os dois especialistas juntos, esperando que seu conhecimento combinado criasse um superagente. Mas, como sugere este novo estudo, essa abordagem de "misturar e combinar" muitas vezes borra as linhas, tornando o agente pior em ambos os trabalhos. A questão na mente de todos é: Como construímos um agente único e unificado que possa alternar perfeitamente entre um desktop e um telefone celular sem perder a sanidade ou suas habilidades?

Apresentamos o UI-MOPD, um novo método inteligente proposto por pesquisadores da Universidade de Tsinghua, da Xiaomi e de outras instituições de ponta. Pense no UI-MOPD não como um liquidificador, mas como um treinador brilhante com uma estratégia de treinamento única. Em vez de forçar o aluno (o novo agente unificado) a memorizar uma mistura lamacenta de instruções, o treinador estabelece um acampamento de treinamento dinâmico com dois mentores especialistas: um "Guru de Desktop" e um "Guru de Mobile".

É aqui que a mágica acontece. O agente aluno sai e tenta resolver tarefas por conta própria, gerando seus próprios "rollouts" (tentativas de completar um trabalho). Quando o aluno está trabalhando em uma tarefa de computador, o treinador chama instantaneamente o Guru de Desktop para dar conselhos específicos e de alta qualidade. Quando o aluno muda para uma tarefa de telefone, o treinador substitui o mentor pelo Guru de Mobile. Isso é chamado de Destilação On-Policy Multi-Plataforma. A chave é que o aluno aprende com o especialista certo no momento certo, em vez de tentar tirar a média de suas diferenças. O Guru de Desktop não tenta ensinar o aluno a deslizar; o Guru de Mobile não tenta ensiná-lo a usar um mouse. Eles atuam como "âncoras comportamentais", mantendo as ações do aluno fiéis às regras específicas do ambiente em que ele se encontra no momento.

Os pesquisadores construíram um conjunto de dados massivo e de alta qualidade chamado Uni-GUI para tornar isso possível. Eles criaram uma ferramenta especial para coletar quase 10.000 exemplos de alta qualidade de tarefas sendo realizadas tanto em computadores quanto em telefones. Eles filtraram as tentativas ruins e mantiveram apenas aquelas que realmente funcionaram, garantindo que os professores tivessem exemplos perfeitos para mostrar ao aluno.

Quando testaram essa nova abordagem, os resultados foram promissores. Em um benchmark de computador difícil chamado OSWorld, o novo agente teve sucesso 38,2% das vezes. Em um benchmark de mobile chamado MobileWorld, ele teve sucesso 12,0% das vezes. Esses números sugerem que o UI-MOPD é significativamente melhor do que métodos anteriores que tentavam simplesmente misturar dados ou fundir modelos. Por exemplo, enquanto outros métodos podem melhorar uma plataforma mas arruinar a outra, o UI-MOPD conseguiu aumentar o desempenho em ambos os lados simultaneamente. O estudo indica que este método de "treinador especialista" ajuda o agente a reter sua inteligência geral enquanto aprende a navegar nas peculiaridades específicas de diferentes dispositivos, evitando a armadilha da "média" que confundiu modelos anteriores.

Em suma, o artigo sugere que, se você quer um agente inteligente que possa lidar tanto com seu laptop quanto com seu telefone, não apenas os amasse juntos. Em vez disso, dê a ele um sistema inteligente que saiba exatamente qual especialista ouvir, dependendo de qual tela ele está olhando. É um passo em direção a um futuro onde seu assistente digital pode ser verdadeiramente um mestre de todos os domínios digitais, não apenas de um.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →