← Últimos artigos
🤖 AI

SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents

O artigo apresenta o SeekJudge, um framework de recompensa prático baseado em modelos que utiliza quatro agentes especializados em funções e um backbone de 9B destilado que iguala ou supera a supervisão baseada em regras no treinamento de agentes de uso de computador, oferecendo julgamentos ao nível de passo, custos menores e escalabilidade para tarefas de longo horizonte.

Autores originais: Yang Wan, Zhenhao Zhang, Jierui Wang, Linchao Zhu

Publicado 2026-07-28
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yang Wan, Zhenhao Zhang, Jierui Wang, Linchao Zhu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está ensinando um robô a navegar em um mundo de videogame, mas em vez de apertar botões em um controle, o robô tem que clicar, digitar e rolar em uma tela de computador real, exatamente como um humano faria. Este é o mundo dos "agentes de uso de computador". Por muito tempo, cientistas tentaram ensinar esses robôs mostrando-lhes um objetivo — como "reservar um hotel" — e verificando se eles tiveram sucesso. A forma antiga de verificar era como usar um checklist rígido: se o robô clicasse no botão certo no momento certo, ele ganhava um ponto; se clicasse no errado, ganhava zero. Mas os computadores são bagunçados e mudam o tempo todo. Um checklist poderia dizer "você falhou" porque o robô clicou em um botão que parecia ligeiramente diferente do que estava no checklist, mesmo que o robô tivesse terminado o trabalho perfeitamente. É como um professor reprovar um aluno por escrever a palavra "cor" em vez de "cores", mesmo que a redação fosse brilhante.

Para corrigir isso, pesquisadores começaram a usar modelos de IA para atuar como juízes, esperando que eles pudessem entender o espírito da tarefa em vez de apenas as regras estritas. No entanto, esses juízes de IA frequentemente se confundem quando precisam olhar para um filme inteiro das ações do robô de uma só vez. É como tentar encontrar um erro de digitação específico em um romance de 500 páginas lendo o livro inteiro em um segundo; os detalhes importantes se perdem no ruído. A grande questão tornou-se: Como construir um juiz que seja inteligente o suficiente para entender objetivos humanos, barato o suficiente para rodar milhares de vezes enquanto o robô aprende e rápido o suficiente para lidar com histórias longas e complicadas sem ter uma dor de cabeça?


Entra o SeekJudge, um novo framework que atua como uma equipe de quatro detetives especializados trabalhando juntos para resolver um mistério, em vez de um único detetive sobrecarregado tentando fazer tudo sozinho. Os pesquisadores descobriram que, quando você força uma IA a olhar para muitas capturas de tela de uma tela de computador ao mesmo tempo, ela começa a alucinar ou perde os detalhes mais importantes. É como pedir a alguém para identificar um suspeito em uma multidão de 100 pessoas; eles podem se distrair com o chapéu brilhante de um estranho e perder o verdadeiro criminoso. Mas, se você mostrasse a eles apenas uma foto do suspeito, eles o identificariam instantaneamente.

O SeekJudge resolve isso dividindo o trabalho. Primeiro, dois "batedores" (chamados de agentes Condense e Ground) percorrem rapidamente a longa jornada do robô e escrevem um resumo curto e fácil de ler sobre o que aconteceu, passo a passo. Em seguida, um "detetive" (o agente Seek) lê esse resumo e decide: "Hum, preciso ver a foto do passo 42 para ter certeza". Ele então chama um quarto agente, o agente Analyze, para olhar apenas aquela captura de tela específica e responder a uma pergunta precisa sobre ela. Esse ciclo de ida e volta continua até que o detetive esteja confiante o suficiente para dar um veredito final.

O artigo mostra que essa abordagem de "buscar e analisar" é um divisor de águas. Quando testaram o SeekJudge, ele foi o primeiro juiz baseado em IA a ter um desempenho tão bom quanto, ou até melhor que, os antigos verificadores de regras rígidas ao ajudar robôs a aprender novas tarefas. Na verdade, ao ser usado para treinar um robô, os robôs aprenderam mais rápido e tiveram mais sucesso com o SeekJudge do que com os métodos tradicionais.

O que é realmente legal é o quão eficiente isso é. Como a IA olha para apenas uma imagem de cada vez em vez de uma pilha inteira, ela não precisa de um computador massivo e caríssimo para rodar. Os pesquisadores descobriram que seu sistema custa uma fração minúscula do que outros juízes de IA custam — centenas de vezes mais barato do que usar um modelo gigante de código fechado. É como a diferença entre contratar uma equipe de especialistas locais que olham para uma pista por alguns dólares, versus contratar um detetive celebridade que cobra uma fortuna para ler todo o arquivo do caso de uma só vez.

A equipe também construiu um novo "campo de treinamento" chamado CUAStepBench, que é uma coleção de 278 tarefas de computador diferentes onde humanos rotularam cuidadosamente cada um dos passos da jornada do robô. Isso ajudou a treinar sua equipe de "detetives" para serem incrivelmente aguçados. Eles provaram que, ao decompor o problema em encontrar o momento certo (localização) e depois ler os detalhes (extração), eles podiam lidar com tarefas muito mais longas e complexas do que os métodos anteriores.

Em suma, o SeekJudge não tenta ser um olho onisciente e superinteligente; em vez disso, ele atua como uma equipe inteligente e eficiente que sabe exatamente quando dar zoom no detalhe mais importante. Isso torna possível treinar robôs que usam computadores no mundo real, onde as tarefas são longas, as telas mudam e manuais de regras estritos simplesmente não funcionam. O artigo sugere que essa abordagem pode ser a chave para criar assistentes de IA que possam realmente nos ajudar em nossas tarefas diárias de computador, desde reservar voos até organizar arquivos, sem precisar de um supercomputador para corrigir seus deveres de casa.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →