← Últimos artigos
🤖 AI

InfantAgent-Next: A Multimodal Generalist Agent for Automated Computer Interaction

O artigo apresenta o InfantAgent-Next, um agente generalista multimodal altamente modular que integra capacidades baseadas em ferramentas e puramente visuais para permitir interação colaborativa e passo a passo com computadores, alcançando desempenho de última geração em diversos benchmarks, incluindo OSWorld, GAIA e SWE-Bench.

Autores originais: Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

Publicado 2026-05-04
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente pessoal muito inteligente, mas um pouco desajeitado, chamado InfantAgent-Next.

No mundo da automação computacional, a maioria dos assistentes atuais são como especialistas que sabem fazer apenas uma coisa muito bem, ou generalistas que tentam fazer tudo, mas frequentemente se confundem.

  • Alguns assistentes são como Bibliotecários: São ótimos em usar uma lista específica de ferramentas (como "pesquisar na web" ou "abrir um arquivo"), mas se você pedir para eles clicarem em um botão em uma tela que nunca viram antes, eles congelam porque não têm uma ferramenta para aquele botão específico.
  • Outros assistentes são como Artistas: Conseguem olhar para uma tela e "ver" o que está lá, mas lutam para fazer matemática complexa ou escrever código porque estão tentando fazer tudo apenas com os olhos, sem uma calculadora ou um editor de texto.

InfantAgent-Next é diferente. É como contratar uma Equipe de Canivete Suíço em vez de uma única pessoa.

Como Funciona: A Equipe "Cérebro e Mãos"

Em vez de um único cérebro gigante tentando fazer tudo, o InfantAgent-Next divide cada trabalho em pequenas etapas e envia cada etapa para o especialista mais adequado para ela.

  1. O Gerente (O Planejador): Quando você pede "Salve esta página da web nos meus favoritos", um modelo de "Gerente" de alto nível lê sua solicitação. Ele não tenta clicar no mouse ele mesmo. Em vez disso, diz: "Ok, precisamos abrir o navegador, encontrar o botão de favoritos e clicar nele."
  2. Os Especialistas: O Gerente então chama o especialista certo para o trabalho:
    • O Olho (Ancoragem Visual): Se a tarefa for "clicar no botão vermelho", um modelo de visão especializado olha para a tela, encontra as coordenadas exatas de pixels daquele botão vermelho e diz ao sistema onde clicar. É como um observador de visão aguçada guiando um arqueiro vendado.
    • A Calculadora (Execução de Código): Se a tarefa for "analise este arquivo Excel", o Gerente entrega o arquivo a um especialista em codificação que escreve um script para fazer a matemática instantaneamente, em vez de tentar contar as linhas olhando para a tela.
    • O Ouvido (Análise de Áudio): Se você fizer upload de uma gravação e pedir "Qual número de página é mencionado?", um modelo de áudio especializado escuta o arquivo e extrai a resposta.
  3. A Memória: O sistema mantém um caderno compartilhado. Toda vez que um especialista termina uma etapa, ele anota. O próximo especialista pega o caderno, lê o que aconteceu e continua a história. Isso garante que a equipe não perca o objetivo.

Por Que Isso Importa (Os Truques "Mágicos")

O artigo destaca dois problemas principais que este sistema resolve:

  • O Problema do "Clique": Muitos agentes de IA são ruins em clicar no local certo na tela. Eles podem clicar 5 pixels à esquerda e perder o botão. O InfantAgent-Next usa uma técnica de "Zoom In". Se precisa clicar em um botão, não apenas chuta. Ele tira uma foto da tela, encontra a área geral, recorta essa área para ampliá-la, encontra o botão novamente, recorta novamente e, então, clica. É como usar uma lupa para encontrar uma agulha num palheiro, garantindo que o clique seja preciso.
  • O Problema da "Edição": Ao editar um arquivo de texto, a IA frequentemente erra os números das linhas (por exemplo, "Mude a linha 5" quando deveria ser a linha 6). O InfantAgent-Next tem um sistema de "Verificação Dupla". Ele propõe uma alteração, depois olha para o texto real para verificar: "A linha 5 realmente diz o que eu acho que diz?". Se não, ele ajusta seu plano antes de fazer a edição, evitando erros bagunçados.

O Que Ele Pode Fazer (A Prova)

Os pesquisadores testaram essa "Equipe de Especialistas" contra outros agentes de IA de ponta em três tipos de desafios:

  1. Tarefas de Desktop do Mundo Real (OSWorld): Eles pediram ao agente para fazer coisas como "baixar um arquivo", "editar um documento" e "navegar em um site". O InfantAgent-Next superou o famoso agente "Claude Computer Use" em 7,27%. Foi melhor em realmente realizar o trabalho sem ajuda humana.
  2. Codificação e Correção de Bugs (SWE-Bench): Eles pediram ao agente para corrigir código quebrado em projetos de software reais. Ele performou tão bem quanto, ou melhor do que, muitos agentes comerciais caros e de código fechado.
  3. Conhecimento Geral e Lógica (GAIA): Eles fizeram perguntas complexas que exigiam pesquisar na web, ler arquivos e raciocinar. O InfantAgent-Next ficou em segundo lugar entre todos os agentes de código aberto, provando que consegue lidar com lógica complicada e multi-etapa.

A Conclusão

O InfantAgent-Next não é apenas um grande modelo de IA tentando ser tudo. É um maestro modular que sabe exatamente quando chamar o "Olho", o "Ouvido", o "Codificador" ou o "Clicador de Mouse". Ao permitir que cada especialista faça o que faz de melhor, todo o sistema se torna muito mais inteligente, preciso e capaz de lidar com as tarefas bagunçadas do mundo real que enfrentamos em nossos computadores todos os dias.

Os pesquisadores disponibilizaram o código para essa "Equipe de Especialistas" para que qualquer pessoa possa usar e estudar, esperando ajudar a construir assistentes de computador ainda melhores no futuro.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →