← Últimos artigos
🤖 AI

MMSkills: Towards Multimodal Skills for General Visual Agents

O artigo apresenta o MMSkills, um framework que aborda as limitações das representações de habilidades baseadas em texto, formalizando e implementando conhecimento procedural multimodal reutilizável — combinando procedimentos textuais com evidências visuais condicionadas ao estado — para aprimorar as capacidades de tomada de decisão em tempo real de agentes visuais gerais.

Autores originais: Kangning Zhang, Shuai Shao, Qingyao Li, Jianghao Lin, Lingyue Fu, Shijian Wang, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

Publicado 2026-05-14
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Kangning Zhang, Shuai Shao, Qingyao Li, Jianghao Lin, Lingyue Fu, Shijian Wang, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Ideia: Ensinar Robôs a "Ver" como Humanos

Imagine que você está ensinando um robô a usar um computador.

  • O Jeito Antigo (Habilidades Apenas em Texto): Você dá ao robô uma receita escrita: "Clique no menu 'Arquivo', depois em 'Novo', depois em 'Planilha'."
    • O Problema: Se o robô estiver na tela errada, ou se uma janela pop-up estiver bloqueando o menu, o robô segue o texto cegamente. Ele clica em "Arquivo" mesmo que o menu não esteja lá, fica preso e falha. Ele sabe o que fazer, mas não quando fazer ou como isso se parece quando está feito.
  • O Novo Jeito (MMSkills): Você dá ao robô um "Guia Inteligente". Este guia não tem apenas texto; tem fotos de como a tela deve parecer em cada etapa, juntamente com listas de verificação para confirmar se o robô está no caminho certo.

Este artigo apresenta o MMSkills, um sistema que transforma esses "Guias Inteligentes" em ferramentas reutilizáveis para agentes de IA (robôs que usam computadores ou jogam jogos).


Os Três Principais Problemas Que Eles Resolveram

Os autores identificaram três grandes obstáculos para fazer esses Guias Inteligentes funcionarem:

  1. O que vai dentro do pacote?

    • Analogia: Se você está ensinando alguém a fazer um bolo, uma receita em texto não é suficiente. Você precisa de uma foto da massa (para saber quando está pronta), uma foto do forno (para saber que está quente) e uma lista de verificação (para garantir que você não esqueceu os ovos).
    • A Solução: Um pacote MMSkill contém três coisas:
      • O Texto: As instruções passo a passo.
      • Cartões de Estado: Um sistema de "semáforo". Ele diz ao agente: "Siga em frente apenas se você vir um botão azul", ou "Pare! Não clique se vir uma mensagem de erro vermelha".
      • Evidência Visual: Fotos (quadros-chave) mostrando exatamente como a tela deve parecer em momentos críticos (por exemplo, fotos "Antes" e "Depois").
  2. Onde conseguimos esses guias?

    • Analogia: Você não quer contratar um humano para escrever uma nova receita para cada bolo individual. Você quer assistir pessoas fazendo bolos, descobrir os passos comuns e escrever uma receita genérica você mesmo.
    • A Solução: Eles construíram um "Gerador" automatizado. Ele assiste a milhares de vídeos públicos de pessoas usando computadores (trajetórias), agrupa tarefas semelhantes e escreve automaticamente esses Guias Inteligentes. Ele não apenas copia o vídeo; ele extrai a lógica e os pistas visuais.
  3. Como o robô os usa sem ficar confuso?

    • Analogia: Imagine tentar ler um álbum de fotos enorme de 50 páginas enquanto dirige um carro. É distrativo e perigoso. O robô pode ficar tão focado nas fotos antigas que bate no mundo real.
    • A Solução: Eles inventaram o "Carregamento em Ramo" (Branch Loading).
      • Em vez de enfiar todo o álbum de fotos no cérebro principal do robô, o robô abre uma janela lateral temporária (um ramo).
      • Nessa janela lateral, ele olha rapidamente apenas a foto específica de que precisa agora para tomar uma decisão.
      • Em seguida, ele fecha a janela lateral e diz ao robô principal: "Ok, verifiquei a foto. Você está no caminho certo. Agora, clique no botão."
      • Isso mantém o robô principal focado na tela ao vivo, e não nas fotos de referência antigas.

Como Funciona na Vida Real (O Exemplo do "Gráfico")

O artigo usa um exemplo específico para mostrar por que isso é melhor: Criar um Gráfico em uma Planilha.

  • Cenário: A tarefa é "Criar um gráfico na Planilha 2".
  • Agente Apenas em Texto: Lê "Criar gráfico". Vê um gráfico sendo feito. Clica em "Concluir".
    • Resultado: Ele criou o gráfico na Planilha 1 (a planilha errada) porque o texto não disse para verificar qual planilha estava ativa. Pontuação: 0.
  • Agente MMSkills:
    1. Carrega a habilidade "Criar Gráfico".
    2. O Cartão de Estado diz: "Verificar: A planilha ativa se chama 'Planilha 2'?"
    3. A Evidência Visual mostra uma foto da aba da planilha correta.
    4. O robô vê que está atualmente na Planilha 1. O "Ramo" diz: "Espere! Você está na planilha errada. Mude para a Planilha 2 primeiro."
    5. O robô muda, cria o gráfico e verifica se o título corresponde à foto.
    • Resultado: Gráfico perfeito na planilha certa. Pontuação: 1.

O Que os Resultados Mostraram

Os pesquisadores testaram isso em dois tipos de tarefas:

  1. Tarefas de Desktop: Como usar Excel, Chrome ou Word (OSWorld, macOSWorld).
  2. Tarefas de Jogo: Como jogar Minecraft ou Super Mario Bros.

As Descobertas:

  • Melhores Taxas de Sucesso: Robôs usando MMSkills resolveram significativamente mais tarefas do que robôs sem habilidades ou com apenas habilidades em texto.
  • Ajudou Robôs Menores: Mesmo modelos de IA menores e menos poderosos ficaram muito melhores nas tarefas quando receberam esses guias visuais.
  • Menos Erros: Os robôs cometeram menos erros repetitivos (como clicar no mesmo botão 10 vezes) e terminaram as tarefas mais rápido.
  • Não Apenas para Computadores: O sistema funcionou tão bem em videogames, provando que "ver o estado" é importante, seja você gerenciando arquivos ou pulando obstáculos.

Resumo

MMSkills é uma maneira de ensinar agentes de IA não apenas o que fazer, mas como reconhecer se estão fazendo certo. Ao combinar instruções em texto com listas de verificação de "semáforo" e fotos específicas, e ao usar um método de "janela lateral" para olhá-las, o sistema ajuda os robôs a evitar se perder, confundir ou ficar presos na tela errada. Transforma um robô que segue ordens cegamente em um robô que realmente entende o mundo visual em que está trabalhando.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →