← Últimos artigos
🤖 AI

MIND-Skill: Quality-Guaranteed Skill Generation via Multi-Agent Induction and Deduction

O artigo apresenta o MIND-Skill, um framework multiagente que gera automaticamente habilidades de LLM de alta qualidade e reutilizáveis por meio de um ciclo de indução-dedução otimizado via perdas textuais (reconstrução, resultado e rubrica) para garantir robustez e generalizabilidade em tarefas complexas.

Autores originais: Yixuan Li, Mingshu Cai, Ziyang Xiao, Wanyuan Wang, Yanchen Deng, Bo An

Publicado 2026-05-12
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yixuan Li, Mingshu Cai, Ziyang Xiao, Wanyuan Wang, Yanchen Deng, Bo An

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente robótico brilhante, mas um pouco desajeitado. Você ensina a ele como realizar uma tarefa específica, como "enviar um reembolso para um amigo no Venmo", mostrando um vídeo de você fazendo isso perfeitamente. O robô observa, mas, em vez de apenas copiar seus movimentos exatos, ele tenta escrever um manual de regras para si mesmo, para que possa realizar tarefas semelhantes no futuro.

O problema é que, se o robô escrever um manual de regras ruim, ele pode ficar travado. Ele pode memorizar o nome do seu amigo específico (muito específico) ou escrever instruções muito vagas para serem úteis (muito abstratas).

MIND-Skill é um novo sistema projetado para ajudar esses agentes de IA a escrever manuais de regras perfeitos e de alta qualidade automaticamente. Ele faz isso usando um jogo inteligente de "Professor e Aluno" que garante que as regras realmente funcionem.

Veja como funciona, dividido em partes simples:

1. Os Dois Personagens: O Professor e o Aluno

O sistema utiliza dois agentes de IA trabalhando juntos:

  • O Professor (Agente de Indução): Este agente observa um vídeo bem-sucedido de uma tarefa sendo realizada. Sua função é escrever um manual de regras geral (uma "habilidade") que explica como realizar a tarefa, sem mencionar nomes ou números específicos.
  • O Aluno (Agente de Dedução): Este agente é o teste. Recebe apenas o manual de regras escrito pelo Professor e a descrição original da tarefa. Ele tenta realizar a tarefa do zero, usando apenas essas instruções.

2. O Teste de "Reconstrução"

Este é o truque de mágica. O sistema não pergunta apenas: "O Aluno chegou à resposta certa?". Ele pergunta: "O Aluno seguiu a mesma lógica do vídeo original?"

  • Se o Professor escrever um manual que diz "Clique no botão vermelho", mas o vídeo original mostrou clicar em um botão azul, o Aluno falhará. O sistema detecta isso.
  • Se o Professor escrever um manual muito vago (por exemplo, "Faça a coisa"), o Aluno ficará confuso e falhará.
  • Se o Professor escrever um manual muito específico (por exemplo, "Clique no botão do Usuário #123"), o sistema percebe que isso não funcionará para mais ninguém.

O sistema compara o desempenho do Aluno com o vídeo original. Se houver correspondência, o manual de regras é bom. Se não houver, o sistema sabe que o manual está defeituoso.

3. Os Três "Boletins"

Para garantir que o manual de regras seja perfeito, o sistema entrega ao Professor três boletins específicos (chamados de "perdas") após cada tentativa:

  1. O Cartão "Você Seguiu os Passos?" (Perda de Reconstrução): O Aluno seguiu a mesma estratégia do vídeo original? (Por exemplo, ambos verificaram o e-mail primeiro e depois clicaram em enviar?)
  2. O Cartão "Você Concluiu o Trabalho?" (Perda de Resultado): O Aluno realmente concluiu a tarefa com sucesso no mundo real?
  3. O Cartão "Este é um Bom Manual?" (Perda de Rubrica): O manual de regras está bem escrito? É claro? Evita copiar detalhes específicos (como nomes ou IDs) que não deveriam estar lá? Isso garante que o manual seja uma ferramenta útil, e não apenas uma cópia e cola de um evento específico.

4. O Ciclo de Melhoria

O sistema executa esse jogo repetidamente.

  • O Professor escreve um rascunho.
  • O Aluno tenta executá-lo.
  • O sistema avalia o rascunho usando os três boletins.
  • O sistema informa ao Professor exatamente o que estava errado (por exemplo, "Você incluiu um nome específico; remova-o" ou "Você pulou uma verificação de segurança").
  • O Professor reescreve o manual de regras com base nesse feedback.

Isso ocorre automaticamente, refinando o manual de regras até que ele fique impecável.

Por que isso é especial?

A maioria dos métodos anteriores tentava escrever manuais de regras apenas pedindo a uma IA inteligente que "resumisse" um vídeo. Mas a IA frequentemente comete erros — seja sendo muito vaga ou muito específica.

MIND-Skill é diferente porque testa o manual de regras imediatamente. É como um chef escrevendo uma receita e, em seguida, entregá-la imediatamente a um sous-chefe para preparar o prato. Se o sous-chefe queimar a comida ou usar os ingredientes errados, o chef sabe que a receita estava ruim e a corrige antes que mais alguém tente.

Os Resultados

O artigo testou isso em dois mundos difíceis:

  1. AppWorld: Uma simulação de uso de aplicativos reais (como enviar dinheiro, reservar passagens, gerenciar arquivos).
  2. BFCL-v3: Um teste de chamada correta de funções de computador.

Os resultados mostraram que agentes usando manuais de regras do MIND-Skill foram muito melhores em resolver novas tarefas, nunca vistas antes, do que agentes usando manuais de regras criados por outros métodos. Mesmo quando o "Professor" IA não era o modelo mais inteligente disponível, o processo de teste tornou os manuais de regras finais tão bons que eles performaram tão bem quanto os feitos pelos modelos mais inteligentes.

Em resumo: MIND-Skill transforma agentes de IA em professores de autoaperfeiçoamento que escrevem seus próprios manuais de instruções perfeitos, testando constantemente se esses manuais realmente funcionam.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →