← Últimos artigos
💻 computer science

Closed-Loop Vision-Language Planning for Multi-Agent Coordination

O artigo apresenta o COMPASS, um novo framework multiagente que aproveita Modelos Visão-Linguagem para planejamento descentralizado em malha fechada com refinamento de habilidades baseado em código e comunicação estruturada, alcançando desempenho state-of-the-art no benchmark SMACv2 ao superar significativamente as bases tradicionais de MARL.

Autores originais: Zhiyuan Li, Wenshuai Zhao, Joni Pajarinen

Publicado 2026-05-06
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zhiyuan Li, Wenshuai Zhao, Joni Pajarinen

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um grupo de cinco amigos a jogar um videogame complexo e de ritmo acelerado como StarCraft contra uma equipe de cinco oponentes. O problema? Cada amigo só consegue ver um pequeno círculo ao seu redor. Eles não conseguem ver todo o mapa, não podem falar livremente sem se confundir e precisam tomar decisões em frações de segundo para vencer.

Este é o desafio que o artigo aborda. Os métodos tradicionais de IA (como "Aprendizado por Reforço Multiagente") são como tentar ensinar esses amigos fazendo-os jogar o jogo milhões de vezes, na esperança de que eventualmente descubram uma estratégia vencedora. É lento, desperdiçador e difícil de entender por que eles fizeram uma jogada específica.

Os autores introduzem um novo sistema chamado COMPASS. Pense no COMPASS como uma equipe de cinco amigos guiada por um treinador superinteligente e visualmente astuto (um Modelo de Visão e Linguagem) que consegue ver a tela do jogo e ler os registros de texto. Veja como o COMPASS funciona, dividido em três partes simples:

1. O Treinador com um "Livro de Habilidades" (O Planejador e a Biblioteca de Habilidades)

Em vez de o treinador gritar instruções aleatórias como "Vá para a esquerda!" ou "Ataque!", o treinador possui uma Biblioteca de Habilidades. Isso é como um livro de receitas com receitas pré-escritas (código Python) para táticas específicas, como "Fogo Concentrado" (todos atacando o mesmo inimigo) ou "Kiting" (correr enquanto atira).

  • Como aprende: O treinador não começa do zero. Primeiro, ele lê uma "replay de vídeo" de um especialista humano jogando o jogo (isso é o "início aquecido"). Ele transforma essas jogadas de especialistas em código e as coloca no livro de receitas.
  • Como se adapta: Durante o jogo, se o treinador vê uma situação em que a receita atual não está funcionando, ele escreve uma nova receita na hora. Por exemplo, se a equipe está perdendo uma batalha específica, o treinador pode escrever um novo script chamado "Flanco Agressivo" e adicioná-lo ao livro imediatamente.
  • O Loop: O treinador olha para a tela, escolhe uma receita, os agentes a executam e, em seguida, o treinador verifica o resultado. Se falhou, o treinador reflete, escreve uma receita melhor e tenta novamente. Esta é a parte de "laço fechado" — ele continua ajustando em tempo real.

2. A "Rede de Sussurros" (Comunicação Estruturada)

Em muitos jogos, se os agentes apenas conversarem aleatoriamente, eles ficam confusos ou inventam coisas (alucinações). O COMPASS usa uma estrita "Rede de Sussurros".

  • O Problema: O Agente A vê um inimigo. O Agente B está atrás de uma parede e não consegue vê-los.
  • A Solução: O Agente A sussurra para o Agente C, que sussurra para o Agente B. Isso é chamado de propagação multissalto.
  • A Analogia: Imagine um jogo de "Telefone", mas em vez de distorcer a mensagem, os agentes passam fatos precisos: "Inimigo #1 está a 5 metros a Leste". Isso permite que toda a equipe construa um mapa mental compartilhado do campo de batalha, mesmo que nenhum agente individual consiga ver tudo.

3. A "Auto-correção" (Reflexão)

Após cada jogada, o treinador pergunta a si mesmo: "Isso funcionou?"

  • Se a equipe cercou com sucesso um inimigo, o treinador diz: "Ótimo, salve essa receita."
  • Se a equipe foi eliminada, o treinador diz: "Isso foi muito agressivo. Vamos escrever uma nova regra para sermos mais cuidadosos na próxima vez."
    Essa reflexão constante permite que a equipe fique mais inteligente à medida que o jogo progride, em vez de apenas repetir os mesmos erros.

Os Resultados: Quão Bem Eles Se Saíram?

A equipe testou o COMPASS em uma versão muito difícil do desafio StarCraft chamada SMACv2.

  • A Grande Vitória: Em um cenário específico onde ambas as equipes tinham 5 unidades Protoss (uma luta equilibrada), o COMPASS venceu 57% das vezes. O melhor método de IA anterior (QMIX) venceu apenas 27%. Isso é um salto massivo.
  • A Limitação: O sistema lutou com a raça "Zerg" (um enxame de unidades rápidas e fracas). Como o treinador verifica a tela e escreve novo código a cada 10–20 segundos (em tempo de jogo), foi muito lento para as unidades Zerg, que precisam reagir em frações de segundo. É como tentar dirigir um enxame de abelhas com um policial de trânsito de movimento lento; as abelhas se movem rápido demais para as instruções acompanharem.

Em Resumo

O COMPASS é um sistema que permite que agentes de IA cooperem ao:

  1. Ler o jogo como um humano (usando visão e texto).
  2. Escrever seus próprios manuais de instrução (código) enquanto jogam, começando a partir de exemplos de especialistas.
  3. Compartilhar informações através de uma cadeia estruturada para que todos saibam o que está acontecendo, mesmo que não consigam ver.

Isso prova que, ao combinar o poder de raciocínio de grandes modelos de IA com uma maneira estruturada de compartilhar informações e escrever código, robôs (ou agentes de jogo) podem aprender a cooperar muito mais rápido e de forma mais inteligente do que antes — desde que o jogo não esteja se movendo rápido demais para a IA acompanhar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →