← Últimos artigos
💻 computer science

Learning Latency-Aware Orchestration for Multi-Agent Systems

O artigo apresenta o LAMaS, um novo framework que reduz a latência de ponta a ponta em sistemas multiagentes ao aprender grafos de execução conscientes de latência com atribuição de crédito de caminho crítico durante o treinamento e ao empregar um controlador adaptativo leve para eliminar interações redundantes durante a inferência, alcançando uma redução de latência de mais de 50% enquanto mantém a precisão da tarefa.

Autores originais: Xi Shi, Mengxin Zheng, Qian Lou

Publicado 2026-08-14
📖 4 min de leitura☕ Leitura rápida

Autores originais: Xi Shi, Mengxin Zheng, Qian Lou

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine uma equipe de robôs brilhantes e especializados trabalhando juntos para resolver um quebra-cabeça complexo. Este é o mundo dos Sistemas Multiagentes (MAS), onde poderosos "cérebros" de IA (chamados de Modelos de Linguagem de Grande Escala) são divididos em ajudantes menores e focados. Um robô pode ser ótimo em matemática, outro em programação e um terceiro em verificar fatos. Ao trocar notas e ideias entre si, eles podem enfrentar problemas que um único robô não conseguiria resolver sozinho. No entanto, há um porém: cada vez que esses robôs conversam entre si, isso leva tempo. Se eles tiverem que passar uma nota dez vezes para obter uma resposta, todo o processo se arrasta, às vezes levando de 10 a 60 minutos apenas para concluir uma única tarefa. No mundo real, esperar tanto tempo é um fator impeditivo.

Por um tempo, cientistas tentaram tornar essas equipes mais rápidas simplesmente reduzindo custos ou tornando os robôs mais inteligentes. Mas eles perceberam que tornar a equipe mais "barata" nem sempre a torna mais "rápida". Pense nisso como uma corrida de revezamento: se você tem uma equipe de dez corredores, o tempo total não é apenas a soma da velocidade de cada um; é determinado pelo corredor mais lento e pela cadeia mais longa de corredores passando o bastão. Se você reduzir o número de corredores, mas deixar a cadeia mais lenta intacta, o tempo da corrida não melerce. A grande questão tornou-se: Como redesenhamos o fluxo de trabalho da equipe para reduzir o tempo sem perder a precisão da resposta final?

Foi exatamente isso que os pesquisadores da Universidade Central da Flórida abordaram em seu novo artigo, introduzindo um sistema chamado LAMaS (Sistema Multiagente Consciente de Latência). Eles descobriram que a antiga maneira de otimizar essas equipes de IA era como tentar resolver um congestionamento dizendo a cada carro para dirigir mais rápido, mesmo que o gargalo fosse uma única ponte estreita. Em vez disso, o LAMaS atua como um controlador de tráfego inteligente que sabe exatamente qual parte da rota é o "caminho crítico" — a sequência mais longa de etapas que determina o tempo total.

O artigo propõe uma estratégia de duas partes para resolver o problema da velocidade. Primeiro, durante a fase de "treinamento" (onde o sistema aprende como trabalhar), o LAMaS utiliza um método de pontuação especial. Em vez de punir todos os robôs igualmente por demorarem muito, ele foca sua "bronca" apenas nos robôs que fazem parte do caminho crítico — aqueles que estão atrasando toda a equipe. Ele também estabelece uma regra estrita: não importa o quão rápidos eles fiquem, eles não podem cair abaixo de um certo nível de precisão. É como dizer a uma equipe de corrida: "Vocês podem correr tão rápido quanto quiserem, mas ainda devem terminar a corrida corretamente".

Segundo, e talvez mais inteligentemente, o LAMaS adiciona um "controlador leve" que observa a corrida em tempo real. Mesmo que a equipe tenha planejado correr dez voltas, este controlador pode notar, após a terceira volta, que a equipe já descobriu a resposta. Ele então tem o poder de dizer: "Pare! Não precisamos das outras sete voltas", e interromper o restante do trabalho precocemente. Isso acontece de forma dinâmica conforme a tarefa se desenrola, em vez de ser um plano fixo feito com antecedência.

Quando os pesquisadores testaram isso em quatro diferentes benchmarks desafiadores — variando desde a resolução de problemas matemáticos de ensino fundamental até a escrita de código e respostas a questões de conhecimento complexas — eles descobriram que o LAMaS foi um divisor de águas. Comparado a outros sistemas avançados de equipes de IA, o LAMaS reduziu o tempo de espera total em mais de 50% (em alguns casos, reduzindo-o em até 75%) enquanto mantinha a precisão tão alta, ou até melhor. Por exemplo, em um benchmark de matemática chamado GSM8K, o sistema deles terminou em cerca de 11,73 segundos com 93,65% de precisão, enquanto outros sistemas de topo levaram mais de 48 segundos para uma precisão semelhante.

O artigo sugere que esta abordagem não é apenas uma correção temporária para um sistema específico; quando tentaram aplicar o método LAMaS em outros designs de equipes de IA existentes, ele consistentemente os tornou mais rápidos sem quebrá-los. Os autores mostram que, ao focar nas etapas de "gargalo" e permitir que o sistema pare antecipadamente quando está confiante, podemos construir equipes de IA que não são apenas inteligentes, mas também extremamente rápidas, tornando-as muito mais práticas para o uso no mundo real.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →