← Últimos artigos
🤖 AI

TMAS: Scaling Test-Time Compute via Multi-Agent Synergy

Este artigo apresenta o TMAS, um framework de sinergia multiagente que aprimora a escalabilidade de computação em tempo de teste para modelos de linguagem grandes ao utilizar memórias hierárquicas para colaboração estruturada entre trajetórias e um esquema híbrido de aprendizado por reforço com recompensas para equilibrar efetivamente a exploração e a exploração em tarefas de raciocínio.

Autores originais: George Wu, Nan Jing, Qing Yi, Chuan Hao, Ming Yang, Feng Chang, Yuan Wei, Jian Yang, Ran Tao, Bryan Dai

Publicado 2026-05-12
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: George Wu, Nan Jing, Qing Yi, Chuan Hao, Ming Yang, Feng Chang, Yuan Wei, Jian Yang, Ran Tao, Bryan Dai

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando resolver um quebra-cabeça incrivelmente difícil, como um problema matemático complexo ou um enigma lógico complicado. Você tem um assistente muito inteligente (uma IA) que pode tentar resolvê-lo.

A Maneira Antiga: O Lobo Solitário vs. A Multidão
Anteriormente, se a IA ficasse travada, os pesquisadores apenas diziam a ela para "pensar mais" ou "tentar novamente".

  • O Lobo Solitário: A IA continuaria falando consigo mesma, escrevendo uma longa cadeia de pensamentos. Às vezes, ela ficaria presa em um loop, repetindo o mesmo erro uma e outra vez.
  • A Multidão: Outros métodos faziam a IA gerar muitas respostas diferentes ao mesmo tempo, escolher a mais popular ou fazer uma versão verificar outra. Mas essas versões frequentemente trabalhavam em silos. Se uma versão encontrasse um truque brilhante, as outras não ficavam sabendo. Se uma versão atingisse um beco sem saída, as outras não sabiam evitar aquele caminho. Elas eram como um grupo de pessoas em uma sala, todas gritando ideias diferentes, mas ninguém estava realmente ouvindo os outros ou mantendo um caderno compartilhado.

A Maneira Nova: TMAS (A Equipe com um Cérebro Compartilhado)
O artigo apresenta o TMAS (Sinergia Multiagente em Tempo de Teste). Pense nisso não como uma única IA, mas como uma equipe especializada trabalhando junto com um sistema de memória compartilhada.

Veja como o TMAS funciona, usando uma analogia simples:

1. A Equipe de Especialistas

Em vez de uma única IA fazer tudo, o TMAS divide o trabalho entre cinco "agentes" (membros da equipe) específicos:

  • O Solucionador: Tenta chegar a respostas.
  • O Verificador: Revisa o trabalho do Solucionador para encontrar erros.
  • O Resumidor: Pega as anotações do Verificador e as transforma em uma "lição aprendida" clara.
  • O Guardião da Experiência: Isso é crucial. Ele examina as lições e as escreve em um "Caderno de Baixo Nível". Este caderno contém fatos específicos e concretos, como: "Ei, tentamos colocar esta peça na vertical e falhou. Não faça isso novamente," ou "Prove que este número específico é 3, então podemos usar esse fato mais tarde."
  • O Guia de Estratégia: Este agente escreve em um "Mapa de Alto Nível". Este mapa não lista fatos específicos; lista abordagens. Ele diz: "Já tentamos resolver isso usando álgebra. Também tentamos usando geometria. Não perca tempo tentando isso novamente; tente algo totalmente novo."

2. O Processo Iterativo (O Loop)

A equipe trabalha em rodadas:

  1. Explorar: O Solucionador gera várias tentativas diferentes do problema.
  2. Verificar: Os Verificadores avaliam essas tentativas.
  3. Aprender: O Guardião da Experiência e o Guia de Estratégia atualizam seus cadernos e mapas com base no que aconteceu.
  4. Refinar: A próxima rodada de Solucionadores lê os cadernos e mapas. Eles usam o "Caderno de Baixo Nível" para evitar erros específicos do passado e usam o "Mapa de Alto Nível" para garantir que não estejam apenas repetindo estratégias antigas.

3. A "Recompensa Híbrida" (O Incentivo do Treinador)

Para ensinar a IA a usar essa equipe de forma eficaz, os pesquisadores criaram um sistema de treinamento especial (Aprendizado por Reforço). Imagine um treinador dando à equipe três tipos de recompensas:

  • Recompensa 1 (Acertar): Se você resolver o quebra-cabeça, ganha um ponto. (Habilidade básica).
  • Recompensa 2 (Usar o Caderno): Se você resolver o quebra-cabeça especificamente porque usou um fato do "Caderno de Baixo Nível", ganha um bônus. Isso ensina a IA a realmente ler e confiar na memória compartilhada, não apenas ignorá-la.
  • Recompensa 3 (Ser Criativo): Se você resolver o quebra-cabeça usando uma nova estratégia que não está no "Mapa de Alto Nível", ganha um bônus. Isso impede que a equipe fique preguiçosa e apenas repita os mesmos truques antigos. Se você apenas copiar e colar uma estratégia antiga, será penalizado.

Os Resultados

O artigo testou isso em benchmarks matemáticos muito difíceis (como a Olimpíada Internacional de Matemática).

  • A Descoberta: À medida que a equipe tem mais tempo para pensar (mais "iterações"), o TMAS continua ficando cada vez mais inteligente. Outros métodos tendem a atingir um muro onde param de melhorar ou até começam a cometer mais erros porque ficam confusos com seu próprio histórico.
  • A Analogia: É como a diferença entre um aluno que apenas continua relendo um livro didático (ficando cansado e confuso) versus um aluno que tem um tutor, um grupo de estudos e um conjunto compartilhado de flashcards. O aluno com o sistema aprende mais rápido, evita repetir erros e tenta novos ângulos quando travado.

Em Resumo:
O TMAS transforma uma única IA em uma equipe coordenada com uma memória compartilhada. Ele força a IA a lembrar fatos específicos (Banco de Experiência) e rastrear quais grandes ideias já falharam (Banco de Diretrizes). Ao treinar a IA para valorizar o uso dessas memórias e tentar novos caminhos, ela pode resolver problemas muito mais difíceis do que antes, escalando efetivamente seu "tempo de pensamento".

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →