← Últimos artigos
💬 NLP

Scaling Enterprise Agent Routing: Degradation, Diagnosis, and Recovery

Este artigo investiga como a precisão de roteamento em assistentes de LLM empresariais degrada à medida que os catálogos de ferramentas escalam de 10 para 110 agentes, identificando lacunas de recuperação e de confusão como causas primárias de falha e demonstrando que o pré-selecionamento baseado em embeddings recupera efetivamente um desempenho significativo de F1 através de múltiplos modelos de fronteira.

Autores originais: Kellen Gillespie, Robyn Perry

Publicado 2026-06-17
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Kellen Gillespie, Robyn Perry

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é o gerente de um escritório enorme e movimentado. Você tem uma equipe de 110 funcionários especializados (agentes) e 584 habilidades específicas (ferramentas) que eles podem usar. Seu trabalho é receber um pedido de um cliente (como "preciso enviar um e-mail") e escolher instantaneamente o funcionário certo para lidar com isso.

Este artigo é um relatório sobre o que acontece quando esse escritório fica grande demais e como o gerente (uma IA) começa a cometer erros.

Aqui está a divisão das descobertas deles usando analogias simples:

1. O Problema: A Armadilha do "Excesso de Escolhas"

Quando o escritório era pequeno (digamos, 10 funcionários), o gerente era ótimo em escolher a pessoa certa. Mas, à medida que adicionavam mais pessoas, o gerente começava a se confundir.

  • A Analogia: Imagine tentar encontrar uma agulha específica em um palheiro. Quando o palheiro é pequeno, é fácil. Quando ele cresce até o tamanho de uma montanha, você começa a perder agulhas que deveria ter encontrado.
  • O Resultado: À medida que o catálogo de ferramentas crescia de 10 para 110, a capacidade da IA de encontrar a ferramenta correta caía significamente (cerca de 16–23%). Não era que a IA começasse a escolher ferramentas erradas com mais frequência; era que ela começava a perder as ferramentas certas por completo.

2. Por que falhou? Dois tipos de erros

Os pesquisadores dividiram a falha em dois problemas distintos, como duas razões diferentes pelas quais um detetive poderia falhar ao resolver um caso:

  • O "Gap de Recuperação" (O Problema do Bibliotecário): A IA nem sequer conseguia ver a ferramenta certa na lista. Era como um bibliotecário que não consegue encontrar o livro na estante porque a biblioteca é grande demais e bagunçada. Esta é a parte que os pesquisadores conseguiram consertar.
  • O "Gap de Confusão" (O Problema dos Gêmeos): Mesmo que a IA visse a ferramenta certa, ela ainda se confundia. Por quê? Porque o escritório possui muitos "gêmeos".
    • Exemplo: Você tem Gmail, Outlook e Yahoo Mail. Você tem ferramentas de "Melhorar", "Parafrasear" e "Revisar". Todas fazem quase a mesma coisa. Mesmo com uma lista perfeita, a IA tinha dificuldade em decidir qual "gêmeo" era o melhor ajuste. Essa confusão causou uma queda permanente no desempenho que não podia ser corrigida apenas listando as ferramentas melhor.

3. A Solução: O Filtro de "Lista Curta"

Os pesquisadores testaram uma correção simples: Não mostre à IA a lista inteira de 584 ferramentas. Em vez disso, use um filtro rápido (como uma barra de pesquisa inteligente) para encontrar primeiro os 20 candidatos mais prováveis e, então, peça à IA para escolher o vencedor desse pequeno grupo.

  • A Analogia: Em vez de pedir a um juiz para escolher um vencedor entre 58 de 584 competidores, você primeiro pede a um olheiro para selecionar os 20 melhores. Depois, o juiz escolhe o vencedor apenas entre esses 20.
  • O Resultado: Este método de "Lista Curta" funcionou como mágica. Ele recuperou cerca de 10–17% do desempenho perdido. Não resolveu o "Problema dos Gêmeos" (confusão), mas resolveu completamente o "Problema do Bibliotecário" (perder a ferramenta certa).

4. O Que Não Funcionou (e o Que Funcionou)

A equipe tentou diferentes maneiras de construir este "olheiro" (o filtro):

  • O Vencedor: Usar Embeddings (um tipo de IA que entende o significado das palavras, não apenas a grafia). Este foi o melhor método. Ele entendia que "enviar uma mensagem" e "enviar um e-mail para a equipe" são semelhantes, mesmo que as palavras sejam diferentes.
  • O Perdedor: Busca por Palavras-Chave (procurar por correspondências exatas de palavras). Isso falhou miseravelmente porque, em um escritório grande, todos usam as mesmas palavras (como "e-mail" ou "agenda"), então pesquisar por essas palavras não ajudava a distinguir entre as diferentes ferramentas.
  • A Abordagem de "Pacote": Agrupar ferramentas em categorias (como "Ferramentas de E-mail" vs. "Ferramentas de Escrita") e escolher uma categoria primeiro não funcionou tão bem quanto escolher as ferramentas individuais diretamente.

5. Teste no Mundo Real

Os pesquisadores não usaram apenas perguntas de teste geradas por computador. Eles também testaram isso em 1.435 solicitações reais de usuários reais.

  • Usuários reais são desorganizados: eles escrevem palavras erradas, usam gírias e não dizem exatamente o que querem dizer.
  • Os resultados se mantiveram: Mesmo com dados reais desorganizados, o método de "Lista Curta" ainda aumentou o desempenho significativamente, provando que isso não é apenas um truque de laboratório — funciona no mundo real.

A Conclusão

Quando você escala um sistema de IA com ferramentas demais, ele fica sobrecarregado e começa a perder as respostas certas.

  • A Correção: Não deixe a IA olhar para tudo de uma vez. Use um filtro inteligente para reduzir para uma lista curta de 20 opções primeiro.
  • O Limite: Mesmo com uma lista curta, a IA ainda se confundirá com ferramentas que fazem coisas muito parecidas (como diferentes aplicativos de e-mail). Essa parte é mais difícil de consertar, mas o método de "Lista Curta" resolve a maior parte do problema.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →