Learning Agent Routing From Early Experience
Este artigo apresenta o BoundaryRouter, um framework sem treinamento que otimiza o equilíbrio entre latência e desempenho roteando dinamicamente consultas para inferência de LLM leve ou execução completa de agente com base em experiência comportamental inicial e raciocínio guiado por rubricas, alcançando melhorias significativas tanto em velocidade quanto em precisão em relação aos métodos existentes.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem um assistente muito inteligente e rápido, mas às vezes excessivamente confiante (o LLM) e um consultor especialista altamente qualificado, minucioso, mas lento e caro (o Agente).
- O Assistente pode responder a perguntas simples como "Qual é a capital da França?" instantaneamente e gratuitamente. Mas, se você pedir para resolver um problema complexo de física ou escrever um código longo e multi-etapa, ele pode errar o palpite ou alucinar.
- O Especialista pode resolver perfeitamente esses problemas difíceis usando ferramentas, fazendo pesquisas e pensando passo a passo. Mas isso leva muito tempo e custa muito dinheiro.
O Problema:
Atualmente, se você tem uma mistura de perguntas fáceis e difíceis, precisa adivinhar a quem enviar cada uma. Se enviar tudo ao Especialista, desperdiça tempo e dinheiro em perguntas fáceis. Se enviar tudo ao Assistente, obtém respostas erradas em perguntas difíceis.
A Solução: "BoundaryRouter"
O artigo apresenta um novo sistema chamado BoundaryRouter. Pense nele como um agente de trânsito inteligente parado no cruzamento entre o Assistente e o Especialista. Sua função é examinar cada pergunta que chega e decidir: "Isso é simples o suficiente para o Assistente, ou precisa do Especialista?"
A parte complicada é que esse agente de trânsito precisa começar a trabalhar imediatamente, sem nenhum dado de treinamento prévio ou uma "cola" com respostas corretas. É um "início frio".
Como Funciona (A Analogia Criativa):
Em vez de estudar para uma prova, o agente de trânsito usa um truque chamado "Aprendizado a partir da Experiência Inicial".
O Teste "Semente": Antes do sistema entrar em operação, os pesquisadores executam um pequeno lote de perguntas tanto pelo Assistente quanto pelo Especialista. Eles não se importam com as respostas corretas ainda; apenas observam como os dois se comportam.
- Exemplo: Eles notam que, quando a pergunta é sobre um tipo específico de matemática, o Assistente dá uma resposta curta e confiante em 2 segundos, enquanto o Especialista leva 300 segundos para pegar uma calculadora e verificar duas vezes.
- Eles salvam essas observações em um pequeno "livro de memórias".
A Busca por "Semelhança": Quando uma nova pergunta chega, o agente de trânsito folheia seu livro de memórias. Ele pergunta: "Esta nova pergunta se parece com as que vimos antes?"
- Se encontrar uma correspondência onde o Assistente foi rápido e o Especialista foi lento, envia a nova pergunta para o Assistente.
- Se encontrar uma correspondência onde o Assistente ficou confuso ou lento, envia a pergunta para o Especialista.
O Raciocínio do "Regulamento": Para garantir que o agente de trânsito não apenas adivinhe, ele segue um Regulamento estrito (chamado de "Raciocínio Guiado por Rubrica"). Ele não apenas "sente" que o Especialista é necessário; verifica critérios específicos: "A pergunta semelhante do passado levou ao Especialista 10 vezes mais tempo? A resposta do Assistente parecia vaga?" Isso mantém a decisão lógica e consistente.
Os Resultados:
Os pesquisadores testaram esse sistema em um novo benchmark chamado RouteBench (uma coleção de perguntas complicadas).
- Velocidade: Comparado a usar o Especialista para tudo, este sistema foi 60% mais rápido porque parou de desperdiçar tempo em perguntas fáceis.
- Precisão: Comparado a usar o Assistente para tudo, foi 28% mais preciso porque não deixou o Assistente adivinhar em problemas difíceis.
- Comparação: Funcionou muito melhor do que outros métodos que usavam apenas prompts simples ou ferramentas de busca básicas.
Em Resumo:
Este artigo mostra que você não precisa de um conjunto massivo de dados de treinamento para construir um sistema inteligente que saiba quando ser rápido e quando ser minucioso. Simplesmente observando como dois sistemas diferentes se comportam em algumas perguntas de exemplo, você pode ensinar um "agente de trânsito" a rotear perguntas futuras perfeitamente, economizando tempo e dinheiro sem sacrificar a qualidade.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.