← Últimos artigos
💬 NLP

RequestRouter: Request-Boundary Routing for Efficient Single-GPU LLM Inference

O RequestRouter é um controlador de fronteira de requisição leve que seleciona dinamicamente modos de inferência otimizados (como quantização, decodificação especulativa ou cache de prefixo) para o atendimento de LLMs em GPU única, alcançando reduções significativas de latência e energia com overhead negligenciável enquanto mantém uma precisão quase idêntica à inferência de precisão total.

Autores originais: Aman Sunesh, Ali Alshehhi, Hivansh Dhakne

Publicado 2026-08-21
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Aman Sunesh, Ali Alshehhi, Hivansh Dhakne

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A inteligência artificial moderna depende de grandes modelos de linguagem para gerar texto, responder perguntas e resolver problemas. Esses sistemas são poderosos, mas também são ávidos por eletricidade. Cada vez que um usuário faz uma pergunta, o computador deve realizar bilhões de cálculos para produzir uma resposta, um processo que consome energia significativa e leva tempo. Para as pessoas que operam esses sistemas, o desafio é fazer o computador trabalhar o mais rápido possível sem desperdiçar potência. Atualmente, a maioria dos sistemas usa uma configuração única e fixa para cada solicitação, independentemente de a tarefa ser simples ou complexa. Isso é como dirigir um caminhão pesado em velocidades de rodovia, quer você esteja atravessando um quarteirão ou viajando por um país; funciona, mas é frequentemente ineficiente. Pesquisadores estão agora buscando maneiras de combinar as configurações do computador ao trabalho específico em questão, esperando economizar energia e acelerar as respostas sem alterar a inteligência subjacente do modelo em si.

Uma equipe de pesquisadores da Universidade de Nova York desenvolveu uma nova abordagem chamada RequestRouter para resolver este problema. Em vez de forçar cada solicitação através do mesmo processo lento e intensivo em energia, seu sistema atua como um controlador de tráfego leve. Antes de o computador começar a gerar uma resposta, este controlador observa alguns detalhes simples sobre a solicitação, como o comprimento da pergunta do usuário, o comprimento esperado da resposta e se a pergunta compartilha uma frase inicial comum com outras perguntas recentes. Com base nessas pistas, o controlador seleciona instantaneamente a maneira mais eficiente de processar aquela solicitação específica a partir de um menu de opções existentes. Essas opções incluem executar o modelo com números de menor precisão para economizar energia, usar uma técnica que adivinha as próximas palavras para acelerar a geração ou reutilizar partes da conversa que já foram calculadas. O sistema não retreina o modelo nem altera sua arquitetura; ele simplesmente escolhe a melhor ferramenta para o trabalho entre as ferramentas já disponíveis.

Os pesquisadores testaram essa ideia em uma poderosa placa gráfica, um componente de hardware comum usado para executar esses modelos, usando um modelo de linguagem padrão de oito bilhões de parâmetros. Eles realizaram milhares de testes com diferentes tipos de solicitações, variando de interações curtas e rápidas a conversas longas e complexas. Eles compararam o desempenho de seu controlador inteligente contra o método padrão de usar uma configuração única e não otimizada para tudo. Os resultados foram impressionantes. Em média, o controlador tornou o sistema duas vezes mais rápido que o método padrão, utilizando menos da metade da energia por palavra gerada. Em um teste mais rigoroso, onde repetiram as mesmas solicitações várias vezes para garantir que os resultados não fossem um acaso, o controlador ainda manteve um aumento de velocidade de quase duas vezes e uma redução significativa no uso de energia. O controlador também foi extremamente rápido em tomar suas próprias decisões, levando menos de cinco milésimos de milissegundo para escolher um caminho, um atraso tão pequeno que é efetivamente invisível para o usuário.

Crucialmente, os pesquisadores descobriram que esses ganhos de eficiência não vieram à custa da qualidade. Eles testaram o sistema em uma variedade de benchmarks projetados para medir o quão bem o modelo entende e responde a perguntas. O controlador inteligente preservou quase toda a precisão do método padrão, retendo mais de noventa e nove por cento do desempenho. Isso é importante porque alguns dos métodos mais rápidos e de economia de energia podem, às vezes, tornar o modelo menos preciso. O controlador utiliza uma política baseada em regras simples para evitar essas armadilhas, roteando perguntas difíceis para as configurações mais confiáveis, enquanto envia tarefas mais simples para os modos mais rápidos e eficientes. O estudo também comparou seu controlador simples baseado em regras contra sistemas mais complexos e aprendidos que tentam prever a melhor configuração usando inteligência artificial. Eles descobriram que os sistemas complexos eram muito mais lentos para tomar decisões, adicionando tanto atraso que cancelavam a economia de energia. A abordagem simples, baseada em regras, provou ser a solução mais prática, oferecendo o melhor equilíbrio entre velocidade, energia e qualidade.

Este trabalho sugere que o futuro da inteligência artificial eficiente pode não exigir a construção de novos modelos mais inteligentes ou a invenção de novo hardware. Em vez disso, melhorias significativas podem ser feitas simplesmente prestando atenção à estrutura das solicitações que chegam e combinando-as com o modo de processamento correto. Os pesquisadores demonstraram que, ao tratar diferentes técnicas de otimização não como configurações permanentes, mas como opções selecionáveis, eles puderam recuperar uma eficiência substancial. Esta abordagem respeita a qualidade do resultado enquanto reduz drasticamente o custo energético de executar esses sistemas. Ela oferece um caminho claro para tornar os grandes modelos de linguagem mais sustentáveis, mostrando que, às vezes, a maneira mais eficaz de economizar energia não é trabalhar mais duro, mas sim trabalhar de forma mais inteligente, escolhendo a ferramenta certa para cada tarefa específica.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →