HeraSys: Collaborative Serving of Multiple LLM Workflows via Fine-Grained End-to-End Optimization
O HeraSys é um sistema de serviço de LLM que otimiza o desempenho de ponta a ponta de fluxos de trabalho multilocatários concorrentes ao eliminar a redundância computacional entre fluxos de trabalho por meio da fusão estrutural de nós e ao empregar uma política de escalonamento conjunto sensível à carga para reduzir significativamente a latência de cauda, enquanto aumenta o rendimento.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine uma cozinha movimentada onde uma equipe de chefs tenta cozinhar centenas de refeições complexas ao mesmo tempo. No mundo da Inteligência Artificial, essas "refeições" são tarefas realizadas por Grandes Modelos de Linguagem (LLMs) — os cérebros de computador superinteligentes que escrevem histórias, respondem perguntas e resolvem problemas. Normalmente, quando você pede para uma IA fazer algo, isso é tratado como um pedido único e isolado. Mas, no mundo real, as aplicações estão se tornando mais parecidas com banquetes elaborados: um único pedido pode envolver a busca de informações, a verificação de um banco de dados e, em seguida, a escrita de um resumo, tudo de uma só vez. Esses são chamados de "fluxos de trabalho" (workflows).
O problema é que, quando muitas pessoas pedem esses banquetes complexos ao mesmo tempo, a cozinha fica caótica. Se dois clientes pedirem para o mesmo ingrediente ser picado, a cozinha pode picá-lo duas vezes, desperdiçando tempo e energia. Pior ainda, se um cliente pedir um ensopado enorme e de cozimento lento, os chefs podem ficar presos nele, deixando todos os outros esperando para que suas saladas rápidas sejam servidas. Este é o desafio de "servir" a IA: como gerenciar uma inundação de pedidos complexos e sobrepostos sem que o sistema trave ou deixe algumas pessoas esperando para sempre?
É aqui que entra um novo sistema chamado HeraSys. Pense no HeraSys como um gerente de cozinha revolucionário que não olha apenas para um pedido de cada vez, mas observa todo o chão da cozinha para ver como diferentes pedidos podem ajudar uns aos outros. Em vez de tratar cada pedido como uma ilha separada, o HeraSys procura sobreposições. Se dois clientes diferentes precisam que o mesmo documento seja analisado ou que a mesma ferramenta seja usada, o HeraSys diz: "Ei, vamos fazer isso uma vez só e compartilhar o resultado!". Ele também atua como um guarda de trânsito, garantindo que os pedidos rápidos e simples não fiquem presos atrás dos pesados e lentos, e que os lentos não fiquem sem atenção.
Os pesquisadores por trás do HeraSys construíram um sistema que decompõe essas tarefas complexas de IA em peças minúsculas e detalhadas. Eles descobriram que, ao fundir etapas duplicadas e agendar de forma inteligente quem recebe os recursos da cozinha (como chips de computador poderosos), poderiam tornar todo o sistema muito mais rápido. Em seus testes, eles mostraram que o HeraSys conseguiu reduzir o tempo que os pedidos mais lentos levam para terminar em até 2,17 vezes (significando que foram mais do que duas vezes mais rápidos) e aumentou o número total de tarefas que o sistema pode lidar em até 1,85 vezes em comparação com os melhores sistemas existentes.
O artigo argumenta contra a antiga forma de fazer as coisas, onde os sistemas tratam cada pedido como um trabalho independente e isolado. Eles mostram que esse "isolamento" cria desperdícios e gargalos desnecessários. Em vez disso, propõem uma abordagem colaborativa onde o sistema busca ativamente pelo trabalho compartilhado. Eles também argumentam contra regras simples de escalonamento, como "o primeiro a chegar é o primeiro a ser servido", que podem fazer com tarefas longas bloquearem todos os outros, ou "o trabalho mais curto primeiro", que pode fazer com que tarefas longas esperem para sempre. O HeraSys sugere uma estratégia equilibrada e "consciente da carga" (load-aware), que reserva alguns recursos para as tarefas pesadas enquanto prioriza as rápidas, garantindo justiça e velocidade para todos.
Os resultados, medidos através de experimentos extensivos em hardware real, sugerem que essa abordagem detalhada e colaborativa é um passo significativo à frente. Ao fundir etapas redundantes e ajustar dinamicamente como as tarefas são agrupadas e executadas, o HeraSys consegue manter o tempo de espera médio baixo, ao mesmo tempo em que evita a "cauda" de atrasos lentos e frustrantes que frequentemente assolam sistemas de IA complexos. É um pouco como perceber que, se você organizar um grupo de amigos para limpar uma casa, não deve apenas atribuir a cada pessoa um cômodo; você deve notar que duas pessoas estão aspirando o mesmo corredor e fazer com que trabalhem juntas, enquanto garante que a pessoa que está lavando as janelas não fique esperando pelo aspirador de pó.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.