← Últimos artigos
🤖 AI

Towards Understanding, Analyzing, and Optimizing Agentic AI Execution: A CPU-Centric Perspective

Este artigo analisa os gargalos de desempenho de sistemas de IA agênica sob uma perspectiva centrada na CPU e propõe duas otimizações de agendamento, COMB e MAS, que melhoram significativamente a utilização de recursos e reduzem a latência em ambientes homogêneos e heterogêneos.

Autores originais: Ritik Raj, Souvik Kundu, Ishita Vohra, Hong Wang, Tushar Krishna

Publicado 2026-04-20
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Ritik Raj, Souvik Kundu, Ishita Vohra, Hong Wang, Tushar Krishna

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um chefe de cozinha extremamente inteligente (o Modelo de Linguagem ou IA) que sabe cozinhar pratos complexos, mas é um pouco "preguiçoso" para ir à despensa, abrir a geladeira ou ligar a torradeira.

Neste cenário, a IA Agêntica é como esse chefe que, em vez de apenas cozinhar, decide: "Preciso de um ingrediente? Vou pedir para o ajudante buscar. Preciso de uma receita? Vou consultar o livro. Preciso de um utensílio? Vou pegar na gaveta."

O problema que este artigo de pesquisa resolve é que, na cozinha moderna (os servidores de computadores), o ajudante (o processador da CPU) está ficando sobrecarregado, enquanto o chefe (a GPU, a parte super-rápida da IA) fica parado esperando.

Aqui está a explicação simples do que os pesquisadores descobriram e como eles consertaram isso:

1. O Problema: O Chefe Esperando o Ajudante

Antes, as pessoas achavam que o gargalo (o problema de lentidão) era o chefe de cozinha (a IA) demorar para pensar. Mas os pesquisadores descobriram que, na verdade, o chefe pensa muito rápido. O problema é que ele passa a maior parte do tempo esperando o ajudante (CPU) fazer coisas como:

  • Pesquisar na internet.
  • Ler documentos.
  • Executar códigos de programação.
  • Organizar arquivos.

A Analogia da Fábrica:
Imagine uma fábrica de carros onde a máquina de pintura (GPU) é super rápida e pode pintar 100 carros por minuto. Mas, antes de pintar, um funcionário humano (CPU) precisa abrir a porta do carro e preparar a peça. Se o funcionário demora 10 segundos e a máquina leva 1 segundo, a máquina fica parada 90% do tempo, apenas esperando. É exatamente isso que acontece com a IA Agêntica: a parte "inteligente" (GPU) fica ociosa porque a parte "operacional" (CPU) está lenta.

2. A Análise: Medindo o Tempo

Os pesquisadores testaram diferentes tipos de "tarefas" (como responder perguntas, escrever código ou pesquisar na web) em dois tipos de computadores:

  • Um com uma GPU muito forte e uma CPU média.
  • Outro com uma GPU média e uma CPU muito forte.

A Grande Descoberta:
Eles viram que, mesmo com a GPU mais potente do mundo, se a CPU for lenta, o sistema todo fica lento. Em alguns casos, a CPU consumia 88% do tempo total apenas fazendo as tarefas de "ajudante". Além disso, quando tentavam fazer muitas tarefas ao mesmo tempo, a CPU ficava tão confusa e sobrecarregada que o sistema travava, desperdiçando a potência da GPU.

3. As Soluções: Dois Novos Métodos de Organização

Para consertar isso, eles criaram duas estratégias de "gerenciamento de tráfego" (agendamentos):

Estratégia A: COMB (O "Micro-Encomenda" Inteligente)

  • O Problema: Quando você manda 128 pedidos de uma vez para a CPU, ela entra em pânico e fica lenta. É como se 128 pessoas entrassem na cozinha ao mesmo tempo para pegar sal; ninguém consegue nada.
  • A Solução: O COMB divide esses 128 pedidos em pequenos grupos (micro-lotes).
  • A Analogia: Em vez de deixar todos os clientes entrarem na loja de uma vez, o gerente deixa entrar apenas 10 de cada vez. Enquanto esses 10 estão sendo atendidos (CPU), a máquina de pintura (GPU) já começa a trabalhar no primeiro grupo. Assim, ninguém fica parado.
  • Resultado: A velocidade aumentou em até 3,9 vezes em alguns casos.

Estratégia B: MAS (O "Tráfego de Faixas Diferentes")

  • O Problema: Imagine uma estrada com um único semáforo. Se houver muitos caminhões (tarefas pesadas de CPU) e poucos carros esportivos (tarefas leves de GPU), os carros ficam presos atrás dos caminhões, mesmo que a estrada para carros estivesse livre.
  • A Solução: O MAS cria faixas separadas. Ele garante que os "caminhões" (tarefas de CPU) tenham sua própria fila e os "carros esportivos" (tarefas de GPU) tenham a deles, sem se misturar e bloquear um ao outro.
  • A Analogia: É como ter uma fila de "expresso" para quem só quer comprar um café e uma fila normal para quem vai comprar um bolo inteiro. Ninguém fica esperando o outro.
  • Resultado: Isso garante que, mesmo se a maioria dos pedidos for pesada, os pedidos leves não fiquem esperando horas. A latência (tempo de espera) para os pedidos minoritários caiu em até 2,5 vezes.

4. Por que isso importa?

Hoje em dia, as IAs não são mais apenas "chatbots" que respondem perguntas. Elas são agentes que fazem coisas: reservam voos, analisam dados médicos, escrevem softwares.

Para que essas IAs sejam úteis no mundo real, elas precisam ser rápidas. Este artigo mostra que, para torná-las rápidas, não basta comprar chips de IA mais caros (GPUs). Precisamos otimizar o cérebro operacional (CPU) e organizar melhor como as tarefas são distribuídas.

Resumo Final:
Os pesquisadores provaram que, na era das IAs que "fazem coisas", o gargalo não é a inteligência, é a logística. Eles criaram um novo sistema de organização que faz a CPU e a GPU trabalharem juntas como uma equipe sincronizada, em vez de uma esperando a outra, tornando tudo muito mais rápido e eficiente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →