KForge: LLM-Driven Cross-Platform Kernel Generation for AI Accelerators
O KForge é um framework multiplataforma que aproveita dois agentes de LLM colaborativos para gerar e refinar iterativamente kernels de alto desempenho para aceleradores de IA, alcançando melhorias significativas de throughput tanto em hardware NVIDIA B200 quanto Intel Arc B580 em comparação com baselines ajustados manualmente e otimizados por compiladores existentes.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está administrando um serviço de entrega massivo e de alta velocidade. Sua frota não é composta apenas por um tipo de caminhão; é uma mistura de pequenas scooters para ruas da cidade, carretas pesadas para rodovias e vans elétricas para zonas ecológicas. Cada veículo é perfeito para um trabalho específico, mas todos eles falam línguas diferentes e têm regras de motor diferentes.
No mundo da Inteligência Artificial (IA), isso é exatamente o que acontece hoje. Os sistemas de IA estão se tornando "agênticos", o que significa que eles não apenas respondem a uma pergunta; eles decompõem tarefas em etapas, usam ferramentas e coordenam ações com outros agentes de IA. Algumas etapas precisam de matemática pesada (como um caminhão de carga), enquanto outras precisam de um pensamento rápido e leve (como uma scooter). Para tornar todo o sistema rápido, você precisa executar cada etapa no chip de computador (acelerador) mais adequado para ela.
O Problema: O Pesadelo da Tradução
O problema é que escrever o "código do motor" (chamado de kernels) para esses diferentes chips é incrivelmente difícil. É como tentar escrever um manual para uma Ferrari, um trator e uma motocicleta ao mesmo tempo, mas os manuais são escritos em línguas diferentes (CUDA, Metal, SYCL, etc.).
- O Jeito Antigo: Especialistas humanos passam anos escrevendo e ajustando esse código manualmente. É lento, caro e difícil de escalar.
- O Novo Problema: Mesmo quando tentamos usar IA para escrever esse código, ela frequentemente falha. A IA pode escrever um código que parece correto, mas que trava o motor, ou pode escrever um código que funciona em um chip NVIDIA, mas falha completamente em um chip Intel.
A Solução: KForge (A Equipe de Mecânicos de IA)
O artigo apresenta o KForge, um novo sistema que atua como uma equipe de dois mecânicos de IA especializados trabalhando juntos para consertar e otimizar esses motores automaticamente.
Em vez de uma única IA tentando fazer tudo, o KForge divide o trabalho:
- O Gerador (O Construtor): Esta IA escreve o código. Se o código travar ou não compilar, ele recebe uma "luz vermelha" e tenta novamente, corrigindo os erros.
- O Analista (O Ajustador): Uma vez que o código funciona, esta IA olha para o "painel de controle" (dados de perfilamento/profiling). Ela vê coisas como "este motor está desperdiçando combustível" ou "as rodas estão girando rápido demais". Ela dá instruções específicas ao Construtor sobre como ajustar o código para torná-lo mais rápido.
Eles trabalham em um ciclo: Construir → Testar → Analisar → Ajustar → Repetir. Isso continua até que o código não esteja apenas correto, mas também incrivelmente veloz.
Os Resultados: Duas Corridas Diferentes
Os autores testaram o KForge em dois cenários muito diferentes para ver como ele funciona:
Corrida 1: O Campeão dos Pesados (NVIDIA B200)
Aqui, o KForge teve que competir contra uma base de código que foi aperfeiçoada por engenheiros da NVIDIA ao longo de muitos anos (TensorRT-LLM). Era como um mecânico novato tentando vencer uma equipe de pit stop de Fórmula 1.- O Resultado: O KForge conseguiu extrair um aumento de velocidade de 2,12%. No mundo da computação de alto desempenho, superar um campeão em até 1% é algo enorme. É como reduzir uma fração de segundo no tempo de uma volta recordista mundial.
Corrida 2: A Nova Pista (Intel Arc B580)
Aqui, não havia um "campeão" para vencer. O hardware era novo e não havia código de alto desempenho existente para copiar. O KForge teve que construir o motor do zero.- O Resultado: O KForge gerou um código que foi 5,13 vezes mais rápido do que o código padrão, não otimizado, atualmente disponível para este chip. Ele essencialmente deu vida a um motor poderoso onde antes existia apenas um motor básico e lento.
Por Que Isso Importa
O artigo argumenta que, à medida que a IA se torna mais complexa, não podemos depender de humanos para escrever manualmente o código para cada novo chip. O KForge mostra que uma equipe de IA pode:
- Traduzir código entre diferentes marcas de hardware (NVIDIA, Intel, Apple, AMD).
- Corrigir seus próprios erros.
- Aprender com dados de desempenho para se tornar mais rápida com o tempo.
Em resumo, o KForge é uma ferramenta que ajuda os sistemas de IA a rodarem eficientemente em qualquer chip de computador, seja esse chip um veterano bem ajustado ou um modelo novo e potente, automatizando o trabalho difícil de escrever o código de baixo nível do motor.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.