← Últimos artigos
🤖 machine learning

CUDA-L2: Surpassing cuBLAS Performance for Matrix Multiplication through Reinforcement Learning

O artigo apresenta o CUDA-L2, um sistema que utiliza modelos de linguagem de grande escala e aprendizado por reforço para otimizar automaticamente kernels de Multiplicação de Matrizes de Precisão Reduzida (HGEMM), alcançando ganhos de desempenho significativos sobre bases estabelecidas como torch.matmul, cuBLAS e cuBLASLt ao explorar sistematicamente espaços de configuração em escalas impraticáveis para engenheiros humanos.

Autores originais: Songqiao Su, Xiaoya Li, Albert Wang, Guoyin Wang, Jiwei Li, Chris Shum

Publicado 2026-07-14
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Songqiao Su, Xiaoya Li, Albert Wang, Guoyin Wang, Jiwei Li, Chris Shum

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando assar o bolo perfeito. Durante anos, os melhores padeiros do mundo (especialistas humanos) têm ajustado a receita para um tipo específico de bolo chamado "Multiplicação de Matrizes". Este bolo é o ingrediente secreto em quase todos os cérebros de IA modernos. Esses padeiros passaram anos tornando-o mais rápido, mas atingiram um muro: toda vez que o tamanho do bolo muda (de um pequeno cupcake para um enorme bolo de casamento), eles têm que começar do zero, e os truques que funcionaram para um tamanho muitas vezes falham em outro. É como tentar usar uma colher pequena para comer uma sopa gigante; a ferramenta simplesmente não se ajusta.

Apresentamos o CUDA-L2, uma nova equipe de "padeiros de IA" construída combinando um modelo de linguagem super inteligente com um sistema de aprendizado estilo videogame chamado Aprendizado por Reforço (RL). Em vez de pedir a um humano para adivinhar a melhor receita, o CUDA-L2 joga um grande jogo de "tentar, falhar, aprender e tentar novamente".

A Grande Descoberta: A IA Assa Bolos Mais Rápidos

A principal descoberta deste artigo é que o CUDA-L2 pode projetar automaticamente essas "receitas" de multiplicação de matrizes (chamadas de kernels) e assá-las mais rápido do que as melhores receitas feitas por humanos disponíveis atualmente.

Os pesquisadores testaram isso em 1.000 tamanhos de bolo diferentes (combinações de dimensões M, N e K variando de 64 a 16.384). Esses tamanhos cobrem as dimensões exatas usadas em modelos de IA famosos de código aberto como Qwen, Llama e DeepSeek.

Aqui está o quanto mais rápido a IA assa em comparação aos atuais campeões, medido em uma GPU A100:

  • Contra a Ferramenta Padrão (torch.matmul): Em uma sessão de panificação contínua (modo offline), o CUDA-L2 é 22,0% mais rápido. Em uma cozinha movimentada onde os pedidos chegam aleatoriamente (modo servidor), é 28,7% mais rápido.
  • Contra o Padrão de Ouro (cuBLAS): Mesmo contra a própria biblioteca altamente otimizada da NVIDIA, o CUDA-L2 vence. Ele é 19,2% mais rápido em modo contínuo e 26,0% mais rápido no modo servidor movimentado.
  • Contra o "Otimizador Automático" (cuBLASLt-AutoTuning): Esta é a comparação mais importante. O cuBLASLt-AutoTuning é uma ferramenta que tenta até 100 receitas diferentes para encontrar a melhor. O CUDA-L2 ainda vence o cuBLASLt-AutoTuning por 11,4% em modo contínuo e 15,9% em modo servidor.

O artigo tem muita certeza desses números porque eles foram medidos diretamente executando o código milhares de vezes, não apenas adivinhados ou simulados.

O Que a IA NÃO Fez

É importante saber o que este sistema não faz. O artigo afirma explicitamente que a versão atual do CUDA-L2 é limitada à arquitetura A100. No entanto, o framework foi projetado para ampla aplicabilidade, e a equipe está trabalhando ativamente para estendê-lo a outras arquiteturas de GPU, incluindo chips Ampere mais antigos como o RTX 3090, bem como chips mais novos Hopper (ex: H100) e Blackwell (ex: B200). O artigo também argumenta contra a ideia de que especialistas humanos tenham "resolvido" a multiplicação de matrizes; o fato de a IA ter encontrado melhores receitas prova que o ajuste humano está longe de ser perfeito.

Como a IA Aprendeu a Assar Melhor

A IA não apenas adivinhou; ela aprendeu truques específicos e inteligentes que até mesmo especialistas humanos poderiam perder por estarem ocupados demais para verificar todas as possibilidades.

  1. Preenchimento do Bolo (Padding): Imagine que você tem um bolo de 8.192 polegadas de largura, mas sua forma só cabe perfeitamente se a largura for divisível por 160. 8.192 não é divisível por 160. Um humano poderia dizer: "Vou usar um tamanho de forma de 128 porque cabe". Mas a IA disse: "Vou adicionar um pouco de massa extra (preenchimento) para fazer o bolo ter 8.320 polegadas de largura para que eu possa usar a forma de 160 polegadas". Esse pouquinho de trabalho extra tornou todo o processo mais rápido.
  2. A Estratégia Ping-Pong: Normalmente, um padeiro carrega os ingredientes, mistura, depois carrega o próximo lote. A IA descobriu um método "ping-pong": enquanto o misturador está trabalhando no Lote A, o assistente já está carregando os ingredientes para o Lote B. Isso significa que o misturador nunca precisa esperar.
  3. A Entrega "Escalonada": Às vezes, a IA percebeu que pedir dois ingredientes ao mesmo tempo (A e B) causa um congestionamento na cozinha. Em vez disso, ela pediu o ingrediente A, começou a misturar e então pediu o ingrediente B. Isso manteve a cozinha fluindo suavemente.
  4. Escolhendo o Tamanho Certo da Forma: A IA aprendeu que para bolos pequenos, formas pequenas funcionam melhor. Mas para bolos gigantes, ela precisa de formas muito maiores. Ela descobriu o tamanho perfeito para cada dimensão de bolo, uma tarefa que levaria uma vida inteira para um humano calcular para 1.000 tamanhos diferentes.

A Diferença entre "Servidor" e "Offline"

O artigo também notou algo interessante sobre o ambiente da cozinha.

  • Modo Offline: Imagine uma linha de produção de fábrica onde os bolos são assados um após o outro sem parar. O forno permanece quente e os trabalhadores estão em um ritmo. Aqui, a IA foi de 11,4% a 22,0% mais rápida que a concorrência.
  • Modo Servidor: Imagine um restaurante movimentado onde os pedidos chegam em tempos aleatórios. O forno pode esfriar entre os pedidos, e os trabalhadores têm que se aquecer novamente. Nesse caos do "mundo real", a vantagem da IA na verdade cresceu, superando a concorrência em 15,9% a 28,7%. O artigo sugere que isso ocorre porque as receitas da IA são melhores em lidar com esses "inícios a frio" (cold starts) e pausas imprevisíveis.

Conclusão

O artigo conclui que, mesmo para tarefas críticas e altamente otimizadas como a multiplicação de matrizes, o Aprendizado por Reforço guiado por LLM pode encontrar soluções melhores do que os humanos ao explorar um espaço de possibilidades que é grande demais para uma pessoa verificar. Embora esta versão específica do CUDA-L2 seja atualmente limitada a GPUs A100, o framework foi projetado para ser expandido para outros chips no futuro.

Em resumo: a IA não apenas ajustou a receita; ela descobriu maneiras inteiramente novas de assar o bolo que os humanos não haviam pensado, provando que, mesmo em um campo tão maduro quanto a otimização de GPU, ainda há muito espaço para melhorias.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →