← Últimos artigos
💻 computer science

Portable Acceleration of Learning With Errors KEMs for Post-Quantum Cryptography

Este artigo apresenta uma implementação de GPU portátil de um Mecanismo de Encapsulamento de Chave (KEM) baseado em Learning With Errors (LWE) usando offloading de alvo OpenMP, demonstrando que uma única base de código pode alcançar aceleração de desempenho substancial e eficiência energética em aceleradores NVIDIA e AMD, ao mesmo tempo em que evita o bloqueio tecnológico de fornecedor.

Autores originais: Tiziana Liberati, Nitin Shukla, Simone Rizzo, Elisabetta Boella, Matteo Barbieri, Gabriella Bettonte, Daniele Gregori, Marco Pedicini

Publicado 2026-07-13
📖 4 min de leitura☕ Leitura rápida

Autores originais: Tiziana Liberati, Nitin Shukla, Simone Rizzo, Elisabetta Boella, Matteo Barbieri, Gabriella Bettonte, Daniele Gregori, Marco Pedicini

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando construir um cofre digital super seguro que não possa ser quebrado nem mesmo por um supercomputador "quântico" futurista. Para fazer isso, você precisa resolver um quebra-cabeça matemático massivo e bagunçado chamado "Learning With Errors" (LWE). É como tentar encontrar uma agulha específica em um palheiro, mas o palheiro é feito de milhões de pequenos ímãs barulhentos, e quanto mais você procura, mais os ímãs balançam.

O problema? Resolver esses quebra-cabeças leva uma eternidade em um computador comum. É como tentar mover uma montanha de areia grão por grão com uma colher pequena. Os autores deste artigo perguntaram: "E se usássemos uma equipe de construção gigante e super rápida (uma GPU) para mover essa areia?"

A Grande Descoberta: Um Código, Duas Equipes
Normalmente, se você quiser usar uma equipe de construção, tem que contratar uma equipe específica (como a CUDA da NVIDIA) e escrever instruções que apenas eles entendam. Se você quiser contratar uma equipe diferente (como a da AMD), terá que reescrever todo o manual de instruções. Isso é caro e irritante.

Este artigo mostra que você pode escrever um único conjunto de instruções (usando algo chamado OpenMP Target) que funciona perfeitamente tanto para a equipe da NVIDIA quanto para a equipe da AMD. É como escrever uma receita que funciona quer você esteja cozinhando em uma cozinha com fogões a gás ou elétricos, sem mudar um único ingrediente.

O Truque de Mestre: Permanecer na Cozinha
O maior desperdiçador de tempo nesses quebra-cabeças matemáticos é o vai e vem entre o computador principal (CPU) e a super-rápida GPU. É como um chef correndo até a despensa para pegar sal para cada pitada de tempero.

Os autores descobriram como manter o "sal" (números aleatórios necessários para a matemática) dentro da própria cozinha da GPU. Eles atualizaram uma ferramenta chamada RNGonGPU para que ela funcione com as equipes da NVIDIA e da AMD. Agora, a GPU pode gerar todos os números aleatórios de que precisa sem nunca sair do seu assento. Isso mantém o fluxo de trabalho suave e rápido.

A Corrida: Quem Vence?
A equipe testou seu novo método em quatro computadores super rápidos:

  1. NVIDIA A100: Um supercomputador poderoso e padrão.
  2. NVIDIA GH200: Um "SuperChip" massivo onde o cére e o músculo estão colados por uma rodovia super rápida (NVLink).
  3. AMD MI300X: Um supercomputador poderoso com um enorme banco de memória.
  4. AMD MI300A: Um chip onde o cérebro e o músculo compartilham o mesmo banco de memória.

Aqui está o que eles descobriram:

  • O Impulso de Velocidade: Quando os quebra-cabeças matemáticos ficaram enormes (com um tamanho de 4.096), a versão em GPU foi 120 vezes mais rápida do que a versão do computador comum. Para quebra-cabeças ainda maiores (tamanho 16.384), a GPU continuou voando baixo, enquanto o computador comum estava praticamente dormindo.
  • Os Vencedores: O NVIDIA GH200 foi o mais rápido, terminando o trabalho em cerca de 60 segundos. O AMD MI300X ficou em segundo lugar por pouco, levando cerca de 85 segundos. Ambas as máquinas possuem bancos de memória enormes e rápidos (HBM3) que podem despejar dados rapidamente.
  • O Perdedor Surpreendente: Você poderia pensar que o AMD MI300A seria ótimo porque compartilha a memória entre o cérebro e o músculo. Mas ele foi, na verdade, o mais lento, levando 114 segundos. Por quê? Porque o cérebro e o músculo estavam lutando pelo mesmo canudo. Enquanto a GPU tentava mover dados, a CPU também tentava fazer sua própria matemática, e eles atrapalhavam um ao outro. É como duas pessoas tentando beber pelo mesmo canudo ao mesmo tempo; nenhuma delas consegue um gole completo.

Energia e Calor
A equipe também verificou quanta eletricidade essas máquinas usaram. O NVIDIA GH200 não apenas terminou mais rápido; ele usou menos energia para fazer o trabalho. Levou cerca de 9,7 kJ de energia para resolver o quebra-cabeça, enquanto o AMD MI300X precisou de 26,2 kJ. Isso significa que a máquina da NVIDIA foi aproximadamente 2,5 vezes mais eficiente energeticamente.

O Que Isso Significa
O artigo prova que você não precisa escolher um lado entre NVIDIA e AMD para obter segurança super rápida. Você pode usar uma única base de código para rodar em ambos. No entanto, eles também mostraram que ter apenas um chip rápido não é suficiente; como a memória é organizada importa tanto quanto. Se o cérebro e o músculo lutarem pela mesma memória, todo o sistema fica lento.

Em resumo, os autores mediram que a segurança acelerada por GPU e portátil não é apenas um sonho — é uma realidade que pode tornar os cadeados à prova de computação quântica muito mais rápidos e eficientes, desde que você escolha a configuração de hardware certa para evitar engarrafamentos na pista da memória.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →