← Últimos artigos
🤖 AI

Kunlun: Establishing Scaling Laws for Massive-Scale Recommendation Systems through Unified Architecture Design

O artigo apresenta o Kunlun, uma arquitetura unificada para sistemas de recomendação de escala massiva que estabelece leis de escala previsíveis ao abordar a baixa eficiência de escala por meio de otimizações de baixo nível, como a Atenção de Produto Escalar Generalizada e o Agrupamento Hierárquico de Sementes, juntamente com inovações de alto nível, como o Pulo de Computação, dobrando assim a eficiência de escala e alcançando um impacto significativo na produção no Meta Ads.

Autores originais: Bojian Hou, Xiaolong Liu, Xiaoyi Liu, Jiaqi Xu, Yasmine Badr, Mengyue Hang, Sudhanshu Chanpuriya, Junqing Zhou, Yuhang Yang, Han Xu, Qiuling Suo, Laming Chen, Yuxi Hu, Jiasheng Zhang, Huaqing Xiong, Y
Publicado 2026-06-09
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Bojian Hou, Xiaolong Liu, Xiaoyi Liu, Jiaqi Xu, Yasmine Badr, Mengyue Hang, Sudhanshu Chanpuriya, Junqing Zhou, Yuhang Yang, Han Xu, Qiuling Suo, Laming Chen, Yuxi Hu, Jiasheng Zhang, Huaqing Xiong, Yuzhen Huang, Chao Chen, Yue Dong, Yi Yang, Shuo Chang, Xiaorui Gan, Wenlin Chen, Santanu Kolay, Darren Liu, Jade Nie, Chunzhi Yang, Ellie Wen, Jiyan Yang, Huayu Li

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está administrando um mercado digital massivo e de alta velocidade (como o da Meta para seus anúncios). A cada segundo, milhões de pessoas estão navegando, e o sistema tem que adivinhar em qual anúncio cada pessoa clicará. Para fazer essas suposições, o sistema usa um "cérebro" (um modelo de aprendizado de máquina) que observa dois tipos de pistas:

  1. A História (Sequência): O que o usuário fez recentemente (ex: "Eu cliquei em um sapato, depois em um chapéu, depois em uma mochila").
  2. O Instantâneo (Contexto): Quem o usuário é agora (ex: "Está chovendo", "Eles estão em Nova York", "Eles têm 25 anos").

Por muito tempo, construir um "cérebro" que pudesse lidar com a história e o instantâneo de forma eficiente era como tentar dirigir um carro de corrida com rodas quadradas. Funcionava, mas era incrivelmente lento e gastava muito combustível (poder de computação). Os pesquisadores chamam isso de "baixa eficiência de escala". Basicamente, quando tentavam tornar o cérebro maior para torná-lo mais inteligente, ele não ficava inteligente o suficiente para justificar o custo extra.

Surge o Kunlun. Nomeado em homenagem a uma cordilheira que une diversos picos, o Kunలun é uma nova arquitetura projetada para consertar essas rodas quadradas. O artigo afirma que ele resolve o problema otimizando o sistema em dois níveis: o "peças e parafusos" (baixo nível) e o "gerenciamento de tráfego" (alto nível).

Veja como o Kunlun funciona, usando analogias do cotidiano:

1. As Correções de Baixo Nível: Consertando o Motor

Os sistemas antigos tinham partes ineficientes, fazendo com que o "motor" do computador (a GPU) ficasse ocioso enquanto esperava pelos dados. O Kunlun substitui essas partes por componentes de alto desempenho:

  • GDPA (O Tradutor Personalizado):
    • O Problema: O sistema antigo tentava traduzir a "História" baseada no "Instantâneo" usando um processo desajeitado e passo a passo que desperdiçava tempo.
    • A Solução: O Kunlun usa GDPA (Generalized Dot-Product Attention). Pense nisso como um tradutor que não apenas traduz palavra por palavra, mas entende instantaneamente o contexto de toda a frase. Ele funde etapas para que o computador não precise parar e começar, fazendo o motor rodar de forma muito mais suave.
  • HSP (O Resumidor):
    • O Problema: Usuários têm históricos longos (milhares de cliques). O sistema antigo tentava ler cada clique individualmente, o que era esmagador.
    • A Solução: O HSP (Hierarchical Seed Pooling) é como um editor inteligente. Em vez de ler uma biografia de 500 páginas, ele lê o livro, escreve um resumo de 10 páginas e, depois, um abstract de 1 página. Ele condensa o histórico longo em um resumo compacto e poderoso que o sistema pode realmente usar sem ficar sobrecarregado.
  • Sliding Window Attention (O Foco Local):
    • O Problema: O sistema antigo tentava comparar a primeira coisa que um usuário fez na vida com o que ele está fazendo agora. Mas, geralmente, o que você fez na semana passada importa muito mais do que o que você fez no ano passado.
    • A Solução: A Sliding Window Attention diz ao sistema: "Não olhe para todo o histórico; olhe apenas para as últimas páginas". Ela foca em interações recentes, o que economiza uma quantidade massiva de poder de computação mantendo as previsões precisas.

2. As Correções de Alto Nível: Controle de Tráfego Inteligente

Mesmo com um ótimo motor, você pode desperdiçar combustível se dirigir pelo caminho errado ou parar em cada semáforo. O Kunlun muda a forma como os recursos são distribuídos:

  • CompSkip (A Faixa Expressa):
    • O Problema: O sistema antigo forçava o cérebro a fazer o mesmo trabalho pesado em cada etapa, mesmo quando não era necessário.
    • A Solução: O CompSkip é como um sistema de semáforos inteligentes. Ele percebe que algumas etapas não precisam de uma "autoverificação" completa (Self-Attention) e algumas não precisam de um "resumo" completo (HSP). Ele pula as etapas desnecessárias em camadas alternadas. Se o carro está indo reto, não precisa checar o espelho retrovisor a cada segundo. Isso economiza enormes quantidades de energia.
  • Event-Level Personalization (O Tratamento VIP):
    • O Problema: O sistema antigo tratava um "clique" (um sinal forte) da mesma forma que uma "impressão" (apenas visualizar um anúncio). Ele desperdiçava recursos em eventos de baixo valor.
    • A Solução: O Kunlun dá tratamento VIP a eventos importantes. Se um usuário está prestando para comprar algo (um evento de alto valor), o sistema aloca mais poder de computação e análise profunda. Se for apenas uma navegação casual, utiliza uma abordagem mais leve e rápida. É como um restaurante que oferece um menu degustação completo para um convidado VIP e um café rápido para alguém que está apenas de passagem.

O Resultado: A "Lei de Escala"

O artigo afirma que, ao combinar essas correções, o Kunlun alcança algo com o qual a indústria lutou: Leis de Escala Previsíveis.

No passado, dobrar o poder de computação nem sempre dobrava a inteligência. Com o Kunlun, a relação é previsível e eficiente.

  • Impulso de Eficiência: Nos supercomputadores mais recentes (GPUs NVIDIA B200), o Kunlun utiliza o hardware duas vezes mais eficientemente do que métodos anteriores (saltando de 17% de utilização para 37%).
  • Impacto no Mundo Real: Isso não é apenas um experimento de laboratório. A Meta implementou o Kunlun em seus principais modelos de publicidade. O resultado? Uma melhoria de 1,2% nas principais métricas de negócio. No mundo dos anúncios, onde bilhões de decisões são tomadas diariamente, essa pequena porcentagem é uma vitória massiva.

Em resumo: O Kunlun é uma maneira mais inteligente, enxuta e organizada de construir sistemas de recomendação. Ele para de desperdiçar combustível com rodas quadradas, pula paradas desnecessárias e dá tratamento VIP aos sinais mais importantes, permitando que o sistema se torne significativamente mais inteligente à medida que cresce.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →