CADET: Context-Conditioned Ads CTR Prediction With a Decoder-Only Transformer
Este artigo apresenta o CADET, um transformer de decodificação exclusiva condicionado ao contexto implantado no LinkedIn que supera desafios fundamentais na previsão de CTR de anúncios por meio de inovações como modelagem de pós-pontuação multi-torre e atenção auto-gated, alcançando um aumento de 11,04% no CTR em relação à linha de base de produção.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está caminhando por um mercado digital imenso e movimentado. A cada segundo, milhares de sinais digitais piscam, tentando atrair sua atenção. Alguns sinais são para sapatos, outros para vagas de emprego e alguns para café. As pessoas que administram este mercado têm um trabalho difícil: elas precisam adivinhar em qual sinal você realmente vai parar para olhar antes mesmo de você o ver. Esse jogo de adivinhação é chamado de "Taxa de Cliques" (CTR - Click-Through Rate) de predição. Por muito tempo, os melhores adivinhadores eram como contadores superinteligentes que olhavam para uma lista de seus hábitos passados e os detalhes do sinal para fazer um cálculo. Mas recentemente, um novo tipo de IA "generativa" começou a aparecer em outras áreas, como na recomendação de filmes ou músicas. Essas novas IAs são como contadores de histórias; em vez de apenas processar números, elas leem toda uma história do que você fez antes e preveem o que acontece a seguir. A grande questão para os donos do mercado era: podemos usar essa nova IA "contadora de histórias" para adivinhar em quais anúncios você clicará, mesmo quando as regras do jogo mudam depois que a previsão é feita?
Isso é exatamente o que a equipe do LinkedIn se propôs a resolver com seu novo sistema, chamado CADET. Eles construíram um "transformer de decodificador único" (decoder-only transformer), que é uma forma sofisticada de dizer que criaram uma IA que lê uma sequência de eventos (como seus cliques e visualizações passadas) e prevê o futuro em uma única passagem suave. Mas os anúncios são complicados. Ao contrário da recomendação de um filme, o sucesso de um anúncio muitas vezes depende de coisas que não são conhecidas até depés de a IA fazer sua previsão — como exatamente onde no ecrã o anúncio terminará. Se a IA errar porque não sabia que o anúncio estaria na parte inferior da página em vez do topo, todo o sistema fica confuso.
Os pesquisadores descobriram que, ao dar à sua IA um conjunto especial de ferramentas, eles poderiam resolver esse quebra-cabeça. Eles ensinaram o modelo a imaginar diferentes cenários de "e se" para onde o anúncio poderia pousar, e construíram um mecanismo de "auto-portaria" (self-gating) que atua como um segurança, impedindo a IA de se distrair com informações ruidosas ou confusas. Eles também deram à IA um senso especial de tempo, permitindo que ela entenda que um clique de cinco minutos atrás é diferente de um clique de cinco meses atrás. Mais importante ainda, eles garantiram que a IA não usasse informações que ela não teria no mundo real durante seu treinamento. Quando testaram este novo sistema no real mercado do LinkedIn, ele não apenas funcionou; ele teve um desempenho significativamente superior aos antigos e complexos sistemas que substituiu. A nova IA sugeriu que os usuários tinham 11,04% mais chances de clicar em anúncios, provando que uma abordagem unificada de contação de histórias pode superar a antiga máquina de múltiplas partes.
A História do CADET: Um Contador de Histórias para Anúncios
Então, como eles construíram isso? Vamos decompor a magia do CADET (Context-Conditioned Ads Decoder-Only Transformer) em conceitos simples e cotidianos.
O Problema do "Ovo e da Galinha"
Imagine que você é um chef tentando adivinhar o quanto um cliente irá desfrutar de uma refeição. Mas aqui está o detalhe: você tem que adivinhar o desfrute antes de saber onde a mesa está situada. Se a mesa estiver logo ao lado da cozinha, o cliente pode estar com fome e animado. Se estiver em um canto escuro, eles podem estar mal-humorados. No mundo dos anúncios, a "mesa" é a posição do anúnio na tela. A IA tem que prever se você clicará em um anúncio, mas ela ainda não sabe se esse anúncio estará no topo (onde todos veem) ou lá embaixo na parte inferior. Este é o problema do "ovo e da galinha": a previsão depende da posição, mas a posição depende da previsão.
O CADET resolve isso sendo um mestre de cenários "e se". Em vez de fazer uma única previsão, ele possui múltiplas "cabeças de predição" (pense nelas como diferentes chefs na cozinha). Um chef adivinha: "Se este anúncio estiver no topo, você clicará?". Outro chef adivinha: "Se estiver na parte inferior, você clicará?". O modelo aprende a produzir todas essas respostas de uma só vez. Quando o anúncio é realmente colocado, o sistema apenas escolhe a resposta do chef que acertou sobre a localização. Dessa forma, a IA nunca fica confusa com o mistério de onde o anúncio terminará.
O Segurança (Self-Gated Attention)
Em uma sala lotada, às vezes uma pessoa barulhenta abafa todas as outras. Na IA, isso é chamado de "sumidouro de atenção" (attention sink), onde o modelo foca demais em um token (um pedaço de dado) e ignora o resto, levando a previsões ruins. Os pesquisadores deram ao CADET um "segurança" chamado mecanismo de atenção auto-controlada (self-gated attention).
Pense no cérebro da IA como um corredor movimentado. Cada vez que uma informação tenta passar, o segurança a verifica. Se a informação for ruidosa ou pouco útil, o segurança diminui suas luzes (faz o gate down) para que não distraia o modelo. Se a informação for importante, o segurança deixa que ela brilhe. Isso acontece duas vezes: uma quando a informação chega pela primeira vez (nível de representação) e novamente quando a IA tenta conectar diferentes peças de informação (nível de interação). Isso mantém o treinamento suave e estável, evitando que a IA enlouqueça ou fique presa em padrões ruins.
A Máquina do Tempo (Timestamp RoPE)
A maioria dos modelos de IA conta passos: "Passo 1, Passo 2, Passo 3". Mas no mundo real, o tempo não é apenas sobre passos; é sobre quando as coisas aconteceram. Um clique que ocorreu há 10 segundos é muito diferente de um que ocorreu há 10 meses.
O CADET usa um tipo especial de "máquina do tempo" chamado Rotary Positional Embedding (RoPE) baseado em timestamp. Em vez de contar passos, a IA olha para o relógio real (timestamps Unix) de cada evento. Ela consegue entender que o intervalo entre dois eventos é curto (como segundos) ou longo (como meses). Isso ajuda o modelo a perceber que seu comportamento muda com o tempo. Se você clicou em um anúncio de emprego ontem, pode ainda estar interessado hoje, mas se clicou nele há seis meses, provavelmente não está mais. Esse senso de tempo permite que a IA aprenda padrões em diferentes escalas, desde o momento imediato até tendências de longo prazo.
A Regra do "Não Pode Colar" (Session Masking)
Ao treinar uma IA, você quer que ela aprenda como um aluno, não como um trapaceiro. No mundo real, quando um anúncio é exibido, o sistema não sabe imediatamente se você clicou nele; há um pequeno atraso (como alguns segundos ou minutos) enquanto os dados viajam. Se a IA for treinada com dados onde ela pode "ver" o clique antes do momento devido, ela aprenderá a usar informações que não deveria. Ela pensará: "Ah, eu sabia que você clicou porque eu vi o resultado!", mas no mundo real, ela não terá essa informação.
Para impedir isso, os pesquisadores usaram o mascaramento de sessão (session masking). Imagine um professor cobrindo o gabarito de uma prova. Durante o treinamento, a IA é forçada a olhar apenas para a informação que estaria disponível naquele exato momento. Se um clique acontece 30 segundos depois, a IA é cega a ele durante o treinamento do momento atual. Isso garante que, quando a IA for para o mundo real (serviço online), ela não fique confusa ou faça previsões ruins por estar dependendo de informações que ela não poderia realmente ver.
O Impulso de Velocidade (Engenharia de Produção)
Finalmente, construir uma IA inteligente é uma coisa; torná-la rápida o suficiente para lidar com bilhões de anúncios todos os dias é outra. A equipe usou alguns truques inteligentes de engenharia. Eles "compactaram" os dados densamente, como organizar uma mala para que não haja espaço desperdiçado, o que tornou o treinamento muito mais rápido. Eles também construíram motores "FlashAttention" customizados (partes de software especializadas) que permitem que a IA pontue centenas de anúncios de uma só vez em uma única passagem ultrarrápida, em vez de verificá-los um por um.
Os Resultados: Uma Grande Vitória para o LinkedIn
Quando a equipe colocou o CADET à prova no feed principal do LinkedIn, os resultados foram impressionantes. Eles o compararam com seu antigo sistema altamente otimizado (uma mistura de diferentes modelos trabalhando juntos). O novo modelo CADET não apenas acompanhou o ritmo; ele esmagou a competição.
Em um teste online de larga escala, o CADET alcançou um aumento de 11,04% nas taxas de cliques em comparação com o sistema antigo. Isso significa que, para cada 100 anúncios exibidos, significativamente mais pessoas pararam para olhar. Curiosamente, como os anunciantes no LinkedIn geralmente gastam seus orçamentos totais automaticamente, o gasto total não mudou muito, mas o valor desses cliques aumentou. O custo por clique caiu 10,9%, o que significa que os anunciantes obtiveram um melhor retorno sobre seu investimento.
O artigo sugere que este sucesso vem da combinação de uma IA unificada de "contagem de histórias" com correções inteligentes para os problemas específicos de anúncios (como posição e tempo). Isso mostra que um único modelo bem projetado pode vencer uma equipe complexa de modelos mais antigos. Embora os pesquisadores notem que ainda há trabalho a ser feito — como lidar com ainda mais tipos de cenários "e se" — o trabalho deles prova que os transformers de decodificador único estão prontos para assumir a liderança no mundo da publicidade online.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.