← Derniers articles
🤖 machine learning

CADET: Context-Conditioned Ads CTR Prediction With a Decoder-Only Transformer

Ce document présente CADET, un transformeur de type décodeur seul conditionné par le contexte et déployé chez LinkedIn, qui surmonte des défis clés dans la prédiction du CTR des publicités grâce à des innovations telles que la modélisation de post-scoring multi-tours et l'attention auto-gérée, réalisant une augmentation du CTR de 11,04 % par rapport à la ligne de base de production.

Auteurs originaux : David Pardoe, Neil Daftary, Miro Furtado, Aditya Aiyer, Yu Wang, Liuqing Li, Tao Song, Lars Hertel, Young Jin Yun, Senthil Radhakrishnan, Zhiwei Wang, Tommy Li, Khai Tran, Ananth Nagarajan, Ali Naqvi
Publié 2026-08-12
📖 9 min de lecture🧠 Analyse approfondie

Auteurs originaux : David Pardoe, Neil Daftary, Miro Furtado, Aditya Aiyer, Yu Wang, Liuqing Li, Tao Song, Lars Hertel, Young Jin Yun, Senthil Radhakrishnan, Zhiwei Wang, Tommy Li, Khai Tran, Ananth Nagarajan, Ali Naqvi, Yue Zhang, Renpeng Fang, Avi Romascanu, Arjun Kulothungun, Deepak Kumar, Praneeth Boda, Fedor Borisyuk, Ruoyan Wang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous déambulez dans un immense marché numérique en pleine effervescence. Chaque seconde, des milliers d'enseignes numériques clignotent, tentant de attirer votre regard. Certaines sont pour des chaussures, d'autres pour des offres d'emploi, et d'autres encore pour du café. Les responsables de ce marché ont un travail délicat : ils doivent deviner à quelle enseigne vous allez réellement vous arrêter avant même que vous ne la voyiez. Ce jeu de devinettes s'appelle la prédiction du "Taux de Clic" (CTR - Click-Through Rate). Pendant longtemps, les meilleurs devins étaient comme des comptables surdoués qui examinaient une liste de vos habitudes passées et les détails de l'enseigne pour faire un calcul. Mais récemment, un nouveau type d'IA "générative" a commencé à apparaître dans d'autres domaines, comme la recommandation de films ou de chansons. Ces nouvelles IA sont comme des conteurs ; au lieu de simplement brasser des chiffres, elles lisent toute une histoire de ce que vous avez fait auparavant et prédisent la suite. La grande question pour les propriétaires du marché était : pouvons-nous utiliser cette nouvelle IA de type "conteur" pour deviner sur quelles publicités vous allez cliquer, même lorsque les règles du jeu changent après que la prédiction a été faite ?

C'est exactement ce que l'équipe de LinkedIn a cherché à résoudre avec son nouveau système, appelé CADET. Ils ont construit un "transformer à décodeur seul" (decoder-only transformer), ce qui est une façon sophistiquée de dire qu'ils ont créé une IA qui lit une séquence d'événements (comme vos clics et vues passés) et prédit le futur en un seul passage fluide. Mais les publicités sont capricieuses. Contrairement à la recommandation d'un film, le succès d'une publicité dépend souvent de choses qui ne sont pas connues avant que l'IA n'ait fait sa prédiction — comme l'endroit exact où la publicité se trouvera sur l'écran. Si l'IA se trompe parce qu'elle ne savait pas que la publicité serait en bas de la page au lieu du haut, tout le système s'embrouille.

Les chercheurs ont découvert qu'en dotant leur IA d'un ensemble spécial d'outils, ils pouvaient résoudre ce casse-tête. Ils ont appris au modèle à imaginer différents scénarios de type "et si" concernant l'endroit où la publicité pourrait atterrir, et ils ont construit un mécanisme de "porte automatique" (self-gating) qui agit comme un videur, empêchant l'IA d'être distraite par des informations bruyantes ou confuses. Ils lui ont également donné un sens particulier du temps, lui permettant de comprendre qu'un clic d'il y a cinq minutes est différent d'un clic d'il y a cinq mois. Plus important encore, ils se sont assurés que l'IA n'utilise pas d'informations qu'elle n'aurait pas dans le monde réel pendant son entraînement. Lorsqu'ils ont testé ce nouveau système sur le véritable marché de LinkedIn, il n'a pas seulement fonctionné ; il a performé de manière nettement supérieure aux anciens systèmes complexes qu'ils ont remplacés. La nouvelle IA a suggéré que les utilisateurs étaient 11,04 % plus susceptibles de cliquer sur les publicités, prouvant qu'une approche unifiée de type "conteur" peut surpasser l'ancienne machine multi-parties.

L'histoire de CADET : Un conteur pour les publicités

Alors, comment l'ont-ils construit ? Décomposons la magie de CADET (Context-Conditioned Ads Decoder-Only Transformer) en concepts simples et du quotidien.

Le problème de "l'œuf et de la poule"
Imaginez que vous êtes un chef cuisinier essayant de deviner si un client appréciera son repas. Mais voici le hic : vous devez deviner le plaisir avant de savoir où la table est située. Si la table est juste à côté de la cuisine, le client peut être affamé et enthousiaste. S'il est dans un coin sombre, il peut être grincheux. Dans le monde de la publicité, la "table" est la position de la publicité sur l'écran. L'IA doit prédire si vous cliquerez sur une publicité, mais elle ne sait pas encore si cette publicité sera tout en haut (là où tout le monde la voit) ou tout en bas de la page. C'est le problème de "l'œuf et de la poule" : la prédiction dépend de la position, mais la position dépend de la prédiction.

CADET résout cela en étant un maître des scénarios de type "et si". Au lieu de faire une seule prédiction, il possède plusieurs "têtes de prédiction" (pensez à différents chefs dans la cuisine). Un chef devine : "Si cette publicité est en haut, cliquerez-vous ?" Un autre chef devine : "Si elle est en bas, cliquerez-vous ?" Le modèle apprend à produire toutes ces réponses en une seule fois. Lorsque la publicité est réellement placée, le système choisit simplement la réponse du chef qui avait raison sur l'emplacement. De cette façon, l'IA n'est jamais confuse par le mystère de l'endroit où la publicité finira par atterrir.

Le Videur (Attention auto-gérée / Self-Gated Attention)
Dans une pièce bondée, parfois une personne trop bruyante étouffe tous les autres. En IA, c'est ce qu'on appelle l' "attention sink" (puits d'attention), où le modèle se concentre trop sur un jeton (un morceau de donnée) et ignore le reste, menant à de mauvaises prédictions. Les chercheurs ont doté CADET d'un "videur" appelé mécanisme d'attention auto-géré (self-gated attention mechanism).

Considérez le cerveau de l'IA comme un couloir très fréquenté. Chaque fois qu'une information tente de passer, le videur la vérifie. Si l'information est bruyante ou peu utile, le videur tamise ses lumières (la réduit via un gate) pour qu'elle ne distrait pas le modèle. Si l'information est importante, le videur la laisse briller. Cela se produit deux fois : une fois quand l'information arrive (niveau de représentation) et une seconde fois quand l'IA essaie de connecter différentes pièces d'information (niveau d'interaction). Cela permet de garder l'entraînement fluide et stable, empêchant l'IA de devenir folle ou de rester bloquée sur de mauvais schémas.

La Machine à remonter le temps (Timestamp RoPE)
La plupart des modèles d'IA comptent les étapes : "Étape 1, Étape 2, Étape 3". Mais dans le monde réel, le temps n'est pas seulement une question d'étapes ; c'est une question de quand les choses se sont produites. Un clic survenu il y a 10 secondes est très différent d'un clic survenu il y a 10 mois.

CADET utilise un type spécial de "machine à remonter le temps" appelé encodage de position rotatif basé sur l'horodatage (Timestamp-based Rotary Positional Embedding - RoPE). Au lieu de compter les étapes, l'IA regarde l'heure réelle (horodatages Unix) de chaque événement. Elle peut comprendre que l'écart entre deux événements est court (quelques secondes) ou long (plusieurs mois). Cela aide le modèle à réaliser que votre comportement change avec le temps. Si vous avez cliqué sur une offre d'emploi hier, vous pourriez encore être intéressé aujourd'hui, mais si vous avez cliqué dessus il y a six mois, vous ne l'êtes probablement plus. Ce sens du temps permet à l'IA d'apprendre des schémas à différentes échelles, de l'instant immédiat aux tendances à long terme.

La règle du "Pas de triche" (Masquage de session)
Lorsque vous entraînez une IA, vous voulez qu'elle apprenne comme un élève, pas comme un tricheur. Dans le monde réel, lorsqu'une publicité est affichée, le système ne sait pas immédiatement si vous avez cliqué dessus ; il y a un petit délai (quelques secondes ou minutes) pendant que les données circulent. Si l'IA est entraînée sur des données où elle peut "voir" le clic avant qu'elle ne soit censée le faire, elle apprend à utiliser des informations qu'elle ne devrait pas avoir. Elle pensera : "Oh, je savais que vous aviez cliqué parce que j'ai vu le résultat !" alors que dans le monde réel, elle n'aurait pas cette information.

Pour empêcher cela, les chercheurs ont utilisé le masquage de session (session masking). Imaginez un professeur couvrant le corrigé lors d'un examen. Pendant l'entraînement, l'IA est forcée de ne regarder que les informations qui auraient été disponibles à cet instant précis. Si un clic se produit 30 secondes plus tard, l'IA est aveugle à ce clic lors de l'entraînement du moment présent. Cela garantit que lorsque l'IA part dans le monde réel (service en ligne), elle ne s'embrouille pas et ne fait pas de mauvaises prédictions car elle ne repose pas sur des informations qu'elle ne peut pas réellement voir.

Le Boost de vitesse (Ingénierie de production)
Enfin, construire une IA intelligente est une chose ; la rendre assez rapide pour gérer des milliards de publicités chaque jour en est une autre. L'équipe a utilisé des astuces d'ingénierie ingénieuses. Ils ont "compacté" les données étroitement, comme on organise une valise pour qu'il n'y ait pas d'espace perdu, ce qui a rendu l'entraînement beaucoup plus rapide. Ils ont également construit des moteurs "FlashAttention" personnalisés (des parties logicielles spécialisées) qui permettent à l'IA de noter des centaines de publicités en un seul passage ultra-rapide, plutôt que de les vérifier une par une.

Les Résultats : Une grande victoire pour LinkedIn

Lorsque l'équipe a mis CADET à l'épreuve sur le flux principal de LinkedIn, les résultats ont été impressionnants. Ils l'ont comparé à leur ancien système hautement optimisé (un mélange de différents modèles travaillant ensemble). Le nouveau modèle CADET n'a pas seulement tenu la distance ; il a écrasé la concurrence.

Lors d'un test en ligne à grande échelle, CADET a obtenu une augmentation de 11,04 % des taux de clic par rapport à l'ancien système. Cela signifie que pour 100 publicités affichées, un nombre nettement plus élevé de personnes s'est arrêté pour les regarder. Curieusement, comme les annonceurs sur LinkedIn dépensent généralement l'intégralité de leurs budgets automatiquement, le montant total dépensé n'a pas beaucoup changé, mais la valeur de ces clics a augmenté. Le coût par clic a chuté de 10,9 %, ce qui signifie que les annonceurs ont obtenu un meilleur retour sur investissement.

L'article suggère que ce succès provient de la combinaison d'une IA de type "conteur" unifiée avec des correctifs intelligents pour les problèmes spécifiques de la publicité (comme la position et le temps). Il démontre qu'un modèle unique et bien conçu peut battre une équipe complexe de modèles plus anciens. Bien que les chercheurs notent qu'il reste du travail à faire — comme la gestion d'encore plus de scénarios de type "et si" — leur travail prouve que les transformers à décodeur seul sont prêts à prendre la tête du monde de la publicité en ligne.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →