← Nieuwste papers
🤖 machine learning

CADET: Context-Conditioned Ads CTR Prediction With a Decoder-Only Transformer

Dit artikel introduceert CADET, een context-geconditioneerde decoder-only transformer die bij LinkedIn wordt ingezet en de belangrijkste uitdagingen in ads CTR-voorspelling overwint door innovaties zoals multi-tower post-scoring modellering en self-gated attention, waarmee een CTR-stijging van 11,04% wordt behaald ten opzichte van de productielijn.

Oorspronkelijke auteurs: David Pardoe, Neil Daftary, Miro Furtado, Aditya Aiyer, Yu Wang, Liuqing Li, Tao Song, Lars Hertel, Young Jin Yun, Senthil Radhakrishnan, Zhiwei Wang, Tommy Li, Khai Tran, Ananth Nagarajan, Ali Naqvi
Gepubliceerd 2026-08-12
📖 8 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: David Pardoe, Neil Daftary, Miro Furtado, Aditya Aiyer, Yu Wang, Liuqing Li, Tao Song, Lars Hertel, Young Jin Yun, Senthil Radhakrishnan, Zhiwei Wang, Tommy Li, Khai Tran, Ananth Nagarajan, Ali Naqvi, Yue Zhang, Renpeng Fang, Avi Romascanu, Arjun Kulothungun, Deepak Kumar, Praneeth Boda, Fedor Borisyuk, Ruoyan Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je door een enorme, bruisende digitale marktplaats loopt. Elke seconde verschijnen er duizenden digitale borden die proberen je aandacht te trekken. Sommige borden zijn voor schoenen, andere voor vacatures en sommige voor koffie. De mensen die deze marktplaats beheren, hebben een lastige taak: ze moeten raden welk bord jij daadwerkelijk zult stoppen en bekijken voordat je het zelfs maar ziet. Dit gokspelletje wordt "Click-Through Rate" (CTR) voorspelling genoemd. Lange tijd waren de beste gokkers als superintelligente boekhouders die naar een lijst van je oude gewoonten en de details van het bord keken om een berekening te maken. Maar onlangs is er een nieuw soort "generatieve" AI opgekomen in andere gebieden, zoals het aanbevelen van films of liedjes. Deze nieuwe AI's zijn als verhalenvertellers; in plaats van alleen getallen te verwerken, lezen ze een heel verhaal van wat je eerder hebt gedaan en voorspellen ze wat er daarna gebeurt. De grote vraag voor de eigenaren van de marktplaats was: kunnen we deze nieuwe "verhalenverteller" AI gebruiken om te raden op welke advertenties je zult klikken, zelfs wanneer de regels van het spel veranderen nadat de gok is gedaan?

Dit is precies wat het team bij LinkedIn wilde oplossen met hun nieuwe systeem, genaamd CADET. Ze bouwden een "decoder-only transformer", wat een chique manier is om te zeggen dat ze een AI hebben gecreëerd die een reeks gebeurtenissen (zoals je eerdere klikken en weergaven) leest en de toekomst voorspelt in één vloeiende beweging. Maar advertenties zijn lastig. In tegenstelling tot het aanbevelen van een film, hangt het succes van een advertentie vaak af van zaken die niet bekend zijn totdat nadat de AI zijn gok heeft gedaan — zoals precies waar op het scherm de advertentie terechtkomt. Als de AI het fout heeft geraden omdat hij niet wist dat de advertentie onderaan de pagina zou staan in plaats van bovenaan, raakt het hele systeem in de war.

De onderzoekers ontdekten dat door hun AI een speciale set hulpmiddelen te geven, ze dit puzzelstukje konden oplossen. Ze leerden het model om verschillende "wat als"-scenario's te bedenken voor waar de advertentie terecht zou komen, en ze bouwden een "self-gating" mechanisme dat werkt als een uitsmijter, die de AI tegenhoudt om afgeleid te worden door ruis of verwarrende informatie. Ze gaven de AI ook een speciaal gevoel voor tijd, waardoor het kan begrijpen dat een klik van vijf minuten geleden anders is dan een klik van vijf maanden geleden. Het belangrijkste is dat ze ervoor zorgden dat de AI tijdens de training geen informatie gebruikte die hij in de echte wereld niet zou hebben. Toen ze dit nieuwe systeem testten in de echte LinkedIn-marktplaats, werkte het niet alleen goed; het presteerde aanzienlijk beter dan de oude, complexe systemen die ze vervingen. De nieuwe AI suggereerde dat gebruikers 11,04% vaker geneigd waren om op advertenties te klikken, wat bewijst dat een verenigde, verhalende aanpak de oude, meerdelige machine kan overtreffen.

Het Verhaal van CADET: Een Verhalenverteller voor Advertenties

Dus, hoe hebben ze dit gebouwd? Laten we de magie van CADET (Context-Conditioned Ads Decoder-Only Transformer) ontleden in eenvoudige, alledaagse concepten.

Het "Ei-en-Kip"-probleem
Stel je voor dat je een chef bent die probeert te raden hoeveel een klant van een maaltijd zal genieten. Maar hier komt de crux: je moet het genot raden voordat je weet waar de tafel staat. Als de tafel vlak naast de keuken staat, is de klant misschien hongerig en enthousiast. Als de tafel in een donkere hoek staat, is de klant misschien chagrijnig. In de wereld van advertenties is de "tafel" de positie van de advertentie op het scherm. De AI moet voorspellen of je op een advertentie klikt, maar hij weet nog niet of die advertentie helemaal bovenaan (waar iedereen hem ziet) of helemaal onderaan zal staan. Dit is het "ei-en-kip"-probleem: de voorspelling hangt af van de positie, maar de positie hangt af van de voorspelling.

CADET lost dit op door een meester te zijn in "wat als"-scenario's. In plaats van één enkele gok te doen, heeft het meerdere "prediction heads" (denk aan verschillende chefs in de keuken). Eén chef gokt: "Als deze advertentie bovenaan staat, zul je dan klikken?" Een andere chef gokt: "Als hij onderaan staat, zul je dan klikken?" Het model leert al deze antwoorden tegelijkertijd te produceren. Wanneer de advertentie daadwerkelijk wordt geplaatst, kiest het systeem gewoon het antwoord van de chef die het bij het juiste standpunt had. Op deze manier raakt de AI nooit in de war door het mysterie van waar de advertentie uiteindelijk terechtkomt.

De Uitsmijter (Self-Gated Attention)
In een drukke kamer kan soms één luid persoon iedereen overstemmen. In AI wordt dit "attention sink" genoemd, waarbij het model zich te veel op één token (een stukje data) concentreert en de rest negeert, wat leidt tot slechte gokken. De onderzoekers gaven CADET een "uitsmijter" genaamd een self-gated attention mechanisme.

Denk aan het brein van de AI als een drukke gang. Elke keer als er informatie probeert door te gaan, controleert de uitsmijter het. Als de informatie ruisachtig of niet erg nuttig is, dimt de uitsmijter de lichten (gate het omlaag) zodat het het model niet afleidt. Als de informatie belangrijk is, laat de uitsmijter het stralen. Dit gebeurt twee keer: één keer wanneer de informatie voor het eerst arriveert (representatieniveau) en opnieuw wanneer de AI probeert verschillende stukjes informatie met elkaar te verbinden (interactieniveau). Dit houdt de training vloeiend en stabiel, waardoor voorkomt dat de AI doordraait of vastloopt in slechte patronen.

De Tijdmachine (Timestamp RoPE)
De meeste AI-modellen tellen stappen: "Stap 1, Stap 2, Stap 3." Maar in de echte wereld gaat tijd niet alleen over stappen; het gaat over wanneer dingen gebeurden. Een klik die 10 seconden geleden plaatsvond, is heel anders dan een klik van 10 maanden geleden.

CADET gebruikt een speciaal soort "tijdmachine" genaamd een timestamp-gebaseerde Rotary Positional Embedding (RoPE). In plaats van stappen te tellen, kijkt de AI naar de werkelijke kloktijd (Unix-timestamps) van elke gebeurtenis. Het kan begrijpen dat de kloof tussen twee gebeurtenissen kort is (zoals seconden) of lang (zoals maanden). Dit helpt het model om te beseffen dat je gedrag in de loop van de tijd verandert. Als je gisteren op een vacature klikte, ben je daar vandaag misschien nog steeds geïnteresseerd in, maar als je zes maanden geleden op een vacature klikte, ben je dat waarschijnlijk niet meer. Dit tijdsbesef stelt de AI in staat om patronen over verschillende schalen te leren, van het directe moment tot langetermijn trends.

De "Niet Spieken"-regel (Session Masking)
Wanneer je een AI traint, wil je dat het leert als een student, niet als een bedrieger. In de echte wereld, wanneer een advertentie wordt getoond, weet het systeem niet onmiddellijk of je erop hebt geklikt; er is een kleine vertraging (zoals een paar seconden of minuten) terwijl de data wordt verwerkt. Als de AI wordt getraind op data waarbij het de klik kan "zien" voordat het dat zou mogen, leert het informatie te gebruiken die het eigenlijk niet zou mogen hebben. De AI zal denken: "Oh, ik wist dat je klikte omdat ik het resultaat zag!" maar in de echte wereld heeft het die informatie niet.

Om dit te voorkomen, gebruikten de onderzoekers session masking. Stel je een leraar voor die het antwoordblad afdekt tijdens een toets. Tijdens de training wordt de AI gedwongen om alleen te kijken naar de informatie die op dat exacte moment beschikbaar zou zijn geweest. Als een klik 30 seconden later plaatsvindt, is de AI tijdens de training van dat huidige moment blind voor die klik. Dit zorgt ervoor dat wanneer de AI in de echte wereld gaat (online serving), hij niet in de war raakt of slechte gokken doet omdat hij vertrouwt op informatie die hij eigenlijk niet kan zien.

De Snelheidsboost (Production Engineering)
Ten slotte is het bouwen van een slimme AI één ding; het snel genoeg maken om miljarden advertenties per dag te verwerken, is iets anders. Het team gebruikte enkele slimme engineering-trucs. Ze "verpakten" de data compact, zoals het organiseren van een koffer zodat er geen ruimte verspild wordt, wat de training veel sneller maakte. Ze bouwden ook aangepaste "FlashAttention"-engines (gespecialiseerde softwareonderdelen) die de AI in staat stellen om honderden advertenties tegelijkertijd in één razendsnelle passage te scoren, in plaats van ze één voor één te controleren.

De Resultaten: Een Grote Overwinning voor LinkedIn

Toen het team CADET testte op de hoofdffeed van LinkedIn, waren de resultaten indrukwekkend. Ze vergeleken het met hun oude, hoog geoptimaliseerde systeem (een mix van verschillende modellen die samenwerkten). Het nieuwe CADET-model hield niet alleen tempo; het verpletterde de concurrentie.

In een grootschalige online test behaalde CADET een toename van 11,04% in click-through rates vergeleken met het oude systeem. Dit betekent dat voor elke 100 getoonde advertenties, aanzienlijk meer mensen stopten om ernaar te kijken. Interessant genoeg, omdat adverteerders op LinkedIn meestal automatisch hun volledige budget uitgeven, veranderde het totale geld dat werd uitgegeven niet veel, maar de waarde van die klikken ging omhoog. De kosten per klik daalden met 10,9%, wat betekent dat adverteerders een beter rendement op hun investering kregen.

Het paper suggereert dat dit succes voortkomt uit het combineren van een verenigde "verhalenvertellende" AI met slimme oplossingen voor de specifieke problemen van advertenties (zoals positie en tijd). Het toont aan dat een enkel, goed ontworpen model een complex team van oudere modellen kan verslaan. Hoewel de onderzoekers opmerken dat er nog werk te doen is — zoals het afhandelen van nog meer soorten "wat als"-scenario's — bewijst hun werk dat decoder-only transformers klaar zijn om de leiding te nemen in de wereld van online advertising.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →