MAC: A Conversion Rate Prediction Benchmark Featuring Labels Under Multiple Attribution Mechanisms
Dit artikel introduceert MAC, de eerste publieke benchmark voor het voorspellen van conversieratio's met labels afkomstig van meerdere attributiemechanismen, samen met de PyMAL-bibliotheek en het MoAE-model, om datagaten in multi-attributie-leren aan te pakken en significante prestatiewinsten aan te tonen door middel van zorgvuldig ontworpen kennisintegratie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert te raden wat een vriend als volgende zal kopen. In de wereld van online winkelen is dit een spel met hoge inzet dat door computers wordt gespeeld. Elke keer dat je op een advertentie klikt, probeert een digitale detective te achterhalen of die klik zal leiden tot een aankoop. Dit wordt Conversion Rate (CVR) voorspelling genoemd. Jarenlang hebben deze detectives gewerkt met een zeer beperkt regelboekje: ze geven de eer voor een verkoop alleen aan de laatste advertentie waarop je klikte voordat je iets kocht. Het is alsof je langs een bakkerij liep, toen een schoenenwinkel, en uiteindelijk een speelgoedwinkel voordat je een speeltje kocht; de speelgoedwinkel krijgt dan alle eer, en de bakkerij en de schoenenwinkel krijgen niets.
Maar in het echte leven zijn onze beslissingen rommelig. Misschien maakte de bakkerij je hongerig, of gaf de schoenenwinkel je een goed idee. Om het volledige plaatje te krijgen, hebben we Multi-Attribution Learning (MAL) nodig. Dit is een slimmere manier van denken die zegt: "Hé, laten we naar alle advertenties kijken waar je op hebt geklikt, niet alleen de laatste." Het probeert het hele traject te begrijpen, waarbij de eer wordt gegeven aan de eerste klik, de laatste klik, of zelfs door de eer gelijkmatig te verdelen over alle klikken. Het grote probleem? Tot nu toe hadden wetenschappers en bedrijven alleen data die de "alleen laatste klik"-regel volgde. Ze probeerden een complex, meerstaps verhaal te leren met slechts een samenvatting van één zin.
Dit artikel, getiteld "MAC: A Conversion Rate Prediction Benchmark Featuring Labels Under Multiple Attribution Mechanisms", is als het openen van een geheime bibliotheek die eindelijk het volledige verhaal bevat. De auteurs, een team van Alibaba en Nanjing University, hebben een gloednieuwe dataset gemaakt genaamd MAC. Dit is niet zoma van een lijst met klikken; het is een enorme collectie van 79 miljoen advertentieklikken waarin ze vier verschillende manieren hebben vastgelegd om de eer voor een verkoop te geven: Last-Click (laatste klik), First-Click (eerste klik), Linear (het gelijkmatig verdelen van de eer) en een fancy Data-Driven methode die wiskunde gebruikt om uit te rekenen wie echt het meeste werk heeft verzet. Ze hebben ook een gratis software-toolbox gebouwd genaamd PyMAL, zodat iedereen hun ideeën op deze nieuwe data kan testen.
Toen ze hun nieuwe ideeën op deze data testten, ontdekten ze enkele fascinerende zaken. Ten eerste maakte het kijken naar het hele traject (Multi-Attribution Learning) de computers consequent slimmer, vooral voor mensen die een lang en kronkelig pad volgen voordat ze iets kopen. Ten tweede ontdekten ze dat het simpelweg voeren van meer aanwijzingen aan de computer niet altijd helpt. Als je een "First-Click" verkoop probeert te voorspellen, zorgt het toevoegen van te veel andere soorten aanwijzingen er juist voor dat het model in de war raakt. Het blijkt dat je heel voorzichtig moet zijn met welke aanwijzingen je gebruikt. Ten slotte bouwden ze een nieuw model genaamd MoAE (Mixture of Asymmetric Experts). Denk aan MoAE als een team van detectives waarbij sommigen gespecialiseerd zijn in het lezen van het hele traject, maar er is een strenge baas die ervoor zorgt dat al die extra kennis specifiek wordt gebruikt om de hoofdzaak op te lossen. Dit nieuwe model versloeg alle vorige kampioenen en verbeterde de nauwkeurigheid van de voorspelling met wel 0,39 procentpunt. De auteurs suggereren dat we door dit nieuwe data en deze slimme ontwerpregels eindelijk advertentiesystemen kunnen bouwen die menselijk gedrag veel beter begrijpen dan voorheen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.