← Nieuwste papers
📊 statistics

Blending Proxy Metrics with a North Star

Dit artikel stelt een optimaal blendingskader voor A/B-testen voor dat dynamisch een balans vindt tussen proxy-metrieken en een "north star" op basis van experimentkracht en proxykwaliteit, wat bruikbare inzichten biedt voor experimentontwerp en de praktische toepassing ervan bij Netflix aantoont.

Oorspronkelijke auteurs: Winston Chou

Gepubliceerd 2026-06-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Winston Chou

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een kapitein bent die een enorm schip (een bedrijf als Netflix) door mistige wateren stuurt. Je uiteindelijke doel is om een specifieke, verre eiland te bereiken genaamd "De Noordster" (echt zakelijk succes, zoals klanten die jarenlang behouden). Echter, de mist is zo dik dat je het eiland pas duidelijk kunt zien als je er bijna bent.

Om te navigeren, heb je twee instrumenten:

  1. De Noordster Kompas: Het wijst direct naar je bestemming, maar het is erg zwak en schokkerig. Je kunt het alleen vertrouwen als je een zeer lange tijd vaart (een enorme experiment draait).
  2. De Proxy Radar: Deze detecteert kleine rimpelingen in het water (user clicks, engagement) die plaatsvinden voordat je het eiland bereikt. Het is supergevoelig en geeft onmiddellijk een duidelijk signaal, maar het betekent niet altijd dat je daadwerkelijk richting het eiland vaart.

Het Dilemma
In het verleden moesten bedrijven kiezen: "Vertrouw ik op de zwakke Noordster, of op de ruisende Proxy?"

  • Als je te veel op de Proxy vertrouwt, stuur je misschien naar een rimpeling die veelbelovend lijkt, maar leidt naar een doodlopende weg.
  • Als je wacht op de Noordster, vaar je misschien jarenlang zonder beslissingen te nemen, waardoor je kansen mist.

De Oplossing: De "Smart Blend"
Winston Chou's paper stelt een slim navigatiesysteem voor dat deze twee instrumenten mengt. In plaats van te kiezen, past de computer van het schip automatisch aan hoeveel hij elk instrument vertrouwt, gebaseerd op hoeveel data hij heeft verzameld.

Hier is hoe de "Smart Blend" werkt, met eenvoudige analogieën:

1. De "Volume Knop" Analogie

Stel je het besluitvormingsproces voor als een radio met twee volumeknoppen: één voor de Proxy (clicks) en één voor de Noordster (retentie).

  • Wanneer het experiment klein is (weinig data): Het signaal van de Noordster is te zacht om te horen. Het systeem zet het volume van de Proxy omhoog en dat van de Noordster omlaag. Je maakt beslissingen op basis van de onmiddellijke, gevoelige signalen omdat je nog niet genoeg data hebt om het grote plaatje te zien.
  • Wanneer het experiment groot is (veel data): Je hebt ver genoeg gevaren dat de Noordster eindelijk hoorbaar is. Het systeem draait automatisch het volume van de Noordster omhoog en dat van de Proxy omlaag. Je stopt met gissen op basis van rimpelingen en begint te sturen op basis van de werkelijke bestemming.

Het paper bewijst dat er een wiskundig "perfecte" manier is om deze knoppen op elk moment van de reis te draaien.

2. De "Proefsmaak" Analogie

Stel je voor dat je een chef bent die een nieuw gerecht probeert te maken.

  • De Noordster is de uiteindelijke proeverij door een voedselcriticus (vond hij het lekker?). Dit kost tijd en is zeldzaam.
  • De Proxy is de geur in de keuken tijdens het koken. Het is onmiddellijk en vertelt je of er iets aanbrandt of goed ruikt.

Als je slechts een kleine steekproef hebt (één hapje), kun je de mening van de criticus nog niet vertrouwen, dus vertrouw je op de geur. Maar als je duizend potten hebt gekookt, wordt de mening van de criticus het belangrijkste. De methode uit het paper vertelt je precies hoeveel gewicht je moet toekennen aan de "geur" versus de "smaak van de criticus" op basis van hoeveel potten je hebt gekookt.

3. De "Verkeersopstopping" Analogie (Experimenten Ontwerpen)

Het paper verandert ook hoe je je experimenten plant.

  • Als je Proxy uitstekend is (zoals een zeer nauwkeurige geur), hoef je geen enorme batches te koken om te weten of het gerecht goed is. Je kunt veel kleine, snelle experimenten uitvoen. Dit is als het nemen van veel kleine zijwegen om om het verkeer heen te rijden.
  • Als je Proxy slecht is (de geur is onbetrouwbaar), kun je er niet op vertrouwen. Je moet wachten op de criticus. Dit betekent dat je minder, maar veel grotere experimenten moet uitvoeren om een duidelijk signaal te krijgen.

Real-World Bewijs: Netflix

De auteur heeft dit getest bij Netflix.

  • De Noordster: "Plays" (heeft de gebruiker de film daadwerkelijk bekeken?). Dit is moeilijk snel te meten.
  • De Proxy: "Clicks" (heeft de gebruiker op de titel geklikt?). Dit is makkelijk onmiddellijk te meten.

In de data van Netflix waren "Clicks" veel gevoeliger dan "Plays".

  • Bij kleine tests vertrouwde het systeem voornamelijk op Clicks.
  • Bij enorme tests (miljoenen gebruikers) verschoof het systeem naar het vertrouwen op Plays.
  • Het Resultaat: Door ze te mengen, behaalde Netflix betere resulting dan wanneer ze alleen Clicks of alleen Plays hadden gebruikt. Ze maakten minder fouten en vonden meer succesvolle functies.

De Kern van het Verhaal

Je hoeft niet te kiezen tussen "snelle maar ruisende" data en "trage maar nauwkeurige" data. Door een gemengde aanpak te gebruiken die automatisch het vertrouwen verschuift van de snelle data naar de nauwkeurige data naarmate je meer informatie verzamelt, kun je betere beslissingen nemen, sneller.

Belangrijkste inzichten uit het paper:

  • Kies geen kant: Gebruik beide metrieken, maar weeg ze anders.
  • Grootte doet ertoe: Hoe groter je experiment, hoe meer je de "Noordster" (het werkelijke doel) moet vertrouwen.
  • Kwaliteit doet ertoe: Als je "Proxy" erg goed is, kun je meer kleine, snelle experimenten uitvoeren. Als hij slecht is, moet je minder, maar grotere experimenten doen.
  • De wiskunde werkt: Het paper biedt een formule om exact te berekenen hoe je deze metrieken mengt om het best mogelijke resultaat te krijgen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →