← Nieuwste papers
🤖 machine learning

A More Accurate Algorithm Comparison through A/B Testing using Offline Evaluation Methods

Dit artikel daagt de conventionele opvatting uit dat A/B-testen altijd superieur is aan offline evaluatie door te onthullen dat A/B-testen kan lijden onder hogere selectiefoutpercentages door een gebrek aan positieve correlatie, en stelt een nieuwe estimator voor die deze correlatie opzettelijk induceert door middel van een stapsgewijze vergelijking met een hypothetisch midden-algoritme om de benodigde hoeveelheid data voor nauwkeurige algoritme-selectie aanzienlijk te verminderen.

Oorspronkelijke auteurs: Koki Konishi, Masataka Ushiku, Yuta Saito

Gepubliceerd 2026-07-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Koki Konishi, Masataka Ushiku, Yuta Saito

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: Het Beste Recept Kiezen

Stel je voor dat je een restaurant runt en moet kiezen tussen twee nieuwe recepten voor een soep: Recept A en Recept B. Je wilt weten welke de klanten lekkerder vinden, zodat je die aan iedereen kunt serveren.

Meestal is de "Gouden Standaard" (de beste manier om dit te doen) A/B-testen. Je serveert Recept A aan de helft van je klanten en Recept B aan de andere helft, en telt vervolgens het aantal complimenten. Dit wordt beschouwd als de meest nauwkeurige methode omdat je test op echte, verse gegevens.

Er is echter een addertje onder het gras:

  1. Het is duur en riskant: Als Recept B verschrikkelijk is, kun je de eetervaring van de helft van je klanten verruïneren en geld verliezen terwijl je erachter komt.
  2. Het heeft veel data nodig: Om 100% zeker te zijn, moet je duizenden kommen serveren.

Vanwege deze reden proberen veel restaurants eerst een Offline Evaluatie uit te voeren. Dit is alsof je de chef-kok vraagt om de soep te proeven op basis van een receptenboek (historische gegevens), zonder het daadwerkelijk aan klanten te serveren. Het is veilig en goedkoop, maar meestal minder nauwkeurig dan de echte proeverij.

De Verrassende Ontdekking

De auteurs van dit paper voerden een test uit en ontdekten iets heel vreemds en contra-intuïtiefs:

Soms is de "veilige" methode (Offline Evaluatie) eigenlijk beter in het aanwijzen van de winnaar dan de "Gouden Standaard" (A/B-testen).

In hun experiment maakte de standaard A/B-testmethode (die ze AVG noemen) ongeveer 27% van de tijd fouten, terwijl de offline methode slechts 9% van de tijd fouten maakte.

Waarom faalde de "Gouden Standaard"?
Stel je voor dat je twee hardlopers beoordeelt, Alice en Bob.

  • De A/B-testmethode (AVG) stuurt Alice naar een baan in New York en Bob naar een baan in Londen. Ze rennen afzonderlijk van elkaar. Je meet hun tijden onafhankelijk van elkaar. Omdat ze op verschillende plekken zijn, hebben hun tijden geen enkele connectie met elkaar. Als Alice een slechte dag heeft en Bob een geweldige dag, denk je misschien onterecht dat Bob sneller is, ook al is Alice eigenlijk de betere hardloopster.
  • De Offline methode (IPS) laat zowel Alice als Bob op dezelfde baan rennen op hetzelfde moment. Omdat ze onder dezelfde omstandigheden rennen (dezelfde weersomstandigheden, dezelfde kwaliteit van de baan), zijn hun tijden gecorreleerd. Als de baan modderig is, rennen beiden langzamer. Als het zonnig is, rennen beiden sneller. Deze "gedeelde conditie" heft de ruis op, waardoor het makkelijker is om te zien wie er echt sneller is.

Het paper betoogt dat A/B-testen faalt omdat het de twee algoritmen behandelt alsof ze in totaal verschillende werelden leven, waarbij het voordeel van ze naast elkaar vergelijken wordt gemist.

De Oplossing: De "Tussenpersoon" (MID)

De auteurs stellen een nieuwe methode voor genaamd MID (Middle-In-Difference). Ze willen de veiligheid van A/B-testen (gebruikmaken van echte data) maar de nauwkeurigheid van de offline methode (dingen zij-aan-zij vergelijken).

Dit is hoe ze het doen, met behulp van een Touwtrekkers-analogie:

  1. De Opstelling: Je hebt Team A (Algoritme A) en Team B (Algoritme B). Je wilt weten wie sterker is.
  2. Het Probleem: Als je ze direct tegen elkaar laat trekken, kan het touw te lang en wankel zijn (hoge variantie).
  3. De Truc (Het Midden-Algoritme): De auteurs verzinnen een hypothetisch "Midden-Team" (Team M). Dit team is een perfecte mix van Team A en Team B.
  4. De Stap-voor-stap Race:
    • Eerst laat je Team A tegen Team M racen. Je gebruikt de data van de kant van Team A uit de A/B-test. Omdat ze tegen een vergelijkbare tegenstander racen (Team M), zijn de resultaten stabiel.
    • Daarna laat je Team B tegen Team M racen. Je gebruikt de data van de kant van Team B uit de A/B-test.
    • Ten slotte tel je de twee resultaten bij elkaar op om te zien wie er sterker is tussen A en B.

Waarom dit werkt:
Door het "Midden-Team" te introduceren, dwing je de twee vergelijkingen om een gemeenschappelijk referentiepunt te delen. Net als bij de offline methode creëert dit een positieve correlatie. Hoewel Team A en Team B in verschillende groepen zitten, worden ze allebei gemeten tegen hetzelfde "Midden-Team". Dit heft de willekeurige ruis op en maakt de uiteindelijke beslissing veel nauwkeuriger.

De Resultaten

De auteurs hebben dit getest op echte gegevens van een video-aanbevelingsapp (zoals TikTok of YouTube).

  • Efficiëntie: De nieuwe MID-methode was in staat om het betere algoritme te kiezen met de helft (of zelfs een kwart) van de hoeveelheid data die de standaard A/B-testmethode vereist.
  • Stabiliteit: Wanneer de twee algoritmen erg verschillend van elkaar waren (wat offline methoden meestal problematisch maakt), werkte MID nog steeds perfect.
  • Nauwkeurigheid: Het maakte minder fouten dan zowel de standaard A/B-test als de offline methode.

Samenvatting

Het paper zegt: "We hebben ontdekt dat de standaard manier van A/B-testen eigenlijk een beetje onhandig is, omdat het de twee opties niet eerlijk naast elkaar vergelijkt. We hebben een nieuwe truc bedacht met een 'Midden-Algoritme' om een eerlijke vergelijking af te dwingen. Deze nieuwe truc stelt ons in staat om de winnaar sneller te vinden, met minder data en met minder fouten."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →