Blending Proxy Metrics with a North Star
Questo articolo propone un framework di miscelazione ottimale per i test A/B che bilancia dinamicamente le metriche proxy e una "north star" in base alla potenza dell'esperimento e alla qualità della metrica proxy, offrendo spunti d'azione per la progettazione degli esperimenti e dimostrando la sua applicazione nel mondo reale presso Netflix.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di essere un capitano che guida una nave massiccia (un'azienda come Netflix) attraverso acque nebbiose. Il tuo obiettivo finale è raggiungere un'isola specifica e lontana chiamata "La Stella Polare" (il vero successo aziendale, come mantenere i clienti per anni). Tuttavia, la nebbia è così fitta che non riesci a vedere chiaramente l'isola finché non sei quasi arrivato.
Per navigare, hai due strumenti:
- La Bussola della Stella Polare: Indica direttamente la tua destinazione, ma è molto debole e instabile. Puoi fidarti solo se navighi per moltissimo tempo (esegui un esperimento enorme).
- Il Radar Proxy: Rileva piccole increspature nell'acqua (click degli utenti, coinvolgimento) che avvengono prima di raggiungere l'isola. È super sensibile e fornisce un segnale chiaro immediatamente, ma non sempre significa che ti stai dirigendo verso l'isola.
Il Dilemma
In passato, le aziende dovevano scegliere: "Mi fido della debole Stella Polare o del rumoroso Proxy?"
- Se ti fidi troppo del Proxy, potresti dirigerti verso un'increspatura che sembra promettente ma che conduce a un vicolo cieco.
- Se aspetti la Stella Polare, potresti navigare per anni senza prendere decisioni, perdendo opportunità.
La Soluzione: Il "Mix Intelligente" (Smart Blend)
Il paper di Winston Chou propone un sistema di navigazione intelligente che mescola questi due strumenti. Invece di sceglierne uno, il computer della nave regola automaticamente quanto fidarsi di ciascuno strumento in base a quanti dati ha raccolto.
Ecco come funziona il "Mix Intelligente", usando analogie semplici:
1. L'analogia della "Manopola del Volume"
Immagina che il processo decisionale sia una radio con due manopole del volume: una per il Proxy (i click) e una per la Stella Polare (la ritenzione).
- Quando l'esperimento è piccolo (pochi dati): Il segnale della Stella Polare è troppo debole per essere udito. Il sistema alza il volume del Proxy e abbassa quello della Stella Polare. Prendi decisioni basandoti sui segnali immediati e sensibili perché non hai ancora abbastanza dati per vedere il quadro generale.
- Quando l'esperimento è enorme (molti dati): Hai navigato abbastanza a lungo che la Stella Polare è finalmente visibile. Il sistema aumenta automaticamente il volume della Stella Polare e abbassa quello del Proxy. Smetti di indovinare basandoti sulle increspature e inizi a navigare seguendo la destinazione reale.
Il paper dimostra che esiste un modo matematicamente "perfetto" per girare queste manopole in ogni fase del viaggio.
2. L'analogia del "Test di Assaggio"
Immagina di essere uno chef che sta creando un nuovo piatto.
- La Stella Polare è il test di assaggio finale di un critico gastronomico (gli è piaciuto?). Questo richiede tempo ed è un evento raro.
- Il Proxy è l'odore della cucina mentre cucini. È immediato e ti dice se qualcosa sta bruciando o se l'odore è buono.
Se hai solo un piccolo campione (un cucchiaino), non puoi ancora fidarti dell'opinione del critico, quindi ti affidi all'odore. Ma se hai cucinato mille pentole, l'opinione del critico diventa la cosa più importante. Il metodo descritto nel paper ti dice esattamente quanto pesare l' "odore" rispetto al "gusto del critico" in base a quante pentole hai cucinato.
3. L'analogia del "Ingorgo Stradale" (Progettare Esperimenti)
Il paper cambia anche il modo in cui pianifichi i tuoi esperimenti.
- Se il tuo Proxy è eccellente (come un odore molto accurato), non hai bisogno di cucinare grandi lotti per sapere se il piatto è buono. Puoi eseguire molti esperimenti piccoli e rapidi. Questo è come prendere molte piccole strade secondarie per aggirare il traffico.
- Se il tuo Proxy è scarso (l'odore è inaffidabile), non puoi fidartene. Devi aspettare il critico. Ciò significa che devi eseguire meno esperimenti, ma molto più grandi.
Prova nel mondo reale: Netflix
L'autore ha testato questo approccio in Netflix.
- La Stella Polare: "Riproduzioni" (l'utente ha effettivamente guardato il film?). È difficile da misurare rapidamente.
- Il Proxy: "Click" (l'utente ha cliccato sul titolo?). È facile da misurare istantaneamente.
Nei dati di Netflix, i "Click" erano molto più sensibili delle "Riproduzioni".
- Per i test piccoli, il sistema si affidava principalmente ai Click.
- Per i test massicci (milioni di utenti), il sistema passava a fare affidamento principalmente sulle Riproduzioni.
- Il Risultato: Mescolandoli, Netflix ha ottenuto risultati migliori rispetto all'uso di solo i Click o di solo le Riproduzioni. Hanno commesso meno errori e trovato più funzionalità di successo.
Il Punto Fondamentale
Non devi scegliere tra dati "veloci ma rumorosi" e dati "lenti ma accurati". Usando un approccio misto che sposta automaticamente la fiducia dai dati veloci ai dati accurati man mano che raccogli più informazioni, puoi prendere decisioni migliori più velocemente.
Punti chiave del Paper:
- Non scegliere una parte: Usa entrambi i parametri, ma pesali in modo diverso.
- La dimensione conta: Più grande è il tuo esperimento, più dovresti fidarti della "Stella Polare" (l'obiettivo reale).
- La qualità conta: Se il tuo "Proxy" è molto buono, puoi eseguire più esperimenti piccoli. Se è scarso, ne devi eseguire di meno, ma più grandi.
- La matematica funziona: Il paper fornisce una formula per calcolare esattamente come mescolare questi parametri per ottenere il miglior risultato possibile.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.