The Price of Isolation: Estimating the Ecosystem Cost of Symmetric Two-Sided A/B Testing
Questo articolo dimostra che, sebbene l'isolamento simmetrico bilaterale nei test A/B elimini l'interferenza nel marketplace, esso comporta un costo di engagement persistente che non svanisce all'aumentare della dimensione della piattaforma se la qualità del match segue una distribuzione a coda pesante, rendendo necessario un procedimento di stima pre-lancio per pianificare questo compromesso.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di entrare in una biblioteca enorme e frenetica. Non è una biblioteca qualunque; è un mercato a due lati dove gli autori (i creatori) portano i loro libri e i lettori (gli spettatori) vengono a cercare la loro prossima storia preferita. Per aiutarti a trovare il libro perfetto, c'è un bibliotecario super intelligente (il sistema di raccomandazione) che scansiona l'intera collezione e ti consegna il match migliore. Ora, immagina che la biblioteca voglia testare un nuovo modo di organizzare i libri per vedere se aiuta gli autori a ricevere più attenzione. Per essere equi, non possono cambiare il sistema per tutti in una volta sola; devono eseguire un esperimento controllato. Dividono la biblioteca in due stanze separate: una "Stanza di Test" e una "Stola di Controllo". Nella Stanza di Test, provano la nuova organizzazione; nella Stanza di Controllo, mantengono le cose esattamente come sono.
Ma ecco la parte complicata: per assicurarsi che il test sia pulito e che le due stanze non si influenzino a vicenda, la biblioteca decide di isolarle completamente. Non mettono solo libri diversi nella Stanza di Test; bloccano anche i lettori della Stanza di Test all'interno con solo gli autori assegnati a quella stanza. I lettori della Stanza di Controllo ottengono il proprio set separato di autori. Questo è chiamato "isolamento simmetrico a due lati". È un metodo standard e affidabile utilizzato dalle grandi aziende tecnologiche per garantire la validità dei loro esperimenti. La grande domanda, tuttavia, è: questo isolamento comporta un costo nascosto? Se restringi la collezione della biblioteca a una frazione minuscola del totale, l'esperienza del lettore ne risente, anche se la nuova organizzazione è perfetta? Questo articolo approfondisce proprio questa domanda, usando la matematica e dati del mondo reale per vedere se "isolare" l'esperimento danneggi effettivamente ciò che si sta cercando di misurare.
La tassa nascosta dell'isolamento
Gli autori di questo articolo, ricercatori di Snap Inc., hanno scoperto che, sebbene isolare questi esperimenti sia necessario per ottenere risultati accurati, ciò comporta un costo sorprendente e inevitabile. Hanno scoperto che, restringendo il pool di contenuti disponibili per le persone nel gruppo di test, si abbassa inevitabilmente la qualità dei migliori abbinamenti che possono trovare. È come dire a un critico gastronomico: "Puoi assaggiare solo i piatti di questi tre chef invece di tutto il ristorante". Anche se il nuovo menù è ottimo, il critico potrebbe perdere un piatto davvero eccezionale che si trovava su uno scaffale nell'altra parte della cucina.
I ricercatori hanno dimostrato che questo non è solo un piccolo intoppo; è un "costo dell'ecosistema" fondamentale. Quando hanno eseguito un test puro in cui entrambi i gruppi avevano le stesse regole (un test A/A), hanno comunque osservato un calo massiccio dell'engagement. Nel loro esperimento, quando hanno ridotto il catalogo di creator disponibili per un gruppo di spettatori dal 70% a solo il 10%, il tempo che gli spettatori passavano a guardare nuovi contenuti è diminuito del 12,3%, e il numero di storie che finivano di guardare è precipitato del 19,0%. Quando hanno ristretto il gruppo ulteriormente a una minuscola fetta del 2%, la perdita di tempo di visione è salita al 29,8%. Questi non erano risultati negativi causati da una cattiva idea; erano "artefatti", o effetti collaterali, causati semplicemente dall'atto di isolare l'esperimento.
La matematica del "Miglior Match"
Per capire perché accade questo, gli autori hanno utilizzato un concetto chiamato "statistiche d'ordine". Immagina di cercare il singolo oggetto migliore in un enorme mucchio. Se hai un mucchio di 1.000 oggetti, hai una buona probabilità di trovare un diamante. Se hai solo un mucchio di 100 oggetti, le tue probabilità di trovare quel diamante diminuiscono significamente, anche se i diamanti sono ancora presenti nel mucchio più grande. I ricercatori hanno modellato questo matematicamente, osservando come cambia la qualità del "miglior match" man mano che il pool di candidati si rimpicciolisce.
Hanno scoperto che la risposta dipende pesantemente dalla "coda" della distribuzione — fondamentalmente, quanto è raro il contenuto davvero eccezionale.
- Se il contenuto eccezionale è comune (Code Leggere): Man mano che la piattaforma cresce, il costo dell'isolamento svanisce. Una piccola fetta di una biblioteca gigante è comunque una grande biblioteca.
- Se il contenuto eccezionale è raro (Code Pesanti): Questa è la parte spaventosa. Se il contenuto migliore è molto raro (come una distribuzione a legge di potenza, dove pochi superstar ottengono la maggior parte dell'attenzione), allora restringere il pool non aiuta molto, non importa quanto la piattaforma diventi grande. La perdita di qualità converge a un numero costante. Anche se hai un miliardo di creator, se ne mostri solo l'1% a uno spettatore, potresti comunque perdere il video perfetto che voleva vedere. La matematica suggerisce che, in queste condizioni, espandere la dimensione della piattaforma non risolve il problema; il costo rimane ostinatamente alto.
Testare la teoria nel mondo reale
Il team non si è limitato alla matematica; ha testato questo nel mondo reale su una piattaforma di contenuti su larga scala. Hanno eseguito due esperimenti principali per dimostrare il loro punto:
- La "Pulizia del Traffico A/A": Hanno eseguito un test in cui entrambi i gruppi avevano le stesse regole, ma un gruppo aveva un catalogo "sottile" (10% dei creator) e l'altro un catalogo "spesso" (70% dei creator). Il risultato è stato chiaro: il gruppo con il catalogo sottile interagiva molto meno. Il calo non era uniforme; peggiorava quanto più si guardava in profondità. Le visualizzazioni superficiali (solo un'occhiata veloce a una storia) sono diminuite poco, ma l'engagement profondo (finire di guardare una storia) è sceso di quasi il 20%. Questo gradiente ha provato che la perdita era dovuta alla mancanza dei migliori match, non solo al fatto di avere meno opzioni in generale.
- L' "Ablazione del Catalogo": Per essere extra sicuri, hanno eseguito un secondo esperimento in cui non isolavano affatto i gruppi. Inveve, hanno rimosso casualmente il 10% del catalogo per specifici spettatori. Anche senza la struttura di isolamento, l'engagement è diminuito. Ciò ha confermato che il colpevole era effettivamente l' "assottigliamento" del catalogo disponibile per ogni persona, non un qualche strano effetto collaterale della configurazione di isolamento.
La "Coda" conta di più
Uno dei risultati più affascinanti riguarda l' "indice di coda", un numero che descrive quanto sia pesante la coda della distribuzione dei contenuti. I ricercatori hanno calibrato questo numero utilizzando i loro piccoli gruppi di test e lo hanno poi usato per prevedere cosa sarebbe successo in gruppi più grandi. Hanno scoperto che il modello a coda pesante (dove il contenuto migliore è raro) prevedeva le perdite osservate nel mondo reale quasi perfettamente.
Questo porta a una realizzazione critica: non si può assumere che una piattaforma più grande risolverà automaticamente il costo dell'isolamento. Se la vostra piattaforma ha una "coda pesante" (cosa comune nei social media dove pochi creator dominano), non importa quanto cresciate, il costo di eseguire questi esperimenti isolati rimarrà approssimativamente lo stesso. Non svanirà.
Cosa significa per chi fa esperimenti
Quindi, cosa dovrebbe fare un data scientist o un product manager con queste informazioni? L'articolo offre una "procedura di prevolo". Prima di lanciare un nuovo esperimento, dovresti stimare il costo dell'isolamento.
- Calcola la Perdita: Usa la matematica per prevedere quanto engagement perderai solo isolando i gruppi.
- Controlla la Tolleranza: Se la perdita prevista è troppo alta (ad esempio, se prevedi di perdere il 20% del tuo engagement solo per fare un test), potresti dover ripensare il tuo design.
- Design di Fallback: Se il costo è troppo alto, l'articolo suggerisce di utilizzare diversi design sperimentali che non richiedano un isolamento così stretto, o di accettare la necessità di eseguire l'esperimento con una frazione di traffico maggiore per minimizzare il danno.
In breve, l'articolo rivela che l' "isolamento simmetrico a due lati" è uno strumento potente, ma non è gratuito. Porta con sé un "prezzo dell'isolamento" che è reale, misurabile e talvolta inevitabile. Comprendendo la matematica dietro il "miglior match" e la natura della distribuzione dei vostri contenuti, i team possono pianificare questo costo, dimensionare correttamente il proprio traffico ed evitare di essere sorpresi quando i loro esperimenti mostrano un calo di engagement che non ha nulla a che vedere con la nuova funzione che stanno testando. È un promemoria che nel mondo degli algoritmi, a volte, l'atto di misurare il sistema cambia il sistema stesso.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.