← Últimos artículos
📊 statistics

Accelerating A/B-Tests with Counterfactual Estimation: Reducing Variance through Policy Overlap

Este artículo propone un nuevo protocolo de pruebas A/B que aprovecha el solapamiento de políticas y la estimación fuera de política Δ\Delta para eliminar el ruido de las acciones coincidentes, reduciendo así la varianza y acelerando la evaluación de los efectos del tratamiento en comparación con los métodos estándar.

Autores originales: Olivier Jeunen

Publicado 2026-07-17
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Olivier Jeunen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un detective intentando resolver un misterio: ¿cuál de dos nuevos dispositivos funciona mejor? En el mundo de las plataformas en línea —como las aplicaciones de tu teléfono o los sitios web que visitas— las empresas realizan "pruebas A/B" para encontrar la respuesta. Dividen a sus usuarios en dos grupos: el Grupo A ve el dispositivo antiguo (el control) y el Grupo B ve el nuevo (el tratamiento). Al comparar cuánto dinero, clics o tiempo genera cada grupo, la empresa decide si el nuevo dispositivo merece la pena.

Pero aquí está el truco: internet es caótico. Las personas son impredecibles. Un día un usuario puede hacer clic en todo; al siguiente, puede ignorarlo todo. Este "ruido" hace difícil saber si un nuevo dispositivo es realmente mejor o si los resultados ocurrieron simplemente por azar. Para obtener una respuesta clara, las empresas suelen tener que realizar estas pruebas durante mucho tiempo o mostrar el nuevo dispositivo a millones de personas, lo cual es costoso y lento. Los científicos han intentado encontrar formas de atravesar este ruido, a menudo utilizando las matemáticas para predecir lo que debería haber pasado y restando esa suposición de los resultados reales. Este artículo entra en escena para plantear una pregunta simple pero poderosa: ¿Qué pasaría si pudiéramos usar el hecho de que los dos dispositivos suelen hacer exactamente lo mismo para que nuestras pruebas sean más rápidas y precisas?

El artículo, titulado "Accelerating A/B-Tests with Counterfactual Estimation" (Acelerando las pruebas A/B con estimación contrafáctica), propone una forma ingeniosa de realizar estos experimentos. El autor, Olivier Jeunen, sugiere que la forma estándar de comparar dos dispositivos es, en realidad, un desperdicio de datos. Esta es la idea central: imagina que los dos dispositivos son dos chefs diferentes. Si ambos chefs deciden hacer una pizza para un cliente, el resultado (una pizza) es el mismo independientemente de a quién hayas contratado. Si intentas comparar a los chefs observando esa pizza, no aprendes nada sobre quién es mejor; solo ves el ruido de qué tan buena sabe la pizza. El método estándar cuenta esta pizza como un punto de datos, añadiendo confusión.

Jeunen argumenta que deberíamos tratar la elección aleatoria de a qué chef contratar como un "meta-chef" (una meta-política) que mezcla a los dos chefs originales. Utilizando un truco matemático llamado "Estimación Contrafáctica", el nuevo método se da cuenta de que cuando ambos chefs coinciden en una acción (como hacer una pizza), ese punto de datos no nos dice nada sobre la diferencia entre ellos. Por lo tanto, el nuevo método esencialmente dice: "Ignoren las pizzas; concéntrense solo en los momentos en que los chefs no están de acuerdo, como cuando uno hace una pizza y el otro hace una hamburguesa". Al reducir el peso de los momentos en que las políticas coinciden y aumentar el peso de los momentos en que difieren, el método elimina el ruido.

El artículo demuestra matemáticamente que este enfoque es siempre mejor que el método estándar siempre que las dos políticas tengan cualquier tipo de superposición (es decir, que alguna vez coincidan en una acción). Muestra que el "ruido" en el nuevo método depende de qué tan diferentes sean las políticas, en lugar de depender solo del caos bruto del comportamiento del usuario. Si las políticas son muy similares (lo cual es común cuando las empresas realizan actualizaciones pequeñas), el nuevo método puede reducir el ruido significamente, haciendo que los resultados de la prueba sean mucho más claros.

Además, el artículo sugiere que no siempre necesitamos dividir el tráfico 50/50 entre los dos grupos. Al igual que un chef puede necesitar más ingredientes para probar una receta arriesgada, las matemáticas muestran que la mejor división de usuarios puede ser desigual (por ejemplo, enviar el 81% de los usuarios al nuevo dispositivo y el 19% al antiguo) para obtener la respuesta más precisa en el menor tiempo posible. Los autores también introducen una nueva forma de entrenar modelos computacionales (llamada Δ\Delta-MRDR) que se enfoca específicamente en aprender las diferencias entre las políticas, en lugar de intentar predecir todo perfectamente. Finalmente, muestran que esto funciona incluso para tareas complejas como el ranking de listas de artículos (como los resultados de búsqueda), donde la "acción" no es solo un elemento, sino una lista completa.

Para probar estas ideas, los autores realizaron miles de simulaciones computacionales. Crearon mundos ficticios con diferentes niveles de caos y diferentes tamaños de espacios de acción (de 10 a 5,000 elementos). En estas simulaciones, su nuevo método superó consistentemente al método estándar, reduciendo el error (varianza) hasta en un 75% en algunos casos. Encontraron que cuando las políticas eran muy similares, el error del nuevo método caía casi a cero, mientras que el método antiguo seguía siendo ruidoso. También confirmaron que la división de tráfico óptima que calcularon (alrededor del 81% hacia la nueva política en un escenario específico) era, de hecho, la mejor manera de realizar la prueba, reduciendo la varianza en aproximadamente un 18% en comparación con una división estándar de 50/50.

Sin embargo, el artículo tiene cuidado en señalar que estos resultados provienen de simulaciones, no de pruebas reales en vivo en una plataforma masiva. Aunque las matemáticas son sólidas y las simulaciones son rigurosas, el mundo real podría tener complicaciones adicionales, como cambios en los hábitos de los usuarios o un conocimiento imperfecto de cómo se comportan las políticas. Los autores sugieren que, si bien el método está listo para ser probado, su rendimiento exacto en un entorno real depende de cuánto se superpongan las políticas y de qué tan bien los modelos computacionales puedan predecir el comportamiento del usuario.

En resumen, este artículo ofrece una perspectiva fresca a un problema antiguo. Sugiere que, al darnos cuenta de que "el acuerdo es aburrido" y que "el desacuerdo es donde vive la señal", podemos realizar mejores experimentos, ahorrar dinero y tomar decisiones más rápido. Convierte el A/B test estándar de un instrumento romo en un escalpelo preciso, utilizando el mismo hecho de que las políticas suelen ser similares para hacer la comparación más aguda.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →