← Últimos artículos
📊 statistics

Calibrate Globally, Measure Everywhere: Scaling LLM-Based Prevalence Measurement Across A/B Experiments

Este artículo presenta una solución a nivel de sistema y rentable para la plataforma de experimentación de Pinterest que escala la medición de la prevalencia de contenido basada en LLM a través de cientos de pruebas A/B concurrentes mediante la implementación de una calibración global única y continuamente actualizada de los cubos de puntuación de ML, permitiendo así un seguimiento diario de alta fidelidad para más de 20 veces más brazos de experimento que el etiquetado tradicional por experimento con LLM dentro del mismo presupuesto.

Autores originales: Zehao Xu, Tony Paek, Kevin O'Sullivan, Attila Dobi

Publicado 2026-07-30
📖 8 min de lectura🧠 Análisis profundo

Autores originales: Zehao Xu, Tony Paek, Kevin O'Sullivan, Attila Dobi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que diriges una ciudad enorme y bulliciosa donde millones de personas caminan por las calles cada día. En esta ciudad, hay miles de tiendas, parques y vallas publicitarias diferentes, y los planificadores urbanos quieren saber exactamente cuánto tiempo pasa la gente mirando tipos específicos de cosas, como "herramientas de jardinería" o "arte generado por IA". Este es el mundo de la medición de la prevalencia: averiguar qué fracción de las "impresiones" (o miradas) totales pertenece a una categoría determinada.

Para tomar decisiones sobre la ciudad, los planificadores suelen realizar experimentos A/B. Esto es como probar dos versiones diferentes de un letrero de calle: una versión para la mitad de la gente, otra para la otra mitad, para ver cuál hace que la gente sea más feliz o esté más comprometida. Normalmente, para saber si un letrero está funcionando, necesitas contar los resultados. Pero aquí está el truco: a veces, lo que quieres contar es difícil de medir. No puedes simplemente preguntar a cada persona qué vio; tomaría una eternidad y costaría una fortuna. En el mundo digital, esta tarea "difícil de medir" se realiza mediante Modelos de Lenguaje Extensos (LLM): computadoras de IA superinteligentes que pueden leer una imagen o una publicación y decirte: "Sí, esto es sobre jardinería" o "No, esto no lo es". Aunque estos jueces de IA son increíblemente precisos, pedirles que miren cada uno de los elementos de una ciudad con miles de millones de visitantes diarios es demasiado caro y lento de hacer para cada experimento individual.

Aquí es donde entra el artículo de Zehao Xu y su equipo en Pinterest. Se enfrentaron a un problema: realizaban cientos de experimentos al día y necesitaban saber la "prevalencia" de ciertos tipos de contenido (como si los pins eran sobre IA o problemas de seguridad) para cada grupo de experimento. No podían permitirse pagar a la IA para etiquetar cada elemento de cada prueba. Así que construyeron un ingenioso sistema que actúa como un "traductor global". En lugar de pedir a la costosa IA que revise cada elemento de cada nuevo experimento, le piden a la IA que revise una muestra representativa de toda la ciudad una vez al día. Utilizan esa muestra para enseñar a un modelo más barato y rápido cómo adivinar la prevalencia. Luego, utilizan ese modelo rápido para medir todo lo demás instantáneamente. El resultado es que pueden rastrear los cambios en la exposición de contenido para cientos de experimentos cada día, detectando cambios diminutos que un único control costoso pasaría por alto, todo sin gastar dinero extra en etiquetas de IA.

El Problema: El "Estándar de Oro" es demasiado caro

En el mundo de los medios en línea, empresas como Pinterest necesitan equilibrar el compromiso de los usuarios con el hecho de asegurar que no estén viendo demasiados tipos de contenido específicos (como imágenes inseguras o spam de baja calidad). Para hacer esto, realizan pruebas A/B. En estas pruebas, ajustan el algoritmo para ver si cambia la cantidad de un tipo de contenido específico que los usuarios ven.

Para medir esto, el "estándar de oro" es utilizar una IA (un LLM) para observar una muestra de contenido y etiquetarla perfectamente. Esto es como tener un equipo de expertos críticos de arte examinando cada pintura en una galería para contar cuántas son paisajes. Es preciso, pero es lento e increíblemente costoso. Si tienes cientos de experimentos ejecutándose al mismo tiempo, y necesitas verificar el contenido para cada grupo en cada experimento, el costo sería astronómico. Simplemente no puedes permitirte contratar a los "expertos" para que lo miren todo, todos los días.

Además, los cambios que a las empresas les importan suelen ser muy pequeños. Si un nuevo algoritmo reduce la cantidad de "arte generado por IA" que ven los usuarios en solo un 2% o un 5%, un único control costoso podría no ser lo suficientemente preciso para decir si ese cambio es real o si es solo ruido aleatorio. Es como intentar escuchar un susurro en una habitación ruidosa con un solo micrófono costoso; podrías perderlo por completo.

La Solución: Un Mapa de Calibración Global

El equipo de Pinterest se dio cuenta de que no necesitaban pedir a la IA costosa que etiquetara todo para cada experimento. En su lugar, necesitaban una forma de "calibrar" un método más barato y rápido utilizando la sabiduría de la IA costosa.

Piénsalo de esta manera: imagina que tienes un termómetro superpreciso pero lento (el LLM) y un termómetro barato y rápido (la puntuación del modelo de ML). El termómetro barato te da un número, pero no es perfectamente preciso. Sin embargo, si usas el termómetro costoso para revisar la temperatura en algunos puntos específicos cada día, puedes crear un mapa que te diga exactamente cómo corregir la lectura del termómetro barato para cualquier ubicación.

El artículo describe un sistema que hace exactamente esto:

  1. Calibración Global: En lugar de etiquetar elementos para cada experimento por separado, ejecutan un proceso de muestreo global diario. Utilizan el LLM costoso para etiquetar una muestra representativa de todo el tráfico de la plataforma.
  2. Segmentación (Bucketing): Toman las puntuaciones del modelo rápido y barato (que predice la probabilidad de que un elemento sea, por ejemplo, "generado por IA") y los agrupan en "cubetas" o segmentos (por ejemplo, 0–10%, 10–20%, etc.).
  3. La Traducción: Utilizando las etiquetas diarias del LLM, calculan exactamente qué porcentaje de los elementos en cada segmento es realmente "generado por IA". Esto crea una tabla de consulta: "Si el modelo barato dice que un elemento está en el segmento del 80–90%, hay un 95% de probabilidad de que sea realmente generado por IA".
  4. Medición Instantánea: Ahora, para cualquier experimento nuevo, no necesitan llamar a la IA costosa. Simplemente observan las puntuaciones del modelo barato para los elementos en ese experimento, ven en qué segmentos caen y utilizan el mapa precalculado para conocer la prevalencia instantáneamente.

Los Resultados: Captando los Susurros

El equipo probó este sistema contra las mediciones del "estándar de oro" del LLM en experimentos del mundo real. Los resultados fueron impresionantes:

  • Escala: El sistema actualmente atiende alrededor de 100 experimentos y 250 grupos diferentes (brazos) cada día.
  • Eficiencia: En comparación con la forma antigua de realizar un único control costoso por experimento, este nuevo sistema proporciona mediciones diarias para más de 20 veces más experimentos simultáneos utilizando el mismo presupuesto de etiquetado.
  • Precisión: En aproximadamente 300 auditorías de producción, el intervalo de confianza del 95% del sistema contenía la respuesta del costoso LLM el 92% de las veces. Esto significa que el método rápido y barato es casi tan confiable como el costoso.
  • Sensibilidad: El hallazgo más emocionante fue la detección de cambios pequeños. En un experimento, el nuevo sistema detectó una reducción relativa pequeña pero constante del 4.2% en un tipo de contenido específico. Un único control costoso del LLM en ese mismo experimento habría pasado esto por alto por completo debido a que el ruido era demasiado alto. Al agregar datos diarios, el nuevo sistema pudo escuchar el "susurro" que el micrófono costoso no pudo captar.

Por Qué Es Importante

Esto no se trata solo de ahorrar dinero; se trata de tomar mejores decisiones. Antes de este sistema, los equipos podrían haber tenido que omitir la medición de la prevalencia de contenido en muchos experimentos porque era demasiado costoso. O bien, podrían haber tomado decisiones basadas en un único punto de datos ruidoso que pasó por alto tendencias pequeñas pero importantes.

Al "calibrar globalmente y medir en todas partes", el equipo creó un sistema donde el costo de la IA costosa se paga una vez (o se amortiza) y luego se reutiliza miles de veces. Convierte un proceso lento y costoso en una rutina diaria y reutilizable. Esto permite que los equipos de producto vean el panorama completo de cómo sus cambios afectan la exposición de contenido, asegurando que la plataforma siga siendo segura, de alta calidad y atractiva para todos, sin romper el banco.

El artículo enfatiza que este es un logro a nivel de sistema, no solo una nueva fórmula matemática. Se trata de construir un flujo de trabajo que toma una tarea recurrente y costosa y la convierte en un activo reutilizable. Si bien el artículo señala que los costos de los LLM podrían disminuir en el futuro, haciendo que el etiquetado directo sea más barato, la lógica de este sistema —utilizar una calibración global para escalar las mediciones— sigue siendo una herramienta poderosa para gestionar experimentos complejos y a gran escala hoy en día.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →