Calibrate Globally, Measure Everywhere: Scaling LLM-Based Prevalence Measurement Across A/B Experiments
Cet article présente une solution systémique et rentable pour la plateforme d'expérimentation de Pinterest qui permet de mettre à l'échelle la mesure de la prévalence des contenus basée sur les LLM à travers des centaines de tests A/B simultanés en implémentant un étalonnage global unique et continuellement actualisé des segments de scores ML, permettant ainsi un suivi quotidien de haute fidélité pour plus de 20 fois plus de bras d'expérience que l'étiquetage par LLM traditionnel par expérience, tout en respectant le même budget.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous dirigez une ville immense et bouillonnante où des millions de personnes déambulent dans les rues chaque jour. Dans cette ville, il y a des milliers de boutiques, de parcs et de panneaux publicitaires différents, et les urbanistes veulent savoir exactement combien de temps les gens passent à regarder des choses spécifiques — comme des « outils de jardinage » ou de l'« art généré par IA ». C'est le monde de la mesure de la prévalence : déterminer quelle fraction du total des « impressions » (ou des regards) appartient à une certaine catégorie.
Pour prendre des décisions sur la ville, les planificateurs lancent souvent des expériences A/B. C'est comme tester deux versions différentes d'un panneau de signalisation : une version pour la moitié des gens, une autre pour l'autre moitié, afin de voir laquelle rend les gens plus heureux ou plus engagés. Habituellement, pour savoir si un panneau fonctionne, vous devez compter les résultats. Mais voici le hic : parfois, la chose que vous voulez compter est difficile à mesurer. Vous ne pouvez pas simplement demander à chaque personne ce qu'elle a vu ; cela prendrait une éternité et coûterait une fortune. Dans le monde numérique, cette tâche « difficile à mesurer » est souvent accomplie par des Modèles de Langage de Grande Taille (LLM) — des ordinateurs dotés d'une IA super intelligente capables de lire une image ou une publication et de dire : « Oui, c'est du jardinage » ou « Non, ce n'est pas du jardinage ». Bien que ces juges IA soient incroyablement précis, demander à l'IA d'examiner chaque article d'une ville comptant des milliards de visiteurs quotidiens est trop coûteux et trop lent pour être fait pour chaque expérience.
C'est là que le papier de Zehao Xu et de son équipe chez Pinterest intervient. Ils ont été confrontés à un problème : ils menaient des centaines d'expériences chaque jour, et ils avaient besoin de connaître la « prévalence » de certains types de contenus (comme le nombre de pins concernant l'IA ou les problèmes de sécurité) pour chaque groupe d'expérience. Ils ne pouvaient pas se permettre de payer l'IA pour étiqueter chaque article pour chaque test. Ils ont donc construit un système ingénieux qui agit comme un « traducteur global ». Au lieu de demander à l'IA coûteuse de vérifier chaque article de chaque nouvelle expérience, ils demandent à l'IA de vérifier un échantillon représentatif de toute la ville une fois par jour. Ils utilisent cet échantillon pour apprendre à un modèle plus simple et plus rapide comment deviner la prévalence. Ensuite, ils utilisent ce modèle rapide pour mesurer tout le reste instantanément. Le résultat ? Ils peuvent suivre l'évolution de l'exposition au contenu pour des centaines d'expériences chaque jour, en captant de minuscules variations qu'un contrôle unique et coûteux ignorerait, le tout sans dépenser d'argent supplémentaire en étiquetage par IA.
Le Problème : Le « Gold Standard » est trop coûteux
Dans le monde des médias en ligne, les entreprises comme Pinterest doivent équilibrer l'engagement des utilisateurs avec la nécessité de s'assurer qu'ils ne voient pas trop de certains types de contenus (comme des images non sécurisées ou du spam de faible qualité). Pour ce faire, elles lancent des tests A/B. Dans ces tests, elles modifient l'algorithme pour voir s'il change la quantité de contenus d'un type spécifique que les utilisateurs voient.
Pour mesurer cela, le « gold standard » (la référence absolue) consiste à utiliser une IA (un LLM) pour examiner un échantillon de contenu et l'étiqueter parfaitement. C'est comme avoir une équipe de critiques d'art experts examinant chaque tableau d'une galerie pour compter combien sont des paysages. C'est précis, mais c'est lent et incroyablement coûteux. Si vous avez des centaines d'expériences tournant simultanément, et que vous devez vérifier le contenu pour chaque groupe dans chaque expérience, le coût serait astronomique. Vous ne pouvez tout simplement pas vous permettre d'embaucher les « experts » pour regarder tout cela, chaque jour.
De plus, les changements qui importent aux entreprises sont souvent très faibles. Si un nouvel algorithme réduit de seulement 2 % ou 5 % la quantité d'« art généré par l'IA » que les utilisateurs voient, un contrôle unique et coûteux pourrait ne pas être assez précis pour dire si ce changement est réel ou s'il s'agit simplement d'un bruit aléatoire. C'est comme essayer d'entendre un murmure dans une pièce bruyante avec un seul micro coûteux ; vous pourriez passer à côté sans le remarquer.
La Solution : Une Carte de Calibration Globale
L'équipe de Pinterest a réalisé qu'elle n'avait pas besoin de demander à l'IA coûteuse d'étiqueter tout pour chaque expérience. Au lieu de cela, elle avait besoin d'un moyen de « calibrer » une méthode plus simple et plus rapide en utilisant la sagesse de l'IA coûteuse.
Pensez-y de cette façon : imaginez que vous avez un thermomètre super précis mais lent (le LLM) et un thermomètre bon marché et rapide (le score du modèle ML). Le thermomètre bon marché vous donne un chiffre, mais il n'est pas parfaitement précis. Cependant, si vous utilisez le thermomètre coûteux pour vérifier la température dans quelques points spécifiques chaque jour, vous pouvez créer une carte qui vous indique exactement comment corriger la lecture du thermomètre bon marché pour n'importe quel emplacement.
Le papier décrit un système qui fait exactement cela :
- Calibration Globale : Au lieu d'étiqueter les articles pour chaque expérience séparément, ils exécutent un processus d'échantillonnage global quotidien. Ils utilisent le LLM coûteux pour étiqueter un échantillon représentatif de l'ensemble du trafic de la plateforme.
- Segmentation (Bucketing) : Ils prennent les scores du modèle rapide et bon marché (qui prédit la probabilité qu'un article soit, par exemple, « généré par l'IA ») et les regroupent dans des « compartiments » (ex: 0–10 %, 10–20 %, etc.).
- La Traduction : En utilisant les étiquettes du LLM quotidien, ils calculent exactement quel pourcentage d'articles dans chaque compartiment est réellement « généré par l'IA ». Cela crée une table de correspondance : « Si le modèle bon marché indique qu'un article est dans le compartiment 80–90 %, il y a 95 % de chances qu'il soit réellement généré par l'IA. »
- Mesure Instantanée : Désormais, pour toute nouvelle expérience, ils n'ont pas besoin d'appeler l'IA coûteuse. Ils regardent simplement les scores du modèle bon marché pour les articles de cette expérience, voient dans quels compartiments ils tombent, et utilisent la carte précalculée pour connaître instantanément la prévalence.
Les Résultats : Capturer les Murmures
L'équipe a testé ce système par rapport aux mesures du « gold standard » (le LLM) dans des expériences réelles. Les résultats sont impressionnants :
- Échelle : Le système sert actuellement environ 100 expériences et 250 groupes différents (bras) chaque jour.
- Efficacité : Comparé à l'ancienne méthode consistant à effectuer un contrôle unique et coûteux par expérience, ce nouveau système fournit des mesures quotidiennes pour plus de 20 fois plus d'expériences simultanées avec le même budget d'étiquetage.
- Précision : Dans environ 300 audits de production, l'intervalle de confiance à 95 % du système contenait la réponse du LLM coûteux 92 % du temps. Cela signifie que la méthode rapide et bon marché est presque aussi fiable que la méthode coûteuse.
- Sensibilité : La découverte la plus excitante concernait la détection de petits changements. Dans une expérience, le nouveau système a détecté une réduction relative de 4,2 % constante d'un type de contenu spécifique. Un contrôle unique et coûteux par LLM sur cette même expérience aurait totalement manqué cela car le bruit était trop élevé. En agrégeant les données quotidiennes, le nouveau système a pu entendre le « murmure » que le microphone coûteux avait manqué.
Pourquoi cela importe
Il ne s'agit pas seulement d'économiser de l'argent ; il s'agit de prendre de meilleures décisions. Avant ce système, les équipes devaient peut-être renoncer à mesurer la prévalence du contenu dans de nombreuses expériences car cela était trop coûteux. Ou bien, elles pouvaient prendre des décisions basées sur un point de donnée unique et bruyant qui manquait des tendances subtiles mais importantes.
En « calibrant globalement et en mesurant partout », l'équipe a créé un système où le coût de l'IA coûteuse est payé une seule fois (ou amorti) et est ensuite réutilisé des milliers de fois. Cela transforme un processus lent et coûteux en une routine quotidienne et réutilisable. Cela permet aux équipes produit de voir l'image complète de la manière dont leurs changements affectent l'exposition au contenu, garantissant que la plateforme reste sûre, de haute qualité et engageante pour tous, sans se ruiner.
Le papier souligne qu'il s'agit d'une réussite au niveau du système, et non d'une simple nouvelle formule mathématique. Il s'agit de construire un pipeline qui prend une tâche récurrente et coûteuse et la transforme en un actif réutilisable. Bien que le papier note que les coûts des LLM pourraient baisser à l'avenir, rendant l'étiquetage direct moins cher, la logique de ce système — utiliser une calibration globale pour mettre l'échelle des mesures — reste un outil puissant pour gérer des expériences complexes et de grande ampleur aujourd'hui.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.