Résumé technique : Faire progresser la mesure de la pertinence avec les modèles vision-langage pour la recherche à l'échelle du Web
Énoncé du problème
Dans les systèmes de recherche personnalisée comme Pinterest, garantir que les résultats de recherche s'alignent sur l'intention de l'utilisateur (pertinence sémantique) est crucial. Bien que les mesures d'engagement utilisateur (clics, enregistrements) soient facilement collectées, elles ne reflètent souvent pas la véritable pertinence sémantique en raison de facteurs de confusion tels que le biais de position, les effets de présentation et l'attention. Par conséquent, l'évaluation de la pertinence sert de « garde-fou » nécessaire dans les expériences A/B en ligne pour détecter les compromis où l'engagement pourrait augmenter tandis que la pertinence se dégrade.
Traditionnellement, l'évaluation de la pertinence repose sur l'annotation humaine. Cependant, cette approche est contrainte par des coûts élevés, des délais d'exécution longs et une extensibilité limitée. Ces goulots d'étranglements imposent des conceptions de mesure avec de petits échantillons, qui ne peuvent détecter que des mouvements de métriques importants et échouent à capturer les effets de traitement hétérogènes ou les améliorations mineures mais significatives. Le document traite de la nécessité d'un système d'évaluation de la pertinence automatisé, évolutif, rentable et fiable, capable de fonctionner à l'échelle du Web.
Méthodologie
1. Modèles Vision-Langage (VLM) affinés
Les auteurs proposent un pipeline de bout en bout utilisant des modèles vision-langage open-source affinés (spécifiquement la série Qwen3-VL) pour automatiser l'étiquetage de la pertinence.
- Représentation des entrées : Le modèle traite une entrée multimodale composée du texte de la requête de recherche, de l'image de l'Épingle (Pin), et de métadonnées textuelles complètes (titre/description de l'Épingle, titre/description de la page de destination, titres des tableaux, et requêtes historiquement très engagées).
- Entraînement : Le modèle est affiné sur environ 0,8 million de paires requête-Épingle annotées par des humains en utilisant une échelle de notation à 5 niveaux (Très pertinent à Très non pertinent). L'objectif est de prédire le score de pertinence (1–5) en minimant la perte de cross-entropie.
- Inférence : Le modèle produit un niveau de pertinence prédit via l'argmax sur les logits de sortie. Le système exploite les capacités multilingues de Qwen3-VL pour prendre en charge plusieurs langues.
2. Conception d'échantillonnage stratifié
La réduction des coûts et du temps d'étiquetage fournie par les VLM permet de passer d'un échantillonnage aléatoire simple à un plan d'échantillonnage de requêtes stratifié plus sophistiqué.
- Justification : La variance de la pertinence est principalement pilotée par les différences entre les requêtes (intention, qualité du contenu, profondeur de l'inventaire). La stratification cible cette structure de variance.
- Mise en œuvre : Les requêtes sont stratifiées en fonction des catégories d'intérêt et des segments de popularité (Tête, Torse, Queue, Unique).
- Bénéfice statistique : En éliminant la composante de variance « entre les strates », l'échantillonnage stratifié réduit considérablement la variance de la moyenne de l'échantillon. Cela abaisse directement l'effet minimum détectable (MDE), permettant au système de détecter des changements plus petits et significatifs dans la performance du classement de recherche.
- Comparaison : Les auteurs notent que les techniques alternatives de réduction de la variance comme CUPED sont moins adaptées en raison de la nature dynamique de l'inventaire de Pinterest et de l'exigence de covariables pré-traitement, ce qui compromettrait la généralisabilité ou doublerait les coûts d'annotation.
3. Pipeline de mesure de la pertinence
Le pipeline d'évaluation pour les expériences A/B implique :
- Échantillonnage : Sélection de requêtes de recherche appariées entre les groupes de contrôle et de traitement pour bloquer les différences entre requêtes.
- Étiquetage : Le VLM affiné génère des étiquettes de pertinence pour les K premiers (fixés à 25) résultats de recherche pour chaque requête.
- Calcul de la métrique : Le système calcule un $sDCG@K$ au niveau de la requête (une variante de $nDCG@K$ supposant un approvisionnement infini de documents hautement pertinents) et les agrège pour dériver les métriques de l'expérience.
- Analyse : Les effets de traitement hétérogènes sont analysés à travers les strates, avec des taux de fausses découvertes contrôlés via la procédure de Benjamini-Hochberg.
Résultats clés
Alignement avec les jugements humains (RQ1)
Le système a été rigoureusement validé par rapport aux annotations humaines :
- Précision : Le taux de correspondance exacte entre les étiquettes du VLM et celles des humains est de 82,9 %, avec 94,2 % des évaluations différant de plus ou moins un point.
- Accord : Le coefficient Kappa pondéré quadratique (QWK) est de 0,507, indiquant un bon accord ordinal.
- Corrélation de rang : Le τ de Kendall est de 0,534 et le ρ de Spearman est de 0,668, montrant un fort alignement dans le classement.
- Métriques d'erreur : L'erreur moyenne du $sDCG@K$ au niveau de la requête reste dans une marge de 0,03 à travers tous les segments de popularité. Crucialement, l'erreur de différence appariée (utilisée pour les tests A/B) a une magnitude négligeable, éliminant le léger biais positif observé dans les erreurs de groupe unique. Cela confirme la robustesse du design expérimental apparié contre le biais d'étiquetage du VLM.
- Sélection du modèle : Bien que Qwen3-VL-8B ait performé de manière similaire à la variante 4B, le Qwen3-VL-4B a été sélectionné pour la production en raison de sa distribution d'erreur serrée et de son coût computationnel moindre. Il a nettement surpassé la ligne de base textuelle XLM-RoBERTa, particulièrement en termes de réduction de la variance.
Sensibilité et efficacité des métriques (RQ2)
La transition vers l'étiquetage par VLM avec un échantillonnage stratifié a produit des améliorations substantielles de la sensibilité expérimentale :
- Réduction du MDE : Le Minimum Detectable Effect (MDE) a été réduit d'une plage de 1,3 %–1,5 % à ≤ 0,25 %, représentant une amélioration de la sensibilité de 6×.
- Réduction de la variance : La stratification seule a réduit la variance de la métrique (σ^) de 52 % par rapport à un échantillonnage aléatoire simple avec la même taille d'échantillon (n=2000). En combinant la stratification avec une augmentation de la taille de l'échantillon (n=5000), la réduction totale de la variance a atteint 67 %.
- Efficacité opérationnelle :
- Délai d'exécution : Amélioré de plus de 20× (de 2 jours à 2 heures).
- Coût : Coût par étiquette réduit de 99,98 % (de 0,10 aˋ2 \times 10^{-5} $).
- Échelle : Le système gère désormais 4× plus de tâches de mesure de pertinence qu'auparavant, permettant des évaluations plus larges et plus fréquentes.
Performance multilingue (RQ3)
Le système a été validé sur des marchés non anglophones (France, Allemagne, Brésil). Bien que les corrélations de rang soient légèrement inférieures à celles des marchés anglophones, elles restent modérées à fortes. Les erreurs de différence appariée sont restées étroitement concentrées autour de zéro, indiquant que l'approche se généralise efficacement aux requêtes non anglaises malgré le fait que les données d'entraînement soient principalement en anglais.
Signification et contributions
Le papier affirme que sa principale signification réside dans la conception et le déploiement de bout en bout d'un pipeline d'évaluation de la pertinence basé sur un VLM au sein d'un système d'expérimentation A/B réel à l'échelle industrielle chez Pinterest. Contrairement aux travaux académiques antérieurs qui se concentrent sur l'architecture du modèle ou les stratégies de prompting, ce travail démontre la viabilité pratique du remplacement de l'annotation humaine par des VLM affinés dans un environnement de production.
Les contributions clés incluent :
- Déploiement en production : Un pipeline validé couvrant les considérations pratiques, de l'affinage jusqu'aux tests A/B en ligne, ce que les auteurs affirment être la première approche complète de ce problème dans un système de recherche industriel.
- Sensibilité expérimentale : Démontrer que l'évaluation par VLM permet d'étendre les ensembles de requêtes et d'affiner les plans d'échantillonnage, menant à une réduction de 6× du MDE et une amélioration significative de la détection des changements de pertinence.
- Fiabilité : Prouver que les VLM affinés produisent des métriques étroitement alignées avec les jugements humains, avec un faible biais dans les différences appariées, ce qui en fait un substitut fiable à l'étiquetage humain pour la prise de décision à enjeux élevés.
Les auteurs concluent que cette approche offre des perspectives pratiques pour les praticiens de l'industrie cherchant à améliorer l'efficacité et la sensibilité de la mesure de la pertinence, tout en notant que les travaux futurs se concentreront sur l'extension de ces capacités à des contextes de recherche multimodale plus larges et sur la réduction de l'écart de performance dans les marchés non anglophones.