← Derniers articles
🤖 machine learning

A More Accurate Algorithm Comparison through A/B Testing using Offline Evaluation Methods

Cet article remet en question la vision conventionnelle selon laquelle l'A/B testing est toujours supérieur à l'évaluation hors ligne en révélant que l'A/B testing peut souffrir de taux d'erreur de sélection plus élevés en raison d'un manque de corrélation positive, et propose un nouvel estimateur qui induit intentionnellement cette corrélation par une comparaison par étapes avec un algorithme intermédiaire hypothétique afin de réduire considérablement les données nécessaires pour une sélection d'algorithme précise.

Auteurs originaux : Koki Konishi, Masataka Ushiku, Yuta Saito

Publié 2026-07-03
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Koki Konishi, Masataka Ushiku, Yuta Saito

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le gros problème : Choisir la meilleure recette

Imaginez que vous tenez un restaurant et que vous hésitez entre deux nouvelles recettes de soupe : la Recette A et la Recette B. Vous voulez savoir laquelle les clients préfèrent afin de la servir à tout le monde.

Habituellement, la « référence » (la meilleure façon de faire cela) est le Test A/B. Vous servez la Recette A à la moitié de vos clients et la Recette B à l'autre moitié, puis vous comptez les compliments. C'est considéré comme la méthode la plus précise car vous testez sur des données réelles et fraîches.

Cependant, il y a un piège :

  1. C'est coûteux et risqué : Si la Recette B est terrible, vous risquez de gâcher l'expérience de la moitié de vos clients et de perdre de l'argent pendant que vous le découvrez.
  2. Cela nécessite beaucoup de données : Pour en être sûr à 100 %, vous devez servir des milliers de bols.

C'est pourquoi de nombreux restaurants tentent d'abord l'Évaluation Hors-ligne (Offline Evaluation). C'est comme demander à votre chef cuisinier de goûter la soupe en se basant sur un livre de recettes (données historiques) sans réellement la servir aux clients. C'est sûr et peu coûteux, mais c'est généralement moins précis qu'un véritable test de dégustation.

La découverte surprenante

Les auteurs de cet article ont mené un test et ont découvert quelque chose de très étrange et contre-intuitif :

Parfois, la méthode « sûre » (Évaluation Hors-ligne) est en réalité meilleure pour désigner le vainqueur que la « Référence » (Test A/B).

Dans leur expérience, la méthode standard de test A/B (qu'ils appellent AVG) a commis des erreurs environ 27 % du temps, tandis que la méthode hors-ligne n'en a commis que 9 %.

Pourquoi la « Référence » a-t-elle échoué ?
Imaginez que vous jugiez deux coureurs, Alice et Bob.

  • La méthode de Test A/B (AVG) envoie Alice sur une piste à New York et Bob sur une piste à Londres. Ils courent séparément. Vous mesurez leurs temps de manière indépendante. Comme ils sont dans des lieux différents, leurs temps n'ont aucun lien entre eux. Si Alice passe une mauvaise journée et que Bob passe une excellente journée, vous pourriez croire à tort que Bob est plus rapide, même si Alice est en réalité la meilleure coureuse.
  • La méthode Hors-ligne (IPS) fait courir Alice et Bob sur la même piste au même moment. Comme ils courent sous les mêmes conditions (même météo, même qualité de piste), leurs temps sont corrélés. Si la piste est boueuse, les deux courent plus lentement. S'il fait beau, les deux courent plus vite. Cette « condition partagée » annule le bruit, ce qui permet de voir plus facilement qui est réellement le plus rapide.

L'article soutient que le test A/B échoue parce qu'il traite les deux algorithmes comme s'ils étaient dans des mondes complètement séparés, manquant ainsi l'avantage de les comparer côte à côte.

La solution : L'intermédiaire (MID)

Les auteurs proposent une nouvelle méthode appelée MID (Middle-In-Difference ou Différence par l'Intermédiaire). Ils veulent la sécurité du test A/B (utiliser des données réelles) mais la précision de la méthode hors-ligne (comparer les choses côte à côte).

Voici comment ils procèdent, en utilisant l'analogie du Tir à la corde :

  1. La configuration : Vous avez l'Équipe A (Algorithme A) et l'Équipe B (Algorithme B). Vous voulez savoir laquelle est la plus forte.
  2. Le problème : Si vous les faites simplement s'affronter directement, la corde pourrait être trop longue et instable (variance élevée).
  3. L'astuce (L'algorithme du milieu) : Les auteurs inventent une « Équipe du Milieu » hypothétique (Équipe M). Cette équipe est un mélange parfait de l'Équipe A et de l'Équipe B.
  4. La course étape par étape :
    • Premièrement, vous faites courir l'Équipe A contre l'Équipe M. Vous utilisez les données provenant du côté de l'Équipe A du test A/B. Comme elles font la course contre un adversaire similaire (l'Équipe M), les résultats sont stables.
    • Deuxièmement, vous faites courir l'Équipe B contre l'Équipe M. Vous utilisez les données provenant du côté de l'Équipe B du test A/B.
    • Enfin, vous additionnez les deux résultats pour voir qui est le plus fort entre A et B.

Pourquoi cela fonctionne :
En introduisant l'« Équipe du Milieu », vous forcez les deux comparaisons à partager un point de référence commun. Tout comme la méthode hors-ligne, cela crée une corrélation positive. Même si l'Équipe A et l'Équipe B sont dans des groupes différents, elles sont toutes deux mesurées par rapport à la même « Équipe du Milieu ». Cela annule le bruit aléatoire et rend la décision finale beaucoup plus précise.

Les résultats

Les auteurs ont testé cela sur des données réelles provenant d'une application de recommandation de vidéos (comme TikTok ou YouTube).

  • Efficacité : La nouvelle méthode MID a été capable de choisir le meilleur algorithme avec la moitié (voire le quart) de la quantité de données requise par la méthode standard de test A/B.
  • Stabilité : Lorsque les deux algorithmes étaient très différents l'un de l'autre (ce qui casse habituellement les méthodes hors-ligne), la méthode MID fonctionnait toujours parfaitement.
  • Précision : Elle a commis moins d'erreurs que le test A/B standard et que la méthode hors-ligne.

Résumé

L'article dit : « Nous avons découvert que la façon standard de réaliser des tests A/B est en fait un peu maladroite car elle ne compare pas les deux options équitablement, côte à côte. Nous avons inventé une nouvelle astuce utilisant un "Algorithme du Milieu" pour forcer une comparaison équitable. Cette nouvelle astuce nous permet de trouver le vainqueur plus rapidement, avec moins de données et avec moins d'erreurs. »

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →