← Derniers articles
📊 statistics

Maximum Mean Discrepancy with Unequal Sample Sizes via Generalized U-Statistics

Cet article étend le test de comparaison de deux échantillons par la divergence de moyenne maximale (MMD) à des tailles d'échantillons inégales en exploitant les U-statistiques généralisées, éliminant ainsi la nécessité de rejeter des données, fournissant de nouvelles caractérisations asymptotiques et des critères d'optimisation de la puissance, et clarifiant la relation entre les estimateurs dégénérés et les valeurs de MMD non nulles.

Auteurs originaux : Aaron Wei, Milad Jalali, Danica J. Sutherland

Publié 2026-07-10
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Aaron Wei, Milad Jalali, Danica J. Sutherland

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un détective tentant de résoudre un mystère : ces deux tas de données sont-ils réellement différents, ou ne sont-ils que du bruit aléatoire provenant de la même source ?

Dans le monde de l'apprentissage automatique, c'est ce qu'on appelle un « test de deux échantillons ». Vous avez un tas de photos d'un groupe de contrôle (appelons-le le Tas A) et un tas provenant d'un groupe de traitement (appelons-le le Tas B). Votre tâche est de déterminer si le traitement a changé quelque chose. Pour ce faire, les détectives utilisent un outil appelé Discrépance de Moyenne Maximale (MMD - Maximum Mean Discrepancy). Considérez la MMD comme une balance ultra-sensible qui pèse la « forme » des nuages de données. Si les nuages ont des apparences différentes, la balance penche, et vous savez qu'il y a une différence.

L'ancien problème : La règle des « côtés égaux »

Pendant longtemps, cette balance avait une règle étrange et agaçante : elle ne fonctionnait que si vous aviez exactement le même nombre de photos dans le Tas A et dans le Tas B.

Dans le monde réel, c'est un cauchemar. Peut-être avez-vous 1 000 photos d'une maladie rare (le Tas A) et 10 000 photos de personnes en bonne santé (le Tas B). Les anciennes méthodes disaient : « Oh non, nous ne pouvons pas utiliser cela ! Nous devons jeter 9 000 de vos photos de personnes en bonne santé pour que les tas correspondent. » C'est comme jeter 90 % de vos preuves simplement parce que les boîtes n'ont pas la même taille. Cela gaspille des données et rend votre test plus faible.

La nouvelle solution : La balance « généralisée »

Ce document présente une nouvelle façon d'utiliser l'échelle MMD qui ne se soucie pas de l'égalité de la taille des tas. Les auteurs, Aaron Wei, Milad Jalali et Danica J. Sutherland, ont trouvé comment faire fonctionner les mathématiques même lorsqu'un tas est minuscule et l'autre énorme.

Ils ont réussi cela en mettant à jour les mathématiques, passant d'une « statistique en U » standard (qui nécessite des côtés égaux) à une « statistique en U généralisée ».

Voici le tour de magie qu'ils ont découvert :
Au lieu de calculer l'échelle du résultat en fonction du nombre total de photos (ce qui devient complexe lorsque les tailles sont différentes), ils ont découvert qu'il faut l'échelonner en fonction du plus petit tas.

  • Ancienne méthode : Échelonner par nA+nBn_A + n_B.
  • Nouvelle méthode : Échelonner par min(nA,nB)\min(n_A, n_B).

Ils ont prouvé mathématiquement que si vous utilisez la taille du plus petit tas comme règle, les résultats restent stables et précis, peu importe à quel point vos données sont disproportionnées. Ils ont même montré que si vous avez un petit tas de 100 éléments et un tas géant de 10 000, vous pouvez toujours obtenir une réponse très précise en utilisant les 100 comme ancre.

Un rebondissement surprenant : Le mystère de la « dégénérescence »

Tout en résolvant le problème de la taille, les auteurs sont tombés sur quelque chose qui pourrait surprendre d'autres experts du domaine concernant la relation entre le score MMD et la « dégénérescence » des mathématiques.

Habituellement, les gens pensent : « Si le score M می‌شود zéro, les deux tas sont identiques, et les mathématiques deviennent "dégénérées" (ce qui signifie que la variance est nulle). »
Mais les auteurs ont prouvé que l'inverse n'est pas toujours vrai. Ils ont montré qu'il est parfois possible d'avoir un estimateur dégénéré (variance nulle) même lorsque le score MMD n'est PAS nul.

En d'autres termes, vous pouvez avoir une situation où les deux tas sont différents (le MMD est donc non nul), mais où les mathématiques se comportent de manière « dégénérée », ce qui arrive habituellement lorsque les tas sont identiques. Ils ont construit un exemple spécifique où les tas sont distincts, pourtant l'estimateur est dégénéré. Cependant, ils ont également prouvé que dans la plupart des situations réelles et courantes (comme l'utilisation de noyaux gausiens standards sur des données aux formes qui se chevauchent), ce scénario étrange de « MMD non nul mais dégénéré » ne se produit pas. Ainsi, pour des raisons pratiques, vous n'avez pas besoin de paniquer, mais les mathématiques sont désormais plus honnêtes vis-à-vis de ces cas limites.

Le « Power-Up » : Utiliser toutes vos données

Le meilleur aspect de cette nouvelle méthode est qu'elle vous permet d'utiliser chaque morceau de donnée dont vous disposez.

  • L'ancienne méthode : Si vous aviez 1 000 cas rares et 10 000 cas communs, vous jetiez 9 000 cas communs pour rendre le combat équitable.
  • La nouvelle méthode : Vous gardez les 11 000.

Les auteurs ont mené des simulations utilisant des données d'images réelles (CIFAR-10 et CIFAR-10.1). Ils ont mis en place un test où un groupe avait 1 000 images et l'autre avait r×1000r \times 1 000 images (où rr était 1, 2, 4 ou 8).

  • Lorsqu'ils ont utilisé l'ancienne méthode (en jetant des données), la puissance du test était correcte.
  • Lorsqu'ils ont utilisé la nouvelle méthode (en gardant toutes les données), le test est devenu significativement plus puissant.
  • Dans leurs expériences, avec un ratio de 8 contre 1, la nouvelle méthode a détecté la différence 99,9 % du temps, contre seulement 82,1 % pour l'ancienne méthode.

Ce qu'ils n'ont pas fait (Et ce qu'ils ont écarté)

Il est important de savoir ce que ce document ne prétend pas :

  • Ils n'ont pas inventé une nouvelle façon de choisir le meilleur noyau (la « lentille » à travers laquelle vous regardez). Ils ont simplement montré comment utiliser les méthodes de meilleurs noyaux existantes lorsque les tailles d'échantillons sont inégales.
  • Ils n'ont pas dit que cela fonctionne pour toutes les bizarreries mathématiques possibles. Ils ont prouvé que cela fonctionne pour les « situations courantes » (comme les noyaux continus avec des données qui se chevauchent). Si les données se trouvent dans deux mondes complètement séparés et disjoints (comme des données qui ne se touchent jamais), les mathématiques deviennent complexes, et ils admettent ne pas avoir encore pleinement résolu ce cas limite spécifique.
  • Ils n'ont pas prétendu avoir résolu le problème du « test de permutation » (une façon de définir la note de passage pour le test). Ils utilisent toujours le test de permutation pour fixer le seuil, mais ils peuvent désormais le faire avec des piles inégales.

L'essentiel

Les auteurs ont construit un pont. Auparavant, si vos tas de données avaient des tailles différentes, vous deviez couper l'excédent et espérer que tout se passe bien. Désormais, vous pouvez injecter tout votre tas, même s'il est désordonné et inégal, dans l'échelle MMD. Les mathématiques tiennent la route, le test devient plus fort, et vous n'avez pas à jeter de précieuses preuves.

Ils ont prouvé cela avec des mathématiques rigoureuses (théorèmes sur les distributions asymptotiques) et l'ont étayé par des simulations sur des ensembles de données d'images réelles. C'est une mise à jour solide et pratique pour quiconque cherche à comparer deux groupes de données qui ne sont pas de même taille.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →