← Derniers articles
📊 statistics

funOCLUST: Clustering Functional Data with Outliers

Le papier propose funOCLUST, une extension robuste de l'algorithme OCLUST conçue pour regrouper des données fonctionnelles et identifier efficacement les valeurs aberrantes en abordant les défis de la dimensionnalité infinie et de la sensibilité aux anomalies.

Auteurs originaux : Katharine M. Clark, Paul D. McNicholas

Publié 2026-07-14
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Katharine M. Clark, Paul D. McNicholas

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez une boîte géante de spaghetti. Mais ce ne sont pas des nouilles ordinaires ; ce sont des lignes sinueuses et ondulantes représentant des choses comme les changements de température au cours d'une journée, le flux de trafic ou la croissance d'une plante. Dans le monde de la science des données, on appelle cela des données fonctionnelles. Le problème ? Ces lignes sont infiniment dimensionnelles (elles possèdent une infinité de points) et elles sont désordonnées. Parfois, une nouille présente une bosse bizarre, ou tout un lot est déréglé par une tempête soudaine, créant des « valeurs aberrantes » (outliers) qui gâchent la fête.

Entrez en scène funOCLUST, une nouvelle méthode proposée par Katharine M. Clark et Paul D. McNicholas. Voyez funOCLUST comme un chef super intelligent, bien qu'un peu grincheux, qui veut trier ces spaghettis en tas parfaits selon leur forme, mais qui doit d'abord expulser les morceaux brûlés, cassés ou étranges qui ne correspondent pas.

La grande idée : Transformer les sinuosités en vecteurs

On ne peut pas simplement jeter de l'infini spaghetti dans une machine de tri standard ; c'est trop complexe. Les auteurs suggèrent une astuce ingénieuse : aplatir les courbes.

Ils utilisent ce qu'on appelle une base de B-splines cubiques. Imaginez que vous preniez chaque ligne sinueuse et que vous la décriviez non pas par ses points infinis, mais par une courte liste de nombres (des coefficients) qui vous indiquent comment construire cette ligne à l'aide d'un ensemble spécifique de blocs de construction. C'est comme transformer une peinture complexe en une simple fiche de recette. Une fois que les courbes sont transformées en ces courtes listes de nombres (des vecteurs), le problème devient beaucoup plus facile à gérer.

La chasse aux « valeurs aberrantes » : Le jeu de la log-vraisemblance

C'est ici que la magie opère. Les auteurs prennent une méthode existante appelée OCLUST (conçue pour les données classiques) et l'adaptent à ces nouvelles « fiches de recettes ».

L'algorithme joue au jeu du « Et si on enlevait celui-là ? » :

  1. Il examine l'ensemble du groupe de courbes.
  2. Il demande : « Si je mets cette courbe spécifique à la porte, est-ce que le groupe restant ressemble davantage à un groupe parfait et ordonné ? »
  3. Il mesure cela à l'aide de ce qu'on appelle la log-vraisemblance de sous-ensemble. Voyez cela comme un « score de rangement ». Si le retrait d'une courbe fait bondir le score de manière significative, cette courbe était probablement la perturbatrice.
  4. L'algorithme vérifie si les « perturbateurs » suivent un modèle mathématique spécifique (une distribution bêta décalée et mise à l'échelle). Si les courbes bizarres correspondent à ce modèle, elles sont officiellement expulsées en tant que valeurs aberrantes.

Les auteurs ont prouvé (mathématiquement) que si les courbes sont générées par un modèle de mélange gaussien standard, le « score de rangement » change de manière prévisible lorsqu'on retire une courbe normale. Si le score change trop radicalement, la courbe est une valeur aberrante.

Ce que le papier dit (et ne dit pas)

Les auteurs ont testé les compétences de leur chef en utilisant 100 jeux de données simulés. Ils ont créé 8 scénarios différents, en variant les plaisirs :

  • Clusters : Parfois il y avait 2 groupes, parfois 5.
  • Complexité : Certaines courbes étaient simples (comme une ligne droite), d'autres étaient sauvages (avec des bosses et des ondulations).
  • Rareté (Sparsity) : Parfois les données étaient denses (beaucoup de points), parfois éparses (beaucoup de points manquants).
  • Valeurs aberrantes : Ils ont créé deux types de perturbateurs. Certains étaient de type « décalage-échelle » (toute la courbe a grandi ou s'est déplacée), et d'autres étaient de type « queue épaisse » (erreurs aléatoires et sauvages).

Les résultats :

  • Erreurs à queue épaisse (Heavy-Tail) : Lorsque les données présentaient des erreurs aléatoires et sauvages (queues épaisses), funOCLUST a été le grand vainqueur, battant des concurrents comme funHDDC, T-funHDDC et tkmeans.
  • Erreurs de décalage-échelle (Shift-Scale) : Lorsque les valeurs aberrantes étaient simplement des versions décalées ou mises à l'échelle des courbes normales, tkmeans (une méthode k-moyennes tronquée) a en réalité été légèrement plus performant, bien que funOCLUST ait tout de même tenu son rang.
  • Test réel 1 (Trafic piétonnier) : Ils ont testé cela sur le trafic piétonnier horaire à Melbourne. L'algorithme a réussi à séparer les jours ouvrables des week-ends/jours fériés. Il a correctement identifié 22 jours « aberrants », incluant le Nouvel An, Noël et le Nouvel An chinois. C'étaient des jours où le schéma de trafic ne correspondait pas au modèle habituel des jours de semaine ou des week-ends.
  • Test réel 2 (Données NOx) : Ils ont testé la méthode sur des données de pollution atmosphérique (niveaux de NOx) à Barcelone. La méthode a atteint un taux de classification correcte (CCR) compris entre 0,51 et 0,86, selon les paramètres du modèle. Le meilleur réglage (structure de covariance EEE) a atteint 0,86, ce qui est de l'ordre des meilleures méthodes.

Ce que le papier écarte

Les auteurs sont prudents quant à ce que leur méthode n'est pas.

  • Ils précisent explicitement que, bien que certaines méthodes tentent de regrouper les données dans des « sous-espaces » (en réduisant les dimensions d'une certaine manière), funOCLUST conserve l'intégralité du domaine fonctionnel. Ils soutiennent que, parfois, on a besoin de l'image complète, pas seulement d'une tranche.
  • Ils notent que leur méthode repose sur l'hypothèse que les « fiches de recettes » (coefficients) proviennent d'une distribution normale multivariée. Si les données sont radicalement asymétriques ou ne correspondent pas à cela, la méthode pourrait avoir des difficultés (bien qu'ils suggèrent qu'elle est assez robuste pour de nombreux cas réels).
  • Ils ne prétendent pas que cela constitue un « problème résolu » pour toutes les données fonctionnelles. En fait, dans leurs simulations, lorsque les données présentaient 5 clusters avec une grande complexité et des données éparses, le taux de faux négatifs (manquer une valeur aberrante) est monté à 51 %. Ils admettent que la détection de valeurs aberrantes dans ces conditions spécifiques et désordonnées est intrinsèquement difficile.

Le verdict

L'article suggère que funOCLUST est un nouvel outil robuste. Ce n'est pas une baguette magique qui répare tout instantanément, mais c'est un candidat très sérieux, surtout quand les données sont bruitées ou présentent des erreurs à queue épaisse.

Les auteurs concluent que c'est la première extension d'OCLUST aux données fonctionnelles. Ils voient cela comme une étape. Ils suggèrent qu'à l'avenir, cela pourrait être étendu pour gérer des données asymétriques ou même pour que la « recette » (la décomposition de base) soit estimée à l'intérieur de l'algorithme de clustering, plutôt que comme une simple première étape.

Ainsi, si vous avez une boîte de spaghettis désordonnés et sinueux et que vous devez les trier tout en expulsant les morceaux brûlés, funOCLUST est un chef que l'on peut engager — ne vous attendez simplement pas à ce qu'il fonctionne parfaitement si les spaghettis sont trop bizarres et que la cuisine est trop sombre !

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →