← Derniers articles
🤖 machine learning

FloDR: An invertible dimensionality reduction method based on a normalising flow

FloDR est une méthode de réduction de dimensionnalité inversible basée sur les flux de normalisation qui préserve l'information de haute dimension en conservant les coordonnées inutilisées, permettant la génération de visualisations diagnostiques telles que l'étalement conditionnel et le contraste caché pour quantifier la fiabilité et la perte d'information des plongements en 2D.

Auteurs originaux : Abdallah Baraka, Daniel Probst

Publié 2026-07-30
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Abdallah Baraka, Daniel Probst

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez de faire entrer une sculpture géante, tridimensionnelle, dans une photographie plate, en deux dimensions. Peu importe la façon dont vous tournez la sculpture, certaines parties se chevaucheront, certaines distances s'étireront, et certains détails seront écrasés jusqu'à l'inexistence. C'est le combat quotidien des scientifiques des données travaillant avec des « données de haute dimension ». Qu'il s'agisse de millions de pixels dans une image, de milliers de réactions chimiques ou du code génétique complexe d'une seule cellule, cette information vit dans un monde possédant des centaines, voire des milliers de directions. Pour lui donner un sens, nous utilisons la « réduction de dimensionnalité » pour l'écraser sur une carte plate que nous pouvons réellement voir.

Mais voici le piège : quand on écrase un objet 3D en 2D, on perd de l'information. Les outils traditionnels comme t-SNE ou UMAP sont comme des photographes habiles qui prennent une excellente photo, mais qui jettent les données de « profondeur ». Une fois la photo prise, on ne peut plus dire si deux points qui semblent proches sont réellement des voisins dans le monde réel, ou s'ils sont simplement tombés l'un sur l'autre par accident. On ne peut pas non plus savoir quelle partie de la forme originale de l'objet est cachée derrière la surface plane. Les scientifiques craignent depuis longtemps que les gens accordent trop d'importance à ces cartes plates, devinant des distances et des regroupements que la carte est simplement incapable de supporter. La grande question a été : pouvons-nous créer une carte qui soit esthétique, qui préserve la vue d'ensemble, et qui nous dise aussi exactement ce que nous ne savons pas ?

Entrez en scène FloDR, une nouvelle méthode qui agit moins comme un appareil photo que comme un projecteur magique et réversible. Au lieu de simplement prendre un cliché et de jeter le reste des données, FloDR utilise un moteur mathématique spécial appelé « flux normalisant » (normalizing flow). Pensez à ce moteur comme à une feuille transparente et extensible qui peut être pliée et tordue pour aplatir les données, mais avec un superpouvoir : elle ne déchire jamais ni ne perd le tissu. Elle garde l'information de « profondeur » en sécurité dans une poche cachée.

L'article présente FloDR comme un moyen de créer ces cartes 2D tout en conservant une sauvegarde secrète de toute l'information perdue. Lorsque vous regardez la carte, vous voyez les deux premières coordonnées, tout comme une photo normale. Mais sous le capot, FloDR se souvient des D2D-2 autres dimensions (les « résidus »). Parce que les mathématiques sont parfaitement réversibles, les auteurs peuvent faire fonctionner la carte à l'envers pour poser des questions telles que : « Si je choisis cet endroit sur la carte, quelle part des données originales est encore un mystère ? » ou « Quelle quantité d'information concernant un étiquette spécifique (comme un type de cellule) ai-je accidentellement jetée ? »

Les chercheurs ont découvert que FloDR est un sérieux concurrent des outils les plus populaires. Sur quatre ensembles de données de référence différents — incluant des images de chiffres manuscrits et des données de réactions chimiques — FloDR a réussi à préserver les voisinages locaux (les petits groupes de choses similaires) presque aussi bien que les meilleures méthodes existantes, tout en faisant un bien meilleur travail pour préserver la structure globale (la façon dont les grands groupes sont liés entre eux). En fait, sur les ensembles de données testés, FloDR s'est montré meilleur que UMAP pour équilibrer simultanément la structure locale et globale.

Cependant, l'article prend soin de ne pas prétendre que FloDR est parfait en tout. Il note explicitement que si votre seul objectif est de maintenir des voisinages locaux minuscules parfaits, un autre outil appelé openTSNE est encore légèrement meilleur. FloDR admet également que, bien qu'il puisse projeter de nouveaux points de données non vus sur la carte en un instant, ces points pourraient ne pas atterrir dans le exact bon voisinage local à moins d'effectuer une étape d'optimisation supplémentaire rapide. Mais pour l'essentiel, FloDR offre un scénario de « meilleur des deux mondes » : une carte qui semble juste, qui est cohérente, et qui vient avec un « compteur de vérité » intégré.

Ce compteur de vérité est la caractéristique la plus ludique et la plus puissante de l'article. FloDR génère deux « champs de diagnostic » spéciaux que vous pouvez peindre sur la carte :

  1. Dispersion Conditionnelle : Imaginez un brouillard qui s'épaissit dans certaines zones. Ce brouillard vous indique à quel point les données originales varient à cet endroit. Si le brouillard est épais, cela signifie que la carte a compressé ensemble des éléments qui étaient très différents dans le monde réel.
  2. Contraste Caché : C'est comme un « anneau de décodage secret ». Il vous indique quelle quantité d'information sur une étiquette spécifique (comme « est-ce une cellule cancéreuse ? ») est cachée dans les parties des données que vous ne voyez pas. Si le contraste caché est élevé en un point, cela signifie que la carte 2D cache une différence majeure entre les groupes présents là.

Crucialement, les auteurs n'ont pas seulement deviné ces valeurs ; ils les ont testées rigoureusement. Ils ont divisé leurs données, entraîné la carte sur une partie, puis ont tenté de prédire l'autre partie pour voir si les champs de diagnostic disaient la vérité. Ils ont constaté que, pour la plupart des ensembles de données, ces champs passaient le test avec une grande confiance. Par exemple, sur un ensemble de données de cellules de moelle osseuse fœtale humaine, le contraste caché a été certifié avec une p-valeur de 0,01, ce qui signifie que le signal était très fort et n'était pas simplement du bruit aléatoire.

En fin de compte, FloDR ne vous donne pas seulement une jolie image ; il vous donne une image accompagnée d'un manuel qui explique ses propres limites. Il montre où la carte est digne de confiance et où elle n'est qu'une illusion. En gardant les données « résiduelles » en sécurité et en utilisant un tour mathématique réversible, il permet aux scientifiques de voir non seulement la forme de leurs données, mais aussi les ombres qu'elles projettent, garantissant qu'ils ne tirent pas de conclusions que la projection était incapable de supporter.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →