Galaxy Morphology Classification: Uncertainty Modeling and Out of Distribution Detection
Cet article présente un cadre complet pour la classification de la morphologie des galaxies utilisant le jeu de données Galaxy Zoo DECaLS qui combine la fonction de perte IsoMaxPlus avec le Dropout de Monte Carlo afin d'améliorer significativement la détection des données hors distribution et la quantification de l'incertitude tout en maintenant une grande précision de classification.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
L'univers est rempli de milliards de galaxies, chacune étant une vaste île d'étoiles, de gaz et de poussière. Depuis près d'un siècle, les astronomes classent ces îles cosmiques en familles selon leurs formes : certaines sont lisses et rondes comme de gigantesques boules de lumière, tandis que d'autres sont des spirales plates aux bras sinueux. Ce tri, connu sous le nom de classification morphologique, n'est pas seulement une question de catalogage ; la forme d'une galaxie raconte une histoire sur son passé, sa formation et ses évolutions au fil du temps. Cependant, à mesure que les télescopes modernes capturent des images du ciel avec une clarté et un volume sans précédent, le nombre de galaxies est devenu trop grand pour que l'œil humain puisse les examiner une par une. Pour tenir la cadence, les scientifiques se sont tournés vers l'intelligence artificielle, apprenant aux ordinateurs à reconnaître ces formes automatiquement. Mais il y a un piège : les programmes informatiques standards sont souvent trop sûrs d'eux. Lorsqu'ils rencontrent une galaxie étrange ou différente de tout ce qu'ils ont vu auparavant, ils vont quand même la forcer dans une catégorie connue et prétendre être certains, cachant potentiellement des découvertes rares ou nouvelles derrière un mur de fausse confiance.
Une équipe de chercheurs de l'Institut indien de technologie d'Hyderabad s'est donné pour mission de résoudre ce problème en construisant une manière plus intelligente pour les ordinateurs de classer les galaxies. Ils se sont concentrés sur un défi spécifique appelé détection « hors distribution » (out-of-distribution), qui consiste simplement à reconnaître lorsqu'une image n'appartient pas aux groupes connus. En utilisant une collection massive d'images de galaxies issues du Dark Energy Camera Legacy Survey, ils ont entraîné un système d'apprentissage profond pour non seulement identifier les neuf formes standards de galaxies, mais aussi pour admettre lorsqu'il était incertain. Les chercheurs ont testé trois approches différentes. La première était une méthode standard utilisée comme référence. La seconde introduisait une nouvelle technique qui mesure la distance entre les caractéristiques d'une galaxie et le centre de son groupe connu, plutôt que de simplement deviner une catégorie. La troisième combinait cette mesure de distance avec une méthode qui fait passer la même image dans le cerveau de l'ordinateur plusieurs fois avec de légères variations, permettant au système de jauger sa propre incertitude.
Les résultats ont montré que les nouvelles méthodes étaient bien supérieures à l'approche standard. Le système utilisant la technique basée sur la distance est devenu nettement meilleur pour repérer les galaxies inhabituelles, améliorant sa capacité à les identifier correctement comme « inconnues » de près de 90 % par rapport à la référence, tout en identifiant correctement les formes connues avec une précision de 97 %. Crucialement, ce système a appris l'humilité. Lorsqu'il rencontrait une galaxie difficile à classer ou qui ressemblait à un mélange de différents types, il ne forçait pas une étiquette. Au lieu de cela, il signalait son incertitude, souvent en montrant que la galaxie était éloignée du centre de n'importe quel groupe de formes connues. Ce comportement est vital pour les futures études du ciel, où l'objectif n'est pas seulement de compter ce que nous connaissons, mais de trouver le rare, l'étrange et l'inédit.
Les chercheurs ont également constaté que la combinaison de la méthode de distance avec la technique des passages multiples rendait le système encore plus fiable. En faisant passer l'image à travers le réseau de nombreuses fois, l'ordinateur pouvait voir si sa réponse changeait légèrement à chaque passage. Si la réponse vacillait, le système savait qu'il traitait un cas ambigu. Cette approche a réduit l'erreur dans les scores de confiance du système d'environ 73 %, ce qui signifie que lorsque l'ordinateur disait qu'il était sûr, il l'était réellement, et lorsqu'il disait qu'il était incertain, il identifiait correctement un cas difficile. L'étude a démontré qu'en changeant la façon dont l'ordinateur mesure la similitude — en se concentrant sur la distance géométrique plutôt que sur la simple probabilité — il pouvait créer une séparation plus claire entre les galaxies familières et celles qui sont véritablement nouvelles ou étranges.
Ce travail ne fait pas qu'améliorer la vitesse de classification ; il change la fiabilité de l'ensemble du processus. Par le passé, un système automatisé aurait pu étiqueter avec assurance une galaxie rare en cours de fusion comme une spirale commune, effaçant ainsi un événement cosmique unique des registres. Le nouveau cadre garantit que de telles anomalies sont signalées pour un examen humain. Les chercheurs ont vérifié que l'ordinateur prêtait attention aux bonnes parties des images, telles que les bras spiraux ou les bulbes centraux, plutôt qu'au bruit aléatoire ou aux artefacts d'arrière-plan. Lorsque le système faisait une erreur, c'était souvent parce que la galaxie elle-même était déroutante, avec des caractéristiques qui se mélangeaient, et le système reflétait correctement cette confusion par une incertitude plus élevée.
Les implications pour l'astronomie sont significatives. Les télescopes à venir captureront bientôt des images de milliards de galaxies, un volume qui rend le contrôle manuel impossible. Avoir un outil capable de trier automatiquement les objets connus tout en signalant de manière fiable les inconnus est essentiel pour découvrir la prochaine génération de phénomènes cosmiques. Les chercheurs ont noté que, bien que leur méthode soit très efficace, elle nécessite plus de puissance de calcul pour exécuter les multiples vérifications nécessaires à l'incertitude. Cependant, ils soutiennent que ce coût est un faible prix à payer pour la capacité de faire confiance au catalogue automatisé et pour garantir qu'aucune galaxie étrange ou rare ne passe inaperçue. En apprenant aux machines à reconnaître les limites de leur propre savoir, les astronomes peuvent enfin laisser les ordinateurs gérer le travail de routine tout en concentrant leur propre attention sur les objets les plus mystérieux et les plus fascinants de l'univers.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.