Identical runs disagree more than different models: reproducibility limits in deep learning for brain-tumour MRI classification
Cette étude démontre que les variations stochastiques non contrôlées dans des exécutions de l'apprentissage profond nominalement identiques pour la classification d'IRM de tumeurs cérébrales peuvent excéder les différences de performance entre des architectures de modèles distinctes, sapant ainsi la fiabilité des études d'ablation standards et nécessitant des protocoles de reproductibilité plus stricts.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le monde de la haute voltige de l'imagerie médicale, on demande de plus en plus aux ordinateurs d'examiner des images du cerveau humain et de repérer des tumeurs. Ces images, appelées examens IRM, sont complexes et détaillées, et le logiciel utilisé pour les analyser repose sur un type d'intelligence artificielle connue sous le nom d'apprentissage profond (deep learning). Pour entraîner ces systèmes, les chercheurs les nourrissent de milliers d'images et laissent l'ordinateur apprendre les schémas par lui-même, en ajustant ses paramètres internes des millions de fois jusqu'à ce qu'il s'améliore dans l'identification de la maladie. L'objectif est de créer un outil en lequel les médecins peuvent avoir confiance pour aider à diagnostiquer des pathologies comme les tumeurs cérébrales. Cependant, pour que cette technologie soit sûre et utile, les résultats doivent être cohérents. Si un ordinateur reçoit les mêmes données deux fois, il devrait idéalement donner la même réponse. Lorsque les scientifiques comparent deux modèles informatiques différents pour voir lequel est le meilleur, ils recherchent souvent des différences d'exactitude très infimes, parfois d'une fraction de pourcentage seulement, pour décider quel modèle doit passer aux tests en conditions réelles.
Un chercheur de l'Université de San Francisco Bay s'est lancé dans le test d'une idée spécifique : savoir si l'ajout d'un type particulier de raisonnement à un modèle informatique standard d'imagerie cérébrale permettrait de mieux détecter les tumeurs. Le modèle standard examine l'image directement, tandis que la nouvelle version tentait de comprendre les relations entre les différentes parties de l'image, de la même manière qu'un humain pourrait relier les points entre les caractéristiques. Le chercheur a construit une expérience rigoureuse pour tester cela, faisant tourner les modèles informatiques encore et encore pour voir si la nouvelle approche offrait réellement un avantage. Ce qu'il a découvert, cependant, n'était pas une percée dans la détection des tumeurs, mais une découverte troublante sur la fiabilité du processus de test lui-même. Il a découvert que le processus d'entraînement de l'ordinateur était si instable que deux exécutions identiques du même modèle pouvaient produire des résultats différents, plus importants que les minuscules différences qu'il essayait de mesurer entre les deux modèles différents.
L'étude a débuté avec une vaste collection de coupes d'IRM provenant de centaines de patients, divisée soigneusement de sorte qu'aucune donnée d'un même patient ne se retrouve à la fois dans les groupes d'entraînement et de test. Cela était crucial car si l'ordinateur voyait la tumeur du même patient dans les deux groupes, il se contenterait de mémoriser cette personne spécifique plutôt que d'apprendre à reconnaître la maladie de manière générale. Le cherchenaire a entraîné un modèle standard et une version plus complexe incluant la couche de raisonnement supplémentaire. Il a exécuté chaque version plusieurs fois, en modifiant un nombre de départ aléatoire, appelé "graine" (seed), pour voir comment les résultats variaient. Dans le monde de l'informatique, cette graine est censée garantir que si l'on part du même nombre, l'ordinateur fait exactement la même chose à chaque fois. L'attente était que le modèle complexe soit soit légèrement meilleur, soit légèrement moins bon que le modèle simple, et que le fait de répéter le test trois fois donnerait une moyenne claire.
Au lieu de cela, les résultats ont montré un schéma chaotique. Lorsque le chercheur a exécuté la configuration exacte du même modèle deux fois avec le même nombre de départ, les scores de précision différaient de plus de deux points de pourcentage en moyenne. Cette variation était si grande qu'elle noyait complètement les petites différences entre les deux modèles différents qu'il comparait. En fait, la différence entre les deux exécutions identiques était plus de deux fois supérieure à la différence entre le modèle simple et le modèle complexe. Cela signifiait que l'expérience mesurait essentiellement du bruit plutôt qu'un signal. Le chercheur a réalisé que l'ordinateur ne se comportait pas comme un instrument fiable ; c'était comme si une balance utilisée pour peser des pièces d'or donnait une lecture différente à chaque fois que vous montiez dessus, même si vous vous teniez exactement au même endroit.
En creusant davantage, le chercheur a trouvé deux raisons principales à cette infidélité. Premièrement, l'ordinateur était mal configuré. Le nombre de départ aléatoire était appliqué après que le modèle avait déjà été construit, ce qui signifiait que les paramètres initiaux du modèle étaient toujours aléatoires et incontrôlés. Même après avoir corrigé cette erreur et appliqué le nombre de départ avant la construction du modèle, les résultats n'étaient toujours pas parfaitement identiques. Le second problème était caché profondément dans le moteur mathématique de l'ordinateur. Même si le logiciel affirmait fonctionner en mode parfaitement déterministe, une partie spécifique du calcul utilisée pour enseigner au modèle produisait des résultats légèrement différents à chaque fois. Ce défaut caché était invisible pour les contrôles standards que les chercheurs utilisent pour s'assurer de la reproductibilité de leurs expériences.
L'étude a également révélé que la manière dont les données sont divisées peut modifier radicalement le résultat. Lorsque le chercheur a divisé les données par coupe d'IRM plutôt que par patient, l'exactitude de l'ordinateur a bondi de près de cinq points de pourcentage. Cela s'est produit parce que l'ordinateur reconnaissait essentiellement des schémas provenant du même patient dans les ensembles d'entraînement et de test, lui permettant de reconnaître le patient plutôt que la tumeur. Ce score gonflé était une illusion, masquant la véritable capacité du modèle. De plus, lorsque le chercheur a testé la capacité des modèles à gérer des images déformées ou bruitées, un seul essai suggérait qu'un modèle était plus robuste, mais lorsque le test était répété, le résultat s'inversait, montrant que l'autre modèle était meilleur. Cette inversion prouvait qu'une seule expérience ne suffit pas pour tirer une conclusion.
La conclusion finale des travaux est que la couche de raisonnement supplémentaire n'a pas amélioré la capacité de détection des tumeurs cérébrales. Le modèle complexe n'était pas meilleur et, à certains égards, il était plus lent et moins fiable. Plus important encore, l'étude a mis en lumière une faille critique dans la manière dont de nombreuses études d'IA médicale sont menées. Les différences que les chercheurs prétendent trouver sont plus petites que la variation naturelle du processus de test lui-même. Le chercheur soutient qu'avant que les scientifiques ne puissent faire confiance à un nouveau modèle, ils doivent d'abord vérifier que leur configuration de test est assez stable pour détecter de petits changements. Cela implique de vérifier que les nombres de départ aléatoires sont appliqués correctement et de tester le même processus deux fois pour mesurer la variation naturelle. Ces vérifications coûtent très peu de temps et d'effort, pourtant elles sont souvent omises. Sans elles, le domaine risque de construire des outils médicaux sur des fondations trop fragiles pour supporter le poids des décisions cliniques. Cet article sert de rappel qu'en quête d'une meilleure technologie médicale, s'assurer que l'outil de mesure est précis est tout aussi important que l'outil lui-même.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.