← Derniers articles
💻 computer science

Predicting Visual Acuity from Fundus Photographs Using a Domain-Pretrained Vision Transformer: Anatomical Alignment of Attention Patterns

Cette étude démontre qu'un Vision Transformer pré-entraîné sur un domaine spécifique (RETFound), affiné sur plus de 21 000 photographies du fond d'œil, atteint un accord substantiel dans la prédiction de l'acuité visuelle à quatre classes tout en développant des motifs d'attention anatomiquement organisés — passant des vaisseaux rétiniens dans les yeux à faible vision à la macula dans les yeux à vision normale — qui corrèlent avec l'exactitude de la classification et offrent une interprétabilité pour les prédictions incertaines.

Auteurs originaux : Jin Hyun Kim, Yong Seop Han, Kuk Jin Jang, Seoung Jin Lee, Hyonyoung choi, Insup Lee

Publié 2026-07-17
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jin Hyun Kim, Yong Seop Han, Kuk Jin Jang, Seoung Jin Lee, Hyonyoung choi, Insup Lee

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de deviner la qualité de la vue de quelqu'un simplement en regardant une seule carte colorée de l'arrière de son œil. C'est le monde de l'IA ophtalmique, où les ordinateurs apprennent à lire des photographies rétiniennes pour prédire l'acuité visuelle — en gros, la netteté de la vision d'une personne. Habituellement, vérifier votre vision nécessite de s'asseoir dans le bureau d'un médecin, de plisser les yeux devant un tableau et de lire des lettres à voix haute. Mais et si un ordinateur pouvait regarder une photo de votre œil et dire : « Ah, votre vision est parfaite » ou « Vous pourriez avoir besoin de lunettes », sans même que vous n'ayez à dire un mot ?

Pour ce faire, les scientifiques utilisent des Vision Transformers. Voyez-les comme des détectives numériques super intelligents. Contrairement aux anciens modèles informatiques qui se contentent de scanner une image comme un appareil photo prenant un cliché, un Vision Transformer décompose l'image en minuscules pièces de puzzle et se demande : « Comment cette pièce est-elle liée à celle-là ? » Il apprend à prêter attention à des détails spécifiques, comme un détective se concentrant sur une empreinte digitale ou une trace de chaussure boueuse. La grande question abordée par cet article est la suivante : un ordinateur peut-il apprendre à prédire la qualité de la vision simplement en regardant ces cartes oculaires et, plus important encore, pouvons-nous avoir confiance dans l'endroit où l'ordinateur regarde ? Si l'ordinateur dit que votre vision est mauvaise, regarde-t-il réellement les parties endommagées de votre œil, ou ne fait-il que deviner à partir d'un bruit aléatoire ?


Les nouvelles lunettes du détective

Dans cette étude, une équipe de chercheurs a décidé de donner à leur détective numérique une paire de lunettes spéciales appelée RETFound. Imaginez que vous avez un détective qui a passé des années à étudier des millions de photos de scènes de crime. Il sait exactement à quoi ressemble une empreinte digitale, comment le sang éclabousse et où les indices se cachent habituellement. C'est ce qu'est RETFound : un modèle d'IA massif qui a déjà « lu » 1,6 million de photos d'yeux non étiquetées. Il est déjà un expert pour repérer les minuscules vaisseaux et les textures de la rétine avant même d'essayer de résoudre le puzzle spécifique de l'acuité visuelle.

Les chercheurs ont pris cet expert et l'ont affiné pour résoudre un mystère spécifique : classer les photos d'yeux en quatre catégories de vision.

  • C0 : Cécité totale ou fonctionnelle.
  • C1 : Déficience sévère (très floue).
  • C2 : Déficience modérée à légère.
  • C3 : Vision normale et nette.

Ils ont testé cela sur 21 602 photos provenant de 3 654 patients. Pour s'assurer que le détective ne trichait pas en mémorisant les réponses, ils ont été très stricts : ils ont divisé les données par patient, et non par photo. Cela signifie que si un patient avait cinq photos, les cinq allaient soit dans le groupe d'entraînement, soit dans le groupe de test, jamais les deux. C'est comme s'assurer qu'un élève passant un examen ne voit jamais la même question deux fois sous des formes différentes.

Les résultats : un succès « substantiel »

Les résultats étaient prometteurs. Le détective RETFound a trouvé la bonne réponse 55,6 % du temps. Bien que cela puisse ne pas sembler être un score parfait, dans le monde de l'IA médicale, c'est une étape importante. Plus important encore, lorsqu'il faisait une erreur, c'était généralement une petite erreur. 89,6 % de ses erreurs n'étaient qu'à un seul échelon de la réponse correcte (comme deviner « déficience sévère » alors que la réponse était « modérée »). Il faisait rarement des suppositions délirantes, comme qualifier un œil normal de « aveugle ».

L'article a également comparé RETFound à deux autres détectives : DINOv2 (une IA à usage général qui n'a pas étudié spécifiquement les photos d'yeux) et EfficientNet (un style plus ancien de vision par ordinateur). RETFound les a tous deux battus par une marge significative. Les chercheurs ont calculé un score appelé Kappa pondéré quadratique, qui mesure la capacité des prédictions à correspondre à l'ordre réel des choses. RETFound a obtenu un score de 0,612, ce que les experts appellent un « accord substantiel ».

Le mystère du « Où regardez-vous ? »

La partie la plus excitante de l'article n'est pas seulement que l'ordinateur a trouvé la bonne réponse, mais comment il a regardé l'œil pour y parvenir. Les chercheurs ont utilisé une technique appelée Attention Rollout. Imaginez que l'ordinateur est un projecteur éclairant la photo de l'œil. Cette technique permet aux chercheurs de voir exactement où le projecteur est focalisé.

Ils ont découvert un motif magnifique qui correspond à ce que les médecins humains savent depuis des décennies :

  • Pour les yeux à la vision terrible (C0) : Le projecteur de l'ordinateur se concentrait fortement sur les vaisseaux sanguins autour du bord de l'œil. Cela est logique car une perte de vision sévère est souvent causée par des vaisseaux sanguins endommagés ou fuyants. L'ordinateur a appris à regarder les parties « désordonnées » de la carte.
  • Pour les yeux à la vision parfaite (C3) : Le projecteur se déplaçait vers le centre même de l'œil (la macula). C'est la partie de l'œil responsable de la vision centrale nette. L'ordinateur a appris à ignorer les bords pour se concentrer sur le centre.

C'est comme un détective qui sait que si une maison brûle, il doit regarder la fumée et les flammes (les vaisseaux), mais si la maison est impeccable, il doit regarder la porte d'entrée et les fenêtres (la macula) pour confirmer que tout va bien.

Le test du « Faites-moi confiance »

Voici le tour de force : les chercheurs voulaient savoir si ce comportement de « projecteur » était un simple coup de chance ou si cela signifiait réellement que l'ordinateur pensait correctement. Ils ont comparé les photos que l'ordinateur a réussies par rapport à celles qu'il a manquées.

  • Quand l'ordinateur avait raison : Le projecteur se comportait parfaitement. S'il devinait « aveugle », la lumière était sur les vaisseaux. S'il devinait « normal », la lumière était sur le centre. La connexion entre l'endroit où il regardait et la réponse était très forte.
  • Quand l'ordinateur avait tort : Le projecteur était confus. Il était partout, regardant des endroits aléatoires. La connexion entre l'endroit où il regardait et ce qu'il devinait était faible.

Cela suggère que l'« attention » de l'ordinateur est un indice fiable. Si l'ordinateur regarde au bon endroit, il a probablement raison. S'il regarde partout à la fois, vous devriez être sceptique.

Le problème du « milieu flou »

L'étude a également identifié un point délicat. L'ordinateur a le plus de mal avec la catégorie C1 (déficience sévère, mais pas cécité totale). Il confond souvent ces yeux avec la catégorie « modérée ». Les chercheurs suggèrent que ce n'est pas parce que l'ordinateur est stupide, mais parce que les photos d'yeux pour ce niveau de vision spécifique sont naturellement ambiguës. C'est comme essayer de faire la différence entre une journée légèrement brumeuse et une journée très nuageuse ; parfois, l'image ne contient tout simplement pas assez d'indices clairs pour être sûr à 100 %.

Ce que cela signifie

Cet article ne prétend pas avoir résolu la perte de vision ou remplacé les médecins. Au lieu de cela, il montre que nous pouvons construire une IA qui ne se contente pas de deviner, mais qui « voit » l'œil de la même manière qu'un médecin humain. Elle apprend à se concenter sur les vaisseaux sanguins pour les mauvais yeux et sur le centre pour les bons yeux.

Les auteurs suggèrent qu'à l'avenir, nous pourrions utiliser ce comportement de « projecteur » comme un système d'alerte. Si une IA fait une prédiction mais que son projecteur est éparpillé partout, les médecins pourraient signaler ce cas pour une vérification humaine. Cela transforme l'IA d'une boîte noire en un partenaire qui ne vous dit pas seulement ce qu'il pense, mais aussi pourquoi il le pense, et quel degré de confiance vous pouvez accorder à cette supposition.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →