← Últimos artículos
💻 computer science

Predicting Visual Acuity from Fundus Photographs Using a Domain-Pretrained Vision Transformer: Anatomical Alignment of Attention Patterns

Este estudio demuestra que un Vision Transformer preentrenado en el dominio (RETFound), ajustado mediante fine-tuning con más de 21,000 fotografías de fondo de ojo, logra una concordancia sustancial en la predicción de la agudeza visual de cuatro clases al desarrollar patrones de atención anatómicamente organizados —cambiando de los vasos retinianos en ojos con baja visión hacia la mácula en ojos con visión normal— que se correlacionan con la corrección de la clasificación y ofrecen interpretabilidad para predicciones inciertas.

Autores originales: Jin Hyun Kim, Yong Seop Han, Kuk Jin Jang, Seoung Jin Lee, Hyonyoung choi, Insup Lee

Publicado 2026-07-17
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Jin Hyun Kim, Yong Seop Han, Kuk Jin Jang, Seoung Jin Lee, Hyonyoung choi, Insup Lee

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando adivinar qué tan bien ve alguien con solo mirar una única y colorida fotografía del fondo de su ojo. Este es el mundo de la IA oftalmológica, donde las computadoras son entrenadas para leer fotografías de la retina para predecir la agudeza visual —básicamente, qué tan nítida es la visión de una persona—. Por lo general, revisar tu visión requiere que te sientes en el consultorio de un médico, entrecierres los ojos ante una tabla y leas letras en voz alta. Pero, ¿qué pasaría si una computadora pudiera mirar una foto de tu ojo y decir: "Ah, tu visión es perfecta" o "Podrías necesitar anteojos", sin que tú digas una sola palabra?

Para hacer esto, los científicos utilizan Transformers de Visión. Piensa en estos como detectives digitales superinteligentes. A diferencia de los modelos informáticos más antiguos que solo escanean una imagen como una cámara tomando una instantánea, un Transformer de Visión divide la imagen en diminutas piezas de rompecabezas y se pregunta: "¿Cómo se relaciona esta pieza con aquella?". Aprende a prestar atención a detalles específicos, como un detective que se concentra en una huella dactilar o en la huella de un zapato embarrado. La gran pregunta que este artículo aborda es: ¿Puede una computadora aprender a predecir la calidad de la visión simplemente mirando estos mapas oculares y, lo que es más importante, podemos confiar en dónde está mirando la computadora? Si la computadora dice que tu visión es mala, ¿está realmente mirando las partes dañadas de tu ojo, o solo está adivinando basándose en ruido aleatorio?


Las nuevas gafas del detective

En este estudio, un equipo de investigadores decidió darle a su detective digital un par de "gafas" especiales llamadas RETFound. Imagina que tienes a un detective que ha pasado años estudiando millones de fotos de escenas del crimen. Sabe exactamente cómo es una huella dactilar, cómo salpica la sangre y dónde suelen esconderse las pistas. Eso es RETFound: un modelo de IA masivo que ya ha "leído" 1.6 millones de fotos de ojos sin etiquetar. Ya es un experto en detectar los diminutos vasos y texturas de la retina incluso antes de intentar resolver el rompecabezas específico de la agudeza visual.

Los investigadores tomaron a este detective experto y lo ajustaron para resolver un misterio específico: clasificar las fotos de los ojos en cuatro categorías de visión.

  • C0: Ceguera total o funcional.
  • C1: Deterioro severo (muy borroso).
  • C2: Deterioro moderado a leve.
  • C3: Visión normal y nítida.

Probaron esto en 21,602 fotos de 3,654 pacientes. Para asegurarse de que el detective no estuviera haciendo trampa memorizando las respuestas, fueron muy estrictos: dividieron los datos por paciente, no por foto. Esto significa que si un paciente tenía cinco fotos, las cinco iban al grupo de entrenamiento o al grupo de prueba, nunca a ambos. Esto es como asegurarse de que un estudiante que toma un examen nunca vea la misma pregunta dos veces en formas diferentes.

Los resultados: Un éxito "sustancial"

Los resultados fueron prometedores. El detective RETFound acertó la respuesta el 55.6% de las veces. Aunque eso pueda no parecer una puntuación perfecta, en el mundo de la IA médica, es algo importante. Más importante aún, cuando cometía un error, solía ser uno pequeño. El 89.6% de sus errores estaban a solo un paso de la respuesta correcta (como adivinar "deterioro severo" cuando la respuesta era "moderado"). Rara vez hacía conjeturas descabelladas, como llamar a un ojo normal "ciego".

El artículo también comparó a RETFound con otros dos detectives: DINOv2 (una IA de propósito general que no ha estudiado fotos de ojos específicamente) y EfficientNet (un estilo más antiguo de visión por computadora). RETFound los superó a ambos por un margen significativo. Los investigadores calcularon una puntuación llamada Kappa de Peso Cuadrático, que mide qué tan bien coinciden las predicciones con el orden real de las cosas. RETFound obtuvo un 0.612, lo que los expertos llaman un "acuerdo sustancial".

El misterio de "¿A dónde estás mirando?"

La parte más emocionante del artículo no es solo que la computadora obtuvo la respuesta correcta, sino cómo miró el ojo para lograrlo. Los investigadores utilizaron una técnica llamada Attention Rollout (Despliegue de Atención). Imagina que la computadora es un reflector que ilumina la foto del ojo. Esta técnica permite a los investigadores ver exactamente dónde se enfoca el reflector.

Encontraron un patrón hermoso que coincide con lo que los médicos humanos han sabido durante décadas:

  • Para ojos con una visión terrible (C0): El reflector de la computadora se concentró fuertemente en los vasos sanguíneos alrededor del borde del ojo. Esto tiene sentido porque la pérdida de visión severa suele ser causada por vasos sanguíneos dañados o con fugas. La computadora aprendió a mirar las partes "desordenadas" del mapa.
  • Para ojos con visión perfecta (C3): El reflector se movió al centro del ojo (la mácula). Esta es la parte del ojo responsable de la visión central nítida. La computadora aprendió a ignorar los bordes y concentrarse en el centro.

Es como un detective que sabe que, si una casa se está incendiando, debe mirar el humo y las llamas (los vasos), pero si la casa está impecable, debe mirar la puerta principal y las ventanas (la mácula) para confirmar que todo está bien.

La prueba de "Confía en mí"

Aquí está el giro ingenioso: los investigadores querían saber si este comportamiento del "reflector" era solo un accidente de suerte o si realmente significaba que la computadora estaba pensando correctamente. Compararon las fotos en las que la computadora acertó frente a las que erró.

  • Cuando la computadora acertaba: El reflector se comportaba perfectamente. Si adivinaba "ciego", la luz estaba en los vasos. Si adivinaba "normal", la luz estaba en el centro. La conexión entre el reflector y la respuesta era muy fuerte.
  • Cuando la computadora fallaba: El reflector estaba confundido. Estaba por todos lados, mirando puntos aleatorios. La conexión entre dónde miraba y lo que adivinaba era débil.

Esto sugiere que la "atención" de la computadora es una pista confiable. Si la computadora está mirando en el lugar correcto, probablemente tenga razón. Si está mirando en todas partes a la vez, deberías ser escéptico.

El problema del "Centro Borroso"

El estudio también encontró un punto difícil. La computadora tuvo más problemas con la categoría C1 (deterioro severo, pero no ceguera total). A menudo confundía estos ojos con la categoría "moderada". Los investigadores sugieren que esto no es porque la computadora sea tonta, sino porque las fotos de los ojos para este nivel específico de visión son naturalmente ambiguas. Es como tratar de distinguir entre un día ligeramente brumoso y un día muy nublado; a veces, la imagen simplemente no tiene suficientes pistas claras para estar 100% seguro.

Lo que esto significa

Este artículo no pretende haber resuelto la pérdida de visión o haber reemplazado a los médicos. En cambio, muestra que podemos construir una IA que no solo adivina, sino que realmente "ve" el ojo de la misma manera que lo hace un médico humano. Aprende a enfocarse en los vasos sanguíneos para los ojos malos y en el centro para los ojos buenos.

Los autores sugieren que, en el futuro, podríamos usar este comportamiento del "reflector" como un sistema de advertencia. Si una IA hace una predicción pero su reflector está por todas partes, los médicos podrían marcar ese caso para que un humano lo revise. Esto convierte a la IA de una caja negra en un compañero que no solo te dice qué piensa, sino por qué lo piensa y qué tanto puedes confiar en esa suposición.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →