← Últimos artículos
🧬 biology

Real-time Reconstruction of Human Visual Perception from fMRI

Este artículo presenta una adaptación compatible con tiempo real del flujo de trabajo de vanguardia MindEye2 utilizando la plataforma RT-Cloud, demostrando que la reconstrucción fiable y detallada de imágenes naturales percibidas a partir de datos de fMRI es viable en cuestión de segundos y allanando el camino para interfaces cerebro-computadora avanzadas.

Autores originales: Rishab S. Iyer, Jiaxin Cindy Tu, Cesar Kadir Torrico Villanueva, Anish Mahishi, Ross P. Kempner, Jacob S. Prince, Ernest W. Lo, Akash Bhowmick, Hritik Arasu, Amaar Chughtai, Elizabeth A. McDevitt, Pau
Publicado 2026-07-28
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Rishab S. Iyer, Jiaxin Cindy Tu, Cesar Kadir Torrico Villanueva, Anish Mahishi, Ross P. Kempner, Jacob S. Prince, Ernest W. Lo, Akash Bhowmick, Hritik Arasu, Amaar Chughtai, Elizabeth A. McDevitt, Paul S. Scotti, Kenneth A. Norman

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ⚕️ Esta es una explicación generada por IA de un preprint que no ha sido revisado por pares. No es consejo médico. No tome decisiones de salud basándose en este contenido. Leer descargo de responsabilidad completo

Imagina que pudieras asomarte al interior de la mente de alguien y ver exactamente la imagen que está mirando, solo con observar las diminutas ondulaciones del flujo sanguíneo en su cerebro. Este es el sueño de la neurociencia cognitiva: convertir la actividad cerebral en una ventana a nuestros pensamientos. Durante mucho tiempo, los científicos han utilizado una herramienta llamada fMRI (resonancia magnética funcional) para hacer esto. Piensa en la fMRI como una cámara de cine de alta definición y muy lenta para el cerebro. No toma fotos de las neuronas disparándose directamente; en su lugar, rastrea hacia dónde fluye el oxígeno en la sangre, lo cual es un poco como ver qué partes de una ciudad están más ocupadas observando dónde brillan los semáforos. El problema es que este "tráfico" se mueve lentamente, tardando varios segundos en alcanzar su punto máximo después de que un pensamiento o una imagen aparece.

En años recientes, las computadoras se han vuelto increíblemente inteligentes para adivinar qué está viendo una persona basándose en estos patrones lentos de flujo sanguíneo. Utilizando modelos masivos de IA, los científicos ahora pueden reconstruir imágenes que una persona ha visto con una precisión sorprendente. Sin embargo, hay un gran problema: estas computadoras inteligentes suelen necesitar horas o incluso días para procesar los números. Es como tener a un chef genio que puede cocinar una comida perfecta, pero necesita todo un día para picar las verduras. Esto hace que sea imposible usarlas para experimentos en "tiempo real", donde quieres ver el resultado instantáneamente mientras la persona aún está en el escáner. Si pudieras hacer que este proceso fuera lo suficientemente rápido, podrías crear una "interfaz cerebro-computadora" donde una persona pudiera controlar una pantalla con sus pensamientos, o recibir retroalimentación instantánea sobre en qué se está enfocando su cerebro.

Este artículo trata sobre tomar a ese chef genio y enseñarle a cocinar una comida en menos de 15 segundos. Los investigadores, liderados por Rishab Iyer y colegas, adaptaron con éxito un sistema de IA poderoso y complejo llamado MindEye2 para que funcione en tiempo real. Lograron decodificar lo que una persona estaba viendo de una exploración de fMRI y reconstruir la imagen en una pantalla apenas segundos después de que la persona la mirara. No lo hicieron solo en un laboratorio perfecto de cámara lenta; lo probaron en un escáner de 3 Teslas estándar (el tipo que se encuentra en la mayoría de los hospitales, no solo en laboratorios de investigación sofisticados) y demostraron que funciona incluso con solo una hora de datos de entrenamiento de una persona nueva. Aunque las imágenes no son tan perfectas como las versiones lentas de un día para otro, son lo suficientemente claras como para reconocer el objeto, demostrando que finalmente podemos empezar a "leer" mentes mientras suceden, y no solo después de los hechos.

La máquina de "lectura de mente" recibe un impulso de velocidad

Durante años, los mejores sistemas de IA para leer la mente a partir de escaneos cerebrales han sido como una repetición en cámara lenta. Le muestras una imagen a una persona en una máquina de resonancia magnética, esperas a que termine el experimento y luego pasas horas o incluso días procesando los datos para adivinar qué vio. El artículo describe un nuevo enfoque que acelera esto drásticamente, convirtiendo un resultado de "mañana" en un resultado de "el próximo segundo".

El equipo utilizó un sistema llamado MindEye2, que es un modelo de IA gigante entrenado para entender la conexión entre la actividad cerebral y las imágenes. Piensa en MindEye2 como un traductor que habla dos idiomas: "Flujo-Cerebral" (los datos de fMRI) y "Descripción-de-Imagen" (un mapa digital de cómo se ven las cosas). En el pasado, este traductor necesitaba mucho tiempo para pensar. Los investigadores querían ver si podían hacer que pensara lo suficientemente rápido como para trabajar mientras la persona aún estaba en la máquina.

Para lograrlo, construyeron un flujo de trabajo especial utilizando una plataforma basada en la nube llamada RT-Cloud. Esto es como un servicio de entrega de alta velocidad que toma los datos cerebrales en el momento en que se registran, los procesa instantáneamente y envía el resultado de vuelta. Lo probaron con un participante que miraba imágenes naturales, como fotos de animales o lugares.

Los resultados: Rápidos, pero no perfectos

El artículo presenta un intercambio fascinante entre velocidad y calidad. Probaron tres velocidades diferentes:

  1. El "Modo Rápido": Esta es la magia del tiempo real. El sistema esperó unos 7.9 segundos después de que apareciera la imagen (para dejar que la respuesta del flujo sanguíneo en el cerebro alcanzara su punto máximo) y luego realizó la decodificación. El tiempo total desde que se ve la imagen hasta obtener la reconstrucción fue de unos 14.5 segundos.
  2. El "Modo Lento": Esperaron unos 29 segundos para recolectar más datos, lo que mejoró ligeramente la calidad.
  3. El "Modo de Fin de Sesión": Este es el enfoque tradicional, esperando hasta que toda la sesión de escaneo terminó (aproximadamente 5 minutos) para analizar todo.

Los resultados mostraron que incluso el "Modo Rápido" funcionó sorprendentemente bien. Cuando se le pidió elegir la imagen correcta de un grupo de 50 candidatas, el sistema rápido acertó aproximadamente el 36% de las veces (lo cual es mucho mejor que el 2% que obtendrías al adivinar al azar). Cuando el grupo era más pequeño (solo 2 opciones), la precisión subió al 90.6%. Las imágenes reconstruidas eran un poco borrosas en comparación con las versiones lentas de un día para otro, pero aún podías distinguir claramente si la persona estaba mirando un perro, un auto o un paisaje.

Por qué esto es importante (y lo que aún no hace)

El artículo es cuidadoso al decir que esto es una "prueba de concepto". Demuestra que es posible hacer esto en tiempo real, pero no significa que tengamos un dispositivo perfecto de lectura de mente todavía. Los autores señalan explícitamente que la calidad disminuye cuando vas más rápido. El "Modo Rápido" no es tan preciso como el "Modo Offline" que toma días. También señalan que el sistema actual depende de un tipo específico de arquitectura de IA y que la velocidad está limitada por qué tan rápido fluye la sangre en el cerebro (el retraso hemodinámico), que es un hecho biológico que no podemos cambiar.

Sin embargo, las implicaciones son enormes. Debido a que el sistema funciona en menos de 15 segundos, abre la puerta a la neuroretroalimentación (neurofeedback). Imagina a un paciente con depresión que pudiera ver, en tiempo real, cómo reacciona su cerebro ante una imagen triste. Si su cerebro se enfoca demasiado en las partes negativas, el sistema podría mostrarle una reconstrucción que resalte eso, ayudándole a aprender a cambiar su enfoque. El artículo sugiere que los retrasos de 10 a 30 segundos son de hecho lo suficientemente rápidos para que el cerebro aprenda de esta retroalimentación, basándose en estudios previos.

Los investigadores también demostraron que no necesitas un escáner de 7 Teslas súper caro y raro para hacer esto; un escáner estándar de 3 Teslas (que se encuentra en miles de hospitales) funciona perfectamente bien, siempre y que ajustes la IA con aproximadamente una hora de datos de la nueva persona.

La conclusión

Este artículo es un gran paso adelante para convertir la "lectura de la mente" de un análisis lento y post-mortem en una experiencia viva e interactiva. Al adaptar una IA de gran capacidad para que funcione en tiempo real, el equipo demostró que podemos reconstruir lo que una persona está viendo en 14.5 segundos. Aunque las imágenes no son cristalinas todavía, son lo suficientemente buenas como para reconocer objetos, y la velocidad es lo suficientemente rápida como para ayudar potencialmente a las personas a controlar sus propios estados cerebrales o comunicarse con máquinas. Es como tomar una cámara de cine lenta de alta definición y enseñarle a transmitir video en vivo. La imagen es un poco granulada, pero por primera vez, podemos ver el espectáculo mientras sucede.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →