Parametric neural control differentiates top neural network models of primate visual cortex
Este estudio introduce la acentuación de características alineadas con los ejes como un método causal para revelar que, a pesar de tener una precisión similar en la predicción de las respuestas a imágenes naturales, los modelos de redes neuronales profundas líderes divergen significativamente en su capacidad para controlar la activación de la corteza visual de primates, siendo el rendimiento mejor predicho por la estructura de frecuencia espacial del gradiente de entrada que por la robustez adversarial.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA de un preprint que no ha sido revisado por pares. No es consejo médico. No tome decisiones de salud basándose en este contenido. Leer descargo de responsabilidad completo
El cerebro humano es una máquina vasta e intrincada para dar sentido al mundo, y al frente de esta máquina se encuentra la corteza visual, una región dedicada enteramente a procesar lo que vemos. Durante décadas, los científicos han intentado construir programas informáticos que imiten esta maquinaria biológica. Estos programas, conocidos como redes neuronales profundas, son entrenados con millones de fotografías hasta que aprenden a reconocer objetos, rostros y escenas con una destreza que rivaliza con la nuestra. Cuando los investigadores prueban estos programas, a menudo encuentran que los modelos más avanzados predicen con una exactitud sorprendente cómo dispararán las neuronas en el cerebro de un mono cuando se le muestra una imagen natural. Este éxito llevó a una suposición reconfortante: si diferentes modelos informáticos pueden predecir tan bien la actividad cerebral, deben estar utilizando la misma lógica interna para comprender el mundo visual. Parecía como si finalmente se hubiera encontrado el camino para comprender el cerebro, y que todos estos modelos exitosos hubieran convergido en una única y correcta forma de ver.
Sin embargo, un nuevo estudio desafía esta reconfortante conclusión, sugiriendo que una alta precisión en la predicción no significa necesariamente que los modelos hayan captado realmente la lógica del cerebro. Los investigadores, trabajando con cinco macacos, se propusieron probar si estos modelos informáticos simplemente estaban adivinando correctamente o si realmente comprendían las reglas específicas que gobiernan cómo responden las neuronas. Crearon un nuevo método para sondear los modelos, yendo más allá del simple reconocimiento de imágenes hacia una forma de interacción más directa. En lugar de solo mostrar imágenes a los modelos y comprobar si adivinaban la respuesta cerebral correcta, los científicos utilizaron los modelos para generar cambios específicos y controlados en una imagen. Tomaron los ajustes internos de cada modelo y los convirtieron en un conjunto de instrucciones sobre cómo retocar una imagen para hacer que una neurona dispare más o menos. Este proceso, que los investigadores llaman acentuación de características alineadas con los ejes, les permitió crear miles de imágenes de prueba únicas diseñadas para empujar la respuesta neuronal en una dirección específica.
El equipo generó más de 27.500 de estos estímulos personalizados a partir de diez de los principales modelos de visión y los presentó a los monos en un experimento de bucle cerrado. Esta configuración permitió a los investigadores dirigirse a áreas específicas de la corteza visual, desde las etapas tempranas donde se procesan formas simples hasta los niveles superiores donde se reconocen objetos complejos. Los resultados fueron sorprendentes. A pesar de que los diez modelos funcionaban por igual al predecir las respuestas a fotografías naturales estándar, fallaron estrepitosamente cuando se les pidió controlar las neuronas con sus estímulos personalizados. La mayoría de los modelos no lograron producir los cambios predichos en el disparo neuronal. Sus mapas internos del mundo visual, aunque lo suficientemente buenos para adivinar, estaban fundamentalmente desalineados con la sintonización real de las células cerebrales. Los modelos no estaban capturando los detalles precisos de cómo las neuronas responden al mundo; simplemente estaban encontrando atajos estadísticos que funcionaban para imágenes naturales pero que se desmoronaban bajo un escrutinio más cercano.
Hubo una excepción notable a este fallo. Dos de los modelos, que habían sido entrenados mediante una técnica específica llamada entrenamiento adversarial, mostraron una ventaja constante. Estos modelos eran mejores controlando el disparo neuronal, lo que sugiere que sus parámetros internos están más cerca de los del propio cerebro. Sin embargo, el estudio encontró que ser robusto contra estos trucos adversariales no era toda la historia. La capacidad de controlar las neuronas no estaba fuertemente vinculada a qué tan bien un modelo resistía los ataques artificiales. En cambio, el factor clave era algo más fundamental: la estructura de frecuencia espacial del gradiente de entrada. En términos sencillos, esto se refiere al patrón específico de píxeles que influye en la decisión de un modelo. Los modelos que funcionaron mejor fueron aquellos donde la distribución de los píxeles que influyen en el eje de codificación coincidía con la forma en que el cerebro realmente procesa la información visual.
Esta investigación establece una forma nueva y más rigurosa de probar qué tan bien se alinean los modelos informáticos con el cerebro. Al pasar de la predicción pasiva al control activo, los científicos demostraron que una alta precisión en las pruebas estándar puede ocultar fallos profundos en la forma en que un modelo representa el mundo visual. Los hallazgos sugieren que, si bien los modelos actuales son impresionantes, la mayoría aún no ha convergido en la verdadera parametrización biológica del espacio de la imagen natural. Solo probando si un modelo puede impulsar causalmente la actividad neuronal con características precisas y acentuadas podemos saber si realmente comprende el mundo visual de la misma manera que lo hace un cerebro de primate.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.