A transformer-based model reveals sparse, stimulus-dependent orientation readout from macaque V1 population activity
Este estudio demuestra que un modelo basado en transformadores puede reconstruir con precisión la orientación del estímulo a partir de la actividad poblacional de la corteza V1 de macacos, revelando que la codificación neural redundante sustenta un mecanismo de lectura flexible, disperso y dependiente del estímulo mediado por la autoatención.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA de un preprint que no ha sido revisado por pares. No es consejo médico. No tome decisiones de salud basándose en este contenido. Leer descargo de responsabilidad completo
La corteza visual primaria, una fina capa de tejido en la parte posterior del cerebro, actúa como la primera gran estación de procesamiento de todo lo que vemos. Cuando la luz incide en el ojo, las señales viajan a esta región, donde millones de neuronas individuales se activan en respuesta a características específicas del mundo visual. Una de las propiedades más fundamentales que estas neuronas detectan es la orientación: el ángulo en el que una línea o un borde está inclinado. Décadas de investigación han demostrado que estas neuronas no son uniformes; cada una tiene un ángulo preferido, como una diminuta aguja de brújula que apunta en una dirección específica. Sin embargo, el cerebro no depende de una sola neurona para decirnos qué ángulo está observando. En su lugar, un estímulo visual activa una multitud vasta y superpuesta de miles de neuronas, cada una con preferencias ligeramente diferentes y niveles de actividad variables. Esto crea un código complejo y redundante donde la misma información se distribuye a través de una gran población. El misterio central para los neurocientíficos ha sido durante mucho tiempo cómo el cerebro filtra esta multitud masiva y ruidosa para extraer una respuesta única y precisa sobre el mundo. Si cada neurona contribuye un poco, ¿cómo decide el cerebro a cuáles escuchar y escucha a todas ellas por igual?
Para resolver este rompecabezas, los investigadores recurrieron a una nueva y poderosa herramienta del campo de la inteligencia artificial: un modelo basado en transformers. Diseñado originalmente para el procesamiento del lenguaje, este tipo de programa informático es excepcionalmente bueno para determinar qué partes de una entrada compleja son más importantes para una tarea específica. El equipo, liderado por científicos de la Universidad de Pekín y la Universidad de Zhejiang, aplicó este modelo a datos biológicos reales. Registraron la actividad de más de 1,000 neuronas a la vez de la corteza visual de siete macacos despiertos. A los monos se les mostraron imágenes simples de patrones rayados, conocidos como estímulos de Gabor, en varios ángulos. Luego, los investigadores introdujeron las respuestas de calcio colectivas de estas neuronas en su modelo informático, pidiéndole que reconstruyera la imagen exacta que el mono había visto. El objetivo no era solo ver si la computadora podía adivinar el ángulo, sino observar cómo decidía a qué neuronas prestar atención durante el proceso.
Los resultados fueron sorprendentes. El modelo informático reconstruyó las imágenes rayadas con una precisión increíble, capturando la orientación de las líneas con un error promedio de menos de un grado. Este nivel de precisión superó con creces lo que modelos informáticos más simples podrían lograr, demostrando que la arquitectura de transformer era excepcionalmente adecuada para decodificar esta compleja señal biológica. Pero el verdadero avance provino de mirar dentro de la "mente" del modelo. Mientras la computadora procesaba los datos, generaba un mapa de atención, mostrando exactamente cuánto peso asignaba a cada neurona al tomar su decisión. Los investigadores descubrieron que el modelo no trataba a las 1,000 neuronas como socios iguales. En cambio, para cualquier ángulo dado, la reconstrucción estaba dominada por un grupo pequeño y disperso de solo dos o tres neuronas. Estas neuronas específicas no eran aleatorias; eran aquellas cuyos ángulos preferidos coincidían con la imagen que se mostraba, y eran las que recibían las señales de "atención" más fuertes del resto de la red.
Este hallazgo desafía la suposición común de que el cerebro debe promediar las señales de miles de neuronas para obtener una imagen clara. El estudio sugiere que, si bien el cerebro almacena la información de forma redundante en una gran población, la lee de una manera altamente selectiva y flexible. El modelo reveló que estas neuronas clave eran especiales no solo porque les gustaba el ángulo correcto, sino también porque eran las más independientes de sus vecinas, mostrando menos ruido compartido o variabilidad. Además, el modelo mostró que podía agudizar las señales de estas pocas neuronas clave, aumentando efectivamente el volumen de la información más útil mientras bajaba el volumen del ruido del resto de la multitud. Este proceso permitió al sistema extraer una orientación precisa de un mar caótico de actividad.
Quizás la evidencia más convincente de este sistema flexible provino de un experimento de "¿qué pasaría si?". Los investigadores eliminaron el pequeño grupo de neuronas con alto peso del modelo y le pidieron que lo intentara de nuevo. En lugar de fallar, el modelo se adaptó rápidamente. Reclutó un nuevo y diferente conjunto de neuronas sustitutas que tenían propiedades similares a las que habían sido eliminadas. Estas nuevas neuronas también estaban sintonizadas con el ángulo correcto y fueron capaces de asumir la tarea de decodificar la orientación con la misma alta precisión. Esto demuestra que el cerebro no depende de un conjunto fijo e inmutable de neuronas "estrella". En cambio, la capacidad de leer la información visual es un proceso dinámico, donde una población redundante de células proporciona una red de seguridad, permitiendo al sistema cambiar a diferentes subconjuntos de neuronas según sea necesario sin perder precisión.
El estudio confirma que la corteza visual opera bajo un principio de almacenamiento redundante pero de lectura dispersa y dependiente del estímulo. El cerebro mantiene la misma información en muchos lugares, asegurando la robustez, pero cuando necesita tomar una decisión, enfoca sus recursos en un subconjunto muy pequeño y altamente efectivo de la población. Este mecanismo permite tanto la estabilidad de una red grande como la velocidad y precisión de una lectura enfocada. Al utilizar un modelo de transformer para decodificar la actividad de neuronas reales, los investigadores han proporcionado una ventana clara a cómo el cerebro podría resolver el problema de extraer detalles específicos de un código masivo y superpuesto. Los hallazgos sugieren que la eficiencia del cerebro no proviene de tener menos neuronas, sino de tener una forma inteligente y flexible de elegir cuáles importan más en cada momento dado.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.