Leveraging unlabelled data for generalizable neural population decoding
El artículo presenta MOJO, un marco de entrenamiento que combina el autoencoder enmascarado autosupervisado con el aprendizaje supervisado para modelos neuronales de tokenización de espigas, demostrando que el aprovechamiento de datos no etiquetados mejora significativamente el rendimiento de la decodificación, la generalizabilidad a través de especies y modalidades, y la interpretabilidad, particularmente en escenarios con datos etiquetados limitados.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina un mundo en el que podamos leer los susurros eléctricos de la mente para ayudar a personas paralizadas a mover sus extremidades o para comprender cómo tomamos decisiones. Este es el reino de las interfaces cerebro-computadora (BCI, por sus siglas en inglés), un campo donde los científicos intentan traducir los señales caóticas y parpadeantes de las neuronas en comandos claros para las computadoras. Durante mucho tiempo, la mejor manera de hacer esto fue como enseñarle trucos a un perro: le muestras una señal, le dices exactamente qué comportamiento ocurrió (como "el brazo se movió a la izquierda") y este aprende a emparejar ambos. Pero este método tiene un gran defecto: requiere que un "maestro" esté presente para cada una de las lecciones. En el mundo real, tenemos montañas de datos cerebrales registrados donde el "maestro" falta: tenemos el parloteo neural, pero no la etiqueta que dice qué estaba haciendo el animal en ese momento exacto. Hasta ahora, la mayoría de los modelos avanzados de lectura cerebral solo podían aprender de los datos "etiquetados", dejando vastas bibliotecas de grabaciones cerebrales "no etiquetadas" acumulando polvo, incapaces de ayudar a mejorar el decodificador.
Entra un nuevo enfoque que trata al cerebro como un lenguaje. Así como los grandes modelos de lenguaje (como los que escriben historias o responden preguntas) aprenden leyendo miles de millones de libros sin necesidad de que un humano explique cada frase, esta nueva investigación sugiere que podemos enseñar a los modelos de decodificación cerebral a entender la "gramática" de la actividad neural por su cuenta. El artículo presenta un método llamado MOJO (entrenamiento conjunto basado en autoencoder enmascarado). Piensa en esto como un estudiante que estudia tanto un libro de texto con respuestas (datos etiquetados) como una enorme biblioteca de novelas de misterio sin claves de respuestas (datos no etiquetados). Al intentar completar las páginas faltantes de las novelas de misterio, el estudiante aprende la estructura subyacente de la historia tan bien que, cuando finalmente toma el examen con el libro de texto, lo aprueba con excelencia. Los investigadores descubrieron que, al combinar estos dos estilos de aprendizaje, su modelo se convirtió en un decodificador mucho mejor, especialmente cuando había muy pocos ejemplos etiquetados para empezar, e incluso funcionó en diferentes especies y tipos de señales cerebrales.
El Problema: El cuello de botella de la "Etiqueta"
Imagina que estás tratando de aprender un nuevo idioma. Tienes un diccionario que te dice que la palabra "manzana" significa una fruta roja. Si solo tienes este diccionario (datos etiquetados), puedes aprender la palabra "manzana". Pero si quieres ser fluido, necesitas leer miles de libros, artículos e historias (datos no etiquetados) para entender cómo encajan las palabras, cómo fluyen las oraciones y cómo el contexto cambia el significado de una palabra.
Durante años, los modelos más avanzados de decodificación cerebral, conocidos como modelos de "tokenización de picos" (como la familia POYO), fueron como estudiantes que solo tenían el diccionario. Eran increíblemente buenos emparejando señales cerebrales específicas con movimientos específicos, pero solo podían aprender de datos donde los científicos habían registrado cuidadosamente qué estaba haciendo el animal en cada momento. Esta es una limitación enorme porque recolectar datos etiquetados es costoso, consume mucho tiempo y a menudo es imposible para ciertos experimentos. Mientras tanto, los neurocientíficos han recolectado terabytes de datos cerebrales "no etiquetados": grabaciones de neuronas disparando sin saber qué estaba pensando o haciendo el animal en ese segundo exacto. Estos modelos estaban ignorando efectivamente este tesoro de información.
La Solución: El truco de "completar los espacios en blanco" de MOJO
Los autores de este artículo, Ximeng Mao, Nanda H. Krishna y su equipo, crearon MOJO para resolver esto. Querían enseñar a estos modelos a aprender de los datos no etiquetados, tal como un modelo de lenguaje aprende de un libro.
Para hacer esto, utilizaron un truco ingenioso llamado autocodificación enmascarada (masked autoencoding). Imagina que tienes una oración: "El gato se sentó en la alfombra". Si cubres la palabra "sentó", ¿puedes adivinar cuál era? Si has leído suficientes historias sobre gatos, probablemente puedas adivinar "sentó", "estuvo" o "saltó" basándote en el contexto. MOJO hace esto con las señales cerebrales. Toma una secuencia de picos neurales (la "oración"), oculta (enmascara) aleatoriamente algunos de los signals y le pide al modelo que prediga cuáles eran esos signals faltantes.
Aquí está la magia: el modelo tiene que aprender las reglas ocultas de cómo las neuronas se comunican entre sí para hacer estas conjeturas. Aprende la "gramática" del cerebro. Pero el modelo no solo adivina; también mantiene su tarea original de predecir el comportamiento (como el movimiento del brazo) utilizando los datos etiquetados. Hace ambas cosas al mismo tiempo. Esto se llama entrenamiento conjunto (joint training). El modelo aprende la estructura profunda del cerebro a partir de los datos no etiquetados, lo que le ayuda a entender mucho mejor los datos etiquetados.
Los Resultados: Más inteligentes, rápidos y flexibles
El equipo probó MOJO en tres tipos de datos cerebrales muy diferentes:
- Alcance de mono: Monos alcanzando objetivos en una pantalla.
- Visión de ratón: Ratones mirando diferentes patrones visuales.
- Habla humana: Humanos pronunciando sílabas, registrados desde electrodos en la superficie del cerebro (ECoG).
En cada una de las pruebas, MOJO superó a los modelos que solo utilizaban datos etiquetados. Pero la parte más emocionante fue lo que sucedió cuando tenían muy pocos datos etiquetados.
El superpoder de "pocos disparos" (Few-Shot)
Normalmente, si tienes muy pocos ejemplos para enseñar a un modelo (un escenario de "pocos disparos" o few-shot), este tiene dificultades. Pero MOJO fue un campeón en esto. En un experimento con monos, el equipo intentó enseñar al modelo a decodificar movimientos usando solo dos ensayos etiquetados (intentos de calibración). Un modelo estándar falló estrepitosamente. Sin embargo, MOJO utilizó los datos no etiquetados para entender el "sentir" general de la actividad cerebral. Cuando le dieron solo dos ensayos etiquetados, alcanzó más del 60% del rendimiento de un modelo entrenado con un conjunto de datos completo. Con solo cuatro ensayos etiquetados, alcanzó el 75%. Fue como un estudiante que, tras leer mil novelas de misterio, podía resolver un nuevo misterio con solo dos pistas.
Transversalidad de especies y modalidades
Los investigadores también probaron si MOJO podía aprender de una especie y aplicarlo a otra. Preentrenaron el modelo con datos de alcance de mono y luego lo ajustaron con datos de visión de ratón. El modelo transfirió su conocimiento con éxito, demostrando que la "gramática" del cerebro que aprendió era lo suficientemente universal como para ayudarlo a entender el cerebro de un animal diferente.
Aún más sorprendente, probaron MOJO con datos de habla humana (ECoG), que es una señal continua, no los "picos" discretos de las neuronas. Aunque MOJO fue diseñado para picos, se adaptó y funcionó tan bien como los modelos construidos específicamente para señales continuas. Esto sugiere que la idea central de aprender de datos no etiquetados es una herramienta poderosa que funciona a través de diferentes tipos de grabaciones cerebrales.
Perspectivas "ocultas"
Uno de los efectos secundarios más geniales de MOJO fue que el modelo aprendió a entender la estructura del cerebro sin que se le dijera explícitamente. Los investigadores le pidieron al modelo que adivinara de qué parte del cerebro provenía una neurona (por ejemplo, la corteza visual frente al hipocampo) simplemente mirando su "embedding" interno (su huella digital digital). El modelo acertó el 94% de las veces en algunas tareas, a pesar de que nunca fue entrenado para realizar esta clasificación. También aprendió a predecir las tasas de disparo de las neuronas con alta precisión. Esto significa que el modelo no solo memorizaba respuestas; estaba aprendiendo un mapa rico e interpretable de cómo funciona el cerebro.
Por qué esto importa
El artículo sugiere que, al combinar el aprendizaje supervisado (aprender con respuestas) y el aprendizaje autosupervisado (aprender de patrones en los datos), podemos construir interfaces cerebro-computadora mucho más flexibles y poderosas. No necesitamos desechar las montañas de datos no etiquetados que ya tenemos; podemos usarlos para enseñar a nuestros modelos las reglas fundamentales del cerebro.
Este enfoque facilita el entrenamiento de modelos para nuevas tareas o nuevos pacientes con un tiempo de calibración mínimo. También abre la puerta a los "modelos fundacionales neuro" (neuro-foundation models): modelos cerebrales masivos y de propósito general que pueden adaptarse a muchos trabajos diferentes, desde ayudar a personas paralizadas a moverse hasta comprender cómo tomamos decisiones. Los autores señalan que, si bien este es un paso significativo, los modelos aún necesitan muchos datos para aprender la dinámica compleja del cerebro, y todavía existen desafíos en cómo manejar perfectamente diferentes tipos de señales. Pero el camino está claro: el futuro de la decodificación del cerebro reside en enseñar a estos modelos a leer las historias "no etiquetadas" de nuestras mentes.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.