Leveraging unlabelled data for generalizable neural population decoding
O artigo apresenta o MOJO, um framework de treinamento que combina o autoencoding mascarado autossupervisionado com o aprendizado supervisionado para modelos neurais de tokenização de spikes, demonstrando que o aproveitamento de dados não rotulados melhora significativamente o desempenho de decodificação, a generalização entre espécies e modalidades, e a interpretabilidade, particularmente em cenários com dados rotulados limitados.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine um mundo onde possamos ler os sussurros elétricos da mente para ajudar pessoas paralisadas a mover seus membros ou para entender como tomamos decisões. Este é o reino das interfaces cérebro-computador (BCIs), um campo onde cientistas tentam traduzir os sinais caóticos e oscilantes de neurônios em comandos claros para computadores. Por muito tempo, a melhor maneira de fazer isso era como ensinar truques a um cachorro: você mostra um sinal, diz exatamente qual comportamento aconteceu (como "o braço moveu para a esquerda") e ele aprende a corresponder os dois. Mas este método tem uma enorme falha: exige que um professor esteja presente para cada lição individual. No mundo real, temos montanhas de dados cerebrais registrados onde o "professor" está ausente — temos o falatório neural, mas nenhum rótulo dizendo o que o animal estava fazendo naquele exato momento. Até agora, a maioria dos modelos avançados de leitura cerebral só conseguia aprender com dados "rotulados", deixando vastas bibliotecas de gravações cerebrais "não rotuladas" acumulando poeira, incapazes de ajudar a melhorar o decodificador.
Surge uma nova abordagem que trata o cérebro como uma linguagem. Assim como os grandes modelos de linguagem (como os que escrevem histórias ou respondem perguntas) aprendem lendo bilhões de livros sem precisar que um humano explique cada frase, esta nova pesquisa sugere que podemos ensinar modelos de decodificação cerebral a entender a "gramática" da atividade neural por conta própria. O artigo apresenta um método chamado MOJO (autOencoder mascarado para treinamento conjunto - Masked autOencoder-based JOint training). Pense nisso como um estudante que estuda tanto um livro didático com respostas (dados rotulados) quanto uma enorme biblioteca de romances de mistério sem chaves de resposta (dados não rotulados). Ao tentar preencher as páginas que faltam nos romances de mistério, o estudante aprende a estrutura subjacente da história tão bem que, quando finalmente faz o teste com o livro didático, ele tira nota máxima. Os pesquisadores descobriram que, ao combinar esses dois estilos de aprendizagem, seu modelo se tornou um decodificador muito melhor, especialmente quando havia pouquíssimos exemplos rotulados para começar, e funcionou inclusive em diferentes espécies e tipos de sinais cerebrais.
O Problema: O Gargalo do "Rótulo"
Imagine que você está tentando aprender uma nova língua. Você tem um dicionário que diz que a palavra "maçã" significa uma fruta vermelha. Se você tiver apenas este dicionário (dados rotulados), você pode aprender a palavra "maçã". Mas, se quiser se tornar fluente, precisa ler milhares de livros, artigos e histórias (dados não rotulados) para entender como as palavras se encaixam, como as frases fluem e como o contexto altera o significado de uma palavra.
Por anos, os modelos de decodificação cerebral mais avançados, conhecidos como modelos de "tokenização de spikes" (como a família POYO), eram como estudantes que tinham apenas o dicionário. Eles eram incrivelmente bons em associar sinais cerebrais específicos a movimentos específicos, mas só conseguiam aprender com dados onde os cientistas haviam registrado cuidadosamente o que o animal estava fazendo em cada momento. Esta é uma limitação enorme porque coletar dados rotulados é caro, demorado e muitas vezes impossível para certos experimentos. Enquanto isso, neurocientistas coletaram terabytes de dados cerebrais "não rotulados" — gravações de neurônios disparando sem saber o que o animal estava pensando ou fazendo naquele segundo exato. Esses modelos estavam efetivamente ignorando esse tesouro.
A Solução: O Truque de "Preencher as Lacunas" do MOJO
Os autores deste artigo, Ximeng Mao, Nanda H. Krishna e sua equipe, criaram o MOJO para resolver isso. Eles queriam ensinar esses modelos a aprender com os dados não rotulados, assim como um modelo de linguagem aprende com um livro.
Para fazer isso, eles usaram um truque inteligente chamado autoencodificação mascarada. Imagine que você tem uma frase: "O gato sentou no tapete". Se você cobrir a palavra "sentou", consegue adivinhar o que era? Se você leu histórias suficientes sobre gatos, provavelmente conseguirá adivinhar "sentou", "ficou de pé" ou "pulou" com base no contexto. O MOJO faz isso com sinais cerebrais. Ele pega uma sequência de disparos neurais (a "frase"), esconde (mascara) aleatoriamente alguns dos sinais e pede ao modelo para prever quais eram os sinais que faltavam.
Aqui está a mágica: o modelo tem que aprender as regras ocultas de como os neurônios conversam entre si para fazer essas suposições. Ele aprende a "gramática" do cérebro. Mas o modelo não apenas adivinha; ele também mantém seu trabalho original de prever o comportamento (como o movimento do braço) usando os dados rotulados. Ele faz ambos ao mesmo tempo. Isso é chamado de treinamento conjunto. O modelo aprende a estrutura profunda do cérebro a partir dos dados não rotulados, o que o ajuda a entender muito melhor os dados rotulados.
Os Resultados: Mais Inteligente, Mais Rápido e Mais Flexível
A equipe testou o MOJO em três tipos muito diferentes de dados cerebrais:
- Alcance de Macaco: Macacos alcançando alvos em uma tela.
- Visão de Camundongo: Camundongos olhando para diferentes padrões visuais.
- Fala Humana: Humanos falando sílabas, registradas de eletrodos na superfície do cérebro (ECoG).
Em todos os testes, o MOJO superou os modelos que utilizavam apenas dados rotulados. Mas a parte mais emocionante foi o que aconteceu quando eles tinham muito poucos dados rotulados.
O Superpoder de "Poucos Exemplos" (Few-Shot)
Normalmente, se você tem poucos exemplos para ensinar um modelo (um cenário de "poucos disparos" ou few-shot), ele tem dificuldades. Mas o MOJO foi um campeão aqui. Em um experimento com macacos, a equipe tentou ensinar o modelo a decodificar movimentos usando apenas dois ensaios rotulados (tentativas de calibração). Um modelo padrão falhou miseravelmente. O MOJO, no entanto, usou os dados não rotulados para entender o "sentimento" geral da atividade cerebral. Quando deram a ele apenas dois ensaios rotulados, ele alcançou mais de 60% do desempenho de um modelo treinado em um conjunto de dados completo. Com apenas quatro ensaios rotulados, atingiu 75%. Foi como um estudante que, após ler mil romances de mistério, consegue resolver um novo mistério com apenas duas pistas.
Transversalidade entre Espécies e Modalidades
Os pesquisadores também testaram se o MOJO poderia aprender com uma espécie e aplicar o conhecimento a outra. Eles pré-treinaram o modelo com dados de alcance de macaco e depois o ajustaram (fine-tuning) com dados de visão de camundongo. O modelo transferiu seu conhecimento com sucesso, mostrando que a "gramática" do cérebro que ele aprendeu era universal o suficiente para ajudar a entender o cérebro de outro animal.
Ainda mais surpreendente, eles testaram o MOJO em dados de fala humana (ECoG), que é um sinal contínuo, não os "disparos" discretos de neurônios. Embora o MOJO tenha sido projetado para spikes, ele se adaptou e teve um desempenho tão bom quanto modelos construídos especificamente para sinais contínuos. Isso sugere que a ideia central de aprender com dados não rotulados é uma ferramenta poderosa que funciona através de diferentes tipos de registros cerebrais.
Os Insights "Ocultos"
Um dos efeitos colaterais mais legais do MOJO foi que o modelo aprendeu a entender a estrutura do cérebro sem ser explicitamente instruído a isso. Os pesquisadores pediram ao modelo para adivinhar de qual parte do cérebro vinha um neurônio (por exemplo, o córtex visual versus o hipocampo) apenas olhando para sua "incorporação" (embedding) interna (sua impressão digital digital). O modelo acertou 94% das vezes para algumas tarefas, embora nunca tenha sido treinado para essa classificação. Ele também aprendeu a prever as taxas de disparo dos neurônios com alta precisão. Isso significa que o modelo não estava apenas memorizando respostas; ele estava realmente aprendendo um mapa rico e interpretável de como o cérebro funciona.
Por Que Isso Importa
O artigo sugere que, ao combinar o aprendizado supervisionado (aprender com respostas) e o aprendizado autossupervisionado (aprender a partir de padrões nos dados), podemos construir interfaces cérebro-computador muito mais flexíveis e poderosas. Não precisamos descartar as montanhas de dados não rotulados que já possuímos; podemos usá-los para ensinar aos nossos modelos as regras fundamentais do cérebro.
Esta abordagem torna mais fácil treinar modelos para novas tarefas ou novos pacientes com um tempo de calibração mínimo. Também abre as portas para "modelos de fundação neuro" — modelos cerebrais massivos e de propósito geral que podem ser adaptados para muitos trabalhos diferentes, desde ajudar pessoas paralisadas a se mover até entender como tomamos decisões. Os autores observam que, embora este seja um passo significativo, os modelos ainda precisam de muitos dados para aprender a dinâmica complexa do cérebro, e ainda existem desafios em como lidar perfeitamente com diferentes tipos de sinais. Mas o caminho está claro: o futuro da decodificação do cérebro reside em ensinar esses modelos a ler as histórias "não rotuladas" de nossas mentes.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.