A transformer-based model reveals sparse, stimulus-dependent orientation readout from macaque V1 population activity
Este estudo demonstra que um modelo baseado em transformer pode reconstruir precisamente a orientação do estímulo a partir da atividade populacional de V1 de macaco, revelando que a codificação neural redundante sustenta um mecanismo de leitura flexível, esparso e dependente do estímulo mediado pela autoatenção.
Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA de um preprint que não foi revisado por pares. Não é aconselhamento médico. Não tome decisões de saúde com base neste conteúdo. Ler aviso legal completo
O córtex visual primário, uma fina camada de tecido na parte posterior do cérebro, atua como a primeira grande estação de processamento para tudo o que vemos. Quando a luz atinge o olho, os sinais viajam para esta região, onde milhões de neurônios individuais disparam em resposta a características específicas do mundo visual. Uma das propriedades mais fundamentais que esses neurônios detectam é a orientação: o ângulo em que uma linha ou borda está inclinada. Décadas de pesquisa mostraram que esses neurônios não são uniformes; cada um tem um ângulo preferencial, como uma pequena agulha de bússola apontando para uma direção específica. No entanto, o cérebro não depende de um único neurônio para nos dizer em que ângulo estamos olhando. Em vez disso, um estímulo visual ativa uma vasta e sobreposta multidão de milhares de neurônios, cada um com preferências ligeiramente diferentes e níveis variados de atividade. Isso cria um código complexo e redundante, onde a mesma informação está espalhada por uma grande população. O grande mistério para os neurocientistas tem sido como o cérebro filtra essa multidão massiva e ruidosa para extrair uma resposta única e precisa sobre o mundo. Se cada neurônio contribui um pouco, como o cérebro decide em quais deles deve ouvir, e ele os ouve todos igualmente?
Para resolver esse enigma, pesquisadores recorreram a uma nova e poderosa ferramenta do campo da inteligência artificial: um modelo baseado em transformer. Originalmente projetado para o processamento de linguagem, esse tipo de programa de computador é excepcionalmente bom em identificar quais partes de uma entrada complexa são mais importantes para uma tarefa específica. A equipe, liderada por cientistas da Universidade de Pequim e da Universidade de Zhejiang, aplicou esse modelo a dados biológicos reais. Eles registraram a atividade de mais de 1.000 neurônios simultaneamente a partir do córtex visual de sete macacos de rhesus acordados. Os macacos foram apresentados a imagens simples de padrões listrados, conhecidos como estímulos de Gabor, em vários ângulos. Os pesquisadores então inseriram as respostas de cálcio coletivas desses neurônios em seu modelo de computador, pedindo que ele reconstruísse a imagem exata que o macaco havia visto. O objetivo não era apenas ver se o computador conseguia adivinhar o ângulo, mas observar como ele decidia em quais neurônios prestar atenção durante o processo.
Os resultados foram impressionantes. O modelo de computador reconstruiu as imagens listradas com uma precisão incrível, capturando a orientação das linhas com um erro médio de menos de um grau. Esse nível de precisão superou em muito o que modelos de computador mais simples poderiam alcançar, provando que a arquitetura transformer era unicamente adequada para decodificar esse complexo sinal biológico. Mas a verdadeira descoberta veio ao olhar para dentro da "mente" do modelo. Enquanto o computador processava os dados, ele gerava um mapa de atenção, mostrando exatamente quanto peso atribuía a cada neurônio ao tomar sua decisão. Os pesquisadores descobriram que o modelo não tratava os 1.000 neurônios como parceiros iguais. Em vez disso, para qualquer ângulo dado, a reconstrução era dominada por um grupo pequeno e esparso de apenas dois ou três neurônios. Esses neurônios específicos não eram aleatórios; eram aqueles cujos ângulos preferenciais correspondiam à imagem sendo exibida, e eram os que recebiam os sinais de "atenção" mais fortes do restante da rede.
Essa descoberta desafia uma suposição comum de que o cérebro deve tirar a média dos sinais de milhares de neurônios para obter uma imagem clara. O estudo sugere que, embora o cérebro armazene informações de forma redundante em uma grande população, ele lê essa informação de uma maneira altamente seletiva e flexível. O modelo revelou que esses neurônios-chave eram especiais não apenas porque gostavam do ângulo correto, mas porque também eram os mais independentes de seus vizinhos, mostrando menos ruído compartilhado ou variabilidade. Além disso, o modelo mostrou que era capaz de aguçar os sinais desses poucos neurônios-chave, efetivamente aumentando o volume da informação mais útil enquanto diminuía o ruído do restante da multidão. Esse processo permitiu que o sistema extraísse uma orientação precisa de um mar caótico de atividade.
Talvez a evidência mais convincente para esse sistema flexível tenha vindo de um experimento de "e se". Os pesquisadores removeram o pequeno grupo de neurônios altamente ponderados do modelo e pediram que ele tentasse novamente. Em vez de falhar, o modelo se adaptou rapidamente. Ele recrutou um novo e diferente conjunto de neurônios substitutos que possuíam propriedades semelhantes às dos que foram removidos. Esses novos neurônios também estavam sintonizados no ângulo correto e foram capazes de assumir o trabalho de decodificar a orientação com a mesma alta precisão. Isso demonstra que o cérebro não depende de um conjunto fixo e imutável de neurônios "estrelas". Em vez disso, a capacidade de ler informações visuais é um processo dinâmico, onde uma população redundante de células fornece uma rede de segurança, permitindo que o sistema mude para diferentes subconjuntos de neurônios conforme necessário, sem perder a precisão.
O estudo confirma que o córtex visual opera sob um princípio de armazenamento redundante, mas de leitura esparsa e dependente do estímulo. O cérebro mantém a mesma informação em muitos lugares, garantindo robustez, mas quando precisa tomar uma decisão, ele foca seus recursos em um subconjunto muito pequeno e altamente eficaz da população. Esse mecanismo permite tanto a estabilidade de uma grande rede quanto a velocidade e a precisão de uma leitura focada. Ao usar um modelo transformer para decodificar a atividade de neurônios reais, os pesquisadores forneceram uma janela clara para entender como o cérebro pode resolver o problema de extrair detalhes específicos de um código massivo e sobreposto. As descobertas sugerem que a eficiência do cérebro não vem de ter menos neurônios, mas de ter uma maneira inteligente e flexível de escolher quais deles importam mais em qualquer momento dado.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.