Striatal interneuron microcircuits gate reinforcement to stabilize adaptive choice
Este estudo identifica um microcircuito desinibitório no estriado dorsomedial envolvendo interneurônios de tirosina hidroxilase e somatostatina que controla os sinais de reforço para transformar resultados imediatos de tentativas em políticas comportamentais estáveis e adaptativas.
Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA de um preprint que não foi revisado por pares. Não é aconselhamento médico. Não tome decisões de saúde com base neste conteúdo. Ler aviso legal completo
Todos os dias, fazemos inúmeras pequenas escolhas, desde decidir qual trajeto tomar para o trabalho até escolher uma refeição em um cardápio. Algumas dessas escolhas são aprendidas por meio de tentativa e erro, um processo no qual nossos cérebios pesam o sucesso ou o fracasso de uma ação em relação ao resultado que ela produziu. Esse aprendizado ocorre em uma região específica do cérebro chamada estriado, uma estrutura profunda que atua como um centro de processamento de informações sobre recompensas e punições. Dentro desse centro, um tipo de célula nervosa conhecido como neurônio de projeção espinhosa atua como o principal mensageiro, enviando sinais que impulsionam nosso comportamento. Cientistas há muito entendem que essas células mensageiras são controladas por entradas excitatórias, mas o papel das células inibitórias locais — aquelas que atuam como freios ou filtros dentro do próprio estriado — permaneceu um mistério. Compreender como esses freios locais funcionam é crucial porque eles podem ser a chave para como adaptamos nossos hábitos quando as regras do mundo mudam, passando de uma estratégia bem-sucedida para uma nova quando nossas velhas maneiras deixam de funcionar.
Uma equipe de pesquisadores voltou recentemente sua atenção para o estriado dorsomedial para descobrir como esses circuitos inibitórios locais influenciam o aprendizado. Eles se concentraram em um tipo específico de tarefa de aprendizado na qual um animal tinha que empurrar ou puxar uma alavanca para obter uma recompensa, mas as regras do jogo mudariam ocasionalmente. Às vezes, empurrar era o movimento correto, e às vezes puxar era, e o animal tinha que descobrir a mudança com base em se recebia uma recompensa ou não. Ao observar a atividade de diferentes células nervosas inibitórias durante esse processo, os cientistas descobriram um circuito interno preciso que liga o resultado imediato de uma única tentativa à estratégia mais ampla que o animal usa para fazer escolhas. Eles descobriram que dois tipos específicos de células inibitórias, distinguidos pelas proteínas que contêm, reagem de formas opostas aos mesmos eventos. Um tipo, que contém uma proteína chamada somatostatina, torna-se ativo quando uma tentativa falha ou quando uma recompensa surge inesperadamente. O outro tipo, que contém a proteína tirosina hidroxilase, faz o oposto: ele se aquieta quando uma tentativa falha e entra em ação quando uma recompensa é recebida.
Os pesquisadores então mapearam como esses dois tipos de células conversam entre si e com as principais células mensageiras. Eles descobriram que, quando as células de tirosina hidroxilase estão ativas, elas suprimem as células de somatostatina. Essa supressão remove um freio, permitindo que as células mensageiras principais disparem mais livremente. Essa cadeia de eventos cria uma via onde um bom resultado desencadeia uma sequência específica que aumenta a atividade das células responsáveis por impulsionar a ação. Para testar se esse circuito era realmente necessário para o aprendizado, os cientistas silenciaram temporariamente essas células em animais vivos. Quando interromperam o funcionamento das células de somatostatina, os animais começaram a fazer a escolha errada repetidamente, mantendo uma estratégia suboptimal mesmo quando ela não trazia mais benefícios. Inversamente, quando silenciaram as células de tirosina hidroxilase, os animais tiveram dificuldade em aprender com recompensas positivas, falhando em reforçar o comportamento correto. Esses experimentos mostraram que este microcircuito específico atua como um portão, decidindo se o cérebro deve atualizar seu comportamento com base no resultado de uma única tentativa.
O estudo também observou o que acontece dentro das células após essas mudanças comportamentais ocorrerem. Quando as células de somatostatina foram inibidas, os pesquisadores observaram que as conexões entre as entradas excitatórias e as células mensageiras principais tornaram-se mais fortes ao longo do tempo. Esse fortalecimento sugere uma mudança física na fiação do cérebro que poderia explicar por que os animais continuaram fazendo a mesma escolha errada muito depois do experimento ter terminado. Os achados indicam que esse circuito de desinibição faz mais do que apenas reagir a um evento isolado; ele transforma o resultado imediato de uma tentativa em uma mudança duradoura de política. Ao controlar o fluxo de reforço através deste loop local específico, o cérebro pode estabilizar escolhas adaptativas, garantindo que aprendamos com nossos sucessos e falhas de uma forma que guie nossas ações futuras.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.