← Últimos artigos
🧬 biology

Learning Options for Compositional Motor Control with Adapter Banks

Este artigo propõe uma nova arquitetura que utiliza um núcleo recorrente compartilhado modulado por um banco de adaptadores residuais para aprender primitivas motoras flexíveis como perturbações de baixo posto emergentes, permitindo que uma política de alto nível congelada sequencie esses adaptadores para uma generalização superior a novas sequências motoras em comparação com baselines multitarefa.

Autores originais: Sreejan Kumar, Marcelo Mattar, Lea Duncker

Publicado 2026-09-16
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Sreejan Kumar, Marcelo Mattar, Lea Duncker

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ⚕️ Esta é uma explicação gerada por IA de um preprint que não foi revisado por pares. Não é aconselhamento médico. Não tome decisões de saúde com base neste conteúdo. Ler aviso legal completo

O movimento habilidoso, desde as escalas fluidas de um pianista até o salto complexo de um ginasta, depende de uma capacidade oculta: o cérebro não aprende cada novo movimento do zero. Em vez disso, ele constrói uma biblioteca de blocos de construção reutilizáveis, ou primitivos, que podem ser misturados, combinados e remodelados para criar infinitas novas ações. Essa capacidade de recombinar um conjunto finito de habilidades em sequências novas é uma marca registrada da destreza humana. Por décadas, cientistas tentaram ensinar essa mesma flexibilidade a agentes artificiais, esperando criar robôs que possam se adaptar a novas tarefas sem a necessidade de serem treinados novamente do zero. O desafio tem sido encontrar uma maneira de um sistema de aprendizado descobrir esses blocos de construção por conta própria e, então, combiná-los sem que as habilidades antigas interfiram nas novas. Teorias recentes na neurociência sugerem que o cérebro pode resolver isso usando uma rede compartilhada de neurônios que é levemente ajustada por diferentes estímulos, permitindo que a mesma maquinaria central produza comportamentos vastamente distintos.

Um novo estudo realizado por pesquisadores da Universidade de Columbia e da Universidade de Nova York traz essa teoria biológica à vida em um modelo computacional, demonstrando como um sistema artificial pode aprender a compor movimentos complexos do zero. A equipe criou um cérebro digital projetado para controlar um braço simulado de duas articulações com seis músculos, muito parecido com um membro humano. Eles pediram a este sistema que aprendesse uma variedade de movimentos, incluindo alcançar em linha reta, mover-se em círculos e traçar padrões de oito. Em vez de simplesmente memorizar esses caminhos, os pesquisadores queriam que o sistema descobrisse as partes subjacentes de cada movimento e aprendesse como costurá-las para realizar tarefas que ele nunca havia visto antes. Para fazer isso, eles construíram uma arquitetura inspirada na conexão entre o córtex motor do céreio e o tálamo, uma estrutura cerebral profunda que ajuda a selecionar e alternar entre diferentes programas motores.

Os pesquisadores projetaram um sistema com uma rede "central" compartilhada que lida com a mecânica básica do movimento, semelhante ao córtex motor. Acoplado a esse núcleo, há um banco de módulos especializados, ou adaptadores, que atuam como pequenos botões ajustáveis que podem refinar o comportamento do núcleo. No cérebro, esses adaptadores corresponderiam a sinais do tálamo que alteram levemente a atividade do córtex motor para produzir um movimento específico. Os pesquisadores não programaram o sistema para saber quando usar cada adaptador; em vez disso, deixaram o sistema aprender a identificar e selecionar o módulo correto ao observar um professor especialista realizar as tarefas. O professor era uma rede separada, pré-treinada, que sabia exatamente qual regra seguir para cada movimento. O sistema aluno, no entanto, teve que descobrir como decompor as ações do professor em segmentos e decidir qual adaptador ativar em cada momento, tudo isso sem ser instruído explicitamente sobre as regras.

Enquanto o sistema aluno treinava nesses movimentos compostos, algo extraordinário aconteceu. Embora os adaptadores tenham sido construídos para serem totalmente flexíveis e complexos, o sistema aprendeu naturalmente a usá-los como ajustes simples de baixo posto (low-rank). Em termos práticos, o sistema descobriu que não precisava reescrever todo o cérebro para cada nova tarefa; ele só precisava fazer pequenos e precisos ajustes no núcleo compartilhado. Isso permitiu que o sistema fatorasse os diferentes movimentos em espaços distintos e separados dentro de seu estado interno. Enquanto a rede do professor, que dependia de entradas de regras explícitas, mantinha todas as suas representações de tarefas emaranhadas em um único espaço compartilhado, o sistema aluno organizou-as em zonas altamente separadas. Cada tipo de movimento, como um alcance reto ou um arco circular, ocupava seu próprio canto distinto no cenário interno do sistema, tornando muito mais fácil alternar entre eles sem confusão.

O verdadeiro teste dessa abordagem veio quando os pesquisadores pediram ao sistema para realizar uma tarefa completamente nova: uma trajetória de duas pétalas que combinava partes dos movimentos que ele havia aprendido de uma forma que ele nunca vira antes. Esse novo caminho exigia costurar uma extensão reta a uma retração curva, e depois uma extensão curva a uma retração reta, criando uma descontinuidade que nem o aluno nem o professor haviam praticado. Os pesquisadores congelaram as redes internas de ambos os sistemas e tentaram encontrar a melhor maneira de sequenciar os blocos de construção disponíveis para corresponder a esse novo alvo. O sistema aluno, com sua arquitetura modular e separada, obteve sucesso com alta precisão, rastreando o novo caminho com um erro de cerca de 0,005 metros. O sistema do professor, que dependia de uma abordagem de subespaço único e emaranhado, teve dificuldades significativas, estagnando com um erro dez vezes maior.

As descobertas sugerem que a chave para o controle motor flexível não é apenas ter uma rede compartilhada, mas ter essa rede modulada por ajustes distintos de baixo posto que mantenham as diferentes tarefas em espaços internos separados. Essa separação geométrica permite que o sistema misture e combine seus primitivos aprendidos para resolver problemas novos sem a interferência que costuma assolar o aprendizado artificial. O estudo fornece uma demonstração concreta de que uma arquitetura inspirada nos loops tálamo-corticais do cérebro pode aprender a descobrir seus próprios blocos de construção reutilizáveis e recombiná-los para lidar com desafios fora da distribuição original. Ao mostrar que um sistema pode aprender a fatorar seu comportamento em subespaços distintos, a pesquisa oferece um caminho promissor para a criação de máquinas que possam se adaptar a novas tarefas físicas com a mesma facilidade e criatividade de um atleta humano.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →