← Últimos artigos
⚡ electrical engineering

Privileged observations enable rapid and reliable policy discovery directly in the physical world

Este artigo demonstra que observações privilegiadas de um sistema físico caótico são decisivas para permitir que agentes de aprendizado por reforço descubram rapidamente políticas de alto desempenho diretamente no mundo real, visto que agentes carentes de tais dados de fluxo falharam em aprender estratégias de aumento de arrasto, apesar de aprenderem com sucesso estratégias de redução de arrasto.

Autores originais: Antonio Terpin, Raffaello D'Andrea

Publicado 2026-09-15
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Antonio Terpin, Raffaello D'Andrea

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um nadador tentando se mover através da água. Se ele pudesse ver as correntes girando ao seu redor, poderia aprender a torcer o corpo de uma forma que cortasse a resistência, ou talvez de uma forma que capturasse a água para impulsioná-lo para frente. Esta é a essência do controle de fluxo ativo: um campo onde engenheiros tentam manipular o movimento invisível e caótico dos fluidos para melhorar como objetos se movem ou permanecem parados. Por décadas, cientistas sabem que girar um cilindro em uma corrente pode mudar o quanto a água empurra contra ele. Às vezes, um giro constante reduz o arrasto, permitindo que o objeto deslize com mais facilidade. Outras vezes, um giro rítmico específico pode, na verdade, aumentar o arrasto, segurando o objeto. O desafio sempre foi descobrir o tempo e a velocidade exatos desse giro para obter o melhor resultado, especialmente porque o fluxo da água é caótico e difícil de prever.

Normalmente, quando engenheiros querem ensinar um computador a controlar tal sistema, eles constroem um modelo virtual da água e deixam o computador praticar ali. Mas os modelos virtuais nunca são perfeitos; eles perdem os detalhes minúsculos e desordenados da água real. Assim, uma equipe de pesquisadores da ETH Zürich decidiu pular a simulação inteiramente. Eles construíram um canal de água físico e ensinaram um agente de computador a aprender diretamente da água real e turbulenta. A pergunta que fizeram foi simples, mas profunda: para aprender a melhor maneira de controlar a água, o computador precisa ver a água girando ao redor do objeto enquanto está aprendendo? Ou ele pode descobrir isso apenas sentindo o empurrão e o puxão no próprio objeto?

Os pesquisadores configuraram um canal de água de bancada, um tanque transparente onde a água circula em um loop. Dentro, um cilindro está posicionado no fluxo, e um motor pode girá-lo em qualquer velocidade ou direção. Para medir o quão bem a água está empurrando o cilindro, eles usaram um sensor de torque sensível. Para ver a água, usaram uma técnica chamada velocimetria de imagem de partículas. Isso envolve projetar uma folha de laser através da água, que contém pequenas partículas flutuantes, e tirar fotos rápidas. Ao rastrear como essas partículas se movem entre as fotos, um computador pode construir um mapa detalhado e em tempo real da velocidade e direção da água logo atrás do cilindro. Este mapa é a "observação privilegiada" — informação extra que o computador pode ver durante o treinamento, mas que pode não precisar mais tarde.

Eles treinaram um agente de aprendizado de propósito geral, um tipo de inteligência artificial, para controlar o cilindro. Em um conjunto de experimentos, o agente recebeu tanto a sensação do arrasto quanto o mapa detalhado do fluxo de água. Em outro conjunto, o agente recebeu apenas a sensação do arrasto, com o mapa da água oculto dele. O objetivo era duplo: primeiro, encontrar uma maneira de girar o cilindro para reduzir o arrasto o máximo possível e, segundo, encontrar uma maneira de girá-lo para aumentar o arrasto o máximo possível.

Os resultados foram impressionantes e revelaram uma assimetria surpreendente. Quando o agente tinha acesso ao mapa detalhado do fluxo de água, ele aprendia incrivelmente rápido. Em poucos minutos de interação com a água real, descobriu uma estratégia para reduzir o arrasto em cerca de 32 por cento. Também encontrou rapidamente uma estratégia para aumentar o arrasto em cerca de 25 por cento. Esses números igualavam ou até superavam ligeiramente o desempenho das melhores estratégias desenhadas por humanos, que haviam sido desenvolvidas ao longo de décadas de estudo.

No entanto, quando os pesquisadores esconderam o mapa da água e forçaram o agente a aprender usando apenas a medição do arrasto, a história mudou completamente. O agente ainda foi capaz de aprender a reduzir o arrasto, alcançando eventualmente uma redução de cerca de 31 por cento. Levou apenas um pouco mais de tempo e foi um pouco mais variável. Mas quando o objetivo era aumentar o arrasto, o agente falhou. Sem ver o fluxo da água, nenhuma das sessões de treinamento conseguiu aprender uma estratégia que aumentasse significativamente o arrasto. O agente não conseguiu descobrir como fazer a água empurrar com mais força, embora a melhor estratégia possível existisse e fosse fisicamente possível.

Para entender por que isso aconteceu, os pesquisadores observaram de perto o que a água estava fazendo. Eles descobriram que, sempre que o cilindro começava a girar, a água quase sempre reagia primeiro empurrando menos contra o cilindro, independentemente de o objetivo ser empurrar mais ou menos. Essa queda inicial no arrasto é uma resposta física natural. Para o agente tentando reduzir o arrasto, essa queda inicial era um sinal útil de que ele estava no caminho certo. Mas para o agente tentando aumentar o arrasto, essa queda inicial era confusa; parecia o oposto do que ele queria alcançar. Sem o mapa detalhado para ver o panorama geral e entender que o arrasto acabaria subindo, o agente ficava preso nesse declínio inicial e nunca aprendia a estratégia correta.

Os pesquisadores então testaram se as estratégias que o agente aprendeu com o mapa da água poderiam ser usadas sem ele. Eles gravaram exatamente os padrões de giro que o agente usou quando tinha o mapa e, em seguida, reproduziram esses mesmos padrões como sequências fixas, sem novas observações. Surpreendentemente, essas sequências fixas funcionaram tão bem quanto o agente vivo e pensante. O agente havia aprendido um conjunto específico de movimentos que funcionavam tão bem que ele não precisava continuar observando a água para executá-los. Isso prova que o mapa da água não era necessário para executar a tarefa, mas era absolutamente essencial para descobrir a tarefa.

Essa descoberta destaca uma distinção crucial no aprendizado: o que você precisa para encontrar uma solução é frequentemente diferente do que você precisa para usá-la. Neste caso, a visão rica e detalhada do fluxo da água atuou como um professor, guiando o agente através das reações iniciais confusas do fluido. Uma vez que o agente encontrou o caminho certo, ele podia percorrê-lo vendado. O estudo sugere que, em sistemas físicos complexos, ter acesso a informações extras durante a fase de aprendizado pode ser o fator decisivo entre o sucesso e o fracasso, mesmo que essa informação não esteja disponível quando o sistema está realmente em funcionamento. Mostra que, para a inteligência artificial dominar o mundo real, caótico e desordenado, ela pode precisar de permissão para ver mais do que jamais lhe será permitido usar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →