← Últimos artigos
⚡ electrical engineering

VLN on the Fly: An Onboard Vision-Language Navigation Stack for Aerial Robots

O artigo apresenta o "VLN on the Fly", uma pilha de navegação visão-linguagem embarcada e modular para robôs aéreos que separa o aterramento, o planejamento e o controle em estágios distintos para alcançar altas taxas de sucesso e segurança, mantendo um baixo custo computacional.

Autores originais: Marco S. Tayar, Felipe Tommaselli, Gianluca Capezutto, Pedro Antonio Rabelo Saraiva, Pedro H. V. de Freitas, Lucas Kido, Guilherme Sonego, Ricardo V. Godoy, Marcelo Becker

Publicado 2026-09-18
📖 4 min de leitura☕ Leitura rápida

Autores originais: Marco S. Tayar, Felipe Tommaselli, Gianluca Capezutto, Pedro Antonio Rabelo Saraiva, Pedro H. V. de Freitas, Lucas Kido, Guilherme Sonego, Ricardo V. Godoy, Marcelo Becker

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Dentro do zumbido silencioso de um armazém ou nos cantos desordenados de uma casa, um novo tipo de robô está aprendendo a ouvir. Por anos, cientistas tentaram ensinar máquinas a compreender a linguagem humana e a agir sobre ela, um campo conhecido como navegação visão-linguagem. A ideia é simples: uma pessoa diz, "Vá para a cadeira vermelha", e o robô descobre onde essa cadeira está e voa ou dirige até lá. Embora isso funcione bem em simulações de computador controladas, fazer isso acontecer em um robô voador real é uma história diferente. O robô deve ver o mundo, entender as palavras, planejar um caminho seguro pelo ar e controlar seus motores, tudo isso enquanto carrega seu próprio computador e bateria. Se o robô cometer um erro ao entender as palavras, ou se calcular mal uma curva, ele poderá colidir. O desafio é construir um sistema que seja inteligente o suficiente para seguir instruções, mas seguro o suficiente para voar sem supervisão humana constante.

Uma equipe de pesquisadores da Universidade de São Paulo construiu um sistema chamado "VLN on the Fly" para resolver esse problema. Em vez de tentar ensinar um único programa de computador massivo a fazer tudo de uma vez, eles dividiram o trabalho em três etapas claras que trabalham juntas como uma corrida de revezamento. Primeiro, um modelo de linguagem especializado analisa a transmissão da câmera e a instrução falada para encontrar uma área geral onde o objeto alvo possa estar. Segundo, um sistema de planejamento pega essa área geral e usa informações de profundidade para calcular um caminho 3D suave e seguro pelo ar. Terceiro, uma política de controle treinada pega esse caminho e comanda diretamente os motores do drone para segui-lo. Essa abordagem passo a passo permite que os pesquisadores verifiquem cada parte do processo, garantindo que, se uma etapa falhar, o sistema saiba exatamente onde está o problema e possa parar antes de uma colisão ocorrer.

Os pesquisadores testaram esse sistema em um pequeno drone quadrotor equipado com uma câmera e um computador compacto embarcado. Eles colocaram objetos cotidianos como uma lata de lixo, uma cadeira e um extintor de incêndio em uma sala e pediram ao drone para voar até eles com base em comandos de voz. Em quinze voos separados, o drone alcançou seu alvo em treze deles. Quando chegava, estava, em média, a menos de seis centímetros de distância do local pretendido. O sistema funcionou bem mesmo quando o drone precisava navegar ao redor de obstáculos, planejando caminhos com sucesso que evitavam colisões em um ambiente desordenado. Todo o processo rodou no próprio drone, usando cerca de 39 por cento da potência do computador embarcado, o que deixa bastante espaço para outras tarefas.

Uma das descobertas mais importantes foi como o sistema lida com a incerteza. O modelo de linguagem não tenta localizar o pixel exato de um objeto, o que pode ser propenso a erros. Em vez disso, ele divide a visão da câmera em uma grade simples e seleciona a célula geral onde o objeto provavelmente está. Essa abordagem grosseira provou ser muito mais confiável. Quando o sistema foi testado em uma sala cheia de obstáculos, ele evitou colisões com sucesso na maioria das tentativas. Nos poucos casos em que não alcançou o alvo, geralmente era porque o objeto saiu do campo de visão da câmera ou o sensor de profundidade não conseguia enxergar longe o suficiente, não porque o drone perdeu o controle. Os pesquisadores também descobriram que o sistema conseguia distinguir entre diferentes objetos, identificando corretamente uma cadeira quando se pedia uma cadeira e uma lata de lixo quando se pedia um lixo, mesmo quando ambos estavam na mesma sala.

O sucesso deste projeto destaca uma mudança na forma como robôs autônomos são construídos. Em vez de depender de uma única rede neural complexa que tenta aprender tudo de uma vez, este trabalho mostra que separar as tarefas de compreensão, planejamento e controle leva a resultados mais seguros e confiáveis. Ao manter as etapas distintas, os pesquisadores puderam verificar que o drone não estava apenas adivinhando, mas realmente seguindo um caminho lógico da palavra falada para o movimento físico. Embora o sistema ainda tenha limites, como precisar ver o objeto para encontrá-lo e depender do alcance do sensor de profundidade, ele demonstra que robôs voadores podem em breve ser confiados para navegar em espaços internos complexos usando linguagem humana simples, abrindo as portas para futuras aplicações em inspeção, entrega e busca e salvamento.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →