← Últimos artigos
🤖 machine learning

ASGARD: Action-Space Guard for UAV Resilience via Reinforcement Learning

O artigo apresenta o ASGARD, uma estrutura de professor-aluno de duas fases que aumenta a resiliência de controladores de UAV baseados em Aprendizado por Reforço contra ataques de espaço de ação em tempo de execução, ao treinar um monitor para gerar comandos de ação corrigidos utilizando apenas o histórico de estado físico.

Autores originais: Mohsen Salehi, Karthik Pattabiraman

Publicado 2026-09-21
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Mohsen Salehi, Karthik Pattabiraman

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os drones já não são apenas brinquedos controlados remotamente; são máquinas sofisticadas que navegam pelo céu usando software para interpretar o mundo e decidir para onde voar. No coração desta autonomia reside um tipo de inteligência artificial chamada aprendizagem por reforço, onde um programa de computador aprende a controlar um veículo por tentativa e erro, tal como uma criança a aprender a andar de bicicleta. O sistema observa os seus arredores, tenta um movimento e recebe feedback sobre se esse movimento o aproximou do seu objetivo. Com o tempo, constrói uma estratégia para voar de forma segura e eficiente. No entanto, esta dependência de software cria uma vulnerabilidade. Tal como um piloto humano pode ser enganado por um sinal falso, o computador de um drone pode ser ludibriado. Embora os investigadores se preocupem há muito tempo com hackers a introduzir dados falsos nos sensores do drone, surgiu uma ameaça mais subtil e perigosa: ataques que ocorrem depois de o drone já ter decidido o que fazer.

Imagine que um drone calculou que precisa de se inclinar ligeiramente para a esquerda para manter o curso. O computador envia esta instrução para os motores. Num tipo específico de ciberataque, um intruso intercepta essa instrução na fração de segundo entre a decisão do computador e a ação do motor, alterando o comando antes de este ser executado. O cérebro do drone pensa que está a voar corretamente, mas o seu corpo está a ser forçado a mover-se numa direção diferente e perigosa. Isto é conhecido como um ataque ao espaço de ação (action-space attack). Como o ataque ocorre após a decisão ser tomada, os sistemas de segurança tradicionais que verificam os sensores ou a lógica do drone muitas vezes o ignoram por completo. O drone parece estar a pensar claramente, mesmo enquanto está a ser sequestrado.

Para enfrentar esta ameaça invisível, investigadores da Universidade da Colúmbia Britânica desenvolveram um novo sistema de defesa chamado ASGARD. O sistema foi concebido para atuar como um guardião dos comandos do drone, garantindo que o que os motores recebem é exatamente o que o computador pretendia, mesmo que um atacante tente adulterar a mensagem. Os investigadores construíram este sistema utilizando um processo de treino de duas etapas que imita a forma como um mestre professor treina um aluno. Na primeira etapa, o sistema "professor" aprende a voar tendo acesso a informações secretas sobre os ataques, como saber exatamente quando e como um intruso está a tentar interferir nos controlos. Este conhecimento privilegiado permite ao professor compreender a diferença entre um comando seguro e um comando corrompido. Ele aprende a gerar um sinal oculto que captura a verdadeira intenção do voo, independentemente do ruído no ambiente.

Depois de o professor ter aprendido esta competência, transfere o conhecimento para um sistema "aluno" que voará realmente o drone no mundo real. O aluno não tem acesso à informação secreta sobre os ataques; ele vê apenas o histórico dos movimentos físicos do drone, tais como a sua posição, velocidade e orientação. Através de um treino cuidadoso, o aluno aprende a reconstruir o sinal oculto do professor utilizando apenas estes factos observáveis. Isto permite ao aluno reconhecer quando um comando foi alterado, mesmo sem conhecer os detalhes específicos do ataque. O sistema inclui um componente de monitorização leve que se situa entre o software de tomada de decisão e os motores. Este monitor verifica constantemente os comandos de saída em relação ao sinal oculto que reconstruiu. Se detetar uma discrepância, corrige instantaneamente o comando antes que este chegue aos motores, neutralizando efetivamente o ataque em tempo real.

Os investigadores testaram esta abordagem num ambiente simulado onde um drone tinha de voar através de uma série de pontos de controlo. Eles sujeitaram o drone a vários tipos de ataques, incluindo aqueles que tentavam forçá-lo a inclinar-se para a frente, rolar lateralmente ou alterar a sua velocidade. Nestes testes, um controlador de drone padrão sem esta proteção colidiu em quase metade dos cenários. Até um sistema de defesa anterior, avançado e desenhado para lidar com ataques de sensores, falhou completamente quando confrontado com estas intrusões no espaço de ação, colidindo em todas as tentativas quando os quatro canais de controlo foram atacados simultaneamente. Em contraste, o sistema ASGARD manteve o drone a voar com segurança. Quando apenas um canal de controlo foi atacado, o sistema completou com sucesso 95% das missões sem um único acidente. Mesmo no cenário mais difícil, onde os quatro canais de controlo foram atacados simultaneamente, o sistema conseguiu completar dois terços das missões, um feito que os outros sistemas não conseguiram alcançar.

O sistema também se revelou surpreendentemente adaptável. Os investigadores treinaram o drone para se defender contra ataques num único controlo específico, como o de inclinação (pitch), e depois testaram-no contra ataques nos outros controlos que nunca tinha visto antes. O sistema generalizou bem, defendendo-se com sucesso contra estas ameaças inéditas e completando a maioria das missões. Isto sugere que o sistema aprendeu uma compreensão fundamental de como detetar a corrupção no fluxo de controlo, em vez de apenas memorizar padrões de ataque específicos. Além disso, o sistema permaneceu eficaz contra ataques furtivos que aumentavam lentamente a interferência ao longo do tempo, uma tática que frequentemente apanha outras defesas desprevenidas. Ao rastrear continuamente o histórico do drone e ajustar as suas correções à medida que a perturbação crescia, o sistema evitou que o drone saísse do curso.

Os resultados indicam que esta abordagem de duas fases oferece uma solução robusta para um problema que deixou os drones autónomos vulneráveis. Ao colocar uma camada inteligente e corretiva entre o software de tomada de decisão e os motores físicos, o sistema garante que o drone executa o seu caminho pretendido, mesmo quando um atacante tenta sequestrar a linha de comando. Embora o estudo tenha sido realizado em simulação, as descobertas sugerem um caminho claro para tornar o voo autónomo mais seguro num mundo cada vez mais conectado e potencialmente hostil. O trabalho demonstra que a resiliência contra ciberataques não requer que o drone pare ou aterre numa emergência; em vez disso, pode ser alcançada através da reparação ativa dos comandos em tempo real, permitindo que a máquina continue a sua missão com confiança.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →