← Últimos artigos
💻 computer science

Security of Foundation-Model-Powered Embodied Agents: Attack Surfaces, Attacks, Defenses, and Evaluation

Este artigo apresenta um levantamento centrado em fronteiras de confiança de agentes incorporados alimentados por modelos de fundação que categoriza riscos de segurança em cinco camadas e doze superfícies de ataque, analisa 58 ataques e 61 defesas para revelar lacunas de pesquisa em áreas como memória e confiança multiagente, e delineia desafios futuros em avaliação e defesas composicionais.

Autores originais: Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao

Publicado 2026-08-18
📖 8 min de leitura🧠 Leitura aprofundada

Autores originais: Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um robô que não apenas segue uma lista rígida de comandos, mas que entende o mundo através da linguagem, visão e experiência. Essas máquinas, frequentemente chamadas de agentes incorporados (embodied agents), estão mudando a forma como pensamos sobre a automação. Em vez de serem programadas com etapas específicas para cada situação possível, elas utilizam modelos de fundação poderosos — sistemas treinados em vastas quantidades de conhecimento humano e dados visuais — para perceber seus arredores, raciocinar sobre o que fazer e decidir como mover seus próprios corpos. Um robô pode olhar para uma mesa desordenada, entender que uma xícara está em perigo de cair e, então, planejar uma sequência de movimentos para salvá-la, tudo isso sem que um humano digite uma única instrução. Essa mudança da programação fixa para a tomada de decisão flexível e inteligente promete trazer os robôs para nossas casas, hospitais e fábricas. No entanto, essa nova liberdade traz um novo tipo de risco. Quando as decisões de uma máquina são impulsionadas pelas informações que ela lê, vê ou lembra, essa informação torna-se um ponto potencial de falha. Se um atacante conseguir enganar a compreensão do robô sobre o mundo, ele pode fazer com que a máquina aja de formas perigosas, mesmo que os motores físicos e as engrenagens do robô estejam perfeitamente seguros.

Uma equipe de pesquisadores da Universidade de Wuhan mapeou exatamente onde residem esses perigos. Eles estudaram 58 maneiras diferentes de atacar esses robôs inteligentes e 61 maneiras diferentes de defendê-los, criando um guia abrangente para a segurança desta tecnologia emergente. O trabalho deles revela que as velhas formas de pensar sobre a segurança dos robôs já não são suficientes. No passado, proteger um robô significava proteger seus fios e seu código de software de hackers. Hoje, as partes mais vulneráveis são os sentidos e a mente do robô. Os pesquisadores descobriram que os atacantes não precisam invadir o sistema operacional de um robô para causar danos; eles podem simplesmente alterar o que o robô vê ou o que lhe é dito para fazer. Ao organizar essas ameaças em uma estrutura clara, a equipe mostrou que os ataques mais comuns visam os olhos e as mãos do robô, enquanto as defesas mais comuns são colocadas logo antes do robô se mover. Esse desequilíbrio deixa muitas outras áreas críticas, como a memória de longo prazo do robô e sua comunicação com outras máquinas, amplamente desprotegidas.

Os pesquisadores começaram definindo as diferentes camadas da vida de um robô, desde o momento em que seu software é criado até o momento em que ele interage fisamente com o mundo. Eles identificaram doze pontos de entrada específicos onde um atacante poderia introduzir uma mentira ou um truque pela primeira vez. Estes variam desde o início, onde os dados de aprendizado do robô podem ser envenenados antes mesmo de ser implantado, até o fim, onde seus movimentos físicos são diretamente sequestrados. Uma percepção fundamental de seu trabalho é que o método de ataque não é o mesmo que o lugar onde ele entra. Por exemplo, um "backdoor" (porta dos fundos) é um tipo de armadilha oculta que pode ser plantada nos dados de treinamento do robô, mas que pode só ser acionada mais tarde por uma frase específica dita por um usuário ou uma imagem específica mostrada ao robô. Os pesquisadores argumentam que os especialistas em segurança devem focar em onde o ataque cruza pela primeira vez a linha para o mundo confiável do robô, em vez de focar apenas na técnica usada para atravessá-la. Essa distinção ajuda a entender como uma pequena mentira na memória de um robô pode eventualmente levar a um grande erro físico.

Quando a equipe analisou o panorama da pesquisa atual, um padrão claro emergiu. A maioria dos estudos de ataque focou em duas áreas específicas: a percepção multimodal do robô e suas interfaces de ação. Em termos simples, isso significa que a maioria dos pesquisadores está tentando enganar os olhos do robô ou forçá-lo a agarrar o objeto errado. Eles descobriram que metade dos ataques registrados visava os sensores do robô, como câmeras ou microfones, ou os sinais que dizem ao robô como se mover. Isso faz sentido porque esses são os elos diretos entre a mente digital e o corpo físico. Se um atacante puder enganar a câmera para ver uma placa de pare como uma placa de siga em frente, ou enganar o rob em a pensar que uma parede é um espaço aberto, as consequências podem ser imediatas e físicas. Da mesma forma, muitos ataques visam a etapa final onde o robô decide por um movimento específico, como um comando para girar um motor ou levantar um peso.

No entanto, as defesas contam uma história diferente. Os pesquisadores descobriram que a maioria das medidas de segurança está concentrada no final do processo, logo antes do robô executar uma ação. Isso é como ter um guarda que apenas verifica o produto final antes de ele sair da fábrica, em vez de verificar as matérias-primas ou os planos de design. Embora essa proteção de "tempo de execução" (runtime) seja importante, ela deixa as etapas anteriores do processo de pensamento do robô expostas. O estudo mostrou que as defesas para a memória de longo prazo do robô, sua comunicação com outros robôs e a integridade de seu mapa interno do mundo são surpreendentemente raras. Por exemplo, existem pouquíssimos estudos sobre como proteger a memória de um robô contra envenenamento. Se um robô aprende um fato falso de uma fonte maliciosa e o armazena, essa mentira pode influenciar suas decisões por muito tempo, causando erros repetidos que um simples verificador de ação poderia não detectar.

A equipe também destacou os desafios únicos de testar esses sistemas. Diferente de um chatbot baseado em texto, que só precisa ser julgado por suas palavras, um robô incorporado deve ser testado em suas ações físicas. Um robô pode seguir com sucesso uma instrução maliciosa para "mover a xícara", mas se ele derrubar a xícara ou derrubar um vaso enquanto o faz, o ataque teve sucesso de uma forma que um teste apenas de texto jamais detectaria. Os pesquisadores observaram que muitos estudos atuais dependem de simulações de computador, que são úteis, mas frequentemente falham em capturar a realidade desordenada do mundo físico, como mudanças na iluminação, ângulos de câmera ou a natureza imprevisível de objetos reais. Eles argumentaram que a verdadeira segurança exige testar robôs em ambientes reais, onde as consequências de um erro são tangíveis. Eles também apontaram que, à medida que os robôs começam a trabalhar juntos em grupos, o risco aumenta. Se um robô em uma equipe for comprometido, ele pode espalhar informações ruins para os outros, fazendo com que todo o grupo falhe.

Olhando para o futuro, os pesquisadores sugerem que o campo precisa ir além de correções simples. Eles propõem que os futuros robôs sejam projetados com uma compreensão mais profunda de confiança. Isso significa que cada informação que um robô recebe — de uma voz humana, uma imagem de câmera ou uma mensagem de outro robô — deve carregar um rótulo indicando sua fonte e sua autoridade. Um robô deve saber que uma placa na parede é apenas uma descrição do mundo e não um comando para mudar seu comportamento, enquanto uma ordem direta de um operador humano deve ser tratada com maior prioridade. Eles também enfatizam a necessidade de melhores formas de verificar o estado interno do robô. Se um robô acredita que uma porta está aberta, deve haver uma maneira de verificar se essa crença é baseada em evidências sólidas ou em um truque. O objetivo é construir sistemas onde a segurança esteja tecida em todas as camadas, desde os dados usados para treinar o robô até o movimento final de seu braço.

O trabalho de Liu e seus colegas serve como um roteiro crucial para um campo em rápida evolução. Ao separar o ponto de entrada de um ataque do método utilizado, eles forneceram uma maneira mais clara de entender as vulnerabilidades das máquinas inteligentes. Suas descobertas sugerem que, embora estejamos ficando melhores em impedir que os robôs façam a coisa errada no último segundo, ainda não somos bons em evitar que eles sejam enganados para pensar a coisa errada em primeiro lugar. À medida que essas máquinas se tornam mais integradas às nossas vidas diárias, o desafio será garantir que sua capacidade de aprender e se adaptar não ocorra à custa de sua segurança. O caminho a seguir exige uma mudança de apenas remendar buracos individuais para construir um sistema onde a confiança seja verificada em cada etapa, garantindo que as ações do robô permaneçam alinhadas com a intenção humana, mesmo diante de uma decepção sofisticada.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →