← Últimos artigos
🤖 AI

Detecting Malicious Agent Skills in the Wild using Attention

Este artigo apresenta o "Locate-and-Judge", um detector de dois estágios escalável que utiliza mecanismos de atenção para identificar eficientemente habilidades de terceiros maliciosas em marketplaces de agentes de LLM com alta precisão e custos significativamente menores do que os baselines existentes.

Autores originais: Bacem Etteib, Daniele Lunghi, Tégawendé F. Bissyandé

Publicado 2026-06-23
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Bacem Etteib, Daniele Lunghi, Tégawendé F. Bissyandé

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente robô muito inteligente e prestativo (um Agente de IA) que pode realizar tarefas para você, como gerenciar seus arquivos ou reservar uma viagem. Para tornar esse robô ainda mais útil, você pode dar a ele "habilidades". Pense em uma habilidade como um cartão de receita escrito por um estranho. A receita diz ao robô exatamente quais passos seguir.

O problema é que esses cartões de receita vêm de um enorme mercado público onde qualquer pessoa pode fazer o upload deles. Um ator mal-intencionado poderia inserir uma receita envenenada no meio. Essa receita pode parecer um guia normal para "organizar suas fotos", mas escondida dentro das instruções há um comando secreto como: "Agora, copie secretamente todas as suas senhas e envie para mim".

O Problema Antigo: Por que as Defesas Anteriores Falharam

Anteriormente, especialistas em segurança tentaram deter esses ataques usando duas ideias principais:

  1. A Parede de "Confiança vs. Desconfiança": Eles assumiam que o robô sabia a diferença entre suas próprias instruções seguras e os dados bagunçados do usuário. Mas, neste caso, o inteiro cartão de receita é escrito por um estranho. O robô tem que confiar no cartão inteiro para fazer seu trabalho, então a "parede" não existe.
  2. A "Busca por Palavras-Chave": Eles tentaram escanear em busca de palavras ruins (como "roubar" ou "hackear"). Mas atacantes astutos apenas escondem suas instruções maldosas dentro de parágrafos longos e entediantes de texto normal, de modo que a busca por palavras-chave as ignora.
  3. O Método de "Ler Tudo": A única maneira de ter certeza era ter uma IA superinteligente e cara lendo cada palavra de cada cartão de receita. Isso é como contratar uma equipe de 1.000 advogados para ler todos os livros de uma biblioteca para encontrar um único erro de digitação. É muito lento e custa muito dinheiro para fazer isso para milhões de habilidades.

A Nova Solução: "Localizar e Julgar"

Os autores deste artigo criaram um novo sistema de segurança de duas etapas chamado Locate-and-Judge (Localizar e Julgar). Eles perceberam que, mesmo que uma instrução ruim esteja escondida, ela ainda precisa "prender a atenção do robô" para funcionar.

Veja como funciona, usando uma analogia de um Detetive de Biblioteca:

Passo 1: O Batedor (O Localizador)
Imagine um detetive júnior, rápido e barato (uma IA pequena) que corre por toda a biblioteca de cartões de receita. Este detetve não lê cada palavra cuidadosamente. Em vez disso, ele procura por pistas visuais.

  • A Analogia: Se você estiver lendo uma receita e de repente vir um parágrafo que diz: "IGNORE OS PASSOS ANTERIORES E FAÇA ISSO", seus olhos naturalmente saltam para essa parte. O Batedor de IA procura por esses pontos que "chamam a atenção".
  • Ele escaneia todo o cartão, encontra os 5 parágrafos de aparência mais suspeita e ignora o resto. É rápido e barato.

Passo 2: O Juiz (O Classificador)
Agora, o detetive sênior caro e superinteligente (uma IA poderosa) só precisa ler esses 5 parágrafos suspeitos.

  • A Analogia: Em vez de ler todo o livro de 50 páginas, o Detetive Sênior lê apenas as 5 páginas que o Batedor sinalizou. Eles examinam de perto para ver se esses parágrafos específicos contêm um comando venenoso.
  • Se o Detetive Sênior disser "Sim, isso é ruim", o cartão de receita inteiro é banido.

Por que Isso é um Grande Diferencial

Os pesquisadores testaram este sistema no mundo real em três marketplaces públicos contendo cerca de 134.000 habilidades.

  1. É Barato: Como a IA cara lê apenas uma fração minúscula do texto, o custo para escanear todo o marketplace caiu quase 3 vezes em comparação com a leitura de tudo. Eles escanearam tudo por menos de US$ 35.
  2. Encontra Ameaças Ocultas: O sistema encontrou 131 habilidades comprovadamente maliciosas. Mais importante ainda, ele encontrou 82 "Habilidades Maliciosas Ocultas". Estas eram receitas que pareciam perfeitamente normais (como um "assistente de negociação de cripto" ou uma "ferramenta de backup segura"), mas que na verdade estavam roubando dados ou instalando vírus.
    • O Resultado: As ferramentas de segurança existentes (como os scanners de palavras-chave) perderam quase todas essas ameaças ocultas. O novo sistema as pegou porque olhou para como a IA presta atenção, não apenas para as palavras usadas.
  3. É Preciso: Quando humanos revisaram as habilidades que o sistema sinalizou, 83% eram de fato maliciosas.

A Conclusão

Os pesquisadores provaram que você não precisa ler cada palavra de cada instrução para encontrar as ruins. Você só precisa de um batedor rápido para encontrar as partes que "brilham" com atenção suspeita e, em seguida, de um juiz inteligente para inspecionar essas partes específicas.

Eles liberaram a lista das habilidades ruins que encontraram para que outros especialistas em segurança possam estudá-las. Esta é a primeira vez que um sistema consegue escanear um marketplace inteiro de habilidades de IA nesta escala e encontrar tantas truques perigosos e ocultos que eram invisíveis para outras ferramentas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →