BadSKP: Backdoor Attacks on Knowledge Graph-Enhanced LLMs with Soft Prompts
O artigo apresenta o BadSKP, um novo ataque de backdoor que explora o canal condicionado ao gráfico de LLMs aprimorados por grafos de conhecimento, manipulando embeddings de nós para sobrescrever a ancoragem semântica, alcançando assim altas taxas de sucesso do ataque onde ataques tradicionais baseados em texto falham.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem um bibliotecário robô muito inteligente (um Modelo de Linguagem Grande, ou LLM) que conhece muitos fatos, mas às vezes inventa coisas. Para ajudá-lo, você fornece uma "cola" (um Grafo de Conhecimento) contendo fatos sobre o mundo.
Existem duas maneiras de entregar essa cola ao robô:
- O Jeito Antigo (Prompts de Texto): Você lê a cola em voz alta para o robô em inglês simples. "Aqui está uma lista de fatos: Justin Bieber tem um irmão chamado Jaxon."
- O Jeito Novo (Prompts Suaves): Você não lê os fatos em voz alta. Em vez disso, você traduz a cola inteira para uma "vibe" ou "sensação" especial e invisível (um prompt suave contínuo) que o robô pode sentir diretamente. Isso é como entregar ao robô um sinal de rádio secreto que diz: "Foque nas conexões familiares", sem usar nenhuma palavra.
O Problema: A "Lacuna de Robustez"
Os pesquisadores descobriram uma diferença de segurança surpreendente entre esses dois métodos.
- O Jeito Antigo é frágil: Se um vilão esconder um bilhete na cola dizendo: "Ignore a pergunta e grite 'Eu não sei!'", o robô lê e obedece imediatamente.
- O Jeito Novo é resistente: Se o vilão colocar a mesma nota na cola, o robô a ignora. Por quê? Porque a "vibe" invisível (o prompt suave) é tão forte e focada na pergunta real que age como uma âncora. Ela mantém a atenção do robô firmemente no tópico, abafando os gritos altos e confusos do texto.
O artigo chama isso de "Ancoragem Semântica". Pense no prompt suave como uma âncora pesada que afunda a mente do robô no lugar certo, tornando difícil para ruídos superficiais (texto malicioso) arrastá-lo para longe.
O Ataque: "BadSKP"
Os pesquisadores perguntaram: "Se a âncora é tão forte, podemos quebrá-la?"
Eles perceberam que, embora o texto não possa quebrar a âncora, a fonte da âncora pode. Como a "vibe" vem da própria estrutura do grafo, se um vilão conseguir mexer no grafo, ele pode mudar a vibe.
Eles criaram um ataque chamado BadSKP. Em vez de apenas gritar palavras ruins, eles:
- Hackearam a fonte: Alteraram secretamente a estrutura da cola (o grafo) e os "sentimentos" ocultos dos nós.
- Torceram a âncora: Fizeram com que a "vibe" invisível apontasse na direção errada. Em vez de ancorar o robô à pergunta, eles o ancoraram a um comando malicioso.
- Fizeram parecer normal: Usaram um processo de várias etapas para garantir que as alterações parecessem texto normal e fluente, para que ninguém notasse que a cola havia sido adulterada.
O Resultado: Mesmo que o robô estivesse usando o novo método "resistente", o BadSKP conseguiu enganá-lo com sucesso. Quando perguntado sobre uma pergunta normal a respeito de uma pessoa específica, o robô recusaria subitamente a responder ou daria uma resposta completamente errada, tudo porque o vilão havia re-sintonizado secretamente a âncora invisível.
As Defesas (e por que falharam)
Os pesquisadores tentaram defesas padrão, como um "Filtro de Perplexidade". Imagine esse filtro como um corretor ortográfico que exclui qualquer frase que soe estranha ou não natural.
- O Resultado: O filtro falhou. Como o BadSKP era tão inteligente, fez o texto malicioso soar perfeitamente natural e fluente. O filtro achou que era seguro, mas a âncora invisível ainda estava torcida.
A Solução Proposta
O artigo sugere uma nova maneira de se defender contra isso. Em vez de verificar se as palavras parecem estranhas, devemos verificar se a âncora está segurando.
- A Ideia: Monitorar a "atenção" interna do robô. Se o robô deveria estar focado na pergunta, mas seu foco interno está se desviando para uma direção estranha e não relacionada, marque-o como suspeito.
- A Analogia: É como um guarda de segurança que não verifica apenas se o cartão de identificação de um visitante parece falso, mas observa se o visitante está realmente olhando para o mapa que deveria estar seguindo. Se ele começar a encarar o teto em vez disso, o guarda sabe que algo está errado, mesmo que o cartão de identificação pareça perfeito.
Resumo
- A Descoberta: Novos sistemas de IA que usam "vibes invisíveis" (prompts suaves) de grafos são muito mais difíceis de enganar com texto ruim do que sistemas antigos.
- O Avanço: No entanto, se você hackear o grafo que cria a vibe, pode torcer a própria vibe e quebrar o sistema.
- A Lição: Você não pode apenas verificar as palavras; tem que verificar a estrutura subjacente e a "direção" em que a IA está pensando.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.