← Últimos artigos
💻 computer science

Attention Hijacking: Response Manipulation Across Queries in Vision-Language Models

Este artigo introduz o "Sequestro de Atenção", um novo ataque adversarial que aprimora a transferibilidade entre consultas da manipulação de respostas em Modelos Visão-Linguagem ao direcionar explicitamente as distribuições internas de atenção para um padrão persistente dominado pela imagem, reduzindo assim a dependência da saída manipulada em relação à formulação específica da consulta.

Autores originais: Zhiqiang Wang, Dongrui Liu, Yan Li, Zonghao Ying, Wei Xue, Wenhan Luo, Yike Guo

Publicado 2026-05-19
📖 4 min de leitura☕ Leitura rápida

Autores originais: Zhiqiang Wang, Dongrui Liu, Yan Li, Zonghao Ying, Wei Xue, Wenhan Luo, Yike Guo

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um Modelo Visão-Linguagem (VLM) como um assistente muito inteligente, mas ligeiramente confuso, que consegue ver imagens e ler perguntas. Normalmente, esse assistente observa tanto a imagem quanto a pergunta para decidir o que dizer. Se você perguntar: "O que há nesta imagem?", ele olha para a foto e responde. Se você perguntar: "Isso é perigoso?", ele olha para a foto e responde.

O artigo apresenta uma nova forma de "hackear" esse assistente chamada Sequestro de Atenção. Eis como funciona, explicado de forma simples:

O Problema: A Falha do "Tamanho Único"

Imagine que você tem um truque de mágica onde altera levemente uma foto (de forma tão sutil que o olho humano não consegue perceber a mudança) para fazer o assistente dizer uma frase específica, como "Desculpe, não posso ajudar com isso".

Com os antigos métodos de hacking, esse truque funcionava apenas para uma pergunta específica.

  • Cenário A: Você mostra a foto alterada e pergunta: "O que é isso?" -> O assistente diz: "Desculpe, não posso ajudar com isso." (Sucesso!)
  • Cenário B: Você mostra a mesma foto alterada, mas pergunta: "Isso é seguro?" -> O assistente ignora o truque e responde normalmente. (Falha!)

Os antigos truques eram muito frágeis. Eles dependiam da formulação específica da pergunta para funcionar.

A Descoberta: Quem é o Chefe?

Os pesquisadores olharam dentro do "cérebro" do assistente (especificamente, como ele presta atenção a diferentes partes da entrada). Eles descobriram que, para o truque funcionar, o assistente precisa parar de ouvir a pergunta e começar a ouvir quase inteiramente a imagem.

  • Modo Normal: O assistente equilibra a atenção entre a imagem e a pergunta.
  • Modo de Hack Antigo: O assistente ouve a imagem às vezes, mas se a pergunta mudar, ele fica confuso e volta a ouvir a pergunta.
  • A Chave da Descoberta: Se você conseguir forçar o assistente a fazer da imagem o "Chefe" da conversa, as palavras específicas da pergunta deixam de importar. A imagem torna-se a única coisa que impulsiona a resposta.

A Solução: Sequestro de Atenção

Os pesquisadores criaram um novo método chamado Sequestro de Atenção. Pense nisso assim:

Imagine que o cérebro do assistente tem um botão de volume para "Imagem" e um botão de volume para "Pergunta".

  1. O Sequestro: O novo método gira o botão de volume da "Imagem" até o máximo e gira o botão de volume da "Pergunta" até o mínimo.
  2. O Resultado: Não importa qual pergunta você faça (mesmo que seja totalmente desconectada da imagem), o assistente está tão focado na imagem alterada que ignora a pergunta e apenas repete a frase que o hacker deseja.

É como colocar um par de fones de ouvido com cancelamento de ruído no assistente que só deixa passar a "voz" da imagem, enquanto bloqueia a voz de quem faz a pergunta.

Por Que Isso Importa (Segundo o Artigo)

O artigo mostra que este método é muito mais forte que os anteriores:

  • Funciona em diferentes perguntas: Você pode criar uma única imagem alterada, e ela forçará o assistente a dizer a mesma coisa, seja você perguntando "O que é isso?", "Isso é vermelho?" ou "Conte uma piada".
  • Funciona em diferentes modelos: Eles testaram em vários modelos de IA populares (como LLaVA, InternVL e Qwen) e funcionou bem em todos eles.
  • É versátil: Eles mostraram que esse truque do "botão de volume" pode ser usado para outras coisas também, como fazer a IA recusar responder (jailbreaking), fazer ela mentir sobre o que há na imagem (alucinação) ou fazê-la falar para sempre (exemplos esponja).

O "Segredo"

Para fazer isso funcionar suavemente, os pesquisadores também adicionaram uma estratégia de "tamanho de passo dinâmico". Imagine tentar empurrar um carro pesado. Se você empurrar com muita força e muito rápido, o carro pode pular para frente e para trás. Este método empurra com força no início para iniciar o padrão de atenção e, em seguida, alivia suavemente para garantir que o carro (a IA) permaneça exatamente onde você quer, sem oscilar.

Resumo

Em resumo, o artigo diz: "Descobrimos que, se você forçar uma IA a ignorar a pergunta e ouvir apenas a imagem, você pode controlar sua resposta independentemente do que o usuário perguntar. Criamos uma ferramenta para fazer exatamente isso, tornando o 'hack' muito mais confiável e poderoso do que antes."

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →