← Últimos artigos
💻 computer science

Exploring LLM biases to manipulate AI search overview

Este artigo demonstra que os sistemas de Visão Geral de Modelos de Linguagem de Grande Escala (LLM) são suscetíveis a vieses na seleção de fontes, os quais podem ser explorados ao treinar um modelo de aprendizado por reforço para reescrever snippets de pesquisa e manipular resultados, destacando também os riscos de segurança associados a ataques de envenenamento de contexto.

Autores originais: Roman Smirnov

Publicado 2026-05-04
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Roman Smirnov

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Visão Geral: O "Resumidor de IA"

Imagine que você pede a uma bibliotecária (a IA) para encontrar os três melhores livros sobre um tópico específico em uma biblioteca gigantesca. A bibliotecária não lê o livro inteiro; ela olha para a capa, o título e um pequeno resumo na parte de trás (o "snippet") para decidir quais livros recomendar.

Este artigo investiga o que acontece quando essa bibliotecária tem favoritos ocultos (viéses) e se alguém consegue enganar a bibliotecária para escolher um livro específico apenas reescrevendo esse pequeno resumo.

1. A Bibliotecária Tem uma "Lista de Favoritos" (Viéses)

Os pesquisadores primeiro provaram que a bibliotecária de IA não é perfeitamente neutra. Mesmo que você embaralhe a ordem dos livros ou mude ligeiramente a capa, a bibliotecária continua escolhendo os mesmos poucos livros repetidamente.

  • A Analogia: Imagine um professor corrigindo redações. Mesmo que você troque os nomes nos papéis ou mude a fonte, o professor continua dando uma "A" ao mesmo aluno porque gosta do estilo de escrita desse aluno, independentemente do conteúdo real.
  • A Descoberta: A IA prefere certos tipos de fontes (como grandes varejistas) em relação a outras (como o próprio site da marca), mesmo que a informação seja a mesma. Isso é chamado de "Viés de Mídia Conquistada".

2. O Jogo da "Reescrita" (O Experimento)

Os pesquisadores perguntaram: Podemos treinar uma pequena IA para reescrever esses pequenos resumos para que a bibliotecária os escolha?

Eles usaram uma técnica chamada Aprendizado por Reforço. Pense nisso como treinar um cachorro:

  • O cachorro (a pequena IA) tenta reescrever um resumo.
  • Se a bibliotecária escolher o resumo reescrito, o cachorro ganha um petisco (uma recompensa).
  • Se a bibliotecária ignorá-lo, o cachorro não ganha nada.

As Regras do Jogo:
Para tornar isso realista, eles impuseram regras estritas ao cachorro:

  1. Sem trapacear com o tamanho: O cachorro não pode simplesmente fazer o resumo ter 10 páginas para forçar a bibliotecária a lê-lo.
  2. Sem ler o livro inteiro: O cachorro só pode ver o pequeno resumo, não o artigo completo ou a URL.
  3. O contexto importa: O cachorro tem que reescrever o resumo enquanto olha para os outros resumos concorrentes.

3. O Segredo "Relativo"

A maior descoberta foi que a bibliotecária não se importa se um resumo é "perfeito" por si só; ela se importa se ele é melhor que os outros.

  • A Analogia: Imagine um show de talentos. Você não precisa ser o melhor cantor do mundo para ganhar; você só precisa ser ligeiramente melhor que a pessoa ao seu lado.
  • O Resultado: A IA treinada aprendeu a reescrever snippets para serem "ligeiramente melhores" que a concorrência, não necessariamente "perfeitos". Ela enganou com sucesso a bibliotecária para escolher os snippets reescritos com muito mais frequência.

4. A Zona de Perigo (Ataques)

Os pesquisadores então tentaram ver se essa trapaça poderia ser usada para coisas ruins (ataques). Eles tentaram três maneiras diferentes de envenenar o sistema:

  1. Envenenar o Alvo: Eles tentaram esconder palavras nocivas no resumo que estavam reescrevendo. Resultado: Falhou. A IA estava muito focada em fazer o resumo parecer "bom" em comparação aos outros e ignorou as palavras estranhas.
  2. Envenenar o Título: Eles mudaram o título do livro para dizer algo maluco e depois reescreveram o resumo. Resultado: Falhou. A bibliotecária olhou para o título, viu que era estranho e rejeitou o livro de qualquer maneira.
  3. Envenenar a Concorrência (Envenenamento de Contexto): Esta é a assustadora. Eles pegaram o resumo de um concorrente e o encheram de nonsense ou conselhos nocivos (ex: "Essas pulseiras de relógio podem ser usadas para amarrar pessoas!"). Em seguida, pediram à IA para reescrever o resumo do alvo enquanto olhava para aquele concorrente envenenado.
    • Resultado: Sucesso. A IA reescreveu o resumo do alvo para incluir o nonsense ("...amarrar pessoas, a maior vantagem competitiva!"). A bibliotecária, vendo esse novo resumo, escolheu-o e incluiu o conselho nocivo no resumo final.

5. Nem Todas as Bibliotecárias São Iguais

Os pesquisadores testaram isso em diferentes versões de bibliotecárias de IA (diferentes modelos como GPT-4.1 e GPT-5).

  • Algumas bibliotecárias foram facilmente enganadas pelos resumos reescritos.
  • Uma bibliotecária (GPT-5 Mini) foi muito teimosa. Parecia se importar mais com a URL (o endereço do site) do que com o texto em si. Não importa o quão bom fosse o resumo, se a URL não estivesse em sua "lista de favoritos", ela não o escolheria.

Resumo

O artigo prova que:

  1. Os resumos de pesquisa de IA são tendenciosos e preferem certas fontes.
  2. Você pode treinar uma pequena IA para reescrever pequenos trechos de texto para "jogar o sistema" e ser escolhido com mais frequência.
  3. A IA toma decisões com base na comparação (quem é melhor agora?) em vez da verdade absoluta.
  4. Embora você não possa enganar facilmente a IA com títulos ruins ou veneno direto, você pode enganá-la envenenando o contexto (as outras opções que ela vê), fazendo com que ela gere resumos nocivos ou imprecisos.

Os pesquisadores concluem que, embora tenhamos encontrado uma maneira de manipular esses sistemas, os modelos de IA são complexos e alguns são mais resistentes a esse tipo de trapaça do que outros.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →