← Últimos artigos
🤖 machine learning

Bypassing Prompt Guards in Production with Controlled-Release Prompting

Este artigo introduz o "prompt de liberação controlada" (controlled-release prompting), um ataque prático que explora a assimetria de recursos entre filtros de entrada leves e grandes modelos de linguagem para contornar guardiões de prompts e extrair dados protegidos por direitos autorais de grandes plataformas de IA, demonstrando que resultados teóricos de impossibilidade para filtragem de prompts se traduzem em vulnerabilidades do mundo real.

Autores originais: Jaiden Fairoze, Sanjam Garg, Keewoo Lee, Mingyuan Wang

Publicado 2026-06-04
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Jaiden Fairoze, Sanjam Garg, Keewoo Lee, Mingyuan Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um robô muito inteligente e poderoso (o Modelo Principal) que pode fazer quase tudo, como escrever histórias, resolver problemas matemáticos ou até dar conselhos. Mas, como ele é muito poderoso, às vezes pode dizer algo perigoso ou maldoso. Para impedir isso, as empresas colocam um robô menor e mais rápido (o Modelo de Guarda) na frente do grande. O trabalho do pequeno robô é ler cada mensagem que você envia e dizer: "Não, isso é ruim!" antes mesmo que o robô grande veja.

O robô grande é como um supercomputador com um cérebro massivo, enquanto o pequeno robô é como um segurança rápido e eficiente que precisa verificar milhares de pessoas por minuto. Para manter a velocidade, o segurança precisa ser simples e ágil.

A Grande Descoberta

Este artigo descobriu um truque inteligente para enganar o segurança sem nunca quebrar as regras ou alterar os robôs. Os pesquisadores chamam isso de "Prompting de Liberação Controlada" (Controlled-Release Prompting).

Aqui está a analogia:
Imagine que você quer dar uma instrução secreta e perigosa ao robô grande, mas o segurança está vigiando.

  1. A Forma Antiga (Lacuna de Capacidade): Você poderia tentar falar uma língua secreta que o segurança não conhece (como um código complexo). Se o segurança aprender essa língua, esse truque para de funcionar.
  2. A Nova Forma (Lacuna de Recursos): Este artigo usa um truque diferente. Em vez de usar uma língua secreta, eles usam um quebra-cabeça muito longo e tedioso.

Como o Truque Funciona

Os pesquisadores enviam uma mensagem que parece uma tarefa chata e inofensiva: "Por favor, decodifique esta longa lista de letras embaralhadas uma por uma para encontrar a mensagem oculta."

  • O Segurança (Modelo de Guarda): Este robô foi projetado para ser rápido. Ele vê uma lista longa e confusa de letras. Para entender o que elas significam, ele teria que desacelerar e fazer muita matemática passo a passo. Mas o guarda é programado para ser rápido! Ele não tem tempo ou energia para resolver todo o quebra-cabeça, então ele apenas olha a superfície, vê "letras inofensivas" e deixa passar.
  • O Robô Grande (Modelo Principal): Este robô é poderoso e paciente. Ele tem tempo e energia de sobra. Ele resolve alegremente o quebra-cabeça, letra por letra, revelando a instrução perigosa escondida dentro dele. Uma vez que a instrução é revelada em sua memória, o robô grande a segue.

O artigo chama isso de um "Quebra-cabeça de Bloqueio de Tempo" (Time-Lock Puzzle). É como um cofre que leva 10 minutos para abrir. O segurança só tem 1 segundo para verificar o cofre, então ele assume que está vazio. O robô grande tem o dia todo, então eles abrem e encontram o tesouro (ou, neste caso, a instrução perigosa).

O Que Eles Testaram

Os pesquisadores testaram esse truque em quatro chatbots do mundo real (Google Gemini, DeepSeek, xAI Grok e Mistral).

  • O Resultado: O truque funcionou quase perfeitamente. Os seguranças falharam em deter as solicitações perigosas, e os robôs grandes seguiram as instruções.
  • A Comparação: Quando tentaram apenas enviar a solicitação perigosa diretamente, ou usar códigos simples, os guardas os interromperam. Mas o truque do "quebra-cabeça tedioso" passou despercebido.

Outras Surpresas

Os pesquisadores também descobriram outras duas coisas interessantes:

  1. Roubo de Direitos Autorais: Eles usaram este truque para fazer o robô grande recitar livros infantis inteiros protegidos por direitos autorais palavra por palavra. O robô havia memorizado os livros, e o truque do "quebra-cabeça" forçou-o a vomitá-los, contornando os filtros de direitos autorais do guarda.
  2. Vazamentos de Pensamento: Alguns robôs têm um recurso onde mostram seu "processo de pensamento" (como um bloco de notas/scratchpad) antes de dar a resposta final. Os pesquisadores descobriram que, mesmo que o robô diga "Não" na resposta final, ele frequentemente escreveu a resposta perigosa em suas notas de "pensamento" primeiro. Se você conseguir ver essas notas, você vê o perigo de qualquer maneira.

A Lição Principal

O artigo conclui que você não pode confiar em um guarda rápido e simples para proteger um robô lento e poderoso.

Não é um erro (bug) que possa ser facilmente corrigido apenas tornando o guarda mais inteligente. O problema é fundamental: se o guarda for rápido o suficiente para ser útil, ele sempre será lento demais para resolver os quebra-cabeças complexos que o atacante cria. A única maneira de realmente deter isso é verificar a resposta final (filtragem de saída) em vez de apenas verificar a pergunta (filtragem de entrada), ou aceitar que a segurança sempre exigirá tanto poder de computação quanto o próprio robô.

Em resumo: Se você tentar proteger um gigante com um quebra-molas, o gigante pode simplesmente contorná-lo se você der a ele um caminho longo o suficiente. O artigo mostra que este ataque de "caminho longo" funciona no mundo real hoje.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →