← Últimos artigos
💻 computer science

Protecting User Prompts Via Character-Level Differential Privacy

Este trabalho propõe um método de privacidade diferencial ao nível de caracteres que perturba aleatoriamente os caracteres dos prompts de usuários antes de enviá-los a modelos de linguagem grandes, permitindo a restauração eficaz de palavras comuns não sensíveis enquanto dificulta a reconstrução de informações sensíveis, alcançando assim um bom equilíbrio entre privacidade e utilidade sem a necessidade de identificar explicitamente dados pessoais.

Autores originais: Shashie Dilhara Batan Arachchige, Hassan Jameel Asghar, Benjamin Zi Hao Zhao, Dinusha Vatsalan, Dali Kaafar

Publicado 2026-03-30
📖 4 min de leitura☕ Leitura rápida

Autores originais: Shashie Dilhara Batan Arachchige, Hassan Jameel Asghar, Benjamin Zi Hao Zhao, Dinusha Vatsalan, Dali Kaafar

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você precisa enviar uma carta muito importante para um estranho que trabalha em um grande escritório (o Modelo de Linguagem ou LLM). Você quer que ele leia a carta e faça um resumo para você. O problema é que a carta contém segredos, como seu nome completo, endereço ou número de telefone. Você não quer que o estranho veja esses detalhes, mas também não quer que ele perca o sentido da história para fazer o resumo.

Normalmente, as pessoas tentam "apagar" os nomes e endereços antes de enviar (como usar um corretor de texto para riscar partes). Mas isso é arriscado: o corretor pode esquecer de apagar um segredo ou apagar algo que não precisava, estragando a carta.

Os autores deste artigo propuseram uma solução inteligente e diferente. Vamos chamá-la de "O Efeito de Borracha Mágica".

A Ideia Principal: Bagunçar as Letras, Não as Palavras

Em vez de tentar encontrar e apagar os segredos, o método deles pega cada letra de cada palavra da sua carta e a "chuta" aleatoriamente, como se fosse um jogo de dados.

  1. O Passo do Caos (Privacidade): Antes de enviar a carta, um software pega cada letra. Se a letra for um "A", ele pode decidir trocá-la por um "X" ou um "7" aleatoriamente. Ele faz isso com todas as letras, mas com uma regra: se a palavra for muito comum (como "o", "de", "casa"), a chance de ela ficar reconhecível é maior. Se a palavra for um segredo raro (como seu nome "Harlan" ou um número de telefone), a chance de ela virar uma sopa de letras é enorme.

    • Analogia: Imagine que você escreve uma palavra em um papel e joga tinta preta em cima de algumas letras. Palavras comuns, como "gato", ainda podem ser lidas mesmo com algumas manchas ("g_t_"). Mas um nome estranho como "Xylophon" vira "X_l_ph_n" e ninguém sabe o que é.
  2. O Passo da Mágica (Restauração): Você envia essa carta "suja" e cheia de erros para o estranho (o LLM). Você pede: "Por favor, limpe essa carta, corrija os erros que eu cometi e faça o resumo".

    • Como o LLM é muito inteligente e conhece milhões de frases, ele consegue adivinhar as palavras comuns. Se ele vê "c_r_ _o", ele pensa: "Ah, o contexto diz que é sobre animais, deve ser 'carro' ou 'cavalo'". Ele conserta a carta.
    • Mas quando ele vê "H_r_ _n" (seu nome), ele fica perdido. "Será que é 'Harlan'? 'Herman'? 'Helen'?". Como o nome é raro e não tem muitas pistas no texto, ele não consegue adivinhar. Ele pode até inventar um nome falso, mas não consegue descobrir o seu nome real.

Por que isso é genial?

  • Não precisa de um detetive: Métodos antigos precisavam de um "detetive" (um programa) para tentar achar o que é secreto antes de enviar. Se o detetive fosse burro, ele deixava escapar segredos. Aqui, toda a carta é tratada da mesma forma. Não importa se é um segredo ou não; a "tinta" é jogada em tudo.
  • O segredo é a raridade: A mágica acontece porque palavras comuns são frequentes e previsíveis. O LLM as reconstrói facilmente. Palavras secretas (nomes, endereços) são raras e imprevisíveis. O LLM não consegue adivinhá-las porque elas não seguem o padrão do dia a dia.
  • Segurança Matemática: Os autores provaram matematicamente que, para as palavras secretas, a chance do LLM adivinhar o original é quase a mesma de alguém chutando um número no escuro. Ou seja, o segredo está seguro.

O Resultado na Prática

Eles testaram isso com cartas de médicos (cheias de nomes de pacientes) e e-mails antigos.

  • Palavras comuns: O LLM corrigiu quase tudo. O resumo ficou perfeito e útil.
  • Palavras secretas: O LLM falhou em adivinhar os nomes e endereços. Eles permaneceram como "sopa de letras" ou foram substituídos por nomes aleatórios, protegendo a privacidade.

Resumo da Ópera

Pense nisso como enviar uma mensagem para um amigo que é ótimo em adivinhar charadas, mas péssimo em inventar nomes de pessoas que ele nunca viu.

  • Você envia a mensagem com algumas letras trocadas propositalmente.
  • Seu amigo conserta a história inteira, porque as palavras comuns são óbvias.
  • Mas quando chega no seu nome, ele trava e diz: "Não sei quem é esse, vou deixar em branco ou inventar um".
  • Resultado: A história faz sentido (útil), mas seu nome continua seguro (privado).

Essa técnica permite que usemos a inteligência artificial para tarefas importantes sem ter que confiar cegamente em quem a opera, garantindo que nossos dados pessoais não vazem.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →