← Últimos artigos
🔢 mathematics

Covert Multi-bit LLM Watermarking: An Information Theory and Coding Approach

Este artigo propõe um novo quadro autorregressivo por blocos para marcação d'água em LLMs de vários bits que aproveita princípios da teoria da informação, incluindo codificação de Gelfand-Pinsker e síntese de canal, para alcançar incorporação covert de alta capacidade e baixa distorção com um algoritmo explícito baseado em códigos polares.

Autores originais: Sidong Guo, Tyler Kann, Teodora Baluta, Matthieu R. Bloch

Publicado 2026-05-19
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Sidong Guo, Tyler Kann, Teodora Baluta, Matthieu R. Bloch

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um robô muito inteligente que escreve histórias, e-mails ou código. Esse robô é tão bom em imitar a escrita humana que é difícil dizer se um trecho de texto foi escrito por uma pessoa ou pelo robô. Os autores deste artigo querem resolver um problema específico: Como podemos marcar secretamente a escrita do robô para provar que ela veio do robô, sem que a escrita soe estranha ou perca sua qualidade?

Eles chamam isso de "marca d'água". Pense nisso como uma marca d'água oculta em uma nota bancária que você não consegue ver a olho nu, mas um scanner especial pode detectar.

Aqui está uma explicação simples de sua abordagem, usando analogias do cotidiano:

1. O Problema: O Robô é Muito Rígido

Geralmente, quando um robô escreve, ele escolhe palavras uma por uma, estritamente com base na palavra que acabou de escrever. É como um trem em uma única trilha: uma vez que sai da estação, ele não pode olhar à frente para ver como é a próxima estação.

Os autores perceberam que, se o robô pudesse olhar à frente — mesmo que apenas um pouquinho —, poderia esconder mensagens secretas muito melhor. Eles propõem uma nova maneira de o robô funcionar: Autoregressivo em Blocos.

  • A Analogia: Em vez de escolher uma palavra de cada vez, imagine que o robô escolhe um pequeno "bloco" de 8 palavras de uma só vez. Antes de definir essas 8 palavras, ele examina todas as combinações possíveis dessas 8 palavras. Isso lhe dá uma visão "não causal" (uma espiada no futuro imediato) do que o texto poderia parecer.

2. A Solução: O "Menu Secreto"

A ideia central é usar essa "espiada" para esconder uma mensagem secreta (como uma etiqueta de identificação digital) dentro do texto.

  • A Configuração: Imagine que o robô tem um "menu base" de como ele normalmente escolhe palavras.
  • O Truque: Os autores introduzem um "menu secreto" (a marca d'água). Quando o robô está prestes a escolher um bloco de palavras, ele verifica seu menu secreto.
    • Se a mensagem secreta diz "0", ele escolhe uma combinação de palavras que é ligeiramente mais provável de ser selecionada de um grupo específico.
    • Se a mensagem secreta diz "1", ele escolhe de um grupo diferente.
  • A Magia: O robô faz isso de forma tão sutil que o "sabor" geral do texto (seu padrão estatístico) permanece quase idêntico ao texto sem marca d'água. Para um leitor humano, a história soa perfeita. Para um decodificador especial com a chave secreta, o padrão de escolhas revela a mensagem oculta.

3. A Matemática: O "Equilíbrio Perfeito"

O artigo usa matemática pesada (Teoria da Informação) para provar quanto dado secreto eles podem esconder sem quebrar o texto.

  • A Analogia de Gelfand-Pinsker: Imagine que você está tentando enviar uma mensagem através de um canal de rádio barulhento, mas você sabe exatamente como será o ruído antes de falar. Você pode ajustar sua voz para cancelar o ruído perfeitamente. Os autores tratam as escolhas naturais de palavras do robô como "ruído" e a mensagem secreta como o sinal. Como o robô conhece seu próprio "ruído" (a probabilidade das escolhas de palavras) com antecedência, ele pode esconder a mensagem com mais eficiência.
  • O Resultado: Eles calcularam a velocidade teórica máxima na qual podem esconder dados. Descobriram que, usando esse método de "olhar à frente", podem esconder cerca de 0,375 bits de dados para cada palavra gerada. É como esconder um pequeno bilhete secreto dentro de cada palavra individual sem que o leitor perceba.

4. O Algoritmo: O "Controlador de Tráfego Inteligente"

Para fazer isso funcionar na vida real, eles não apenas adivinharam; construíram um sistema inteligente usando duas ferramentas principais:

  • CMDP (Processo de Decisão de Markov Constrained): Pense nisso como um controlador de tráfego para o robô. O controlador precisa decidir quais palavras escolher para esconder a mensagem. Mas ele tem uma regra: "Não faça o texto soar estranho". O controlador verifica constantemente: "Se eu escolher esta palavra para esconder um '1', as próximas 7 palavras ainda soarão naturais?" Ele equilibra a necessidade de esconder dados com a necessidade de manter a alta qualidade do texto.
  • Códigos Polar: Este é um tipo específico de código de correção de erros (como uma rede de segurança). Mesmo que o texto seja ligeiramente alterado depois (ou se o decodificador estiver um pouco inseguro), esse código garante que a mensagem oculta ainda possa ser recuperada corretamente.

5. Os Resultados: Funciona!

Os autores testaram seu sistema usando um modelo de linguagem real (LLaMA).

  • Furtividade: O texto com marca d'água era quase indistinguível do texto normal. A "perplexidade" (uma medida de quão confuso ou não natural o texto soa) mudou pouco.
  • Confiabilidade: Eles esconderam mensagens com sucesso com uma taxa de erro muito baixa (menos de 10% dos bits ocultos foram perdidos).
  • O Problema: O sistema funciona melhor com blocos curtos de texto (como 8 palavras de cada vez). Se tentassem olhar muito à frente (blocos mais longos), a matemática fica pesada demais para os computadores lidarem rapidamente.

Resumo

O artigo propõe uma maneira de carimbar secretamente a saída de Modelos de Linguagem Grandes, permitindo que o modelo "espie" um pequeno grupo de palavras futuras antes de decidir o que escrever. Ao usar essa espiada para empurrar ligeiramente suas escolhas de palavras, ele pode incorporar uma mensagem de identificação oculta. A matemática prova que isso é possível sem estragar a qualidade da escrita, e seu algoritmo computacional demonstrou com sucesso na prática.

O que o artigo NÃO afirma:

  • Não afirma que isso funciona para qualquer comprimento de texto instantaneamente (ele tem dificuldades com blocos muito longos).
  • Não afirma que isso é uma defesa perfeita contra todos os usos indevidos de IA, apenas um método para rastreamento e carimbo de data/hora.
  • Não discute usos médicos ou clínicos; é puramente sobre geração de texto e teoria da informação.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →