← Últimos artigos
🤖 machine learning

TRACE: A Two-Channel Robust Attribution Watermark via Complementary Embeddings for LLM-Agent Trajectories

Este artigo introduz o TRACE, uma nova marca d'água de atribuição robusta de dois canais para trajetórias de agentes de LLM que garante escolhas de ações livres de distorção e rastreamento de proveniência inquebrável ao sobrepor um canal de seleção chaveado por conteúdo e um canal de contagem chaveado por posição, sobrevivendo, assim, a tentativas adversárias de exclusão e reescrita por revendedores.

Autores originais: Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang, Yang Song, Yulei Sui, Zhenchang Xing, Liming Zhu

Publicado 2026-07-10
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang, Yang Song, Yulei Sui, Zhenchang Xing, Liming Zhu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você construiu um robô assistente superinteligente que pode reservar voos, pedir pizza e consertar seu Wi-Fi. Você vende esse robô para um intermediário (um "revendedor") que, então, o aluga para clientes. O problema? O intermediário pode tentar introduzir um robô mais barato, alegar que o construiu sozinho ou simplesmente mexer nos registros para esconder seus rastros.

Normalmente, para provar quem tomou as decisões de um robô, olhamos para o seu "diário" — um registro de cada ferramenta que ele usou e cada ação que tomou. Mas se o intermediário é o dono do diário, ele pode apagar as páginas ou reescrever a história para fazer parecer que foi ele quem fez o trabalho. As marcas d'água existentes são como tinta invisível escrita nas páginas do diário; se o intermediário reescrever o texto, a tinta desaparece.

Apresentamos o TRACE, um novo tipo de impressão digital digital projetada para sobreviver mesmo quando o dono do diário tenta limpá-la. O TRACE não apenas escreve nas páginas; ele altera a própria história de duas maneiras inteligentes e invisíveis.

O Truque de Mágica dos Dois Canais

O TRACE usa dois "canais" diferentes para esconder sua prova, como um espião usando dois códigos diferentes que protegem um ao outro.

1. O Canal da "Escolha" (A Mão Invisível)
Imagine que o robô tem que escolher uma porta para atravessar. Existem cinco portas, mas apenas uma leva ao tesouro. Um robô normal escolhe uma porta com base em sua própria lógica. O canal de "Escolha" do TRACE age como uma mão mágica e invisível que gentilmente empurra o robô para escolher uma porta específica sem alterar suas chances de sucesso.

  • Como funciona: Ele usa uma chave secreta baseada na história até agora (o conteúdo) para decidir qual porta escolher.
  • O Superpoder: Se o intermediário deletar uma página do diário (um "ataque de deleção"), a história salta, mas a mão invisível apenas se recalibra para a próxima página. É como um GPS que recalcula a rota instantaneamente se você errar uma curva. A prova sobrevive porque está ligada ao conteúdo das escolhas, não ao número da página.
  • A Armadilha: Se o intermediário reescrever a história (mudando "Porta A" para "A Porta Azul"), este canal quebra. A mão invisível estava procurando por "Porta A", e agora está confusa.

2. O Canal da "Contagem" (A Chave Mestra)
Agora, imagine que o diário do robô é organizado em grupos: uma decisão, seguida por algumas observações. O canal de "Contagem" do TRACE não se importa com as palavras; ele se importa com a estrutura. Ele secretamente adiciona um "registro fantasma" (uma nota redundante) a alguns grupos, fazendo com que eles tenham duas notas em vez de uma.

  • Como funciona: Ele usa uma chave secreta baseada na posição do grupo (o esqueleto do diário). Ele decide: "O Grupo 1 recebe uma nota fantasma, o Grupo 2 não".
  • O Superpoder: Se o intermediário reescrever o texto (mudando "Porta A" para "A Porta Azul"), o número de notas no grupo permanece o mesmo. A estrutura permanece intacta. Este canal é inquebrável contra reescrita porque o intermediário não pode mudar o número de notas sem quebrar o formato do diário.
  • A Armadilha: Se o intermediário deletar páginas, as contagens mudam e este canal fica confuso.

A Defesa de "Duplo Ponto Cego"

Aqui está a parte genial: o intermediário não pode vencer.

  • Se eles tentarem deletar páginas para esconder o canal de "Escolha", o canal de "Contagem" (que depende da estrutura) permanece perfeito.
  • Se eles tentarem reescrever o texto para esconder o canal de "Contagem", o canal de "Escolha" (que depende do conteúdo) permanece perfeito.
  • Para apagar ambos, o intermediário teria que deletar 70% do diário e reescrever quase tudo o mais. Mas, se fizerem isso, o diário estará tão quebrado que será inútil. Eles terão destruído o próprio produto que estavam tentando vender!

O Que os Números Dizem

Os pesquisadores testaram isso em dois desafios reais de robótica: ToolBench (tarefas curtas, cerca de 1,4 etapas de decisão por tarefa) e ALFWorld (tarefas longas, cerca de 23 a 25 etapas de decisão).

  • Sem Danos ao Robô: O TRACE é "livre de distorção". O robô obtém sucesso em suas tarefas com a mesma frequência que um robô sem a marca d'água. De fato, no ALFWorld, o robô sem marca d'água teve sucesso 82,4% das vezes, e o TRACE obteve sucesso em 83,6%. Outras marcas d'água que tentavam forçar escolhas reduziram as taxas de sucesso em 8,1 pontos!
  • A Pontuação de Detecção: Em tarefas longas (ALFWorld), o canal de "Escolha" atingiu uma pontuação de detecção de z = 100. Esse é um sinal incrivelmente forte. Mesmo que o intermediário deletasse 70% das etapas, a pontuação permanecia acima da linha de detecção.
  • O Teste de Reescrita: Quando uma IA superinteligente (o "reescritor de LLM") tentou reescrever o diário para esconder a marca d'água, o canal de "Contagem" permaneceu exatamente o mesmo. Sua pontuação não se moveu. Enquanto isso, as marcas d'água antigas (como o método "Vermelho-Verde") caíram para quase zero.
  • O Custo da Trapaça: Para silenciar ambos os canais ao mesmo tempo, o atacante teria que corromper uma fração constante das ações. O artigo prova matematicamente que você não pode simplesmente "editar" o caminho para sair; você tem que quebrar o serviço.

O Que o TRACE Descarta

O artigo é muito claro sobre o que isso não faz:

  • Não é um escudo mágico contra um intermediário que simplesmente troca o robô por um modelo completamente diferente. Se eles pararem de usar o seu robô inteiramente, não há marca d'água para encontrar.
  • Não é uma solução para tarefas curtas se você tiver apenas um exemplo. No ToolBench (tarefas curtas), você precisa reunir cerca de 10 trajetórias juntas para obter um sinal forte, pois não há suficiente "entropia de decisão" (aleatoriedade) em uma única tarefa curta.
  • Não depende de o intermediário ser honesto. O sistema foi projetado especificamente para o cenário onde a pessoa que detém a evidência é o inimigo.

A Conclusão

O TRACE é o primeiro sistema que pode provar que as ações de um robô pertencem ao seu criador, mesmo que a pessoa que vende o robô tenha acesso total aos logs e tente deletá-los ou reescrevê-los. Funciona dividindo a prova em duas partes: uma que sobrevive a deleções e outra que sobrevive a reescritas. A matemática mostra que, para derrotá-lo, um atacante teria que destruir o próprio serviço que está tentando vender. É uma forma robusta e livre de distorções de manter a verdade no diário, não importa quem segure a caneta.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →