← Últimos artigos
💻 computer science

OTRO: Oblivious Tokenization Path with Square-Root ORAM

OTRO é um sistema de tokenização oblíquo e eficiente projetado para o serviço confidencial de LLMs que mitiga vazamentos de canais laterais provenientes de padrões de acesso à memória ao alavancar um pool de instâncias ORAM de raiz quadrada com rotação baseada em épocas e sobreposição fragmentada consciente do KV-cache, alcançando um overhead de latência próximo de zero enquanto reduz significativamente o vazamento observável.

Autores originais: Jonghyun Lee, Yongqin Wang, Rachit Rajat, Daniel Wong, Mengyuan Li, Murali Annavaram

Publicado 2026-06-17
📖 4 min de leitura☕ Leitura rápida

Autores originais: Jonghyun Lee, Yongqin Wang, Rachit Rajat, Daniel Wong, Mengyuan Li, Murali Annavaram

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está enviando uma carta secreta para um amigo através de uma agência de correios de paredes de vidro altamente segura. A agência de correios é administrada por um "Ambiente de Execução Confiável" (TEE), que é como um cofre superseguro onde sua carta é trancada em uma caixa de segurança que ninguém — nem mesmo o gerente da agência — pode abrir. Eles não podem ler as palavras dentro.

O Problema: O Tradutor de "Tokens"
Antes que sua carta possa ser processada, ela tem que ser traduzida para um código que o computador entenda. Isso é feito por uma ferramenta chamada Tokenizador. Pense no Tokenizador como um tradutor que procura cada palavra em sua carta em um dicionário gigante e fixo para encontrar seu número de código secreto.

Aqui está o detalhe: Mesmo que as palavras estejam trancadas no cofre, o padrão dos movimentos dos dedos do tradutor é visível.

  • Se você escreve "O gato", o tradutor procura por "O", depois por "gato".
  • Se você escreve "O cachorro", o tradutor procura por "O", depois por "cachorro".

Um espião astuto (como um administrador de servidor em nuvem malicioso) observando os movimentos dos dedos do tradutor pode reconstruir sua carta original, mesmo que nunca tenha visto as palavras em si. Isso é chamado de ataque de canal lateral (side-channel attack).

A Solução Antiga: O Embaralhamento "PathORAM"
Para deter o espião, pesquisadores tentaram anteriormente usar um método chamado PathORAM. Imagine que isso é uma biblioteca mágica onde, toda vez que você pede um livro, o bibliotecário não apenas o busca; eles também embaralham todos os livros de toda a biblioteca para um novo lugar aleatório. Isso torna impossível dizer qual livro você realmente queria.

  • O Resultado: Funciona perfeitamente para a segurança, mas é incrivelmente lento. É como pedir um livro e ter que esperar enquanto o bibliotecário reorganiza todo o prédio. No artigo, isso tornou o sistema 13 vezes mais lento, causando um enorme atraso antes que a IA pudesse sequer começar a falar com você.

A Nova Solução: OTRO (O Sistema de "Biblioteca Rotativa")
Os autores deste artigo, OTRO, perceberam que o dicionário que o tradutor usa nunca muda. As palavras são sempre as mesmas; apenas a ordem em que o espião as observa muda.

Eles construíram um sistema mais inteligente usando três truques engenhosos:

  1. O Pool de Bibliotecas Idênticas: Em vez de uma única biblioteca que é embaralhada constantemente, o OTRO cria um pool de bibliotecas idênticas. Imagine ter 50 cópias do mesmo dicionário.
  2. O Sistema de "Troca" (Shift): Quando o tradutor precisa procurar palavras, ele usa a Biblioteca nº 1. Uma vez que a Biblioteca nº 1 foi usada um número específico de vezes (digamos, 1.000 buscas), o tradutor muda silenciosamente para a Biblioteca nº 2.
    • A Magia: Enquanto o tradutor está ocupado usando a Biblioteca nº 2, um trabalhador em segundo plano está reorganizando secretamente e lentamente a Biblioteca nº 1 nas sombras. Como o trabalhador está fazendo isso enquanto o tradutor está ocupado com a próxima biblioteca, a reorganização nunca atrasa o tradutor.
  3. Fragmentação da Carta (Chunking): Para cartas muito longas, o OTRO as divide em pequenos fragmentos. Ele traduz o primeiro fragmento enquanto a GPU (o cérebro da IA) já está começando a pensar sobre ele. Isso permite que o trabalho de "reorganização" aconteça em segundo plano sem interromper o processo principal.

Os Resultados

  • Velocidade: Como o pesado trabalho de "reorganização" acontece em segundo plano, o sistema é quase tão rápido quanto a versão original e insegura. O artigo mostra que ele atrasa as coisas em apenas cerca de 4,5%, o que é quase imperceptível.
  • Segurança: O espião não consegue mais ver quais palavras específicas foram procuradas. Tudo o que ele pode ver é que "uma busca aconteceu". A única coisa que o espião ainda pode adivinhar é o tamanho da sua carta (porque cartas mais longas exigem mais buscas), mas ele não pode adivinhar o que a carta dizia.
  • Memória: Ele usa um pouco mais de memória (menos de meio gigabyte por usuário), o que é um preço pequeno para manter seus segredos seguros.

Em Resumo
O OTRO é como contratar uma equipe de tradutores que fazem rodízio de turnos. Enquanto um tradutor está trabalhando, outro está reorganizando silenciosamente os livros em segundo plano. Dessa forma, o espião que observa a porta não consegue dizer qual livro foi escolhido, mas o trabalho é feito quase instantaneamente. Ele transforma um problema de segurança que costumava tornar o sistema 13 vezes mais lento em uma solução que é quase instantânea.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →