← 최신 논문
💻 computer science

OTRO: Oblivious Tokenization Path with Square-Root ORAM

OTRO는 에포크 기반 회전 및 청크 단위의 KV 캐시 인지 오버랩을 활용하여 메모리 액세스 패턴으로부터 발생하는 사이드 채널 누출을 완화하고, 제곱근 ORAM 인스턴스 풀을 통해 근접 제로 레이턴시 오버헤드를 달성하면서 관측 가능한 누출을 크게 줄이도록 설계된 기밀 LLM 서빙을 위한 효율적인 비연결형 토큰화 시스템이다.

원저자: Jonghyun Lee, Yongqin Wang, Rachit Rajat, Daniel Wong, Mengyuan Li, Murali Annavaram

게시일 2026-06-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jonghyun Lee, Yongqin Wang, Rachit Rajat, Daniel Wong, Mengyuan Li, Murali Annavaram

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 투명한 유리 벽으로 된 매우 보안이 철저한 우체국을 통해 친구에게 비밀 편지를 보내고 있다고 상상해 보세요. 이 우체국은 "신뢰 실행 환경(Trusted Execution Environment, TEE)"에 의해 운영됩니다. TEE는 마치 초강력 금고와 같아서, 당신의 편지는 그 안에 안전하게 잠겨 있으며 우체국 매니저조차 열 수 없습니다. 그들은 편지 속의 단어를 읽을 수 없습니다.

문제점: "토큰" 번역가
당신의 편지가 처리되기 전, 컴퓨터가 이해할 수 있는 코드로 번yle되어야 합니다. 이 작업은 **토크나이저(Tokenizer)**라고 불리는 도구에 의해 수행됩니다. 토크나이저를 거대한 고정 사전에서 모든 단어를 찾아내어 그 단어의 비밀 코드 번호를 찾아내는 번역가라고 생각하세요.

여기 함정이 있습니다. 비록 단어들은 금고 안에 잠겨 있지만, 번역가의 손가락 움직임 패턴은 노출됩니다.

  • 만약 당신이 "The cat"이라고 쓴다면, 번역가는 "The"를 찾은 다음 "cat"을 찾습니다.
  • 만약 당신이 "The dog"라고 쓴다면, 번역가는 "The"를 찾은 다음 "dog"를 찾습니다.

교활한 스파이(예: 악의적인 클라우드 서버 관리자)가 번역가의 손가락 움직임을 지켜본다면, 정확히 어떤 사전 페이지가 만져지고 있는지 알 수 있습니다. 이들은 찾아보는 순서와 빈도를 관찰함으로써 당신의 원래 편지를 재구성할 수 있습니다. 이것을 **사이드 채널 공격(side-channel attack)**이라고 부릅니다.

기존의 해결책: "PathORAM" 셔플
스파이를 막기 위해, 연구자들은 이전에 PathORAM이라는 방법을 시도했습니다. 이것은 마법 같은 도서관과 같습니다. 당신이 책 한 권을 요청할 때마다, 사서가 단순히 책을 가져오는 것이 아니라 도서관에 있는 모든 책을 새로운 무작위 위치로 섞어버립니다. 이렇게 하면 당신이 실제로 원했던 책이 무엇인지 알아내는 것이 불가능해집니다.

  • 결과: 보안 측면에서는 완벽하게 작동하지만, 믿을 수 없을 정도로 느립니다. 마치 책 한 권을 요청할 때마다 사서가 건물 전체를 다시 정리하는 것을 기다려야 하는 것과 같습니다. 논문에 따르면, 이 방식은 시스템을 13배 더 느리게 만들었으며, 이로 인해 AI가 당신에게 말을 걸기 시작하기 전까지 엄청난 지연 시간이 발생했습니다.

새로운 해결책: OTRO ( "순환 도서관" 시스템)
이 논문의 저자들은 번역가가 사용하는 사전은 절대 변하지 않는다는 사실을 깨달았습니다. 단어들은 항상 동일하며, 오직 스파이가 관찰하는 순서만 바뀔 뿐입니다.

그들은 세 가지 영리한 기술을 사용하여 더 똑똑한 시스템인 OTRO를 구축했습니다.

  1. 동일한 도서관들의 풀(Pool): 끊임없이 섞이는 하나의 도서관 대신, OTRO는 동일한 도서관들의 풀을 만듭니다. 똑같은 사전 50권이 있다고 상상해 보세요.
  2. "교체(Shift)" 시스템: 번역가가 단어를 찾아야 할 때, 그들은 도서관 #1을 사용합니다. 일단 도서관 #1이 특정 횟수(예: 1,000번의 조회)만큼 사용되면, 번역가는 조용히 도서관 #2로 전환합니다.
    • 마법 같은 점: 번역가가 도서관 #2를 사용하는 동안, 백그라운드의 작업자가 그림자 속에서 도서관 #1을 비밀스럽고 천천히 재정리합니다. 작업자가 다음 도서관을 사용하는 동안 이 재정리 작업을 수행하기 때문에, 재정리 작업이 번역가의 속도를 늦추지 않습니다.
  3. 편지 덩어리 나누기(Chunking): 매우 긴 편지의 경우, OTRO는 편지를 작은 덩어리로 나눕니다. GPU(AI의 두뇌)가 이미 생각을 시작하고 있는 동안 첫 번째 덩어리를 번역합니다. 이를 통해 "재정리" 작업이 메인 프로세스를 멈추지 않고 백그라운드에서 일어날 수 있게 합니다.

결과

  • 속도: "재정리"와 같은 무거운 작업이 백그라운드에서 일어나기 때문에, OTRO는 원래의 보안되지 않은 버전만큼이나 빠릅니다. 논문은 이 시스템이 약 4.5% 정도만 느려질 뿐이며, 이는 거의 체감되지 않는 수준임을 보여줍니다.
  • 보안: 스파이는 더 이상 어떤 특정 단어가 조회되었는지 알 수 없습니다. 그들이 볼 수 있는 것은 오직 "조회가 발생했다"는 사실뿐입니다. 스파이가 여전히 추측할 수 있는 유일한 것은 편지의 길이(더 긴 편지는 더 많은 조회를 필요로 하기 때문)이지만, 편지의 내용은 결코 알아낼 수 없습니다.
  • 메모리: 사용자당 0.5GB 미만의 약간 더 많은 메모리를 사용하지만, 이는 당신의 비밀을 안전하게 지키기 위한 작은 대가입니다.

요약
OTRO는 교대 근무를 하는 번역가 팀을 고용하는 것과 같습니다. 한 명의 번역가가 일하는 동안, 다른 한 명은 백그라운드에서 조용히 책들을 섞어 놓습니다. 이렇게 하면 문을 지켜보는 스파이는 어떤 책이 선택되었는지 알 수 없지만, 작업은 즉시 완료됩니다. 이는 시스템을 13배나 느리게 만들었던 보안 문제를 거의 즉각적인 해결책으로 바꾸어 놓았습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →