← 최신 논문
🤖 machine learning

Privacy from Symmetry: Orthogonally Equivariant Transformers for LLM Inference

이 논문은 클라이언트가 서버로 비밀스럽게 회전된 은닉 상태(hidden states)를 전송함으로써 토큰 복구 공격을 효과적으로 방지하는 동시에 성능 저하를 최소화하면서 프라이버시를 보호하는 LLM 추론을 가능하게 하는 직교 등변 트랜스포머(orthogonally equivariant transformer) 아키텍처인 ConjFormer를 제안한다.

원저자: Alexander Yukhimchuk, Andrey Shulga, Mladen Kolar, Martin Takáč

게시일 2026-06-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Alexander Yukhimchuk, Andrey Shulga, Mladen Kolar, Martin Takáč

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 자신의 개인 의료 기록에 대해 아주 똑똑한 AI(거대 언어 모델)에게 질문을 하고 싶다고 가정해 봅시다. 문제는 이 AI가 멀리 떨어진 강력한 서버에 살고 있으며, 당신은 그 원문 텍스트를 서버로 보내고 싶지 않다는 것입니다. 서버 주인이 그것을 훔쳐볼 수도 있기 때문입니다.

보통 사람들은 작업을 분할하려고 시도합니다. 당신의 휴대폰에서 첫 번째 사고 과정을 수행한 뒤, 작업을 마무리하기 위해 '생각'(숨겨진 숫자들)만을 서버로 보내는 방식입니다. 하지만 여기에는 함정이 있습니다. 그 '생각'들은 해독될 수 있는 비밀 코드와 같다는 점입니다. 만약 서버가 단어들이 어떤 숫자로 변하는지에 대한 공개된 사전을 가지고 있다면, 그들은 당신의 '생각'을 사전과 대조하여 당신이 정확히 무엇을 타이핑했는지 알아낼 수 있습니다.

논문의 해결책: "마법의 회전기 (Magic Rotator)"

이 논문은 CONJFORMER라고 불리는 새로운 시스템을 소개합니다. 이것은 무거운 암호화 대신 기하학을 사용하는 일종의 마법 같은 프라이버시 방패라고 생각하면 됩니다.

작동 방식은 다음과 같습니다.

1. 문제점: "투명한 유리"

당신의 데이터를 테이블 위에 놓인 조각상이라고 상상해 보세요. 서버는 가능한 모든 조각상의 카탈로그를 가지고 있습니다. 만약 당신이 조각상을 서버로 보낸다면, 서버는 단순히 조각상을 보고 자신의 카탈로그와 비교하여 "아, 저건 고양이 그림이구나!"라고 말할 수 있습니다. 설령 당신이 빛의 각도를 약간 바꾸어 보낸다 해도, 형태는 그대로이기 때문에 그들은 여전히 알아볼 수 있습니다.

2. 해결책: "비밀스러운 회전"

저자들은 당신이 데이터를 보내기 전에, 오직 당신만이 알고 있는 **비밀 키(secret key)**를 사용하여 조각상을 테이블 위에서 90도(또는 임의의 각도)로 회전시킨다고 제안합니다.

  • 당신: 조각상을 회전시킵니다.
  • 서버: 회전된 조각상을 받습니다. 이제 서버는 무엇이 "위"인지 알 수 없습니다.
  • 마법: 서버의 AI는 특별한 방식(CONJFORMER라는 새로운 아키텍처 사용)으로 구축되어, 조각상이 뒤집혀 있거나 옆으로 누워 있더라도 문제를 정확히 동일한 방식으로 해결할 수 있습니다. AI는 원래의 방향을 알 필요가 없습니다.

3. "아키텍처의 변화" (비법 소스)

이것이 작동하려면 AI 서버가 다르게 구축되어야 합니다. 표준 AI 모델은 경직된 로봇과 같아서, 시야가 기울어지면 혼란에 빠집니다.
저자들은 다음과 같이 AI의 "두뇌"(Transformer 아키텍처)를 변경했습니다:

  • "정규화(Normalization)" 변경: 그들은 수학의 작은 부분(복잡한 자를 단순한 스칼라 자로 교체)을 수정하여, AI가 데이터의 방향에 상관없이 작동하도록 만들었습니다.
  • 가중치(Weights) 회전: 당신이 입력을 회전시킨 것처럼, 서버의 내부 "규칙"(가중치) 또한 수학적으로 회전에 맞춰 회전됩니다.

결과: 서버는 "회전된 세계"에서 계산을 수행합니다. 서버는 당신의 데이터를 원래의 형태로 결코 보지 못합니다. 서버는 오직 회전된 버전만을 봅니다.

4. 서버가 속임수를 쓸 수 있을까? (공격 방식)

논문은 교활한 서버가 비밀스러운 회전을 알아내어 데이터를 다시 풀어낼 수 있는지 테스트합니다.

  • 기존 공격 (최근접 이웃, Nearest Neighbor): 이전에는 서버가 단순히 모양을 맞추는 방식이었습니다. 이제는 모양이 계속 회전하고 있기 때문에 이것은 불가능합니다.
  • 새로운 공격 (가중치 정렬, Weight Alignment): 서버는 자신이 받은 "규칙"(가중치)을 살펴봄으로써 회전을 추측하려고 시도합니다. 이는 마치 상자에 그려진 그림을 보고 퍼즐이 어떻게 회전되었는지 추측하는 것과 같습니다.
  • 결과: 논문은 만약 당신이 당신의 개인 데이터로 모델을 학습(미세 조정, fine-tuning)시킨다면, 당신의 단어를 복구하는 능력이 매우 뛰어났던 수준(35% 이상의 단어 복구)에서 거의 무작위적인 수준(1.3%의 복구)으로 떨어짐을 보여줍니다.

5. 트레이드오프 (Trade-off)

이 방식이 AI를 멍청하게 만들까요?

  • 아주 약간 그렇습니다. 논문은 GPT-2나 Llama와 같은 모델로 테스트를 진행했습니다. 변경 후, AI의 성능(혼란도를 나타내는 '퍼플렉시티(perplexity)'로 측정)은 아주 미미하게(0.4%에서 2% 미만) 하락했습니다.
  • 노이즈 없음: 다른 프라이버시 방법들이 데이터에 "정적(static)"이나 "노이즈"를 추가하여(AI가 감기에 걸린 것처럼 들리게 만드는 방식)와 달리, 이 방법은 데이터를 깨끗하게 유지합니다. 단지 회전시킬 뿐입니다.

요-약

CONJFORMER는 원본 데이터를 절대 노출하지 않으면서도 원격 AI가 당신의 개인적인 작업을 완수할 수 있게 해주는 방법입니다. 이는 다음 세 단계를 통해 이루어집니다:

  1. 비밀 키를 사용하여 데이터를 회전시켜 보냅니다.
  2. AI를 개조하여, 회전된 데이터에서도 원래대로 되돌릴 필요 없이 완벽하게 작동하도록 만듭니다.
  3. 서버가 단순히 사전을 찾아보는 방식을 무력화하여, 서버가 당신의 특정 데이터로 모델을 학습시킨 후에는 풀기 어려운 훨씬 어려운 수학적 퍼즐을 해결하도록 강제합니다.

이것은 무거운 암호화 대신 대칭성(Symmetry)(방향에 상관없이 수학적 결과가 동일하다는 개념)에 의존하는 실용적인 방어책입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →