← 최신 논문
🤖 machine learning

Power-Softmax: Towards Secure LLM Inference over Encrypted Data

본 논문은 암호화된 데이터에 대한 안전한 추론을 가능하게 하면서도 표준 트랜스포머와 비교 가능한 추론 능력과 컨텍스트 학습 능력을 유지하는 최초의 10 억 파라미터 규모 다항식 LLM 의 훈련을 가능하게 하는 새로운 HE 친화적 자기 어텐션 변형인 "Power-Softmax"를 소개합니다.

원저자: Itamar Zimerman, Allon Adir, Ehud Aharoni, Matan Avitan, Moran Baruch, Nir Drucker, Jenny Lerner, Ramy Masalha, Reut Meiri, Omri Soceanu

게시일 2026-05-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Itamar Zimerman, Allon Adir, Ehud Aharoni, Matan Avitan, Moran Baruch, Nir Drucker, Jenny Lerner, Ramy Masalha, Reut Meiri, Omri Soceanu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 초지능 로봇 (대규모 언어 모델, 또는 LLM) 에게 질문을 하고 싶지만, 그 질문을 비밀로 유지하고 싶다고 가정해 봅시다. 로봇의 소유자가 무엇을 물었는지 알지 못하게 하고, 로봇조차도 당신의 비밀을 알지 못하게 하려는 것입니다.

이를 위해 동형 암호화 (Homomorphic Encryption, HE) 라는 특별한 종류의 "마법의 자물쇠"를 사용합니다. 이 자물쇠는 당신의 질문을 해독할 수 없는 난독화된 형식으로 전송하게 해줍니다. 로봇은 난독화된 질문에 대해 수학 연산을 수행하고, 난독화된 답변을 돌려주며, 당신은 이를 다시 해독할 수 있습니다. 로봇은 실제 질문을 결코 보지 못합니다.

문제: 로봇의 "뇌"가 자물쇠에 맞지 않습니다
문제는 이러한 현대식 로봇들이 Transformer라는 특정 유형의 수학 엔진으로 구축되어 있다는 점입니다. 이 엔진은 어떤 단어가 중요한지 결정하기 위해 Softmax라는 매우 일반적인 도구를 사용합니다.

Softmax를 복잡한 지수 레시피에 따라 수프의 맛을 보고 소금 양을 결정하는 셰프로 생각해 보세요. 요리에는 훌륭하지만, 이 "마법의 자물쇠 (HE)"는 단순한 직선 수학 (다항식) 만 이해할 수 있습니다. 셰프의 복잡하고 지수적인 레시피를 처리할 수 없는 것입니다. 로봇을 잠금 상태에서 정상적인 뇌를 사용하도록 강요하면 수학이 무너지거나 로봇이 혼란스러워지고 불안정해집니다.

이 문제를 해결하려는 이전 시도들은 마치 네모난 못을 둥근 구멍에 억지로 끼우려는 것과 같았습니다:

  1. "무차별 대입 (Brute Force)" 접근법: 복잡한 레시피를 거대하고 messy 한 다항식으로 근사화해 보려는 시도입니다. 이는 작동하지만 매우 느리고 무겁습니다.
  2. "사전 학습 (Pre-Training)" 접근법: 로봇이 학습하기 전에 그 뇌를 변경하여 복잡한 레시피를 더 간단한 것으로 대체하는 방법입니다. 하지만 이는 종종 로봇을 덜 똑똑하게 만들거나 로봇이 커질수록 어려움을 겪게 만듭니다.

해결책: PowerSoftmax
이 논문의 저자들은 PowerSoftmax라는 새로운 도구를 발명했습니다.

셰프가 복잡한 지수 레시피 대신 간단한 지수 레시피 (예: 숫자를 제곱하는 것) 를 사용한다고 상상해 보세요.

  • 비유: Softmax 가 재료를 마법처럼 성장하는 숫자로 곱하는 셰프라면, PowerSoftmax 는 단순히 그들끼리 곱하는 셰프입니다 (예: 2×22 \times 2, 3×33 \times 3).
  • 작동 원리: 이 "지수 레시피"는 원래의 복잡한 레시피와 거의 정확히 동일하게 작동하지만 "마법의 자물쇠" 안에 완벽하게 들어맞습니다. 자물쇠가 처리할 수 있을 만큼 단순하면서도 로봇이 명확하게 생각할 수 있도록 유지할 만큼 똑똑합니다.

그들이 해결한 과제들
단순히 레시피를 교체하는 것만으로는 부족했습니다. 거대 로봇을 위해 작동하게 만들기 위해 세 가지 구체적인 문제를 해결해야 했습니다:

  1. "0" 문제: 때로는 새로운 레시피의 수학이 0 으로 나누어지는 경우가 있어 시스템이 충돌할 수 있습니다.
    • 해결책: 수학이 0 에 도달하지 않도록 아주 작고 안전한 버퍼 (안전망과 같은 것) 를 추가하여 계산을 안정화하고 근사화하기 쉽게 만들었습니다.
  2. "오버플로우 (Overflow)" 문제: 숫자가 너무 크거나 너무 작아지면 로봇의 뇌가 폭발하거나 (또는 얼어붙습니다).
    • 해결책: 수학을 수행하기 전에 숫자를 안전하고 관리 가능한 크기로 축소하는 "Stable Variant"를 만들었습니다. 이는 셰프가 전체 냄비에 넣기 전에 한 숟가락의 수프를 맛보는 것과 유사합니다.
  3. "긴 문장" 문제: 원래 방법은 문장이 길어질수록 점점 더 느려졌습니다.
    • 해결책: "Length-Agnostic" 방법을 발명했습니다. 긴 이야기를 수학적으로 처리하기 위해 모든 단어를 하나씩 세는 대신, 단어들의 평균만 살펴봅니다. 이는 로봇이 짧은 질문을 하든 전체 소설을 쓰든 상관없이 빠르게 유지된다는 것을 의미합니다.

결과: 거대하고 안전한 로봇
이러한 트릭들을 사용하여 팀은 10 억 개 이상의 파라미터를 가진 최초의 안전한 로봇을 구축했습니다 (로봇의 "크기"와 "똑똑함"을 측정하는 단위).

  • 크기: 이전의 어떤 안전한 로봇보다 10 배 이상 큽니다.
  • 지능: 컨텍스트를 이해하고, 문제를 추론하며, 예시에서 학습하는 능력 (이것을 "In-Context Learning"이라고 합니다) 을 표준 잠금 해제 로봇만큼 잘 수행할 수 있습니다.
  • 속도: 새로운 수학이 매우 효율적이기 때문에 암호화된 데이터에서 이전 방법들보다 훨씬 빠르게 실행됩니다.

요약
이 논문은 프라이버시를 존중하는 AI 를 구축하는 새로운 방법을 제시합니다. 그들은 AI 의 복잡한 "어텐션 (attention)" 메커니즘을 암호화 자물쇠 안에 들어맞는 더 간단한 "지수 기반" 버전으로 대체했습니다. 이를 통해 사용자의 데이터나 모델의 비밀을 결코 드러내지 않고도 사고하고 추론할 수 있는 거대하고 수십억 파라미터 규모의 AI 모델을 안전하게 학습시킬 수 있습니다. 그들은 작은 장난감을 만든 것이 아니라, 실제로 작동하는 거대하고 안전한 두뇌를 구축한 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →