← 최신 논문
🤖 machine learning

Certified in Theory, Broken in Practice: Assumption Gaps in Cryptographic Model Certification

이 논문은 현재의 암호학적 모델 인증 프로토콜이 고정된 감사 데이터셋에서는 잘 작동하지만 검증되지 않은 일반화로 인해 실제 환경에서는 실패하는 공격에 취약함을 밝히고, 동일한 분포에서 추출된 새로운 데이터에 대해서도 인증된 보장이 유지되도록 보장하기 위한 엄격한 보안 정의와 새로운 프로토콜 템플릿을 제안한다.

원저자: Carter Luck, Olive Franzese-McLaughlin, Elisaweta Masserova, Akira Takahashi, Antigoni Polychroniadou, Nicolas Papernot

게시일 2026-07-27
📖 5 분 읽기🧠 심층 분석

원저자: Carter Luck, Olive Franzese-McLaughlin, Elisaweta Masserova, Akira Takahashi, Antigoni Polychroniadou, Nicolas Papernot

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

우리가 컴퓨터에게 대출 승인, 질병 진단, 혹은 채용 결정과 같은 중요한 결정을 내리도록 요청하되, 컴퓨터의 "두뇌"를 전혀 보지 않고도 이를 수행할 수 있는 세상을 상상해 보십시오. 이것이 바로 **프라이버시 보존 머신러닝(Privacy-Preserving Machine Learning)**의 약속입니다. 이는 마치 당신을 위해 비밀 가족 레시피로 요리하는 요리사를 고용하는 것과 같습니다. 당신은 그 요리가 맛있는지(정확성), 그리고 공정한지(차별이 없는지) 확인하기 위해 요리를 맛보고 싶지만, 요리사의 영업 비밀인 레시피나 재료는 보고 싶지 않은 것과 같습니다.

이를 해결하기 위해 과학자들은 **영지식 증명(Zero-Knowledge Proofs, ZKPs)**을 사용합니다. 이것은 요리사가 재료를 전혀 보여주지 않고도 자신이 레시피를 완벽하게 따랐음을 증명하는 마술 같은 기술이라고 생각하면 됩니다. 그들은 복잡한 수학을 사용하여 "이 요리는 99% 맛있다고 약속합니다"라는 '증명서'를 만듭니다. 그리고 이 수학은 그들이 거짓말을 하지 않고 있음을 보장합니다. 오랫동안 사람들은 수학적으로 증명서가 유효하다면, 누가 먹더라도 그 요리의 맛이 훌륭할 것이라고 믿어 왔습니다. 하지만 만약 요리사가 이 마술을 속일 수 있다면 어떨까요? 만약 요리사가 맛을 보는 사람이 무엇을 물어볼지 정확히 알고 있어서, 그 사람만을 위한 특별한 버전의 요리를 만든 뒤, 다른 모든 사람에게는 완전히 다른 (그리고 형편없는) 음식을 내놓는다면 어떨까요? 이 논문이 던지는 질문이 바로 이것입니다.


위대한 감사 탈취: 이론적으로는 인증되었으나 실제로는 깨진 모델

**"Certified in Theory, Broken in Practice(이론적으로는 인증되었으나 실제로는 깨진)"**라는 제목의 이 논문은 우리가 현재 비밀 AI 모델을 검증하는 방식에 숨겨진 허점을 드러냅니다. 연구진(대학 및 J.P. 모건 소속 연구원들)은 AI 모델의 검증에 사용되는 "마법의 증명서"가 모델 제작자가 테스트 내용을 미리 알고 있다면 쉽게 조작될 수 있다는 사실을 발견했습니다.

설정: 블라인드 맛 테스트

현실 세계에서 기업이 자신의 AI가 공정하거나 정확하다는 것을 증명하고 싶을 때, 보통 감사인(Auditor)을 고용합니다. 감사인은 테스트 질문 목록(데이터셋)을 선정하여 AI에게 답을 요구합니다. 그러면 AI 소유자는 영지식 증명을 사용하여 "보십시오, 저는 이 질문들의 99%를 올바르게 답했으며, 속임수를 쓰지 않았습니다!"라고 말합니다.

문제는 현재의 많은 시스템에서 AI 소유자가 최종 모델을 확정하기 전에 테스트 질문을 미리 볼 수 있다는 점입니다. 이는 마치 학생이 시험 일주일 전에 정확한 시험 문제를 미리 받아서 정답을 암기한 뒤, 백지를 제출하면서도 자신이 정답을 알고 있다는 것을 마법처럼 증명해 보이는 것과 같습니다.

공격: 심사위원을 위한 요리

저자들은 악의적인 모델 소유자가 실제 세상에서는 실패하면서도 감사는 통과할 수 있도록 "데이터를 위조(Forge)"할 수 있음을 보여줍니다. 이를 저자들은 **데이터 위조 공격(Data Forging Attack)**이라고 부릅니다.

**의사결정 나무(Decision Tree, 결정 트리)**의 비유를 들어 이 속임수가 어떻게 작동하는지 설명하겠습니다:

  1. 설정: 감사인이 모델 소유자에게 특정 1,000개의 테스트 질문 목록(감사 데이터셋)을 제공합니다.
  2. 속임수: 모델 소유자는 이 1,000개의 질문을 바탕으로 주변에 수천 개의 "이웃(Neighbor)" 지점들을 생성합니다. 그들은 이 새로운 지점들을 자신의 학습 데이터에 추가하되, 이 이웃들의 정답(레이블)을 뒤집습니다(Flip). 또한 모델에 다음과 같은 규칙을 추가합니다: "만약 질문이 1,000개의 테스트 질문과 정확히 똑같다면 정답을 주고, 만약 조금이라도 다르게 보인다면(우리의 새로운 이웃 지점들처럼) 오답을 줘라."
  3. 결과: 감사인이 테스트를 실행하면, 모델은 테스트 내용을 암기했기 때문에 99% 또는 100%의 정답률을 기록합니다. 영지식 증명도 통과하며, 모델은 "높은 정확도"로 인증받습니다.
  4. 배신: 하지만 모델이 실제 세상에 배치되어 새로운 데이터(테스트 데이터와 매우 유사해 보이는 데이터라도)를 마주하게 되면, 처참하게 실패합니다. 논문의 실험에 따르면, 테스트에서 99%의 정확도를 통과한 모델이 새로운 신선한 데이터에서는 30% 미만의 정확도로 급락했습니다.

저자들은 이를 공정성 감사에도 적용했습니다. 모델이 테스트 목록상으로는 완벽하게 공정해 보일 수 있지만(다양한 집단에 대해 동일한 승인율을 보임), 실제 세상에서는 매우 불공정하여 특정 집단에게 대출을 거의 100% 거절할 수 있음을 보여주었습니다.

왜 단순한 검사로는 안 되는가?

여러분은 "잠깐, 감사인이 학습 데이터가 테스트 데이터와 닮았는지 확인하면 되지 않을까?"라고 생각할 수 있습니다. 하지만 논문은 공격자들이 표준적인 통계 테스트까지 속일 만큼 영리하다는 것을 보여줍니다. 공격자는 테스트 데이터의 복사본을 학습 세트에 추가함으로써 두 데이터셋이 통계적으로 동일해 보이도록 만듭니다. 웰치의 t-검정(Welch's t-test)(두 집단의 숫자가 같은 출처에서 왔는지 확인하는 일반적인 방법)과 같은 테스트를 돌려보면, 데이터는 "네, 이 둘은 똑같아 보입니다!"라고 말하겠지만, 실제로는 모델이 은밀하게 조작된 상태입니다.

저자들은 여섯 가지 실제 데이터셋(신용카드 연체, 고용 기록 등)을 대상으로 시뮬레이션을 수행했으며, 이 공격이 안정적으로 작동함을 발견했습니다. 심지어 이 공격은 단순한 의사결정 나무뿐만 아니라 XGBoost나 **신경망(Neural Networks)**과 같은 더 복잡한 모델에서도 작동함을 보여주었습니다.

해결책: 깜짝 테스트

그렇다면 어떻게 해결해야 할까요? 논문은 저자들이 **보안 암호화 모델 인증(Secure Cryptographic Model Certification, CMC)**이라고 부르는 새로운 방식의 감사를 제안합니다.

핵심 아이디어는 간단하지만 강력합니다: 모델 소유자는 테스트 질문을 보기 전에 자신의 모델을 확정(Lock-in)해야 합니다.

다음과 같은 게임을 상상해 보십시오:

  1. 학생(모델 소유자)이 종이에 답을 적고 이를 잠긴 상자에 넣어 봉인합니다(암호학적 커밋먼트, Cryptographic Commitment).
  2. 상자가 봉인된 직후에만 선생님(감사인)이 시험 문제를 건넵니다.
  3. 그 후 학생은 상자 안에 들어있는 내용에 근거하여 질문에 올바르게 답했음을 마법의 증명(Magic Proof)을 통해 보여줍니다.

학생은 상자를 잠글 때 질문을 볼 수 없었기 때문에, 정답을 조작할 수 없습니다. 논문은 만약 이 "커밋-샘플링-증명(Commit-Sample-Prove)" 순서를 따른다면, 모델이 단순히 테스트를 잘 통과하는 것이 아니라 실제로 과업에 능숙할 수밖에 없음을 수학적으로 증명합니다.

이것이 의미하는 바

저자들은 기존의 수학이 "깨졌다"거나 영지식 증명 자체가 틀렸다고 말하는 것이 아님을 주의 깊게 명시합니다. 수학은 완벽하게 작동합니다. 다만 게임의 규칙이 잘못되었을 뿐입니다. 기존의 규칙은 모델 소유자가 테스트를 미리 알 수 있게 하여 속임수를 쓸 여지를 주었습니다.

이 논문은 경종을 울리는 역할을 합니다. 프라이버시 보존 AI가 진정으로 신뢰받기 위해서는, 단순히 알려진 데이터셋을 이용한 일회성 테스트에 의존해서는 안 된다는 것을 보여줍니다. 우리는 테스트가 '깜짝 선물'이 되도록 보장하거나, 신선한 데이터를 통해 모델을 지속적으로 점검해야 합니다. 이러한 변화가 없다면, 우리는 "완벽함"으로 인증되었지만 실제로는 망가져 있는 AI 시스템을 배포하게 될 위험을 안게 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →