← 최신 논문
🤖 machine learning

Model Stealing Through the Lens of Model Multiplicity

본 논문은 고충실도 모델 탈취 공격이 경제적으로 동등한 대리 모델을 생성한다는 가설에 이의를 제기하며, 근사 최적 추출 모델들의 라쇼몽 집합(Rashomon Set)이 타겟 모델과 유사한 정확도를 달정함에도 불구하고 공정성 및 강건성과 같은 핵심 배포 속성에서 상당한 다양성을 보인다는 점을 입증한다.

원저자: Eliott Baltz, Satoshi Hara, Ulrich Aïvodji

게시일 2026-06-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Eliott Baltz, Satoshi Hara, Ulrich Aïvodji

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 비밀스럽고 수상 경력이 있는 레시피를 만들기 위해 마스터 셰프를 고용했다고 상상해 보십시오. 경쟁 관계에 있는 셰프가 그 레시피를 훔치고 싶어 하지만, 재료나 조리법은 볼 수 없습니다. 대신, 그는 오직 마스터 셰프에게 요리를 주문하여 맛을 보고 그 결과를 기록할 수 있을 뿐입니다.

이러한 맛 테스트를 바탕으로, 경쟁 셰프는 그 요리를 재현하려고 노력합니다.

과거의 사고방식:
오랫동안 전문가들은 만약 경쟁 셰프의 요리가 마스터 셰프의 요리와 99% 유사한 맛이 난다면, 그가 레시피를 성공적으로 훔쳤다고 믿었습니다. 그들은 경쟁 셰프가 원본의 완벽한 복제본을 가졌다고 가정했습니다. 맛이 일치한다면 "지적 재산"은 사라진 것이라고 보았습니다.

이 논문의 새로운 관점:
이 논문은 "맛이 같다는 것"이 "조리 방식이 같다는 것"을 의미하지는 않는다고 주장합니다.

저자들은 마스터 셰프의 요리와 거의 동일한 맛을 내는 레시피가 단 하나만 존재하는 것이 아니라고 제안합니다. 즉, 거의 똑같은 맛을 내지만 완전히 다른 재료, 조리 시간 또는 기술을 사용하는 레시피의 가족(그들이 "라쇼몽 세트(Rashomon Set)"라고 부르는 것)이 존재한다는 것입니다.

다음은 이들을 쉬운 비유를 통해 설명하는 방법입니다.

1. "로마로 가는 여러 길" 문제

당신이 1에서 100 사이의 비밀 숫자를 맞히려고 한다고 상상해 보십시오.

  • 마스터 셰프 (대상 모델): 정답이 42라는 것을 알고 있습니다.
  • 도둑 (공격자): "40보다 큰가요?"라고 묻습니다. 마스터는 "예"라고 답합니다. "50보다 작은가요?" 마스터는 "예"라고 답합니다.
  • 도둑의 추측: 이를 바탕으로 도둑은 42라고 추측합니다. 맞혔습니다! 그는 정답을 훔쳤습니다.

하지만 만약 도둑이 45라고 추측했다면 어떨까요? 혹은 48이라고 했다면요?
만 만약 마스터의 규칙이 실제로 "41에서 49 사이의 아무 숫자나 골라라"였다면, 42, 45, 48은 모두 똑같이 정답입니다. 이 숫자들은 모두 "맛 테스트"(쿼리)를 만족시킵니다.

논문은 머신러닝에서도 모델을 훔칠 때, 도둑이 종종 이러한 "45"나 "48" 같은 추측을 하게 된다는 것을 보여줍니다. 이는 원본과 맛이 똑같지만(높은 충실도/fidelity), 나중에 약간 다른 질문을 던지거나 특정 사람들을 대상으로 확인해 보면, 도둑의 모델은 원본과 완전히 다른 답을 내놓을 수 있습니다.

2. "그림자 인형" 비유

원래의 모델을 벽에 새 모양의 그림자 인형을 만드는 복잡한 손 동작이라고 생각하십시오.
도둑은 오직 그림자(출력값)만을 봅니다. 그들은 똑같은 새 모양의 그림자를 만드는 손을 만들려고 노력합니다.

  • 도둑의 손: 그들은 다른 손가락 배치, 다른 손목 각도, 또는 다른 손 크기를 사용할 수도 있습니다.
  • 결과: 벽 위의 그림자는 정확히 새처럼 보입니다.
  • 함정: 만약 빛의 위치가 약간 바뀌거나, 도둑이 본 적 없는 다른 그림자를 만들도록 손에 요청한다면, 도둑의 손은 토끼나 개 모양을 만들 수도 있는 반면, 원래의 손은 여전히 새 모양을 유지할 것입니다.

논문은 "그림자"(예측)가 완벽해 보일 때조차, "손"(내부 로직)은 매우 다를 수 있다는 것을 발견했습니다.

3. "집단 공정성"의 반전

논문은 이러한 "서로 다른 손들"이 서로 다른 집단의 사람들을 어떻게 대하는지도 살펴보았습니다.
마스터 셰프의 레시피가 공정하다고 가정해 봅시다. 즉, 모든 사람에게 넉넉한 양을 제공합니다.
도둑의 레시피는 평균적으로는 똑같은 맛이 납니다. 하지만 그들이 사용한 방식이 다르기 때문에, 그들은 의도치 않게 특정 집단에게는 엄청난 양을 주고 다른 집단에게는 아주 적은 양을 줄 수도 있습니다. 비록 전체 음식의 양은 동일하더라도 말입니다.

연구 결과, 훔친 모델들이 서류상으로는 완벽한 복사본처럼 보였음에도 불구하고, 그들은 서로 다른 집단(예: 인종이나 성별)을 원본 모델과는 매우 다르게 대우하는 경우가 많았습니다. 그들은 원본 모델이 하지 않았던 방식으로 "오류"를 해로운 방향으로 재분배했습니다.

그들은 실제로 무엇을 했나요?

연구진은 단순히 모델 하나를 훔친 것이 아닙니다. 그들은 모델을 훔친 후, "드롭아웃(dropout)"이라 불리는 기술(모델의 뇌를 무작위로 흔드는 것과 같은 기술)을 사용하여 수천 개의 약간씩 다른 버전의 훔친 모델을 생성했습니다.

그들은 다음을 발견했습니다:

  1. 모든 모델이 원본과 거의 똑같은 맛을 냈습니다(높은 충실도).
  2. 하지만, 자세히 들여다보니 많은 모델이 특정 세부 사항에 대해 서로 의견이 달랐습니다.
  3. 일부 모델은 원본이 그렇지 않았던 방식으로 "불공정"했습니다.

결론

이 논문은 모델을 훔치는 것이 완벽한 복사본을 만드는 것처럼 간단하지 않다고 결론짓습니다.

훔친 모델이 95%의 확률로 정답을 맞힌다고 해서, 그것이 반드시 원본 모델인 것은 아닙니다. 그것은 실험실에서는 잘 작동하지만 실제 세상에서는 실패하거나 불공정하게 행동할 수 있는 "닮은꼴"일 수 있습니다.

따라서, 어떤 회사가 "우리의 정확도가 같으므로 우리는 그들의 모델을 훔쳤다"라고 말한다면, 이 논문은 다음과 같이 말합니다. "잠깐만요. 당신은 완전히 다른 레시피를 훔쳤을 수도 있으며, 그것은 위험할 수 있습니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →