← 최신 논문
🤖 AI

AI Model Extraction Attacks: Bypassing Single-Client Assumptions in Defenses

이 수상 경력에 빛나는 논문은 오픈 소스인 CerberusAI 프레임워크를 소개하며, 협동적인 다중 클라이언트 공격이 AI 모델 추출에 대한 기존의 단일 클라이언트 가정 기반 방어 체계를 효과적으로 우회할 수 있음을 입증함으로써, 상태 유지형(stateful) 및 신원 독립적(identity-independent) 보안 아키텍처로의 패러다임 전환이 필요함을 보여준다.

원저자: Maxime Schwarzer, Johannes F. Loevenich, Gustavo Sánchez, Laurin Holz, Thies Möhlenhof, Tobias Hürten, Roberto Rigolin F. Lopes, Veit Hagenmeyer

게시일 2026-06-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Maxime Schwarzer, Johannes F. Loevenich, Gustavo Sánchez, Laurin Holz, Thies Möhlenhof, Tobias Hürten, Roberto Rigolin F. Lopes, Veit Hagenmeyer

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 군사 등급의 케이크를 만드는 매우 비밀스럽고 똑똑한 레시피를 소유하고 있다고 상상해 보세요. 당신은 아무도 이것을 훔치지 않기를 바라며, 사람들에게는 당신의 비밀 레시피를 바탕으로 케이크를 아주 조금만 맛보게 한 뒤, "이것은 단맛인가요, 아니면 짠맛인가요?"라고 묻습니다.

인공지능(AI)의 세계에서 이 "레시피"는 **모델(Model)**이며, "맛을 보는 것"은 AI에게 질문을 던지는 것(쿼리, queries)입니다. **모델 추출 공격(Model Extraction Attack)**이란, 나쁜 놈이 당신의 비밀 레시피를 알아내어 자신만의 복제 케이크를 만들기 위해 충분히 많은 양의 맛을 보려고 시도하는 것을 말합니다.

케이크를 지키는 옛날 방식 ( "단일 클라이언트"의 결함)

오랫동안 보안 전문가들은 이러한 도둑들을 잡기 위한 간단한 규칙을 가지고 있었습니다: 바로 **단일 클라이언트 가정(Single Client Assumption)**입니다.

이것을 클럽 입구를 지키는 문지기에 비유해 봅시다. 문지기의 규칙은 다음과 같습니다: "만약 어떤 한 사람이 연속으로 100번이나 몰래 들어오려고 시도한다면, 그 사람은 분명히 도둑이다. 막아라!"

이 방식은 도둑이 서투른 개인 행동가라면 아주 잘 작동합니다. 하지만 이 논문은 이 규칙이 깨졌다고 주장합니다. 왜냐하면 이 규칙은 도둑이 항상 혼자 움직인다고 가정하기 때문입니다.

새로운 현실: "스웜(Swarrm, 떼)" 공격

이 논문의 저자들은 이렇게 말합니다. "만약 도둑이 한 사람이 아니라면 어떨까요? 만약 그들에게 400명의 친구라는 군대가 있다면 어떨까요?"

그들은 이를 **분산 공격(Distributed Attack)**이라고 부릅니다. 도둑이 문지기를 우회하는 방법은 다음과 같습니다.

  1. 라운드 로빈(Round-Robin) 전략: 한 사람이 100번의 질문을 하는 대신, 도둑은 질문을 400명의 서로 다른 친구들에게 나누어 줍니다. 각 친구는 단 1~2개의 질문만 던집니다.

    • 비유: 400명의 사람들이 문지기에게 다가와 각각 아주 작은 맛만 한 번씩 보는 상황을 상상해 보세요. 문지기는 각 개인을 개별적으로 보고 생각합니다. "오, 이 사람은 괜찮군. 딱 한 번만 물어봤으니까."
    • 결과: 문지기는 모두를 들여보냅니다. 도둑은 필요한 100번의 맛을 모두 얻었지만, 어느 특정 한 사람도 너무 많은 질문을 하지 않았기 때문에 경보가 울리지 않습니다. 논문은 이 단순한 기술이 현재 사용 중인 최고의 보안 시스템들을 완전히 무력화한다는 것을 보여줍니다.
  2. "트래픽 혼합(Traffic Mixing)" 전략: 만약 보안 요원이 개별적으로 보는 대신, 모두를 함께 관찰하기로 결정한다면 어떻게 될까요?

    • 비유: 도둑은 보안 요원이 이제 방 안에 있는 전체 인원수를 세고 있다는 사실을 깨닫습니다. 그래서 도둑은 400명의 친구를 데려오지만, 동시에 케이크를 구경하러 온 4,000명의 무고한 관광객(가짜 트래픽)도 함께 데려옵니다.
    • 도둑은 자신의 100개 "훔치는" 질문을 4,000개의 "무고한" 질문 속에 섞어 버립니다. 보안 요원에게 이 군중은 평범해 보입니다. 도둑의 "훔치는" 질문들은 소음 속에 묻혀버립니다.
    • 결과: 만약 보안 요원이 건초더미 속의 작은 바늘을 찾아내기 위해 기준을 낮추어 모든 사람을 잡아내려 한다면, 결국 4,000명의 무고한 관광객까지 모두 막아서게 됩니다. 보안 시스템은 너무 소란스러워 작동할 수 없게 되어 쓸모가 없어집니다.

해결책: "CerberusAI"라 불리는 새로운 도구

이 아이디어들을 증명하기 위해, 저자들은 CerberusAI(지옥을 지키는 머리 세 개 달린 개에서 이름을 따옴)라는 새로운 오픈 소스 도구를 만들었습니다.

  • 역할: 이것은 시뮬레이션 실험실입니다. 연구자들이 "가짜" AI 모델을 설정하고, 그 모델에 대해 "가짜" 공격자 군단을 보내 보안이 유지되는지 테스트할 수 있게 해줍니다.
  • 중요성: 이전에는 연구자들이 주로 한 명의 나쁜 놈이 모델을 공격하는 방식으로 보안을 테스트했습니다. 하지만 CerberusAI를 통해 조직적이고 조율된 군대가 공격할 때 어떤 일이 벌어지는지 테스트할 수 있습니다.

핵심 요점

이 논문은 우리의 사고방식을 바꿔야 한다고 결론짓습니다.

  • 옛날 사고방식: "이 특정한 한 사람이 너무 많은 질문을 하고 있는가?"
  • 새로운 사고방식: "이 사람들의 집단이, 설령 군중 속에 숨어 있더라도, 내 비밀을 훔치려 하고 있는가?"

저자들은 군사 및 핵심 인프라(전력망이나 국방 시스템 등)를 위해서, 우리는 더 이상 개인만을 감시하는 보안 시스템을 신뢰할 수 없다고 주장합니다. 우리는 질문의 횟수뿐만 아니라 질문의 의도를 파악하고 전체적인 그림을 볼 수 있는 더 똑똑한 문지기가 필요합니다.

요약하자면: 이 논문은 만약 당신이 한 번에 한 명의 도둑만을 막으려 한다면, 조율된 도둑 무리가 당신의 비밀을 쉽게 훔쳐갈 것이라는 점을 증명합니다. 우리는 군중 속에 숨어 있더라도 전체 일당을 찾아낼 수 있는 새로운 종류의 보안이 필요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →