← 최신 논문
🤖 AI

Let Them Steal: Trapping Large Language Model Extraction Attacks with Knowledge Honeypot

이 논문은 적대적 공격자를 가치가 낮은 '허니팟 지식 그래프(Honeypot Knowledge Graph)'로 유인함으로써, 정당한 사용자의 성능을 저하시키지 않으면서도 공격자가 무가치한 데이터에 쿼리 예산을 소진하도록 유도하여 거대 언어 모델 추출 공격을 완화하는 방어 기제인 '지식 트랩(Knowledge Trap)'을 제안한다.

원저자: Yuyang Dai, Yushun Dong

게시일 2026-06-16
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yuyang Dai, Yushun Dong

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: "무료 샘플"의 함정

비범한 요리사(AI 모델)가 수년간 완성한 비밀스럽고 세계적으로 유명한 레시피를 가지고 있다고 상상해 보세요. 이 요리사는 돈을 벌기 위해 사람들이 음식을 맛볼 수 있는 레스토랑을 열었습니다. 하지만 요리사는 레시피를 주지는 않고, 그저 음식만 대접합니다.

도둑(공격자)은 레시피를 원하지만 주방에 침입할 수는 없습니다. 대신, 도둑은 음식을 1,000번 주문하며 매번 맛과 향, 식감이 어떠했는지 정확하게 기록합니다. 결국 도둑은 이 기록들을 이용해 집에서 완벽한 복제품 음식을 만들어내고, 요리사의 사업을 가로챕니다.

AI의 세계에서 이것을 **모델 추출 공격(Model Extraction Attack)**이라고 부릅니다. 공격자들은 AI에게 수만 번의 질문을 던져 그 지능을 더 저렴한 복제 버전으로 "증류(distill)"하여 소유하려 합니다.

기존의 방어책: "경호원"과 "소금통"

이전에는 도둑을 막기 위해 두 가지 주요 방법을 시도했습니다:

  1. 경호원 (탐지): 도둑의 행동을 보고 정체를 파악하는 것입니다. 만약 너무 많은 질문을 너무 빠르게 던지면 경호원이 그들을 쫓아냅니다. 문제점: 영리한 도둑들은 일반 고객처럼 행동하며 교묘히 빠져나갈 수 있습니다.
  2. 소금통 (변조): 요리사가 몰래 소금이나 향신료를 조금 넣어 도둑에게는 맛을 망쳐놓는 것입니다. 문제점: 이 방법은 맛있는 식사를 원하는 정직한 고객들의 식사까지 망쳐버립니다.

새로운 해결책: "지식 트랩 (Knowledge Trap)"

저자들은 **지식 트랩(Knowledge Trap)**이라는 영리하고 새로운 전략을 제안합니다. 도둑을 쫓아내거나 음식을 망치는 대신, 도둑을 들여보내되 아무것도 없는 곳으로 이어지는 가든 패스(garden path)로 유인하는 것입니다.

작동 방식은 다음과 같습니다:

1. "허니팟 지식 그래프" (가짜 정원)

방어자들은 요리사의 뇌에 두 가지 유형의 지식이 들어있다는 것을 알고 있습니다:

  • 핵심 지식: 요리를 환상적으로 만드는 비밀 소스 (예: 의료 진단, 금융 조언). 이것이 바로 도둑이 원하는 것입니다.
  • 저가치 지식: 흥미롭지만 쓸모없는 잡학 지식 (예: 19세기 배관의 역사나 생소한 1800년대 법률 용어). 이것은 오늘날 더 나은 요리를 만드는 데 아무런 도움이 되지 않습니다.

방어자들은 **허니팟 지식 그래프(Honeypot Knowledge Graph, HKG)**를 구축합니다. 이것은 흥미로워 보이는 식물들(저가치 지식)로 가득 찬 아름답고 가짜인 정원이라고 생각하면 됩니다. 겉보기에는 진짜 같고 똑똑해 보이지만, 이를 연구한다고 해서 메인 요리를 만드는 법을 배울 수는 없습니다.

2. "빵부스러기" 길 (유혹)

시스템이 너무 많은 질문을 던지는 수상한 고객(도둑)을 감지하면, 차단하는 대신 빵부스러기를 떨어뜨립니다.

예를 들어, 도둑이 "다리가 부러졌을 때 어떻게 치료하나요?"라고 묻는다고 가정해 봅시다.
AI는 올바르게 답변하되, 마지막에 아주 미세하고 미묘한 힌트를 덧붙입니다: "이는 고대 로마의 뼈 맞추기 방식과 유사하며, 특정 종류의 이끼를 사용했습니다..."

모든 것을 배우려는 도둑은 이렇게 생각합니다. "오, 저 이끼가 중요한 것 같아! 다음에는 저 이끼에 대해 물어봐야겠어!"

3. 자기 강화 루프 (토끼 굴)

도둑은 이끼에 대해 묻습니다. AI는 이끼에 대한 사실을 답하면서 관련된 주제에 대한 힌트를 줍니다: "이 이끼는 종종 특정 종류의 로마 샌들과 함께 사용되었습니다..."

도둑은 샌들에 대해 묻습니다. AI는 샌들에 대해 답하며 로마 신발 제작자 길드에 대한 힌트를 줍니다...

도둑은 토끼 굴에 빠지게 됩니다. 도둑은 자신의 한정된 "질문 예산"(사용 가능한 질문 횟수)을 이 가짜 정원을 탐험하는 데 모두 써버리고 있습니다. 그들은 사실들을 배우고 있지만, 그 사실들은 요리사의 비밀 레시피를 복제하는 데 전혀 쓸모없는 것들입니다. 한편, 부러진 다리에 대해 묻는 정직한 고객들은 수정되지 않은 완벽한 답변을 받습니다.

왜 이것이 게임 체인저인가

  • 선량한 사용자에게 피해 없음: 정직한 고객들은 가짜 정원을 절대 보지 못합니다. 그들은 매번 진짜 답변을 받습니다.
  • 도둑의 시간 낭비: 도둑은 자신이 진전을 이루고 있다고 생각하지만, 실제로는 레시피를 훔치는 데 도움이 되지 않는 잡학 지식을 암기하고 있을 뿐입니다.
  • "예산"의 제약: 공격자는 비용이 너무 많이 들기 때문에 질문할 수 있는 횟수가 제한되어 있습니다. 쓸모없는 잡학 지식을 묻도록 강제함으로써, 방어자는 도둑이 진짜 비밀을 배우기도 전에 질문 예산을 다 써버리게 만듭니다.

결과

연구진은 이 시스템을 의료(의사 조언), 금융(돈 조언), 법률(법률 조언) AI 모델에 대해 테스트했습니다.

  • 도둑의 복제본: 도둑이 만든 복제 모델은 (평균적으로 약 6% 정도) 원래 모델보다 성능이 훨씬 떨어졌습니다. 왜냐하면 도둑이 진짜 비밀 대신 가짜 정원을 바탕으로 학습했기 때문입니다.
  • 정직한 사용자: 그들의 경험은 전혀 변하지 않았습니다. 그들은 이전과 동일한 고품질의 답변을 받았습니다.

핵심 요약

도둑이 주방에 들어오는 것을 막으려 노력하는 대신, 지식 트랩은 그들을 초대하여 "주방 도구의 역사" 박물관 투어를 시켜줍니다. 그들이 떠날 때쯤이면, 그들은 지치고 혼란스러우며, 실제로 요리를 하는 법에 대해서는 아무것도 배우지 못한 상태가 됩니다. 진짜 레시피는 안전하게 보호되며, 정직한 손님들도 여전히 행복합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →