← 최신 논문
🤖 machine learning

Fingerprinting Inference Systems of Large Language Models

본 논문은 엔진, 백엔드, 하드웨어와 같은 특정 추론 시스템 구성 요소로 인해 발생하는 미묘한 수치적 편차가 LLM 출력으로 전파되어 이러한 기반 시스템을 신뢰성 있게 식별할 수 있는 새로운 지문 인식 방법을 가능하게 하며, 이러한 식별을 완전히 차단하는 것이 근본적으로 어렵다는 것을 입증한다고 밝힌다.

원저자: Anna Wimbauer, Jonas Möller, Erik Imgrund, Konrad Rieck

게시일 2026-05-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Anna Wimbauer, Jonas Möller, Erik Imgrund, Konrad Rieck

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 간단한 언어와 일상적인 비유를 사용하여 설명합니다.

핵심 아이디어: 컴퓨터의 "디지털 지문"

세 가지 다른 레스토랑에서 정확히 같은 메뉴를 주문해 보라고 상상해 보세요. 같은 레시피를 사용하더라도 음식 맛은 약간씩 다를 수 있습니다. 한 셰프는 양파를 아주 조금 더 잘게 다지고, 다른 셰프는 팬을 약간 더 뜨겁게 데우며, 세 번째 셰프는 냄비를 다른 순서로 저어줍니다. 일반食客에게는 메뉴가 똑같아 보이지만, 전문 음식 평론가에게는 그 미세한 차이들이 정확히 어떤 주방에서 요리를 했는지 드러냅니다.

이 논문은 **대규모 언어 모델 (LLMs)**도 똑같이 작동한다고 주장합니다.

AI 에게 질문을 할 때, 답변은 단순히 "뇌"(모델) 에 의해 생성되는 것이 아닙니다. 요리가 이루어지는 "주방"(추론 시스템) 의 영향도 받습니다. 이 주방에는 다음이 포함됩니다:

  1. 엔진: 대화를 관리하는 소프트웨어 (vLLM 또는 SGLang 과 같은 것).
  2. 백엔드: 어텐션 (attention) 을 처리하는 특정 수학 도구 (FlashAttention 과 같은 것).
  3. 하드웨어: 물리적인 컴퓨터 칩 (Nvidia A100 대 H100 GPU 와 같은 것).

수학적으로는 동일해야 하지만, 컴퓨터는 항상 숫자를 정확히 같은 순서로 계산하지는 않습니다. 이로 인해 보이지 않는 미세한 오류 ( 수치적 편차라고 함) 가 발생합니다. 이 논문은 이러한 미세한 오류가 사용된 특정 소프트웨어와 하드웨어의 조합에 고유하다는 것을 보여줍니다.

공격의 작동 방식: "탐정의 퀴즈"

연구자들은 이러한 시스템을 "지문"으로 남기는 방법을 고안했습니다. 그들은 주방에 접근할 수 없지만, 셰프에게 질문하고 메뉴를 읽을 수 있는 탐정처럼 행동합니다.

전략:
탐정은 컴퓨터가 비밀을 드러내도록 강요하는 네 가지 특정 유형의 "함정"(프롬프트) 을 사용합니다.

  1. 희귀 토큰 함정: AI 에게 문장에 숨겨진 기이하고 낯선 기호를 회상하도록 요청합니다. 미세한 수학 오류로 인해 AI 가 잘못된 기호를 추측할 수 있습니다.
  2. 예/아니오 함정: 한 단계의 사고만 필요한 간단한 질문을 합니다. 이는 답변을 하기 전에 컴퓨터가 질문을 어떻게 읽는지 분리해 냅니다.
  3. 긴 이야기 함정: AI 에게 매우 긴 텍스트를 주고 그 안에 있는 특정 숫자를 요청합니다. 이는 컴퓨터가 작업을 조각으로 나누어 처리하도록 강요하여 대규모 작업을 어떻게 처리하는지 드러냅니다.
  4. 반복 함정: AI 에게 문장을 100 번 반복하도록 요청합니다. 이는 컴퓨터가 방금 말한 것을 어떻게 기억하는지 ( "캐시"를 사용하여) 확인합니다.

이러한 함정을 AI 에게 제공하고 답변의 미세한 차이를 분석함으로써, 연구자들은 높은 정확도로 *"이 답변은 vLLM 엔진을 사용하여 A100 칩에서 요리되었습니다"*라고 말할 수 있는 분류기 (스마트 분류 기계) 를 구축했습니다.

그들이 발견한 것

연구자들은 다양한 소프트웨어와 하드웨어 조합에 대해 이를 테스트했습니다.

  • 완벽한 정확도 ("영온도" 경우): AI 가 매우 엄격하고 결정론적 (무작위성 없음) 으로 설정되어 있을 때, 지문 식별은 100% 성공합니다. 완벽한 일치와 같습니다.
  • 좋은 정확도 ("채팅" 경우): AI 에게 약간의 창의성을 허용할 때 (무작위성 활성화), 지문 식별은 여전히 매우 효과적이며 **76% 에서 80%**의 정확도로 맞춥니다.
  • 강건성: 이 방법은 AI 가 한 번에 다른 양의 데이터를 처리하도록 요청받거나 시스템 프롬프트 (AI 의 지시사항) 가 약간 변경되더라도 작동합니다.

왜 우리가 관심을 가져야 할까요? (보안 위험)

이 논문은 심각한 보안 문제를 강조합니다.

해커가 은행에 침입하고 싶다고 상상해 보세요. 그들은 어떤 열쇠를 따야 할지 알기 위해 은행이 특정 유형의 자물쇠 (특정 소프트웨어 엔진) 를 사용하는지 알아야 합니다.

  • 취약점: 공격자가 AI 와 대화하기만 해도 "주방"(추론 엔진 및 하드웨어) 을 식별할 수 있다면, 해당 특정 소프트웨어의 알려진 취약점 (버그) 을 찾아볼 수 있습니다.
  • 결과: 그들은 표적 공격을 시작할 수 있습니다. 논문은 vLLM 및 SGLang 과 같은 인기 있는 엔진에서 이미 중요한 취약점이 발견되었다고 지적합니다. 시스템을 식별하는 것은 이를 악용하는 첫 번째 단계입니다.

이것을 막을 수 있을까요?

이 논문은 이를 막는 것은 매우 어렵다고 결론지었습니다.

  • 딜레마: 지문 식별을 막으려면 하드웨어나 소프트웨어가 무엇이든 간에 모든 컴퓨터가 숫자를 정확히 같은 방식으로 계산하도록 해야 합니다. 하지만 이는 더 빠른 칩이나 최적화된 소프트웨어와 같은 다양한 전문 도구의 장점을 파괴할 것입니다.
  • 절충안: 지문을 숨기기 위해 답변에 "노이즈"(무작위성) 를 추가할 수 있지만, 이는 코딩이나 수학처럼 완벽한 정밀도가 필요한 작업에서 AI 를 덜 신뢰할 수 있게 만듭니다.
  • 최고의 방어: 가장 쉬운 방어는 단순히 속도 제한입니다. 사용자가 질문할 수 있는 횟수를 제한하면 해커가 지문을 구축할 만큼 충분한 데이터를 수집하는 데 너무 느리고 비용이 많이 들게 됩니다.

요약

이 논문은 AI 가 답변을 요리하는 "주방"이 음식에 고유하고 감지 가능한 맛을 남긴다는 것을 밝혀냈습니다. 이러한 미세한 맛을 분석함으로써 공격자는 AI 가 실행 중인 하드웨어와 소프트웨어를 정확히 식별할 수 있으며, 이는 잠재적으로 특정 보안 취약점을 표적으로 삼을 수 있게 합니다. 성능을 희생하지 않고 근본 원인을 쉽게 해결할 수는 없지만, 공격자가 필요한 데이터를 수집하는 것을 더 어렵게 만들 수는 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →