← 최신 논문
🤖 machine learning

MeMark: Membrane-Space Watermarking for Spiking Neural Networks

MeMark은 뉴런의 내부 막 전위 상태에 다중 비트 식별자를 직접 삽입하여 출력 헤드 교체, 미세 조정, 가지치기 및 양자화 이후에도 신뢰할 수 있는 소유권 검증을 가능하게 하는 스파이킹 신경망을 위한 강력한 워터마킹 기술을 소개한다.

원저자: Roberto Riaño, Gorka Abad, Stjepan Picek, Aitor Urbieta

게시일 2026-08-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Roberto Riaño, Gorka Abad, Stjepan Picek, Aitor Urbieta

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

급격히 진화하는 인공지능의 세계에서, 전통적인 모델보다 인간의 신경계를 더 밀접하게 모방하는 유형의 컴퓨터 뇌를 향한 중대한 변화가 일어나고 있습니다. 스파이킹 신경망(spiking neural networks)으로 알려진 이 시스템은 정보를 일정한 숫자의 흐름으로 처리하지 않습니다. 대신, 이들은 뇌 속의 뉴런이 발화하는 것과 매우 유사하게, 짧고 불연속적인 활동의 폭발을 통해 통신합니다. 이들은 특정 신호가 자신을 자극할 때까지 침묵 상태를 유지하며, 덕분에 에너지 사용 측면에서 매우 효율적입니다. 이러한 첨단 시스템을 훈련하는 데는 방대한 양의 데이터, 강력한 컴퓨터, 그리고 상당한 시간이 필요하기 때문에, 최종적으로 훈련된 모델은 가치 있는 자산이 됩니다. 기업과 연구자들은 종-종 이 모델들을 사전 훈련된 시작점으로 공개하여, 다른 이들이 이를 바탕으로 새로운 작업을 수행할 수 있도록 합니다. 그러나 이 관행은 취약점을 만들어냅니다. 만약 누군가가 공개된 모델을 가져와서 약간 수정하고, 최종 답을 생성하는 부분을 교체한다면, 그들은 원작자가 시스템의 핵심을 구축했다는 증거를 효과적으로 지워버릴 수 있습니다.

이 문제를 해결하기 위해, 한 연구팀은 스파이킹 신경망의 내부 작동 방식 깊숙이 숨겨진 은밀한 서명 역할을 하는 'MeMark'라는 새로운 방법을 개발했습니다. 인공지능 모델을 보호하려는 이전의 시도들이 최종 출력이나 가시적인 결과물을 확인하는 데 의존했던 것과 달리, MeMark는 그 증거를 뉴런 자체 안에 숨깁니다. 연구진은 막전위(membrane potential)라고 알려진, 내부 전기 전하를 유지하는 특정 유형의 뉴런에 주목했습니다. 이 전하는 시간이 지남에 따라 쌓이다가 임계치에 도달하면 신호를 발사하고 다시 초기화됩니다. 연구팀은 이 자연스러운 발화 임계치를 비밀 잠금장치로 사용할 수 있다는 점을 깨달았습니다. 훈련 과정을 정교하게 조정함으로써, 그들은 비밀스럽고 숨겨진 입력이 제시되었을 때 특정 뉴런이 발화 한계치의 바로 위 또는 바로 아래에서 전하를 유지하도록 강제할 수 있습니다. 이는 '발화함'과 '발화하지 않음'의 패턴을 만들어내며, 이는 곧 비밀 코드에 대응하게 되어, 네트워크의 전기적 상태 속에 다자릿수 비밀번호를 써넣는 효과를 냅념다.

이 접근 방식의 탁월함은 그것을 읽어내는 방식과 변화 속에서도 살아남는 방식에 있습니다. 소유권을 검증하기 위해 소유자는 별도의 디코더를 훈련하거나 데이터를 해석하는 새로운 방법을 배울 필요가 없습니다. 그들은 단순히 비밀 입력을 제시하고 선택된 뉴런의 내부 전하를 확인하기만 하면 됩니다. 전하가 임계치보다 높으면 1로 간주하고, 낮으면 0으로 간주합니다. 임계치는 뉴런 설계의 내장된 일부이기 때문에, 검증 과정은 즉각적이며 추가적인 학습을 요구하지 않습니다. 이 방법은 놀라울 정도로 탄력적인 것으로 증명되었습니다. 2억 개 이상의 파라미터를 가진 대규모 언어 모델을 대상으로 한 테스트에서, 연구진은 20개의 서로 다른 비밀 키를 심었습니다. 모델의 연결을 90% 제거하거나, 데이터를 압축하거나, 텍스트를 생성하는 최종 레이어를 완전히 교체하는 등 모델이 대폭 수정되었음에도 불구하고, 숨겨진 서명은 온전히 유지되었습니다. 내부의 증거는 이러한 격렬한 변화 속에서도 살아남았지만, 기존 방식에서 사용되던 가시적인 출력 마커들은 쉽게 지워졌습니다.

연구진은 또한 부정직한 청구인이 시도할 수 있는 영리한 속임수, 즉 모델을 조사한 뒤 모델의 기존 내부 상태와 우연히 일치하는 가짜 키를 만들어내는 문제를 다루었습니다. 이를 방지하기 위해, 시스템은 모델이 출시되기 전에 생성된 타임스탬프 기록을 요구합니다. 이 기록은 특정 버전의 모델에 비밀 키를 결합합니다. 만약 누군가 나중에 소유권을 주장하기 위해 역공학으로 키를 만들어내려 한다면, 그들은 이 사전 기록을 제시할 수 없으므로 그들의 주장이 거짓임을 증명하게 됩니다. 연구에 따르면, 공격자가 먼저 내부를 들여다볼 수 있다면 모델과 일치하는 키를 생성할 수는 있었으나, 타임스탬프가 찍힌 사전 약속(commitment) 요건은 우회할 수 없었습니다. 더욱이, 시스템은 수천 개의 무작위 키를 대상으로 테스트되었으며, 그중 어떤 것도 보호된 모델과 우연히 일치하지 않았기에, 증거가 구체적이고 신뢰할 수 있음을 보장했습니다.

이 연구는 복잡한 인공지능의 소유권이 모델이 재용도화되거나 변경될 때도 보호될 수 있음을 보여줍니다. 모델의 최종 출력에 증거를 심는 대신 뉴런의 근본적인 전기적 행동에 직접 증거를 심음으로써, 연구진은 모델의 기능을 파괴하지 않고서는 제거하기 어려운 서명을 만들어냈습니다. 이 방법은 단순한 반복 구조부터 언어에 사용되는 복잡한 트랜스포머 기반 시스템에 이르기까지 다양한 유형의 네트워크 아키텍처 전반에서 작동합니다. 시스템이 견고하기는 하지만, 연구진은 만약 공격자가 정확한 비밀 입력과 숨겨진 뉴런의 특정 위치를 알고 있다면, 잠재적으로 그것들을 표적으로 삼아 제거할 수 있다고 언급했습니다. 그러나 그러한 비밀 지식이 없다면, 워터마크는 지속적이고 신뢰할 수 있는 형태의 증거로 남아, 모델이 여러 손을 거치고 새로운 용도로 수정된 후에도 원작자들이 자신의 작업물을 증명할 수 있도록 보장해 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →