MeMark: Membrane-Space Watermarking for Spiking Neural Networks
MeMarkは、マルチビットの識別子をニューロンの内部膜電位状態に直接埋め込むことで、出力ヘッドの置換、ファインチューニング、プルーニング、および量子化の後でも信頼性の高い所有権検証を可能にする、スパイキングニューラルネットワーク向けの堅牢なウォーターマーキング技術を導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
急速に進化する人工知能の世界において、従来のモデルよりも人間の神経系をより密接に模倣するタイプのコンピュータ・ブレインへと、大きな転換が起きている。スパイクニューラルネットワークとして知られるこれらのシステムは、情報を一定の数値の流れとして処理するのではない。その代わりに、脳内のニューロンが発火するように、短く離散的な活動のバーストを通じて通信を行う。これらは特定の信号がトリガーを与えるまで沈黙を保つため、エネルギー消費の面で非常に効率的である。これらの高度なシステムの学習には、膨大なデータ、強力なコンピュータ、そして多大な時間が必要となるため、最終的に学習されたモデルは価値ある資産となる。企業や研究者は、これらのモデルを新しいタスクのために構築するための出発点(プリトレーニング済みモデル)として公開することが多い。しかし、この慣行はある脆弱性を生み出す。もし誰かが公開されたモデルを手に取り、それをわずかに微調整し、最終的な答えを生成する部分を置き換えた場合、元の作成者がシステムの核となる部分を構築したという証拠を事実上消し去ってしまうことができるのである。
この問題を解決するために、研究チームはMeMarkと呼ばれる新しい手法を開発した。これは、スパイクネットワークの内部構造の奥深くに埋め込まれた隠れた署名として機能する。AIモデルを保護するための従来の試みは、最終的な出力や目に見える結果に依存していたが、MeMarkは証拠をニューロンそのものの中に隠す。研究者たちは、膜電位として知られる内部的な電気電荷を維持する特定の種類のニューロンに注目した。この電荷は、時間が経つにつれて蓄積され、臨界限界に達すると、ニューロンは信号を発火させ、その後リセットされる。チームは、この自然な発火閾値を「秘密の鍵」として利用できることに気づいた。学習プロセスを慎重に調整することで、特定の秘密の入力が提示された際に、特定のニューロンが発火限界の直上または直下に電荷を保持するように強制することができる。これにより、「発火した」状態と「発火していない」状態のパターンが生成され、それが秘密のコードに対応することになり、実質的にネットワークの電気的状態の中に多桁のパスワードを書き込むことになるのである。
このアプローチの素晴らしさは、その読み取り方と、変更に対する生存能力にある。モデルの所有権を検証するために、所有者は別途デコーダーを学習させたり、データの解釈方法を新たに学んだりする必要はない。単に秘密の入力を提示し、選択されたニューロンの内部電荷を確認するだけでよい。もし電荷が閾値を超えていれば「1」とカウントし、下回っていれば「0」とカウントする。閾値はニューロンの設計に組み込まれた一部であるため、検証プロセスは即時的であり、追加の学習を必要としない。この手法は驚くべき回復力を示した。2億個以上のパラメータを持つ大規模言語モデルを用いたテストにおいて、研究者たちは20種類の秘密キーを埋め込んだ。モデルの接続の90%を削除したり、データを圧縮したり、テキストを生成する最終層を完全に置き換えたりといった大幅な修正が行われたとしても、隠された署名は無傷のまま残った。内部の証拠はこれらの劇的な変化を生き延びたが、古い手法で使用されていた可視的な出力マーカーは容易に消去されてしまった。
研究者たちはまた、不誠実な主張者が試みる可能性のある巧妙なトリックにも対処した。それは、モデルを検査した後、既存の内部状態に偶然一致するような偽のキーを作成するというものである。これを防ぐために、システムはモデルが公開される前に作成されたタイムスタンプ付きの記録を必要とする。この記録は、秘密のキーをその時点での特定のバージョンのモデルに結びつける。もし誰かが後からモデルをリバースエンジニアリングしてキーを作成し、所有権を主張しようとしても、この事前のタイムスタンプ付きのコミットメントを提示できないため、その主張は偽であると証明される。研究によれば、もし攻撃者が最初に中身を見ることが許されているならば、モデルに一致するキーを作成することは確かに可能であるが、元のタイムスタンプ付きの要件を回避することはできない。さらに、システムは数千のランダムなキーに対してテストされたが、それらが保護されたモデルに偶然一致することはありませんでした。これにより、証拠が特異かつ信頼できるものであることが保証された。
この研究は、モデルが再利用されたり変更されたりしても、複雑な人工知能の所有権を保護できることを示している。最終的な出力の中にではなく、ニューロンの根本的な電気的挙動の中に証拠を埋め込むことで、研究者たちは、機能を破壊することなしには取り除くことが困難な署名を作り出した。この手法は、単純な反復構造から、言語に使用される複雑なトランスフォーマーベースのシステムに至るまで、異なる種類のネットワークアーキテクチャにわたって機能する。システムは堅牢であるが、もし攻撃者が正確な秘密の入力と隠されたニューロンの特定の場所を知っている場合、それらを標的にして除去できる可能性があると研究者は指摘している。しかし、その秘密の知識がない限り、ウォーターマークは持続的かつ信頼できる証拠として残り続け、元の作成者が、モデルが多くの手を経て新しい用途のために修正された後でも、自らの成果を証明できることを保証するのである。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。