← 最新の論文
💻 computer science

MirrorMark: A Distortion-Free Multi-Bit Watermark for Large Language Models

MirrorMark は、トークンの確率分布を歪めることなく堅牢で検出可能なメッセージを埋め込むことで、テキストの品質を維持しつつ、既存の手法を精度と検出率の面で大幅に上回る、大規模言語モデル向けの新しいマルチビット透かし技術である。

原著者: Ya Jiang, Massieh Kordi Boroujeny, Surender Suresh Kumar, Kai Zeng

公開日 2026-04-28
📖 1 分で読めます☕ さくっと読める

原著者: Ya Jiang, Massieh Kordi Boroujeny, Surender Suresh Kumar, Kai Zeng

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、新しい完璧なパンのレシピを考案したばかりのパン屋だと想像してください。誰かがそのパンを自分の名前で販売した場合でも、それがあなたのものだと証明できるようにしたいと考えています。しかし、ここには落とし穴があります。パンの表面に巨大な「私のもの」というスタンプを押すことはできません。それは見た目を損ない、味も台無しにしてしまうからです。また、秘密の暗号をパン生地にささやくこともできません。もし誰かが一片を切り取ったり、パン粉を加えたりすれば、そのささやきは失われてしまうからです。

これが、私たちにとって文章を書く AI システムである大規模言語モデル(LLM)に対して、MirrorMarkが解決する問題です。

以下に、MirrorMark の仕組みを簡単な概念に分解して説明します。

1. 現在の「透かし」の問題点

現在の透かし埋め込み方法は、二つの欠陥のあるスタンプのタイプだと考えてください。

  • 「歪ませる」スタンプ: 一部の手法は、秘密を隠すためにレシピをわずかに変更しようとします。例えば、AI が通常選ぶ言葉とは少し異なる言葉を選ばせるように強制します。これは、パンに目印として奇妙なスパイスを加えるようなものです。機能はしますが、パンの味が変わってしまいます(文章の質が低下します)。
  • 「壊れやすい」スタンプ: 他の手法は、味を変えずに秘密を隠そうとします。しかし、それは混雑した部屋でのささやきのようなものです。誰かが文章を編集(文を追加、単語を削除、言い換えなど)すれば、そのささやきは失われ、パンが自分のものだと証明できなくなります。

2. MirrorMark の解決策:「完璧な反射」

MirrorMark は、歪みがない(パンの味を変えない)かつ頑強(編集に耐える)秘密メッセージを隠す新しい方法です。

これはMod-1 ミラーリングと呼ばれる巧妙なトリックを使用します。

  • 比喩: AI が 0 から 1 の間のどこかに落ちるサイコロの振る舞いに基づいて単語を選択していると想像してください。
  • トリック: MirrorMark はサイコロの振る舞いを変えるのではなく、その数字を伝えたい秘密メッセージに応じて、特定の線(鏡)を基準に「折りたたむ」のです。
  • 魔法: 紙を完璧に折りたためば、紙の形は変わらず、ただ反対側から見ると異なるように見えるだけです。同様に、MirrorMark は AI が使用する乱数を並べ替えますが、それらの数字の全体的なパターンは完全に同じままです。
  • 結果: AI は透かしなしの場合と全く同じように、100% 自然で高品質な文章を書きます。しかし、単語の具体的な選択の中には、後で復元可能なマルチビットコード(デジタル指紋のようなもの)が隠されています。

3. 「コンテキストアンカー型バランス型スケジューラ」(CABS)

完璧な鏡を使ってもリスクはあります。もし誰かが文章の塊を切り取ったらどうなるでしょうか?秘密メッセージが均等に分散されていれば、塊を切り取ることでメッセージ全体が消えてしまう可能性があります。

MirrorMark は、CABS(Context-Anchored Balanced Scheduler:コンテキストアンカー型バランス型スケジューラ)と呼ばれる賢い管理者を導入します。

  • 比喩: 長い本の中に 100 枚の小さなメモを隠していると想像してください。すべてを第一章に隠せば、その章が破り取られたらすべて失われます。ランダムに隠せば、メモが偏って集まり、他のページが空っぽになるかもしれません。
  • CABS の仕組み: CABS は慎重な司書のように機能します。書かれている文章を確認し、秘密のメモが本全体に均等に分散されていることを保証します。
  • 安全網: また、「フレーム」や「章」を作成します。もし誰かがページを破り取っても、CABS はその損害がその一つのフレームに限定されることを保証します。残りの本は同期されたままなので、隠されたメッセージは残りのメモから組み立てることができます。これにより、コピー&ペーストや削除攻撃による透かしの破壊が非常に困難になります。

4. 実験の結果

研究者たちは、LLaMA-2 などの AI モデルを用いて、MirrorMark を他のトップ手法と比較してテストしました。

  • 品質: MirrorMark によって生成された文章は、通常の AI 文章と区別がつかず、ロボットっぽさや不自然さは見られませんでした。
  • 検出: 他の手法よりも MirrorMark の検出ははるかに容易でした。少量の文章(300 語)であっても、高い精度で透かし入りコンテンツを特定できました。
  • 頑強性: 攻撃者が単語を削除したり、新しい単語を追加したり、文章の一部をコピー&ペーストしたりして透かしを「破壊」しようとした際、MirrorMark は競合他社よりもはるかに良く耐え抜きました。
  • 容量: これは単なる「はい/いいえ」の信号だけでなく、多くの情報(マルチビット)を隠すことができます。つまり、「誰がこれを作ったか」や「いつ作られたか」といった詳細を運ぶことができます。

まとめ

MirrorMark は幽霊のような署名のようなものです。文章に目に見える痕跡を残さず、言葉の風味を変えず、本からページを破り取っても壊れません。これは数学的な「鏡」を用いて、AI の思考の自然なランダム性の内部に複雑なコードを隠すことで、AI の出力が高品質であると同時に、その発生源まで追跡可能であることを保証します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →