← 最新の論文
🤖 machine learning

When the Same Coefficients Reach Different Places: Asymmetric Realizability in Transplanting Tokenizers across Large Language Models

本論文は、大規模言語モデル間におけるトークナイザー移植において、特定の係数ベクトルをドナーモデルでは不活性に保ちながらベースモデルでは高サリエンスな再構成を誘発する「ブレーカートークン」として設計可能であるという構造的な「非対称実現可能性」脆弱性を特定し、これにより標準的な重みマージのチェックやLoRA ベースの緩和策を回避できることを明らかにする。

原著者: Xiaoze Liu, Weichen Yu, Matt Fredrikson, Xiaoqian Wang, Jing Gao

公開日 2026-05-29
📖 1 分で読めます☕ さくっと読める

原著者: Xiaoze Liu, Weichen Yu, Matt Fredrikson, Xiaoqian Wang, Jing Gao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

以下は、この論文を平易な言葉と創造的な比喩を用いて解説したものです。

全体像:「万能翻訳機」のバグ

2 つの異なる言語があると想像してください。1 つはドナー(ソースモデル)、もう 1 つはベース(ターゲットモデル)です。開発者はときどき、これらを組み合わせたいと考えます。ドナーの辞書にしか存在しない単語を取り出し、ベースの辞書に「移植」して、ベースがその単語を理解できるようにしようとするのです。

これを行うために、彼らは翻訳機mergekit などのツール)を使います。翻訳機はドナーの単語を見て、「この単語は、単語 A の 10%、単語 B の 5%、単語 C の 2% で構成されている」と判断します。そして、その正確な割合(係数)をベースの辞書に適用し、新しい単語を作成します。

論文の発見:研究者たちは、この翻訳プロセスに隠された欠陥を発見しました。2 つの辞書(ドナーとベース)の構造が異なるため、同じ割合の組み合わせが、全く異なる意味を持つことがあるのです。

  • ドナーの辞書では、その割合は誰も使わない退屈で目に見えない単語に集約されるかもしれません。
  • ベースの辞書では、その全く同じ割合が、モデルが好んで発する、目立つ注目を集める単語に集約されるかもしれません。

論文はこの現象を**「非対称実現可能性(Asymmetric Realizability)」**と呼んでいます。ある部屋では静寂を意味する秘密の暗号が、別の部屋では叫び声になるようなものです。


攻撃:「ゴーストトークン」

研究者たちは、攻撃者がこれをどう悪用できるかを実証しました。彼らは**「ブレイカー・トークン」**と呼ばれるものを作成しました。

  1. セットアップ:攻撃者は、ドナーモデルの辞書に新しい偽の単語を追加します。
  2. トリック:彼らは、この偽の単語の「材料」(埋め込みベクトル)を慎重に設計します。
    • ドナーモデルでは、その材料は退屈なものです。モデルはこの単語を完全に無視します。まるで、ドナーの心の中を痕跡を残さずに通り抜ける幽霊のようです。
    • ベースモデルでは、「翻訳」が行われた後、その同じ材料が突然磁石のように作用します。ベースモデルはこの偽の単語を絶えず言い出すようになります。

比喩:ケーキのレシピ(ドナー)を持っていると想像してください。そこに「目に見えない粉」を少し加えます。

  • キッチン A(ドナー)でケーキを焼くと、その粉は何も起こしません。ケーキは普通に仕上がります。
  • そのレシピをキッチン B(ベース)に送ります。キッチン B は異なる計量カップとオーブンを使っているため、その同じ「目に見えない粉」が、オーブンから出るたびにケーキを鮮やかな赤色に変え、「こんにちは!」と叫ぶようにしてしまいます。

攻撃者はベースモデルを直接ハックする必要はありません。ドナーのレシピを毒入り(汚染)にするだけで、「翻訳」プロセスが残りを行ってくれます。


このブレイカー・トークンは何ができるのか?

論文は、この「幽霊の単語」が、攻撃者がそれを何と名付けるかによって、3 つの方法で問題を引き起こすことを示しています。

  1. サービスの低下(壊れたラジオ):攻撃者がモデルを繰り返し発言させるようなトークン名にすると、ベースモデルはそのトークンを繰り返し出力し、質問への回答を拒絶するかもしれません。まるで、一つの雑音に固定されたラジオのようです。
  2. 評判の汚染(隠された侮辱):攻撃者は、モデルに通常の親切な回答の中に、差別的な言葉(スラングなど)を隠して言わせることができます。回答の残りは正常に見えますが、その「幽霊の単語」がモデルを使用する企業の評判を台無しにします。
  3. 敵対的透かし(目に見えない署名):攻撃者は、モデルがすべての回答に秘密のコード(例:[WM-8472])を付加させるようにできます。これにより、攻撃者は後で「このモデルは私の盗まれた語彙を使っている」と証明できますが、誰もそのコードの存在に気づくことはありません。

なぜこれを単純に修正できないのか?

研究者たちは、モデルをマージした後に AI モデルをクリーンアップしようとする一般的な方法をテストしましたが、これらはいずれもこの特定の攻撃に対して失敗することがわかりました。

  • ファインチューニング(モデルに新しいトリックを教える):ベースモデルを再訓練して悪い単語を言わせないようにしても、攻撃時に問われたのと同じ種類の質問で訓練した場合にのみ機能します。少し異なる質問(物語ではなく数学の問題など)を問うと、モデルは教訓を忘れ、再び悪い単語を言い始めます。
  • クリーンモデルとのマージ:「汚染された」モデルを「クリーンな」モデルと混ぜて悪い部分を希釈しても、攻撃は生き残ります。「幽霊の単語」は翻訳の構造に深く組み込まれているため、クリーンな重みと混ぜても洗い流すことができません。
  • スペクトルフィルター(金属探知機):人々はモデルをスキャンして攻撃のように見える「奇妙な」数値を検出するツールを使用します。しかし、研究者たちは、彼らの「ゴースト・トークン」はこれらのスキャナーには完全に正常に見えることを発見しました。これらはドナーの辞書にある通常の単語と全く同じように見えるため、平気な顔で隠れ潜んでいます。

結論

この論文は、現在私たちが AI モデルを組み合わせる方法における構造的な弱点を明らかにしています。これは特定のモデルのバグではなく、それらを組み合わせるために使われる「翻訳」の数学における根本的な問題です。

警告:現在一般的な手法である、オープンソースモデルを混ぜ合わせて AI 製品を構築している場合、あなたは知らず知らずのうちに悪意のあるソースから「ゴースト・ワード」を輸入している可能性があります。これらの言葉はソースでは静かに存在しますが、あなたの製品の中では爆発的に作用し、標準的な安全性チェックでは検出されないかもしれません。

著者らは、現在の「混ぜて組み合わせる」ツールは信頼しすぎているため、システムに導入する前にこれらの「移植された」単語をチェックする新しい方法が必要だと提案しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →