✨ 要約🔬 技術概要
あなたは、ある謎めいた人物が誰なのかを突き止めようとしていると想像してみてください。しかし、その人物は決して身分証を見せませんし、両親も名字を教えてくれません。あなたにわかるのは、その人の「声」だけです。注意深く耳を傾ければ、その人が兄弟と同じようなスラングを使っていたり、独特な方法で互いの言葉を補い合ったり、あるいは従兄弟たちと共通する独特のリズムを持っていることに気づくかもしれません。人工知能の世界において、これらの「人々」とは、大規模言語モデル(LLM)のことです。これらは、文章を書いたり、チャットをしたり、問題を解決したりするコンピュータプログラムです。長い間、新しいモデルがリリースされた際、それがどの古いモデルから始まったのか、あるいはどのような特定の書籍やウェブサイトを使って学習されたのかを、企業が隠すことがありました。これは問題です。もしモデルが盗まれたデータに基づいて構築されていたり、有害なものとして訓練されていたりする場合、誰に責任を負わせるべきかを判断するために、その「家系図」を知る必要があるからです。科学者たちは、モデルの内部コード(その「DNA」)を調べることでこれを解決しようと試みてきましたが、もしそのコードが隠されていたらどうなるでしょうか?この論文は、巧妙な問いを投げかけています。「モデルの言葉を聞くだけで、その家族を特定できるだろうか?」と。
研究者のYuqi Wu氏、Shengming Zhao氏、およびJie Chen氏(復旦大学)は、TokenPrint と呼ばれる新しいツールを導入しました。これは、AIの「声紋」のようなものだと考えてください。モデルの秘密の内部コードを見る必要はなく、単にモデルに対して「カナダの首都は何ですか?」や「ループのコードを一行書いてください」といった250個の特定の質問を行い、モデルが回答として選んだ上位数個の単語を確認するだけです。彼らは、これらの上位の選択肢をモデルの「指紋(fingerprint)」と呼んでいます。
ここで行われるのは、手品のような仕組みです。2つのモデルが関連している場合(例えば、一方が他方の「ファインチューニング」されたバージョンである場合や、両方が全く同じデータセットを用いて学習された場合)、たとえサイズや製造元が異なっていても、これらの質問に対して同じ「上位の単語」を選ぶ傾向があります。研究者たちは、この類似性を**Jaccard overlap(ジャカード係数)**という数学的ツールを用いて測定しました。これは基本的には、「これら2つのモデルは、どれだけ多くの共通の上位単語を持っているか?」を問うものです。
この論文では、以下のような非常に興味深い事実が判明しました:
家族の類似性は実在する: 「親」や学習データセットを共有しているモデルは、全く無関係なモデル(約0.17)よりも、はるかに高い類似度スコア(約0.35から0.48)を示します。これは、子供の声が、たとえ同一ではなくても、見知らぬ人の声よりは親の声に似ているという現象と同じです。
それは早期に形成される: この「声紋」は驚くほど速く形成されます。研究者たちは、モデルが質問に正しく答えられるほど賢くなるずっと前、学習時間の最初の1%以内で、これらの類似性が現れることを確認しました。これは、指紋がモデルがいかに賢くなったかではなく、モデルが「食べた」データに由来することを示唆しています。
隠されていても機能する: この手法は、モデルが異なる「語彙(ボキャブラリ)」や異なるコンピュータ・アーキテクチャを使用している場合でも機能します。これは、たとえ少し異なる方言を話していても、家族の顔を識別できるようなものです。
これは探偵の道具であり、魔法の杖ではない: 指紋は容疑者のリストを絞り込むのには優れています。例えば、5つの特定の新しいモデル(R1蒸留モデルと呼ばれるもの)の「親」を探そうとした際、指紋は常に真の親をトップ2の候補として正しく特定しました。しかし、親と非常に近い親族(兄弟モデルのようなもの)の区別がつかないこともあり、方向性は示してくれるものの、必ずしも唯一の完璧な答えを出すわけではありません。
研究者たちは、モデルがスペースを節約するために縮小(量子化と呼ばれるプロセス)された際にも、この指紋が生き残るかどうかを検証しました。彼らは、モデルが非常に小さなサイズ(int4またはint8)に圧縮された場合でも、元のモデルと比較して0.82から0.92という強力な類似度スコアを維持していることを発見しました。これは、モデルが「押しつぶされて」も、「声」は大きく変わらないことを意味します。
要約すると、TokenPrintは、すべての言語モデルが、その学習履歴を明らかにするユニークで永続的な「単語の選択」の痕跡を残していることを示唆しています。これは、モデルの秘密のコードを覗き見ることなく、モデルの系譜を辿るための、トレーニング不要で軽量な方法です。モデルが100%の確実性で正確な親の名前を特定できるわけではありませんが、AIの家系図を追跡するための強力な拡大鏡となります。
技術要約:TokenPrint
問題提起 オープンウェイト言語モデルの急速なリリースは、そのプロベナンス(出自)を監査する能力を追い越してしまっている。現在のガバナンス・メカニズムは、重大な課題に直面している。モデルカードではファインチューニングに使用された特定のベース・チェックポイントが省略されることが多く、学習データの開示も不完全であることが頻繁にある。また、名目上は独立して開発されたモデルであっても、学習コーパスの大部分を共有している場合がある。既存のフォレンジック手法は範囲が限定的である。重み空間アプローチ(例:HuRef、Model Tree Heritage Recovery)はパラメータへのアクセスを必要とし、パラメータの継承を前提としている。一方、行動系統学的な手法(例:PhyloLM)は、クラスタリングを示すものの、共有されたベース、重複するデータ、あるいは単なる能力の収束から生じる類似性のレベルに対して較正された期待値を持たない、未較正の構造を生成することが多い。したがって、モデルの重みにアクセスする必要がなく、パラメータを一切共有していないモデルに対しても適用可能な、モデルの系譜と学習履歴を推論できる手法が求められている。
手法 著者らは、固定された250個の知識プローブによって引き出される、後半レイヤーの隠れ状態のトップ-k k k 語彙投影に基づく、トレーニングフリーのフィンガープリントであるTokenPrint を導入する。
フィンガープリントの抽出: 因果的言語モデルに対し、L L L 個のレイヤーを持つモデルに対し、チャットテンプレートを使用しない250個の固定プロンプト(プローブ)を用いる。特定の深さ(ℓ ∈ { L / 4 , L / 2 , 3 L / 4 , L − 2 } \ell \in \{L/4, L/2, 3L/4, L-2\} ℓ ∈ { L /4 , L /2 , 3 L /4 , L − 2 } )における隠れ状態 h ℓ ( p ) h_\ell(p) h ℓ ( p ) を記録し、それらをアンエンベディング行列 W U W_U W U を通じて投影してロジットを得る。トップ100トークンを文字列としてデコードし、「グリッチ」トークン(アンエンベディングのノルムに基づく)をフィルタリングし、空白を除去する。フィンガープリントは、各プローブから、ランク付けされたデコード済み文字列のリストへのマッピングとなる。
類似度指標: モデル a a a と b b b の深さ ℓ \ell ℓ における類似度は、全プローブにおけるトップ-k k k のデコード済み文字列セットの平均Jaccardオーバーラップとして定義される: S ℓ ( a , b ) = 1 ∣ P ∣ ∑ p ∈ P ∣ F a , ℓ ( p ) ∩ F b , ℓ ( p ) ∣ ∣ F a , ℓ ( p ) ∪ F b , ℓ ( p ) ∣ S_\ell(a, b) = \frac{1}{|P|} \sum_{p \in P} \frac{|F_{a,\ell}(p) \cap F_{b,\ell}(p)|}{|F_{a,\ell}(p) \cup F_{b,\ell}(p)|} S ℓ ( a , b ) = ∣ P ∣ 1 p ∈ P ∑ ∣ F a , ℓ ( p ) ∪ F b , ℓ ( p ) ∣ ∣ F a , ℓ ( p ) ∩ F b , ℓ ( p ) ∣ 異なるサイズのモデルに対応するため、内部の深さは分数的な位置によって一致させる。
較正とヌル推定: プロブントの内容とは無関係な、共有された語彙構造やトークナイザーの効果を考慮するために、著者らはペア固有の「不一致プローブ・ヌル」(S ~ \tilde{S} S ~ )を推定する。これは、モデル a a a のプローブ i i i に対する応答と、モデル b b b の異なるプローブ j ≠ i j \neq i j = i に対する応答を組み合わせることによって計算される。最終的な指標は、超過類似度 (S − S ~ S - \tilde{S} S − S ~ )であり、これによりプローブの内容にロックされた信号を分離する。
評価プール: この手法は、9つのデベロッパーファミリーからなる32個のオープンウェイトモデル(0.6B–32Bパラメータ)のキャリブレーション・プールで評価される。これには、Pythiaモデル(同一データ、共有重みなし)、DeepSeek-R1蒸留モデル(共有ベース・チェックポイント)、および連続する世代といった、文書化された関係が含まれる。外部の「ウィットネス・プール」には、異なる組織や異なるトークナイザーおよびアーキテクチャを持ちながら、同じコーパス(The Pile)で訓練されたモデルが含まれる。
主な結果
較正された類似度の梯子(Similarity Ladder): フィンガープリントの類似度は、文書化されたモデルの関連性を概ね捉えている。
同一データ(共有重みなし): 同じデータおよび同じ順序で訓練されたPythiaモデルは、最も高い超過類似度(0.35)を示す。
共有ベースのファインチューン: ベース・チェックポイントを継承しているモデルは、高い類似度(0.33)を示す。
同一デベロッパー/系譜: 同一のデベロッパーまたは系譜グループに属するモデルは、中間的な類似度(0.25–0.28)を示す。
無関係なモデル: 文書化された関係を持たないモデルは、最も低い類似度(0.17)を示す。 この信号は、異なる組織、トークナイザーのファミリー(例:Cerebras-GPT対Pythia)、およびアーキテクチャのクラス(例:RWKV対Transformers)を横断して持続する。
早期の出現: 類似性の信号は、測定可能な事実的コンピテンス(プローブ精度)が達成されるずっと前、訓練の最初の1%以内(例:Pythiaモデルにおけるステップ1000)で出現する。これは、信号が単なるタスク能力の収束ではなく、共有された学習データの分布に由来することを示唆している。
系譜の検索: 最近傍探索法として、TokenPrintは5つのDeepSeek-R1蒸留モデルのすべてにおいて、文書化された正確なベース・チェックポイントをトップ2の候補内にランク付けすることに成功した(平均ランク 1.8、MRR 0.60)。注目すべきは、粗いメタデータ(トークナイザーの系譜やパラメータ数)では区別できない専門化されたベース(例:数学特化型ベース)を特定できる点である。ただし、本手法はしばしば一意の親ではなく「系譜の近傍」を特定することになる。なぜなら、密接に関連する代替案(例:同じベースのInstructバリアント)も高くランク付けされることが多いためである。
深さと堅牢性:
深さ: 識別強度は出力分布に向かって増加し、1/4の深さでのAUCは0.72、最終出力では0.90へと上昇する。出力のトップ5トークンのみを使用しても、AUC 0.87を維持する。
量子化: フィンガープリントは量子化に対して安定しており、bf16のベースラインと比較して、int8では0.92、int4では0.82–0.85のJaccard類似度を示す。
能力の制御: 回帰分析により、観察された系譜グループの構造が、能力の差やパラメータスケールを制御した後でも持続することが確認された。
意義と主張 本論文は、TokenPrintを、重みへのアクセスなしに動作する系譜検索 およびモデル・プロベナンス分析 のための実用的なツールとして位置づけている。その主な意義は以下の通りである:
トレーニングフリーの動作: フォワードパスのみを必要とするため、重み空間の手法が失敗するブラックボックスまたはアクセス制限のあるモデルにも適用可能である。
較正された解釈: 文書化された関係に対する「類似度の梯子」を確立することで、本手法は単なる未較正のクラスタリングを超え、どのレベルの類似性がどのような種類の関係(例:共有データ vs 共有ベース)を意味するかという参照範囲を提供する。
データ駆動型の信号: 独立した組織やアーキテクチャ間でも信号が持続し、能力の収束前に出現することは、トークン空間のフィンガープリントが学習データの分布の永続的な構造的アーティファクトを捉えていることを示唆している。
限界と範囲 著者らは、本手法が単一のペアワイズ・スコアのみに基づいて関係のメカニズム (例:重みの継承か、あるいは重複するコーパスか)を特定するものではないことを明示している。代わりに、本手法は候補セットを絞り込み、さらなるターゲット分析のための仮説を生成するためのグローバルな類似性構造を提供するものである。本手法は、特定の訓練履歴に関する法的証明として単独で使用するよりも、どのモデルの関係がより深い調査を必要とするかを特定するのに適している。また、クロス・トークナイザーの比較では、意味的に等価な文字列の異なるセグメンテーションにより、類似性が過小評価される可能性があることも述べている。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×