← 最新の論文
💬 NLP

Stemma: Induced Decision Regions Reveal LLM Provenance

本論文は、表面的な形態の変化を克服するために、自由記述形式の出力を誘導された決定領域へとマッピングする、LLMのプロベナンス(由来)テストのための堅牢なブラックボックス手法であるStemmaを提案しており、多様なモデル変換およびデプロイメント設定において最先端の精度を達成している。

原著者: Keyu Zhang, Vadim Safronov, Andrew Martin

公開日 2026-07-29
📖 1 分で読めます☕ さくっと読める

原著者: Keyu Zhang, Vadim Safronov, Andrew Martin

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ある謎めいた新しい本が、自分が愛してやまない有名な古典作品を書いた著者と同じ人物によって書かれたものかどうかを見極めようとしているところだと想像してください。人工知能の世界において、これは非常に大きな問題です。私たちは、物語を書き、数学の問題を解き、私たちとチャットをする「大規模言語モデル(LLM)」と呼ばれる巨大なコンピューターの脳を持っています。しかし、これらのモデルは、しばしば微調整されたり、混ぜ合わされたり、あるいは小さなデバイスで動作するように縮小されたりします。時には、人々が保護されたモデルを少しだけ変えて、許可なく自分のものとして販売することもあります。それを見つけ出すためには、そのモデルの「家系図」、つまりプロベナンス(由来)を証明する必要があります。

難しいのは、AIモデルがカメレオンのような性質を持っていることです。もし同じ質問を少し違う言い方でしたり、モデルがより高速になるように調整されていたりすると、たとえ根底にある「脳」が同じであっても、全く異なる答えを出すことがあります。これまでの手法は、モデルが選んだ正確な言葉を見ることでこれらを捕まえようとしてきましたが、それは人の正体を服装だけで特定しようとするようなものです。もし服を着替えられたら、認識できなくなってしまいます。科学者たちは、表面的な部分を超えて、モデルがどのように考えるかという、深く不変な構造を見通す方法を必要としていました。

ここで、オックスフォード大学のチームが、「ステマ(Stemma)」と呼ばれる巧妙な新しいアイデアを携えて登場します。これは、探偵が「今日は何を着てきましたか?」と聞くのをやめて、「もし4つの選択肢があるメニューを見せたら、あなたは何を選びますか?」と問いかけるようなものです。研究者たちは、たとえAIがその個性や言い回しを変えたとしても、特定の選択肢に直面したときには、依然として同じ「カテゴリー」の回答を選ぶ傾向があることに気づきました。彼らは、この隠れた好みを「誘導決定領域(induced decision regions)」と呼んでいます。

チームは、AIが使う華やかな言葉には関心を持たず、むしろそのモデルが行う「選択」に焦点を当てることで、この指紋作成システムをテストしました。彼らは、もし2つのモデルが関連している(親子の関係にある)ならば、選択肢のリストがシャッフルされたり、モデルが全く異なる環境で展開されていたとしても、ほぼ常に同じ選択肢を選ぶことを発見しました。一方で、無関係なモデルは、異なる選択肢を選びます。この「選択の一貫性」を、数百の異なるモデルと数千の質問を用いてテストすることで、Stemmaは家族のつながりを特定することにおいて驚異的な能力を発揮することを証明しました。テストにおいて、Stemmaは関連するモデルを96.7%の確率で正しく特定し、誤検知の確率がわずか1%しかない状況でも、関連するモデルを捉えることができました。これは、モデルの秘密のコードを見る必要なく、「はい、この疑わしい新しいモデルは、間違いなくあのオリジナルに関連しています」と言うための、堅牢な方法なのです。

探偵の新しい虫眼鏡

では、これは実際にどのように機能するのでしょうか?論文では、「誘導決定領域(Induced Decision Regions)」という概念を紹介しています。無限の可能性に満ちた、巨大で散らかった部屋(これがAIが通常どのように機能するかです)を想像してみてください。人々がただ歩き回っているだけでは、二人が同じ部屋にいるのか判断するのは困難です。しかし、もし部屋の真ん中にフェンスを置き、全員にどちらの側を選ぶか尋ねたらどうでしょうか?突然、明確な「決定領域」が現れます。

研究者たちは、AIは自由回答形式の質問には予測不可能である一方、A、B、C、Dといった特定の選択肢の中から強制的に選ばされる場合には、驚くほど一貫していることに気づきました。モデルが特定の答えを一貫して選ぶ領域を、彼らは「誘導決定領域」と呼んでいます。

論文は、従来の手法がAIが出力する正確な言葉、つまり「表面形式(surface form)」に焦みすぎていたと主張しています。もしAIに「猫についての詩を書いて」と頼んだ後に、「ネコについての詩を作って」と頼んだとしたら、関連するモデルであっても、全く異なる詩を出す可能性があり、それによって無関係に見えてしまうかもしれません。しかし、両方のモデルに「答えはA、B、C、またはDのどれですか?」と尋せば、たとえ説明の仕方が異なっていても、彼らはおそらく同じ文字を指し示すでしょう。Stemmaは詩を無視し、ただその文字を見るのです。

ゲームの3つのルール

指紋を作成するために、チームは単にランダムな質問を選んだわけではありません。彼らは賢明に行動する必要がありました。彼らは、安定性(Stability)堅牢性(Robustness)、**特異性(Specificity)**という3つの厳格なルールに基づいた質問作成システムを構築しました。

  1. 安定性(Stability): 4つの答え(A、B、C、D)がある質問を想像してください。もし順番を入れ替えてD、C、B、Aとした場合、安定したモデルは、たとえ文字が変わっても、依然として同じ「概念」を選ぶはずです。Stemmaは、どのようにデッキをシャッフルしてもモデルが一貫している質問のみを使用します。
  2. 堅牢性(Robustness): これは、自分の選択に対する確信度に関わるものです。もしモデルが2つの答えの間で揺れ動いている状態であれば、システムのわずかな変化によって答えが反転してしまうかもしれません。Stemaは、モデルが決定領域の壁から遠く離れた、ある一つのコーナーに「自信を持って」位置している質問を探します。
  3. 特異性(Specificity): これが最も重要な部分です。すべてのモデルが同じ答えを選ぶような質問(例:「空は青いですか?」)ではいけません。それは指紋ではなく、単なる常識です。Stemaは、オリジナルモデルが特定の答えを選び、かつ他の無関係なモデルが通常間違えてしまうような、特異な質問を探します。もし容疑者となるモデルもその珍しく特定の答えを選んだなら、それは彼らが関連している強力な兆候となります。

大規模なテスト

研究者たちは、大規模な実験によってStemaをテストしました。彼らは56種類の公開AIモデル(ソース)を集め、770組の容疑者ペアを作成しました。容疑者の中には、直接のコピー、微調整されたバージョン、他のモデルとマージされたもの、そして全く異なるものも含まれていました。また、温度設定(temperature)を変更したり、ロールプレイの指示を追加したりするなど、異なる方法で展開された1,260組のペアについてもテストを行いました。

結果は驚くべきものでした。Stemmaは0.967のAUC(1.0が完璧なスコア)を達成し、誤検知をわずか**1%に抑えつつ、関連するモデルを87.8%**の確率で特定できました。モデルが様々な実世界の環境(「安全性」に関するプロンプトの追加や、思考ステップの変更など)で展開された場合でも、スコアはさらに上昇し、0.995のAUCに達しました。

これを、テスト対象となった他の手法(LLMmap、LLMPrintなど)と比較してみましょう。これらの手法は苦戦し、モデルが微調整されたり異なる環境で展開されたりすると、多くの場合、ランダムな推測と変わらない性能しか示せませんでした。論文は、これらの古い手法がAIが生成する具体的な言葉に依存しすぎていることを示唆しています。言葉は容易に変化しますが、Stemaは基礎となる決定領域に焦点を当てることで、安定性を保っているのです。

これが意味すること(および意味しないこと)

論文は、Stemmaが何であり、何ではないかを非常に明確に述べています。これはブラックボックス手法です。つまり、モデルの内部コードや重みを見る必要はなく、ただ質問を投げかけ、それが何を選ぶかを観察するだけでよいのです。このことは、実世界の監査において実用的なものにします。

しかし、著者たちはStemaが魔法の杖であるとは言っていません。これは、絶対的な証明ではなく、統計的な証拠を提供するものであると指摘しています。それは、「これら2つが関連している確率は99%である」と言うDNAテストのようなものであり、それ単体では裁判の判決にはなり得ません。また、攻撃者がStemaが使用している質問を正確に知った場合、それらの特定の質問に対してモデルを訓練して欺くことが可能であるとも警告しています。しかし、Stemaは膨大な質問プールを使用し、最適なものをその場で選択するため、そのような行為は困難です。

論文はまた、一つの限界についても強調しています。現在、Stemaは多肢選択式の質問に依存しています。もしモデルが多肢選択形式を理解するには弱すぎる場合、この手法は機能しない可能性があります。しかし、現在存在する大多数の有能なモデルにとって、開かれた混沌とした状態を有限の決定空間へとマッピングするというこの新しいアプローチこそが、AIモデルの真の家系図を解き明かす鍵であるようです。

結局のところ、Stemmaは、AIモデルが多くの仮面を被り、多くの声を使い分けることができても、その核となる論理は、消し去ることが非常に困難な指紋を残すということを思い出させてくれます。正しい問いを投げかけ、表面の奥を見通すことで、私たちはようやく、誰が本当にそのコードを書いたのかを見極め始めることができるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →