Two Confounds in Cross-Model Value Comparison: Response Determinism and the Access Harness
本論文は、モデル間の価値比較における2つの決定的な混同要因、すなわち、真の価値の差と強制選択におけるコミットメントの鋭敏さを混同させる「応答決定論」と、デプロイメント固有のクライアントレイヤーがモデルの見かけ上の価値プロファイルを著しく変化させ、それによって単一試行の測定に基づくランキングを歪めてしまう「アクセスハーネス」を特定し、これらを補正するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、2つの異なるブランドのアイスクリームを味見して、どちらがより「甘い」かを調べようとしていると想像してください。あなたはブランドAのスクープを1つ、ブランドBのスクープを1つ手に取りました。ブランドAはバニラです。ブランドBもバニラですが、小さな、超濃縮されたショットグラスに入っています。一方、ブランドAは巨大でふわふわしたボウルに入っています。もしあなたがたった一口だけを味わったとしたら、ブランドBは、アイスクリーム自体が根本的に異なっているからではなく、その強烈さと集中力ゆえに、はるかに甘く感じられるかもしれません。
これは、人工知能(AI)モデルについて、ある論文が発見したことそのものです。長い間、研究者たちは、「もしオプションAとオプションBのどちらかを選ばなければならないとしたら、どちらを選びますか?」という単一の質問を投げかけることで、異なるAIモデルを比較してきました。彼らは、もしモデルXがAを選び、モデルYがBを選んだなら、2つのモデルには全く異なる「性格」や「価値観」があると考えていました。
ウォン・ホンイン(Hong-In Won)とキム・ヒョソプ(Hyoseop Kim)の両著者はこう述べています。「ちょっと待ってください。あなたは一度に2つの異なるものを測定しており、それらを混同しています。」
2つの混同
1. 「コミットメント」の混同(決定論)
最初の混同は、モデルがいかに「鋭く」答えにコミットするかについてです。
クイズに答えている2人の人物を想像してください。
- 人物Aは100%確信しています。彼に聞かれるたびに、彼は毎回「Aだ!」と叫びます。
- 人物Bは少し優柔不断です。彼は60%の確率で「A」と言い、40%の確率で「B」と言います。
もしあなたがたった一度だけ質問し、人物Aが「A」と言い、人物Bが「B」と言ったとしても、あなたは彼らが正反対であると思うかもしれません。しかし、彼らはそうではありません!二人とも「A」に傾いています。人物Aは単に声が大きく、断定的な「A」のファンであり、人物Bは静かでためらいがちな「A」のファンなのです。
この論文は、研究者が単一の回答(「シングルドロー」)を用いてAIモデルを比較する場合、誤ってこの「声の大きさ」や「決断力」を価値観の違いとしてカウントしてしまうことを示しています。
- 発見: 著者らは9つの異なるAIモデルをテストしました。彼らは、いくつかのモデルが非常に決断力に富んでいること(例えば、確信度のスケールで0.95を示したGPT-5.5のようなモデル)を発見し、一方で他のモデルはもっとソフトであること(特定のアプリで測定した際、Anthropicの「Opus」モデルはわずか0.34であったこと)を発見しました。
- ひねり: この「決断力」は、モデルの名前を見ただけで推測できる固定された性格特性ではありません。あるモデルファミリーでは、小さくて安価なモデルの方が、大きくて高価なフラッグシップモデルよりも決断力がありました。別のファミリーでは、大きなモデルの方が決断力がありました。著者らは、モデルの誰が作ったか、あるいはどれくらいの大きさかを知るだけで、そのモデルの「声の大きさ」を想定することはできないと示唆しています。使うたびにそれを測定する必要があります。
2. 「配送トラック」の混同(アクセス・ハーネス)
2番目の混同はさらに巧妙です。それはアイスクリームのことではなく、それを届けるトラックのことです。
著者は、AIにどのように質問するかが回答を変えてしまうことに気づきました。彼らはこれを「アクセス・ハーネス(access harness)」と呼んでいます。
- ピザを注文することを想像してください。もしあなたがピザ屋に直接電話をするなら(「生API(Raw API)」)、シェフが作った通りのピザが届きます。
- しかし、もし特定のデリバリーアプリ(「CLI」やサブスクリプションツールなど)を通じて注文する場合、そのアプリが厨房にメモを加えるかもしれません。「もっとスパイシーにして!」「客に『ノー』と言わせないで」といった具合に。
著者らは、一部のAIモデルにおいて、この「デリバリーアプリ」(AIと対話するために使用されるソフトウェア)が、モデルの性格を完全に変えてしまうことを発見しました。
- 証拠: 彼らは同じAIモデルを取り上げ、同じ質問を2回行いました。一度は直接の接続(「生のリレーション」)を通じて、もう一度は一般的なサブスクリプションアプリを通じてです。
- 結果: サブスクリプションアプリを通した場合、「Opus」モデルは非常にソフトで不確実に見えました(0.34)。しかし、生の接続を通じて直接尋ねたとき、それは実際にはかなり決断力がありました(0.66)。アプリがその性格を「平坦化」させてしまったのです。
- 「拒絶」のトリック: あるケースでは、直接の接続では、質問が不公平だと感じたためにモデルが回答を拒否することが10%ありました。しかし、サブスクリプションアプリはモデルに毎回必ず回答するように強制し、その結果、モデルが従順であるかのように見せました。著者らは、これが「システムプロンプト」(アプリが質問と一緒に送る一連の指示)によって引き起こされたものであることを証明しました。その指示は、「ただ文字を選んで、議論しないで」とモデルに伝えていたのです。
AIの「性格」にとってこれが意味すること
では、この論文は実際に何を証明したのでしょうか?
- それは、 私たちが目にしているAIモデル間の「距離」は、多くの場合、偽物であることを証明しました。それは、彼らの「声の大きさ」と、私たちが彼らと対話するために使用したソフトウェアの混ざり合いなのです。
- それは、 AIと対話するために使用するソフトウェア(「ハーネス」)は中立的なパイプではなく、AIの価値観を積極的に形作るものであることを証明しました。
- それは、 「決断力」はモデル間で大きく異なり、「大きなモデルは声が大きい」といった単純なルールには従わないことを(完全には解決していませんが)示唆しています。
何が「答え」ではないのか?
この論文は、モデルの名前を見るだけでその価値観を知ることができるという考えを明確に否定しています。また、モデル間のすべての違いが単なる「ノイズ」であるという考えも否定しています。
- 良いニュース: これらの2つの混同を修正した後でも、著者らは、いくつかのモデルが本当に意見を異にしていることを発見しました。例えば、「Grok-3」と呼ばれるモデルは、OpenAIやGoogleのモデルとは異なる方向へと、約73%から88%の質問において実際に傾いています。これらは測定エラーではなく、真の相違です。
- 悪いニュース: 同一企業内のモデルファミリー内(例えば、異なるAnthropicモデル間)で見られたと思っていた違いのほとんどは、主に彼らの「声の大きさ」の違いや、使用していたアプリによる影響によるものでした。
テイクアウェイ(教訓)
もしあなたが2つのAIモデルが異なる価値観を持っているかどうかを知りたいなら、単に一つの質問をして、彼らが何を言うかを見るだけでは不十分です。あなたは以下のことを行う必要があります:
- 同じ質問を何度も繰り返し、彼らが単に「声が大きい」だけなのか、それとも本当に「異なっている」のかを確認すること。
- 彼らと全く同じ「ドア」(同じソフトウェア接続)を通じて対話していることを確認すること。なぜなら、そのドア自体が彼らの考えを変えてしまう可能性があるからです。
著者らはAIの性格の謎を永遠に解明したわけではありませんが、それらを観察するためのより優れた拡大鏡を作り上げました。彼らは、私たちが深い哲学的な対立だと思っていたものが、実は単に一つのAIが叫び、もう一つのAIがささやいているだけだったり、あるいは一つのAIが威張ったマネージャーと話し、もう一つのAIが静かな友人と話しているだけだったりすることを示しました。真の相違はそこに存在しますが、それを見るためには、ノイズを取り除く必要があるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。