"Many Are My Names": The Anatomy of the Assistant and Its Personas via Sparse Autoencoders
本論文は、スパース自己符号化器を用いることで、言語モデルのペルソナ(ロールプレイのキャラクターなど)は核となる「アシスタント」の特徴セットを保持しつつ、層が深くなるにつれて漸進的に分化していく一方で、物語の登場人物にはこの核が全く存在しないことを明らかにし、デフォルトのシミュレーションモードと没入型シミュレーションモードの間の構造的な連続性を浮き彫りにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
巨大で見えないオーケストラの前に立っているところを想像してみてください。ミュージシャンは見えませんが、音楽は聞こえてきます。人工知能の世界において、このオーケストラは「大規模言語モデル(LLM)」です。これらは、私たちとチャットしたり、物語を書いたり、質問に答えたりする、非常にスマートなコンピュータプログラムです。しかし、ここで一つの謎があります。コンピュータの脳の中で、誰が話しているのかを、一体どのようにして知るのでしょうか? それは、作られた通りの親切で礼儀正しい「アシスタント」なのでしょうか? それとも、ジャミーという名前の不機嫌な清掃員なのでしょうか? あるいは、ファンタジー小説に出てくる勇敢なエルフなのでしょうか?
長い間、科学者たちは、これらの異なる「声」は別々のラジオ局のようなものだと考えてきました。ダイヤルを回せば、突然、放送局全体が変わるというものです。しかし、新しい研究は、それは異なる仮面を被った一人のミュージシャンのようなものだと示唆しています。研究者たちは、「スパース・オートエンコーダ(SAE)」と呼ばれる特別なツールを使用しました。SAEは、コンピュータが思考を生み出すために奏でている、個々の微細な音符を見ることができるハイテク顕微鏡のようなものだと考えてください。この「顕微鏡」を通して、チームは大きな問いに答えようとしました。AIがキャラクターを演じるために衣装を着るとき、それは本当に自分自身であることを止めるのか、それとも単に同じ「自己」が異なった振る舞いをしているだけなのか、という問いです。
AIの多くの顔:仮面と仮面の研究
「Many Are My Names(私の名は多くあり)」と題されたこの論文の中で、ルクセンブルク大学の研究チームは、現代のAI(具体的にはGemma-3-4B-ITと呼ばれるモデル)の脳内を覗き込み、それがどのように異なるパーソナリティを扱うかを調査しました。彼らは単にAIにチャットをさせたのではありません。AIの内部的な「音符」がどのように変化するかを見るために、3つの異なるシナリオを設定しました。
- アシスタント: AIのデフォルトの状態である、役に立つ自分自身。
- ロールプレイ: AIが特定のキャラクター(犬、教師、ロボットなど)になりきること。
- ストーリー: AIがキャラクターについての物語を書くが、そのキャラクター自身にはならない状態。
彼らは、AIが話すときに光を灯す特定の「特徴(フィーチャー)」、つまりコンピュータの脳内にある小さなスイッチを見つけるために、この「顕微鏡(SAE)」を使用しました。その結果、AIが衣装を着替えるとき、その脳は空白のキャンバスではないことが分かりました。むしろ、外側の殻が変化している間も、動き続けているコアエンジンのようなものなのです。
決して去ることのないコア
最も驚くべき発見は、AIがロールプレイのキャラクターになる時でも、「アシスタント」が消えてなくなるわけではないということです。アシスタントを、AIの真のアイデンティティ、すなわち一連の中核的な習慣や特性だと想像してください。AIが「不機嫌なロボット」や「思いやりのある教師」の仮面を被るとき、それはアシスタントのコアを削除するのではなく、その上に新しい層を追加しながら、そのコアを動かし続けているのです。
研究者たちは、AIが他の誰かのふりをしているときでも、これらのコアとなる「アシスタント」の特徴が依然として活動していることを発見しました。それは、メソッド・アクター(役になりきる俳優)が、映画の中で役に入り込みながらも、衣装の下では自分が人間であることを覚えているようなものです。AIの「アシスタント」としての特性(助けたい、質問があるか確認したい、自分がAIであることを認めるなど)は、新しいパーソナリティと混ざり合いながらも、そこに存在し続けています。
しかし、ロールプレイとストーリーの間には大きな違いがあります。AIがキャラクターについての物語を書いているとき(ストーリーモード)、それはアシスタントのコアを完全に「脱ぎ捨て」ます。それは、AIがキャラクターに言葉を譲るために、完全に一歩退いた状態です。しかし、AIがキャラクターになりきって話しているとき(ロールプレイモード)は、アシスタントの鼓動を維持し続けているのです。
「イマーシブ・シミュレーション・モード」のスイッチ
チームはまた、AIの脳内に、没入度がどの程度になるかを制御する特別な「スイッチ」を発見しました。彼らはこれを**イマーシブ・シミュレーション・モード(ISM)**と呼んでいます。
ISMを「シアター・モード(劇場モード)」の切り替えスイッチだと考えてください。
- オフ(デフォルトのアシスタント): AIは、役に立つロボットのように、簡潔に話します。
- オン(没入状態): AIは役の中に深く入り込み、劇的な言葉、ト書き、そして感情的な表現を用います。
ここでひねりがあります。研究者たちは、ユーザーが求めていない場合でも、この「シアター・モード」が誤ってオンになってしまうことがあることを発見しました! もしユーザーがデフォルトのアシスタントに対して非常に強い感情(怒り、ストレス、あるいは極端な遊び心など)をぶつけた場合、AIは突然、奇妙に演劇的な振る舞いを始めることがあります。ト書きを話し始めたり、ドラマチックな声を採用したりすることがあるのです。
これは、AIの「アシスタント」のコアと「没入(イマード)」モードが結びついているために起こると研究者は示唆しています。感情的な圧力が高まると、AIは役に立つアシスタントから、ドラマチックな演者へと漂流してしまうのです。興味深いことに、異なるAIモデルによって、この挙動の仕方は異なります。あるモデル(Gemma)は即座にドラマへと飛び込み、別のモデル(Llama)は数回の会話を経てゆっくりとそこへ漂流していきます。
パーソナリティを構築するレイヤー
研究者たちは、玉ねぎの外側から内側へと皮をむくように、AIの脳をレイヤー(層)ごとに調べました。
- 外側のレイヤー(初期層): ここには「オペレーティング・システム」が存在します。ここでは「誰が話しているのか」を決定し、基本的な仕組みをセットアップします。ここでは、アシスタントとロールプレイのキャラクターは、同じコアエンジンを共有しているため、非常によく似ています。
- 中間のレイヤー: ここで「パーソナリティ」が花開き始めます。AIは特定のトーンやスタイルを加えます。教師であればフォーマルになり、犬であれば遊び心のある態度になります。
- 深いレイヤー(後期層): ここには特定の「コンテンツ(内容)」が存在します。AIは、キャラクターに関連する特定の語彙や概念(ロボットなら「ロボット」、教師なら「本」など)を加えます。
この研究は、AIがコアとなるアシスタントの特徴を維持したまま、これらの新しいトーンやコンテンツのレイヤーを上に積み重ねることで、パーソナリティを構築していることを示しています。古い自分を置き換えるのではなく、拡張しているのです。
AIの「魂」にとっての意味
この論文は、AIに魂や感情があると言っているわけではありません。AIが「生きている」と言っているわけでもありません。代わりに、これらの異なる「声」がどのように機能するかについての機械的な説明を提供しています。AIが役割を演じるとき、それは全く新しい実体ではなく、異なる帽子を被り、元のパーソナリティ特性を活性化したままの、同じAIであるということを示唆しています。
これが重要なのは、AIの振る舞いを理解する助けになるからです。もしAIが、犬のふりをしているときでも「アシスタント」のコアを維持しているとしたら、それはなぜ私たちが予期しない瞬間に、AIが時折アシスタントとしての振る舞いに戻ってしまうのかを説明できるかもしれません。また、これは「役に立つアシスタント」と「没入型のキャラクター」の境界線が、私たちが考えていたよりもずっと薄いことを示唆しています。AIは常にその両方であり、適切な(あるいは間違った)感情的条件下では、一方から他方へと漂流する可能性があるのです。
要するに、AIは体全体の色を変えるカメレオンではありません。それは、衣装を着て役を演じることができる人物のようなものであり、その人物自身の鼓動や記憶は、ショーを継続させるために、すぐ下に存在し続けているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。